语音/音乐/音频论文速递 2026-08-20

语音/音乐/音频论文速递 2026-08-20 共分析 20 篇论文 ⚡ 今日概览 📥 抓取 20 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #多模态模型 3篇 ███ #音频理解 3篇 ███ #语音交互 2篇 ██ #语音识别 2篇 ██ #音乐理解 2篇 ██ #音频分类 2篇 ██ #音频生成 2篇 ██ #语音合成 1篇 █ 📊 论文评分排行榜(20 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Alignment Is All You Need: Instruction-Free Training fo 8.0分 前25% 模型报告 #音频理解 🥈 Aslema at NADI 2026: Augmentation through Fewshot for S 8.0分 前25% 系统技术报告 #语音交互 🥉 X2Streaming-TTS: Causal Token-Level Text-to-Speech from 7.9分 前25% 模型报告 #语音合成 4. Generalized Audio-Driven Synthesis of Precise Drummer M 7.8分 前25% 模型报告 #音视频生成 5. Computational Features for Symbolic Melody Analysis 7.6分 前25% 系统技术报告 #音乐理解 6. Geometric Iterative Retrieval for Neural Audio Codec Re 7.6分 前25% 方法研究 #音频编码 7. Evaluating Music Context Preservation: A Multi-facet Fr 7.5分 前25% 数据集与基准 #音乐理解 8. Nine Emotion Centroids: A Label-Free Valence Axis That 7.5分 前25% 方法研究 #音频理解 9. Accurate Decoding of Natural Sentences from Non-Invasiv 7.5分 前25% 应用研究 #语音识别 10. Mitigating Spectral Bias in Neural Operators for Underw 7.3分 前50% 方法研究 #音频理解 11. FM Synthesizer Audio-Parameter Shared Embeddings 7.3分 前50% 方法研究 #音频生成 12. Low-Power, Neuromorphic, Acoustic Anomaly Detection for 7.3分 前50% 应用研究 #音频分类 13. Finetuning Strategies for Querying Sounds by Vocal Imit 7.3分 前50% 系统技术报告 #音频检索 14. Understanding Multilingual Medical ASR Adaptation Throu 7.2分 前50% 应用研究 #语音识别 15. Multimodal Rapport Estimation in Real-World HRI 7.0分 前50% 应用研究 #多模态模型 16. StocksTalk: A Voice-Enabled Conversational Agent for St 6.7分 前50% 系统技术报告 #语音交互 17. ChiroEcho: extending automated bat vocalisation classif 6.7分 前50% 方法研究 #音频分类 18. Pedagogical AI in Mental Health: A Tri-Stream Fine-Tune 6.7分 前50% 应用研究 #多模态模型 19. Sounds Uncertain: Exploring the Affective Aspects of So 6.7分 前50% 应用研究 #音频生成 20. Large Language Models in Mental Health: A Systematic Re 6.0分 前50% 综述 #多模态模型 📋 论文列表 🥇 Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models 8.0/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-20 · 更新于 2026-09-04 · 17 min · 3435 words

语音/音乐/音频论文速递 2026-08-19

语音/音乐/音频论文速递 2026-08-19 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 3篇 ███ #音乐理解 2篇 ██ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音唤醒 1篇 █ #语音情感识别 1篇 █ #说话人验证 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 FireRedTTS3: Unified Speech Generation and Editing with 9.0分 前10% 方法研究 #语音合成 🥈 SpeechSense: A Paralinguistic-Focused Dataset for Fine- 8.5分 前25% 数据集与基准 #语音情感识别 🥉 DynaForcing: Overcoming Dynamic Collapse in Self-Forcin 8.0分 前25% 方法研究 #音视频生成 4. Automatic Transcription of Microtonal Free-Rhythm Vocal 7.5分 前25% 应用研究 #音乐转录 5. Emotion Across Speech and Faces: Shared Affective Mecha 7.4分 前50% 方法研究 #音视频理解 6. UniVerse: Benchmarking and Enhancing LALMs on Culturall 7.1分 前50% 数据集与基准 #音乐理解 7. A Multiplication-Free Feature Extractor for Signal Clas 6.9分 前50% 方法研究 #语音唤醒 8. PolyDebate: A Game-Orchestrated Multimodal System for D 6.8分 前50% 应用研究 #语音交互 9. Uncertainty-Aware Decision Making in Multimodal Large L 6.8分 前50% 综述 #音频理解 10. Why GPT-Style Models Do Not Directly Transfer to Symbol 6.7分 前50% 理论研究 #音乐生成 11. The Last Mile of Deepfake Speech Detection: An Industry 6.6分 前50% 系统技术报告 #语音伪造检测 12. Closing the Affective Loop: Multimodal Speaker-Listener 6.5分 前50% 应用研究 #语音交互 13. DNN-Based Frequency-Dependent Estimation of Speech, Mus 6.5分 前50% 方法研究 #音频分离 14. Multi-turn Conversational AI from Text to Multimodal In 6.5分 前50% 综述 #语音交互 15. On computational approaches to Pop music culture 6.1分 前50% 综述 #音乐理解 16. Target Speaker Identification: A Low-Latency Streaming 5.6分 前50% 系统技术报告 #说话人验证 📋 论文列表 🥇 FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations 9.0/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ...

2026-08-19 · 更新于 2026-09-04 · 18 min · 3634 words

语音/音乐/音频论文速递 2026-08-18

语音/音乐/音频论文速递 2026-08-18 共分析 39 篇论文 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 3篇 ███ #语音增强 3篇 ███ #语音识别 3篇 ███ #音频分类 3篇 ███ #音频理解 3篇 ███ #声源定位 2篇 ██ #语音编码 2篇 ██ #音视频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retri 7.9分 前25% 数据集与基准 #音频检索 🥈 What Makes a Good Layer? Assessing the Layer-Wise Intri 7.7分 前25% 方法研究 #音乐理解 🥉 How Fragile Is Your Watermark? Training-Free Structural 7.6分 前25% 方法研究 #音频水印 4. Numerical and perceptual validity of synthetic Head-Rel 7.6分 前25% 应用研究 #声源定位 5. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evo 7.5分 前25% 方法研究 #音频字幕生成 6. CineDub: Scaling End-to-End Video Dubbing to Multi-Spea 7.3分 前50% 方法研究 #音视频语音合成 7. Prototype-Rectified Iterative Self-supervised Manifold 7.2分 前50% 方法研究 #音频分类 8. CLARA: Clip-Level Multimodal Alignment with VLM-Derived 7.2分 前50% 方法研究 #音视频理解 9. Impulse Response Estimation via Laguerre-Fourier Expans 6.8分 前50% 方法研究 #音频理解 10. SingDance: Compositional Zero-Shot Singing-and-Dancing 6.8分 前50% 方法研究 #音视频生成 11. Listen, Reason, and Segment: Aligning LALMs with Editor 6.8分 前50% 方法研究 #音频理解 12. AnyTalk: Speech Animation for Arbitrary Characters Leve 6.7分 前50% 方法研究 #音视频语音合成 13. Evidence of Absence: Cross-Modal Abductive Risk Percept 6.6分 前50% 方法研究 #音频事件检测 14. ParaJSCC: A Parameterized Framework for Reusable Multim 6.6分 前50% 方法研究 #音频编码 15. ARENA: Automated Red-Teaming for Large Audio Language M 6.5分 前50% 方法研究 #音频理解 16. The Null Token Knows: Reducing Message-Free Hallucinati 6.5分 前50% 方法研究 #语音识别 17. Moving Horizon Estimation for Underwater Target Trackin 6.5分 前50% 方法研究 #声源定位 18. Multi-Granularity Sentiment Integration for LLM-Based M 6.5分 前50% 方法研究 #音视频理解 19. Adding Voice Cloning to Text-to-Audio-Video Models with 6.4分 前50% 方法研究 #语音克隆 20. Xemo-Talker: Unlock Emotions Explicitly for Audio-Drive 6.2分 前50% 方法研究 #音视频生成 21. Separate First, Then Associate: A Two-Stage Approach fo 6.2分 前50% 系统技术报告 #音视频语音分离 22. Geometry-adaptive Ambisonic encoding for sparse microph 6.2分 前50% 方法研究 #空间音频 23. A survey of AI-generated voices and their detection 6.1分 前50% 综述 #语音伪造检测 24. Iterative Self-Learning for Expressive Text-to-Speech S 6.1分 前50% 方法研究 #语音合成 25. Cached LLM Probability Retrieval for Speech Recognition 6.1分 前50% 方法研究 #语音识别 26. DuplexGen: Decoupling Content, Timing, and Acoustics fo 6.1分 前50% 方法研究 #语音合成 27. Speaker-Normalized Semantic Speech Tokens via Iterative 6.0分 前50% 方法研究 #语音编码 28. Multi-Modal Generative Fuzzy System: Fuzzy Inference Gu 5.9分 前50% 方法研究 #音视频问答 29. A Parameter-Free Few-Shot Evaluation for Elephant Vocal 5.9分 前50% 应用研究 #音频分类 30. Contrastive Learning with Variational Regularization fo 5.9分 前50% 方法研究 #语音合成 31. Sonifying I2S Transport Signals to Detect Transmission 5.9分 前50% 系统技术报告 #音频分类 32. An Analytical-Prior Framework for Data-Efficient Predic 5.8分 前50% 方法研究 #预训练 33. Navigating Speech Enhancement for Real-Time MRI: A Syst 5.7分 前50% 应用研究 #语音增强 34. Distinguishing AI-Generated Music from Edited Audio as 5.6分 前50% 方法研究 #音频伪造检测 35. A Novel Binaural Cue Preservation Loss for DNN-Based Bi 5.6分 前50% 方法研究 #语音增强 36. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluat 5.6分 前50% 方法研究 #语音识别 37. Feedforward Active Speech Suppression Based on Time Ser 5.5分 前50% 方法研究 #语音增强 38. Using the Mimi codec for metalinguistic representations 4.7分 后50% 方法研究 #语音编码 39. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Ran 3.5分 后50% 系统技术报告 #音频编码 📋 论文列表 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-18 · 更新于 2026-09-04 · 40 min · 8515 words

语音/音乐/音频论文速递 2026-08-17

语音/音乐/音频论文速递 2026-08-17 共分析 20 篇论文 ⚡ 今日概览 📥 抓取 20 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音乐理解 3篇 ███ #语音合成 2篇 ██ #语音识别 2篇 ██ #音视频生成 2篇 ██ #语音交互 1篇 █ #语音伪造检测 1篇 █ #说话人日志 1篇 █ #音乐源分离 1篇 █ 📊 论文评分排行榜(20 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesi 8.2分 前25% 模型报告 #语音合成 🥈 Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint 7.7分 前25% 方法研究 #音视频生成 🥉 Trajectory Dynamics in Self-Supervised Learning Latent 7.6分 前25% 方法研究 #语音伪造检测 4. H2H Music Improv: A Communication Model and Audio-Visua 7.6分 前25% 数据集与基准 #音乐理解 5. Singer-Informed Vocal Source Separation for Multi-Singe 7.5分 前25% 方法研究 #音乐源分离 6. Why Performance Metrics Overpromise in Auditory Attenti 6.9分 前50% 方法研究 #语音交互 7. VoiceDesigner: Text-to-Voice Generation and Editing via 6.8分 前50% 系统技术报告 #语音合成 8. The MPB Corpus: A Dataset of Melody, Rhythm, Harmony, a 6.8分 前50% 数据集与基准 #音乐理解 9. Acoustic UAV Detection in Battlefield Scenarios: Handli 6.7分 前50% 方法研究 #音频事件检测 10. Avatar-Forever: Decoupled Parallel Training for High-Qu 6.6分 前50% 方法研究 #音视频生成 11. LoopVSR: A Loop Engineering Framework for Automated Rep 6.6分 前50% 方法研究 #音视频语音识别 12. Leading-Silence Augmentation and Multi-Stage Synthetic 6.5分 前50% 系统技术报告 #说话人日志 13. StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Sup 6.4分 前50% 方法研究 #语音识别 14. Ambisonics Encoding of Room Impulse Responses using a D 6.3分 前50% 方法研究 #音频生成 15. AT-ADD: All-Type Audio Deepfake Detection Challenge Sum 6.3分 前50% 数据集与基准 #音频伪造检测 16. S2Dialog: Multimodal Dialogue Retrieval with Semantic a 6.0分 前50% 方法研究 #音频检索 17. Measuring Fairness in Large Audio Language Models via S 5.6分 前50% 方法研究 #语音识别 18. Exploring ESC Winners with Nested Diagrams 5.4分 后50% 系统技术报告 #音乐理解 19. Architecture and Affordances of PLAUD: Performative Lat 5.0分 后50% 系统技术报告 #音乐生成 20. Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A T 4.4分 后50% 系统技术报告 #音视频理解 📋 论文列表 🥇 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents 8.2/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-17 · 更新于 2026-09-04 · 20 min · 4165 words

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 ✅ 筛选入选 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward… 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech… 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained… 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI… 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding… 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware… 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of… 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme… 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross… 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous… 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with… 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In… 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

2026-08-14 · 更新于 2026-09-04 · 12 min · 2527 words

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-09-04 · 20 min · 4212 words

语音/音乐/音频论文速递 2026-08-12

语音/音乐/音频论文速递 2026-08-12 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 4篇 ████ #语音识别 4篇 ████ #音乐理解 4篇 ████ #扩散模型 1篇 █ #端到端 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DuplexWorld: Can voice agents help you get through the 8.5分 前25% 数据集与基准 #语音交互 🥈 A Dataset and Benchmark for Optical Music Recognition o 8.5分 前25% 数据集与基准 #端到端 🥉 Measuring Cross-Cultural Style Diffusion Through Era Cl 8.3分 前25% 方法研究 #音乐理解 4. Training Set Synthesis for Bioacoustic Denoising: A Cas 8.0分 前25% 应用研究 #语音增强 5. Modeling and Interpreting Correlations, Null Distributi 8.0分 前25% 方法研究 #音频理解 6. Seeds Before Objectives: Rethinking Evaluation for Low- 7.9分 前25% 数据集与基准 #语音识别 7. Beyond Dry References: Learning Relative Audio Effects 7.7分 前25% 方法研究 #音乐理解 8. MAJEPPA: Morphing and Assessing in a Unified Piano Perf 7.5分 前25% 方法研究 #音乐理解 9. DIY e-HandPan: A new DIY Low-Cost Handpan Interface bas 7.2分 前50% 系统技术报告 #音频交互 10. Rationale-Guided Learning for Multimodal Emotion Recogn 7.2分 前50% 方法研究 #语音情感识别 11. The GENEA Challenge 2026: A Large-Scale Disentangled Ev 7.2分 前50% 数据集与基准 #语音交互 12. Beyond Naturalness: Probing Automated Text-To-Speech Ev 7.1分 前50% 数据集与基准 #语音质量评估 13. In Defense of Using Worst-case Privacy Disclosure as Pr 7.1分 前50% 理论研究 #说话人验证 14. Pitch Contour Tokenization using VQ-VAE and Its Applica 7.1分 前50% 方法研究 #音乐理解 15. VoxSumm: A Multilingual Corpus of Long-Form Spoken News 6.9分 前50% 数据集与基准 #语音翻译 16. myMediWhisper: Construction of Burmese Medical Speech C 6.7分 前50% 数据集与基准 #语音识别 17. MazzikaAI: A knowledge-based performance-to-prompt comp 6.6分 前50% 系统技术报告 #音乐生成 18. ASR-Roundtrip Evaluation Can Mask Context- and Conventi 6.5分 前50% 方法研究 #语音合成 19. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with 6.5分 前50% 系统技术报告 #音视频生成 20. TimeRoute: Time-Aware Modality Routing and Diffusion fo 6.5分 前50% 方法研究 #扩散模型 21. X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint 6.4分 前50% 方法研究 #语音交互 22. Edge Phoneme Recognition for Children’s Speech through 6.3分 前50% 模型报告 #语音识别 23. DINO-A: Adapting Self-Distillation Vision Transformers 6.2分 前50% 方法研究 #音频分类 24. Whisper-Aware LLM: Self-Supervised Uncertainty Learning 6.1分 前50% 方法研究 #语音识别 25. Never Stop Speaking: a Denial-of-Service Attack on End- 5.4分 后50% 方法研究 #语音交互 26. BiTSE: Binaural Target Speaker Extraction in Noisy Mult 5.0分 后50% 方法研究 #语音分离 27. Monophonic Audio Synthesizer Using FPGAs 4.2分 后50% 系统技术报告 #音频生成 📋 论文列表 🥇 DuplexWorld: Can voice agents help you get through the day? 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-12 · 更新于 2026-09-04 · 24 min · 4909 words

语音/音乐/音频论文速递 2026-08-11

语音/音乐/音频论文速递 2026-08-11 共分析 40 篇论文 ⚡ 今日概览 📥 抓取 40 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 4篇 ████ #音频生成 4篇 ████ #音乐生成 3篇 ███ #音频字幕生成 3篇 ███ #声源定位 2篇 ██ #语音合成 2篇 ██ #语音情感识别 2篇 ██ #语音编码 2篇 ██ 📊 论文评分排行榜(40 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detai 8.4分 前25% 方法研究 #音频字幕生成 🥈 Deferred Audio Pruning with Local Audio-Visual Dynamics 8.4分 前25% 方法研究 #模型剪枝 🥉 PACE: A Playback-Aligned Context Engine for LLM-Based F 8.0分 前25% 系统技术报告 #语音交互 4. REFRAMED: Towards Realistic Audio Description Generatio 8.0分 前25% 数据集与基准 #音频字幕生成 5. SraVaani 1.0: Scaling Inclusive Speech Recognition for 7.9分 前25% 模型报告 #语音识别 6. AudioMap: Cloze-and-Choice Reinforcement Learning for T 7.9分 前25% 方法研究 #音频字幕生成 7. SAMOT: State-Aware Step Modulation and Optimal Transpor 7.7分 前25% 方法研究 #音视频理解 8. ReLMCodec: Designing Predictable Speech Tokens from Pre 7.7分 前25% 方法研究 #语音编码 9. VoxZip: Semantic-Anchored Temporal KV Cache Compression 7.7分 前25% 方法研究 #音频理解 10. Steering dense music retrieval with open-vocabulary con 7.7分 前25% 方法研究 #音乐检索 11. VIOLET: High-Fidelity Violin Synthesis with Techniques 7.6分 前25% 方法研究 #音乐生成 12. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified 7.6分 前25% 模型报告 #音频生成 13. Beyond Reconstruction: Full-Context Generative DiT for 7.5分 前25% 系统技术报告 #音乐生成 14. From Inaudible Inputs to Model Failures: Low-Frequency 7.4分 前50% 方法研究 #音频理解 15. Beyond Piano: Cross-Instrument MIDI Velocity Estimation 7.3分 前50% 方法研究 #音乐理解 16. omni-macos: On-Device Omni-Modal Search on Apple Silico 7.2分 前50% 系统技术报告 #音频检索 17. SCoPE: Training-Free Audio-Visual Event Perception via 7.1分 前50% 方法研究 #音视频理解 18. BAMU: Bitstream-Aware Marginal-Utility Allocation for F 7.1分 前50% 方法研究 #语音编码 19. Dramarrator: Object-Based Audio Editing for Audio Drama 7.0分 前50% 系统技术报告 #音频生成 20. CuteTTS: Efficient and High-Quality Speech Synthesis vi 7.0分 前50% 系统技术报告 #语音合成 21. RAG-Audio: Retrieval-Augmented Generation for Faithful 6.9分 前50% 方法研究 #音频生成 22. Listen, See and Track: Spatio-Temporal Audio-Visual Sou 6.7分 前50% 数据集与基准 #音视频问答 23. From Speech to Interaction: Analyzing Multimodal System 6.6分 前50% 系统技术报告 #音视频语音识别 24. MADBench: A Benchmark for Modality-Aware Audio Deepfake 6.6分 前50% 数据集与基准 #音视频理解 25. A Unifying Perspective on Audio Generative Modeling: La 6.5分 前50% 理论研究 #音频生成 26. Multilingual Emotion Neurons in Large Audio-Language Mo 6.5分 前50% 方法研究 #语音情感识别 27. DAVE: A Decoupled Audio-Visual Enhancement Framework fo 6.5分 前50% 系统技术报告 #音视频语音分离 28. Structured Phonological Representations for Audio-Artic 6.5分 前50% 方法研究 #语音属性识别 29. CtrlSpeech: Coarse-to-Fine Control for Expressive Speec 6.4分 前50% 方法研究 #语音合成 30. Neural Array-Generic Direction-of-Arrival Estimation Ex 6.4分 前50% 方法研究 #声源定位 31. AI-Guided Learning: Research on Knowledge and Skill Acq 6.3分 前50% 系统技术报告 #音视频理解 32. Speaker Role and Language Diarization for Analyzing Mul 6.3分 前50% 应用研究 #说话人日志 33. MusicLayout: Explicit Structural Planning for Controlla 6.3分 前50% 系统技术报告 #音乐生成 34. Mitigating Over-Suppression in Speech Enhancement via I 6.2分 前50% 方法研究 #语音增强 35. Physics-Informed Learning for Robust Acoustic Localizat 6.2分 前50% 方法研究 #声源定位 36. EmoS: A Theory-Grounded Framework for Evaluating and Al 6.2分 前50% 数据集与基准 #语音情感识别 37. Dynamic Clustering for Cross-Segment Permutation Alignm 6.2分 前50% 方法研究 #语音分离 38. The Voiceprint Fallacy: Why Voices Are Not Unique Biome 6.0分 前50% 综述 #说话人验证 39. Investigating Multimodal Informativity under Different 5.9分 前50% 方法研究 #多模态模型 40. Machine-Learning-Based Diagnostic Framework for Passive 5.6分 前50% 应用研究 #音频分类 📋 论文列表 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward 8.4/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ...

2026-08-11 · 更新于 2026-09-04 · 33 min · 6905 words

语音/音乐/音频论文速递 2026-08-10

语音/音乐/音频论文速递 2026-08-10 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 2篇 ██ #音乐理解 2篇 ██ #音频伪造检测 2篇 ██ #音频生成 2篇 ██ #多模态模型 1篇 █ #歌唱生成 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 How Much AI Is in This Track? Quantifying the Proportio 8.3分 前25% 方法研究 #音频伪造检测 🥈 Objects as Audio-Visual Modal Sound Fields 7.6分 前25% 方法研究 #音频生成 🥉 StreamArena: Toward Continuous, Interactive, and Long-H 7.6分 前25% 数据集与基准 #多模态模型 4. Frame-Level Pansori Mode Classification with Complement 7.6分 前25% 数据集与基准 #音乐理解 5. Multi Codec Discrete Diffusion Model for Text Guided Sp 7.3分 前50% 方法研究 #语音编辑 6. MI-MIDI: Mechanistic Interpretability of Text-to-MIDI G 7.1分 前50% 方法研究 #音乐生成 7. SemBridge: Semantic Token Anchoring for Continuous-Late 7.0分 前50% 方法研究 #语音合成 8. Do Audio Language Models Use Paralinguistic Evidence? C 6.9分 前50% 数据集与基准 #语音情感识别 9. Separating Decision-Rule Misalignment from Readout-Cove 6.8分 前50% 方法研究 #语音情感识别 10. MMAG: A Multi-Control Mixed Audio Generation Benchmark 6.8分 前50% 数据集与基准 #音频生成 11. Assessing AI-generated music detection in real-world br 6.8分 前50% 数据集与基准 #音频伪造检测 12. LSEAD: A Privacy-Preserving LLM-Based Speech Analysis F 6.6分 前50% 系统技术报告 #语音识别 13. Cloud-Boosted Low-Compute Multi-Channel Speech Enhancem 6.0分 前50% 方法研究 #语音增强 14. Shape Your Feed: An LLM-based Agentic System for Conver 5.7分 前50% 系统技术报告 #音视频交互 15. From Prompting to Describing: A Cross-Cultural Study of 5.5分 前50% 应用研究 #音乐理解 16. Beyond Call and Response: Modelling Reciprocal Coordina 5.5分 前50% 方法研究 #歌唱生成 📋 论文列表 🥇 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-10 · 更新于 2026-09-04 · 14 min · 2864 words

语音/音乐/音频论文速递 2026-08-07

语音/音乐/音频论文速递 2026-08-07 共分析 21 篇论文 ⚡ 今日概览 📥 抓取 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #音频生成 2篇 ██ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AffectDF: The Most Comprehensive Benchmark for Speech D 8.4分 前25% 数据集与基准 #语音伪造检测 🥈 LILAC: An Idempotent Neural Speech Codec 8.1分 前25% 方法研究 #语音编码 🥉 KVAE: Family of Tokenizers for Multimodal Generative Mo 8.1分 前25% 模型报告 #音频编码 4. Decolonizing Linguistic Policies in Automated Speech Re 7.8分 前25% 理论研究 #语音识别 5. Audio-to-Score Transcription using Pre-trained Features 7.7分 前25% 数据集与基准 #音乐转录 6. Diff2Mix: Controllable Music Mixing via Diffusion Model 7.5分 前25% 方法研究 #音频生成 7. Vorch-Streamer: Extending Human Audio-Visual Generation 7.4分 前50% 方法研究 #音视频生成 8. EG-VAE: A Unified Framework for Electric Guitar Tone Tr 7.3分 前50% 方法研究 #音频生成 9. Explicit and Stable Pseudospectral Time-Domain Method f 7.2分 前50% 方法研究 #音频理解 10. FormBharo: Designing and Evaluating a Voice Agent for C 7.0分 前50% 系统技术报告 #语音交互 11. Whence the Voice? Self-supervised Dual-source Audio-Vis 6.8分 前50% 方法研究 #声源定位 12. Bias Analysis of L2 Speaking Assessment Systems Using C 6.7分 前50% 方法研究 #语音质量评估 13. Diff-Symbo: Text-Controlled Long-Duration Symbolic Musi 6.5分 前50% 方法研究 #音乐生成 14. Rethinking Automatic Music Mixing as Sequential Stem Bl 6.5分 前50% 方法研究 #音乐生成 15. How to Recognize New Words: A Comparison Between Contex 6.4分 前50% 方法研究 #语音识别 16. Beyond Residual Connections: Manifold-Constrained Hyper 6.0分 前50% 方法研究 #说话人验证 17. A Study of ASR Adaptation and Representation Dimensiona 5.7分 前50% 方法研究 #语音情感识别 18. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Hea 5.6分 前50% 方法研究 #音视频生成 19. The interface of intonation and lexical tone: Boundary 5.6分 前50% 综述 #语音属性识别 20. C\(^3\)PO: Evaluating Cross-Modal Composition and Counter 5.5分 前50% 数据集与基准 #音视频问答 21. ECHO: A Locally-Deployable Agentic Health Assistant wit 5.5分 前50% 系统技术报告 #语音属性识别 📋 论文列表 🥇 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-07 · 更新于 2026-09-04 · 17 min · 3544 words