ICLR 2026 语音/音频论文详细分析

ICLR 2026 语音/音频论文详细分析 共分析 133 篇 ICLR 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 语音合成(10篇) 音频生成(9篇) 语音识别(9篇) 基准测试(9篇) 音乐生成(9篇) 语音对话系统(8篇) 音频分类(6篇) 音频问答(6篇) 语音情感识别(5篇) 多模态模型(5篇) 音视频(4篇) 音频检索(4篇) 语音分离(3篇) 模型评估(2篇) 语音翻译(2篇) 音乐信息检索(2篇) 生成模型(2篇) 音乐理解(2篇) 视频生成(2篇) 跨模态生成(1篇) 脑编码(1篇) 模型可解释性(1篇) 音视频深度伪造检测(1篇) 图像生成(1篇) 数据集(1篇) 语音增强 #对抗样本(1篇) 语音大模型(1篇) 音频编辑(1篇) 音视频事件检测(1篇) 生态计算(1篇) 视频描述生成(1篇) 视频摘要(1篇) 语音问答(1篇) 基准测试 #数据集(1篇) 音频安全(1篇) 神经网络架构(1篇) 语音转换 #语音匿名化(1篇) 声源定位(1篇) 序列解耦(1篇) 空间音频(1篇) 音频分离(1篇) 机器人操作(1篇) 动作生成(1篇) 音频场景理解(1篇) 跨模态检索(1篇) 语音增强(1篇) 多模态推理(1篇) 语音合成评估(1篇) 语音生成(1篇) 生物声学(1篇) 模型比较(1篇) 音视频联合推理(1篇) 语音识别 #语音合成(1篇) ⚡ 今日概览 📥 133 篇 → 🔬 深度分析完成 ...

2026-05-01 · 更新于 2026-08-14 · 72 min · 15177 words

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

📄 CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation 标签:#音频分类 #自监督学习 #多模态模型 #Transformer #医疗音频 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #自监督学习 | #多模态模型 #Transformer | arxiv 👥 作者与机构 第一作者:Hamza Shafiq(机构未明确;文中“Affiliation: Jun Hu”标注异常) 通讯作者:Aaqib Saeed(Eindhoven University of Technology, Netherlands;a.saeed@tue.nl) 作者列表:Hamza Shafiq(机构未明确)、Hung Manh Pham(Singapore Management University, Singapore)、Bin Zhu(Singapore Management University, Singapore)、Pan Zhou(Singapore Management University, Singapore)、Aaqib Saeed(Eindhoven University of Technology, Netherlands) 💡 毒舌点评 本文把 ECG、PPG、PCG 之间的生理学延迟建模为可学习的一等公民部件,延迟感知 latent prediction 加上两阶段课程在多个下游任务中确实带来显著提升,尤其对过去较弱的心音 PCG 任务贡献清楚。跨模态对齐不是简单拼接,而是通过可微高斯核和生理 anchor 监督把延迟估计嵌入训练目标,这比 naive timestamp alignment 有实质进步。但论文在无代码、无权重、部分关键训练细节未交代的前提下,仍把“统一心脏基础模型”的叙述推得较满,复现性和工业可信度明显打折;PCG 基线选择和统计显著性也仍有可诟病之处。 ...

2026-08-14 · 更新于 2026-08-14 · 6 min · 1255 words

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 📥 抓取 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Au 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained Models 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI Scienti 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding fo 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware Retr 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of a 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Co 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross-Lingua 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scen 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In-V 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

2026-08-14 · 更新于 2026-08-14 · 13 min · 2588 words

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

📄 Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning 标签:#音频事件检测 #参数高效微调 #说话人日志 #自监督学习 #Transformer 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #LoRA | #参数高效微调 #说话人日志 | arxiv 👥 作者与机构 Xulin Fan:University of Illinois Urbana-Champaign, USA Jialu Li:University of Arizona, USA Mohammad Nur Hossain Khan:Worcester Polytechnic Institute, USA Kexin Hu:University of Illinois Urbana-Champaign, USA Bashima Islam:Worcester Polytechnic Institute, USA Mark Hasegawa-Johnson:University of Illinois Urbana-Champaign, USA Nancy L. McElwain:University of Illinois Urbana-Champaign, USA 通讯作者:论文未明确标注通讯作者;作者邮箱在论文中列出,但未说明通讯作者身份。 ...

2026-08-13 · 更新于 2026-08-14 · 4 min · 766 words

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-08-14 · 20 min · 4212 words

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

📄 A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores 标签:#端到端 #Transformer #基准测试 8.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #端到端 | #Transformer | #基准测试 | arxiv 👥 作者与机构 Dongmin Kim(韩国西江大学 Music & Arts Learning (MALer) Lab) Brian Liu(独立研究者) Jose J. Valero-Mas(西班牙阿利坎特大学模式识别与人工智能小组) Dasaem Jeong(韩国西江大学 MALer Lab;联系邮箱 dasaemj@sogang.ac.kr;论文未明确标注“通讯作者”,按署名与联系邮箱推断) 💡 毒舌点评 首个多声部 OMR 基准的开创性毋庸置疑,视觉对齐 + 三编码转换 + 测试集互斥四折协议的工程链条相当完整,3.6%/5.9% 的基线让这个任务从“不可能”变成了“可挑战”。但人工校对没有第二人校验、四折标准差偏大、LMXE 由作者自己的转换管线生成并取得全面优势,使得“编码选择 > 架构选择”这个 headline 结论的公信力打了折扣。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 770 words

BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays

📄 BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays 标签:#语音分离 #Transformer #语音增强 #多通道 5.0/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 📝 5.0/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音分离 | #Transformer | #语音增强 #多通道 | arxiv 👥 作者与机构 第一作者:Selani A. Indrapala(斯里兰卡莫拉图瓦大学,电子与电信工程系) 通讯作者:未说明 作者列表:Selani A. Indrapala(斯里兰卡莫拉图瓦大学电子与电信工程系)、Wageesha N. Manamperi(斯里兰卡莫拉图瓦大学电子与电信工程系) 资助来源:“Accelerating Higher Education Expansion and Development (AHEAD)” 项目(编号 6026-LK/8743-LK)及斯里兰卡电信监管委员会(TRCSL)2024 研发基金 💡 毒舌点评 用 oracle DoA/VAD 把 SegSNR 从 -8.69 拉到 -2.57,说明空间与活动性信息确实能带来可观增益;但所谓“目标说话人提取”既依赖真值标签,又未与任何已有 TSE 方法对比,更像“带 oracle 指导的 BCCTN 增强”。更扎眼的是引言末尾宣称 “consistently surpasses state-of-the-art methods”,而全文的对比基线只有 MVDR 和自己使用的 BCCTN 系列,SOTA 声称没有实质证据支撑,离 AR 眼镜实际部署还有很大距离。 ...

2026-08-12 · 更新于 2026-08-14 · 6 min · 1193 words

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

📄 DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning 标签:#音频分类 #自监督学习 #Transformer #知识蒸馏 #预训练 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频分类 | #自监督学习 | #Transformer #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Tomasz Radzikowski(Warsaw University of Technology) 通讯作者:未披露 作者列表:Tomasz Radzikowski、Mateusz Modrzejewski、Przemysław Rokita(均为 Warsaw University of Technology) 论文状态:Preprint,已接收于 ICAISC 2026,最终版将发表于 Springer LNAI。 💡 毒舌点评 把 DINO 以最小改动搬到通用音频,并用与 BYOL-A v2 完全对齐的 FSD50K 预训练和 EVAR 线性探针评测做了一次干净的算法级对照,这是论文最有价值的贡献。但整套方法没有任何针对音频的新机制,最佳变体平均落后 BYOL-A v2 达 11.96 个百分点;作者把差距归因于 65,536 维投影在 FSD50K 尺度下数据效率不足和多裁剪的局部-全局语义不匹配,却既没有对投影维度、多裁剪开关做消融,也没有在 AudioSet 上验证尺度假设,因此“机制解释”更像事后假设而非实证结论。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 787 words

语音/音乐/音频论文速递 2026-08-12

语音/音乐/音频论文速递 2026-08-12 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 4篇 ████ #语音识别 4篇 ████ #音乐理解 4篇 ████ #扩散模型 1篇 █ #端到端 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DuplexWorld: Can voice agents help you get through the 8.5分 前25% 数据集与基准 #语音交互 🥈 A Dataset and Benchmark for Optical Music Recognition o 8.5分 前25% 数据集与基准 #端到端 🥉 Measuring Cross-Cultural Style Diffusion Through Era Cl 8.3分 前25% 方法研究 #音乐理解 4. Training Set Synthesis for Bioacoustic Denoising: A Cas 8.0分 前25% 应用研究 #语音增强 5. Modeling and Interpreting Correlations, Null Distributi 8.0分 前25% 方法研究 #音频理解 6. Seeds Before Objectives: Rethinking Evaluation for Low- 7.9分 前25% 数据集与基准 #语音识别 7. Beyond Dry References: Learning Relative Audio Effects 7.7分 前25% 方法研究 #音乐理解 8. MAJEPPA: Morphing and Assessing in a Unified Piano Perf 7.5分 前25% 方法研究 #音乐理解 9. DIY e-HandPan: A new DIY Low-Cost Handpan Interface bas 7.2分 前50% 系统技术报告 #音频交互 10. Rationale-Guided Learning for Multimodal Emotion Recogn 7.2分 前50% 方法研究 #语音情感识别 11. The GENEA Challenge 2026: A Large-Scale Disentangled Ev 7.2分 前50% 数据集与基准 #语音交互 12. Beyond Naturalness: Probing Automated Text-To-Speech Ev 7.1分 前50% 数据集与基准 #语音质量评估 13. In Defense of Using Worst-case Privacy Disclosure as Pr 7.1分 前50% 理论研究 #说话人验证 14. Pitch Contour Tokenization using VQ-VAE and Its Applica 7.1分 前50% 方法研究 #音乐理解 15. VoxSumm: A Multilingual Corpus of Long-Form Spoken News 6.9分 前50% 数据集与基准 #语音翻译 16. myMediWhisper: Construction of Burmese Medical Speech C 6.7分 前50% 数据集与基准 #语音识别 17. MazzikaAI: A knowledge-based performance-to-prompt comp 6.6分 前50% 系统技术报告 #音乐生成 18. ASR-Roundtrip Evaluation Can Mask Context- and Conventi 6.5分 前50% 方法研究 #语音合成 19. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with 6.5分 前50% 系统技术报告 #音视频生成 20. TimeRoute: Time-Aware Modality Routing and Diffusion fo 6.5分 前50% 方法研究 #扩散模型 21. X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint 6.4分 前50% 方法研究 #语音交互 22. Edge Phoneme Recognition for Children’s Speech through 6.3分 前50% 模型报告 #语音识别 23. DINO-A: Adapting Self-Distillation Vision Transformers 6.2分 前50% 方法研究 #音频分类 24. Whisper-Aware LLM: Self-Supervised Uncertainty Learning 6.1分 前50% 方法研究 #语音识别 25. Never Stop Speaking: a Denial-of-Service Attack on End- 5.4分 后50% 方法研究 #语音交互 26. BiTSE: Binaural Target Speaker Extraction in Noisy Mult 5.0分 后50% 方法研究 #语音分离 27. Monophonic Audio Synthesizer Using FPGAs 4.2分 后50% 系统技术报告 #音频生成 📋 论文列表 🥇 DuplexWorld: Can voice agents help you get through the day? 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-12 · 更新于 2026-08-14 · 24 min · 4909 words

Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty

📄 Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty 标签:#声源定位 #Transformer #鲁棒性 #多通道 6.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #Transformer | #鲁棒性 #多通道 | arxiv 👥 作者与机构 第一作者:Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) 通讯作者:未说明 作者列表: Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) Changwoo J. Lee(Duke University, Department of Statistical Science) Xin Shen(Duke University, Department of Statistical Science) Ari Lehtiö(University of Jyväskylä, Digital Services) Sandro von Brandenburg(University of Jyväskylä, Digital Services) Ossi Nokelainen(University of Jyväskylä, Department of Biological and Environmental Science;University of Jyväskylä, Open Science Centre) David B. Dunson(Duke University, Department of Statistical Science) Otso Ovaskainen(University of Jyväskylä, Department of Biological and Environmental Science) 💡 毒舌点评 用“保留物理求解器 + 学习校正 + 两层物理门控 + GDOP 缩放不确定性”的思路来抑制双曲定位的灾难性长尾,诊断清楚、设计务实,这是论文最大的亮点。但真实实验只有一个冰冻湖站点、六个已知扬声器位置,森林场景全部是仿真,且没有给出完整混合门控在森林仿真中的直接结果;基线只有经典双曲求解器,未与任何现代深度学习、score-based 或 conformal 声源定位方法对比。整体说服力仍未达到顶会主接收准。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 619 words