ICLR 2026 语音/音频论文详细分析

ICLR 2026 语音/音频论文详细分析 共分析 133 篇 ICLR 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 语音合成(10篇) 音频生成(9篇) 语音识别(9篇) 基准测试(9篇) 音乐生成(9篇) 语音对话系统(8篇) 音频分类(6篇) 音频问答(6篇) 语音情感识别(5篇) 多模态模型(5篇) 音视频(4篇) 音频检索(4篇) 语音分离(3篇) 模型评估(2篇) 语音翻译(2篇) 音乐信息检索(2篇) 生成模型(2篇) 音乐理解(2篇) 视频生成(2篇) 跨模态生成(1篇) 脑编码(1篇) 模型可解释性(1篇) 音视频深度伪造检测(1篇) 图像生成(1篇) 数据集(1篇) 语音增强 #对抗样本(1篇) 语音大模型(1篇) 音频编辑(1篇) 音视频事件检测(1篇) 生态计算(1篇) 视频描述生成(1篇) 视频摘要(1篇) 语音问答(1篇) 基准测试 #数据集(1篇) 音频安全(1篇) 神经网络架构(1篇) 语音转换 #语音匿名化(1篇) 声源定位(1篇) 序列解耦(1篇) 空间音频(1篇) 音频分离(1篇) 机器人操作(1篇) 动作生成(1篇) 音频场景理解(1篇) 跨模态检索(1篇) 语音增强(1篇) 多模态推理(1篇) 语音合成评估(1篇) 语音生成(1篇) 生物声学(1篇) 模型比较(1篇) 音视频联合推理(1篇) 语音识别 #语音合成(1篇) ⚡ 今日概览 📥 133 篇 → 🔬 深度分析完成 ...

2026-05-01 · 更新于 2026-09-04 · 72 min · 15177 words

Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System

📄 先分好组再混音:为什么两阶段不是技巧,而是分工 英文题目:Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System 一句话:论文把自动混音拆成可干预的分组与组内组间两阶段,用三组听感实验说明全混模型迁移看模型、分错组比响度错更难补、而保持模型不变只换输入就能显著提升,但结论受三首歌与小样本听音的限制。 标签:#音乐生成 | #生成模型 | #Transformer | #模型比较 评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Jinjie Shi:机构信息未在 arXiv HTML 中可靠披露 Wei Hua:机构信息未在 arXiv HTML 中可靠披露 Kunzhu Xie:机构信息未在 arXiv HTML 中可靠披露 Make Li:机构信息未在 arXiv HTML 中可靠披露 Yuchen Liu:机构信息未在 arXiv HTML 中可靠披露 Joshua Reiss:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把两阶段混音从工程惯例拆成可干预的分组与组内平衡变量,用同一套听感流程检验迁移、误差传播与分解增益,问题切得准,对系统选型有直接参考价值。硬伤是只用3首密集流行摇滚片段和18名有效听音人支撑全部结论,曲风、曲目与听众代表性都窄,部分关键比较还受地板效应和轨数兼容处理的混淆,结论外推要打折。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 872 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data

📄 不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer 英文题目:TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data 一句话:为破解音频到乐谱转录长期缺真实配对数据的困境,TUTTI 用 NotaGen 生成 36 万对合成音频-ABC 乐谱预训练纯 Transformer 编码器-解码器,再在真实数据上微调,在钢琴与弦乐四重奏上超越专用基线并零样本泛化到未见过的萨克斯,代价是评估仍限于 14.8 秒切块且合成到真实的域差距未被量化。 标签:#音乐转录 | #预训练 | #Transformer | #数据集 | #迁移学习 评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露 Yashan Wang:机构信息未在 arXiv HTML 中可靠披露 Shangda Wu:机构信息未在 arXiv HTML 中可靠披露 Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露 Shijie Liang:机构信息未在 arXiv HTML 中可靠披露 Wuna Meng:机构信息未在 arXiv HTML 中可靠披露 Chuanqi Yang:机构信息未在 arXiv HTML 中可靠披露 Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露 Feng Yu:机构信息未在 arXiv HTML 中可靠披露 Maosong Sun:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 NotaGen 生成的 363610 对合成数据把数据饥渴的 Transformer 硬生生喂成了跨乐器通用转录器,在弦乐四重奏等任务上把总分从 84.9 拉到 95.6 的提升是实打实的。短板是整套流水线对合成到真实的域差距缺乏量化分析,EPR 与 SFZ 渲染的真实性未经听感或声学指标验证,且声称开源的 TuttiCorpus 与代码在截稿时仍为承诺状态。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1563 words

U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement

📄 相位不再复用:当 Transformer 学会看懂复数谱图 英文题目:U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement 一句话:针对卷积难以捕捉长程时频依赖且复用含噪相位限制音质的问题,U-PAST 用复数谱图的 Transformer 编码加 U-Net 解码直接重建幅度和相位,在混响失配下取得最优 SI-SDR,并在匹配条件下以小参数取得最高 PESQ-wb,但低计算量尚未转化为时延优势。 标签:#语音增强 | #Transformer | #模型评估 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cao Duong Ly:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 Jörn Anemüller:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 💬 毒舌点评 用 1.17M 至 2.40M 参数和 4.39G 至 4.71G MACs 在混响失配下实现对全部基线的 SI-SDR 超越,证明了复数域 Transformer-U-Net 对相位感知与长程建模的协同价值,效率-鲁棒性权衡清晰。短板是所谓首个复数混合架构本质为 AST 分块嵌入与复数 U-Net 的工程拼接,未提出新注意力或复数算子,在其余 3 个条件下仍落后 TF-GridNet 1.62 dB 至 2.44 dB SI-SDR,且未开源任何代码与权重,复现与落地价值受限,低 MACs 也未转化为时延优势。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1637 words

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

2026-09-02 · 更新于 2026-09-04 · 24 min · 4954 words

CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

📄 用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型 英文题目:CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations 一句话:针对对比学习全局强局部弱、JEPA 局部强却依赖 EMA 且易坍缩的矛盾,CoJEPA 用同一 ViT-1D 主干在类别令牌上做对比、在序列令牌上做掩码潜预测,以对比梯度替代 EMA 实现稳定,并在 7 个音乐任务上尤其以调性与和声取得显著增益,代价是深层谐波信息衰退与私有数据限制复现。 标签:#音乐理解 #自监督学习 #对比学习 #Transformer #音乐检索 评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Gabriel Meseguer-Brocal:机构信息未在 arXiv HTML 中可靠披露 Yuexuan Kong:机构信息未在 arXiv HTML 中可靠披露 Romain Hennequin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用对比学习梯度直接替代联合嵌入预测架构的指数移动平均教师,单主干在类别令牌与序列令牌上分工施加全局对比与局部潜空间预测,7.1M 参数在调性与和声任务上逼近 330M 的 MusicFM,思路干净且有效。短板是预训练依赖未公开的 22M 私有曲库且无代码权重,掩码比例在方法章与训练章表述矛盾,层间性能波动大却缺乏对预测器深度与损失权重的消融,稳定性声明缺少损失曲线与坍缩度量支撑。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1263 words

Opinionated, Hesitant and Stressed: Three Studies of How Politicians Speak in Four Slavic Parliaments

📄 议会里的声音政治学:当情感、犹豫与重音在四种斯拉夫语中分道扬镳 英文题目:Opinionated, Hesitant and Stressed: Three Studies of How Politicians Speak in Four Slavic Parliaments 一句话:论文以 6000 小时 ParlaSpeech 议会语音为底座,用同一套对齐与标注流水线检验情感—声学、犹豫—语境、重音—词类三条线索,发现效价主导的 J 型声学曲线与南北斯拉夫分化的犹豫性别效应,以及克罗地亚语重音偏好的束状结构。 标签:#语音情感识别 #Transformer #模型评估 评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Ivan Porupski:机构信息未在 arXiv HTML 中可靠披露 Nikola Ljubešić:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把 ParlaSpeech 这一 6000 小时跨 4 语议会语音资源真正用到了语言学问题上,情感-声学 J 型曲线与填充停顿(filled pause,FP)性别效应南/西斯拉夫反转都具备跨语言对照价值。短板是三项研究拼盘式陈列、方法深度不足且统计建模细节与复现材料缺失,更像 ParlaSpeech 3.0 的能力展示报告而非独立的方法或发现型顶会论文。 ...

2026-09-01 · 更新于 2026-09-04 · 5 min · 1024 words

Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement

📄 相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来 英文题目:Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement 一句话:针对压缩相位感知损失在中高频的幅度-相位补偿导致过衰减,论文用固定 Sigmoid 与信号依赖的谱自适应两种频带加权来压低不可靠相位监督,在 HyST-Net 流式基线上使 4-8 kHz 的 LSD 降低约 1.18 dB 而全带质量持平,代价是超参数固定且仅在 DNS 合成集验证。 标签:#语音增强 #Transformer #流式处理 评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Haixin Zhao:机构信息未在 arXiv HTML 中可靠披露 Nilesh Madhu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于直指压缩相位感知损失的幅度相位补偿效应,用频带加权缓解中高频过衰减,动机清晰且与流式轻量场景强绑定。短板是两类加权本质仍是手工设计的频域衰减曲线,超参数固定且缺乏跨数据集与主观听感验证,HyST-Net 的混合建模也更像为验证损失而搭的基线而非独立贡献。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1093 words

Using Prosody to Predict Syntactic Structure

📄 韵律能猜出多少句法?把停顿与时长放进互信息的秤上称重 英文题目:Using Prosody to Predict Syntactic Structure 一句话:把韵律与句法的纠缠定义为互信息并用交叉熵上界在 34 万句英语朗读与自发对话上称重,证明时长与停顿可降低句法不确定性最高 10.2% 且主要标记边界,但已知词序列后增量信息因预训练不对称的估计偏差而近乎冗余。 标签:#Transformer #端到端 #模型评估 评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Junghyun Min:Georgetown University Alex Warstadt:UC San Diego Tamar I. Regev:MIT Tiago Pimentel:机构信息未在 arXiv HTML 中可靠披露 Ethan Gotlieb Wilcox:Georgetown University 💬 毒舌点评 亮点在于把韵律与句法的纠缠首次形式化为可计算的互信息,并用多模态 T5 在 34 万句规模上给出量化证据,框架的结构无关性与特征模块化值得肯定。短板是仅用时长与停顿两个最粗糙的韵律特征且仅在英语上验证,却对文本与韵律编码器不对称预训练导致的负条件互信息估计轻描淡写,结论的外推力被严重削弱。 📌 核心摘要 论文旨在量化韵律究竟携带多少句法信息,以检验直接指称、间接指称等理论对句法-韵律接口的竞争性预测。方法核心是将句法信息含量定义为韵律随机变量 \(P\) 与句法随机变量 \(S\) 的互信息 \(I(P;S)\) 及其文本条件版本 \(I(P;S|W)\),并通过编码器-解码器语言模型的交叉熵上界来估计句法熵 \(H(S)\) 与条件熵。相较于以往依赖个案或简化统计假设的研究,该框架具有结构无关、上下文敏感与特征模块化三个新特性,可分离不同韵律通道与句法成分的贡献。实验在 298k 句自发对话 CANDOR 与 44k 句朗读 LibriTTS 上显示,时长与停顿单独可降低句法不确定性最高达 10.2%,且主要编码边界而非短语标签,在自发语音中占比更高。该结果为间接指称理论与韵律引导习得提供了大规模实证支持,同时表明在已知词序列时韵律的增量句法信息接近冗余且因估计偏差呈现负值。局限在于仅考察英语的两个韵律维度、依赖 Stanza 银色句法分析、韵律编码器与文本编码器预训练不平衡导致的估计偏差以及未约束输出词表造成的概率泄露。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1512 words