ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
针对单句语音情绪识别忽略对话连续性的问题,论文提出只用前文音频做均值池化增强的 ACERT 模块,在 IEMOCAP 上以 25 秒前文将无上下文基线从 68.38% 提高到 79.08%,代价是情绪快速翻转的多人对话如 MELD 几乎无增益。
针对语音模型泛化不到环境音、频谱模型保不住语音时序的问题,JASPER 在共享 Transformer 上联合预测时域伪标签与频域块标签,原文报告 2000 小时下平均准确率 81.74% 与 XARES-LLM 两轨 0.66 和 0.50 的领先均值,但频谱权重极偏向 0.01 且推理仍只用波形输入。
针对约旦方言标注语音稀缺问题,论文用 Wav2Vec 2.0 自监督表示做起点,再以五轮噪声学生训练迭代利用未标注与增强语音,在 12.5 小时标注加五批各 2.5 小时未标注条件下把词错误率降到 51%,代价是多轮大模型迭代需要双卡 83 小时级训练开销。
针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。
PACE 针对非平行口音转换,用冻结 WavLM 上的口音预测子空间更新加检索融合实现推理时可调的转换强度,默认点以 16.0% 词错误率和 39.0% 分类器准确率优于复现基线,代价是说话人相似度降到 0.583。
针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。
论文用可独立控制的 FormulaBank 把程序化规模拆成公式类覆盖 C 与类内渲染多样 I,在 FDSL 与 AudioMAE 对照中显示两者收益不同且依赖学习形式,匹配的 AudioMAE 实验显示程序化音频偏好 10–25% 低掩码而 AudioSet-28K 偏好 50–75% 掩码,代价是结论限于全量微调与特定模型流程。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对多车同时遮挡的非视距预警问题,该工作在原始 8 通道波形上做隔帧未来潜表示预测预训练,再用双向长短期记忆网络做三头微调,在 T 路口验证取得方向与计数与车型同步提升,代价是仅验证至多 2 辆车且跨场景需少样本适配。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。
针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。
该研究从法国电视广播档案出发固定编码器与训练步数,只改变一千小时预训练子集的成分,再用语音识别与语音音乐检测等下游对照检验成分效应,结果显示去音乐有助于识别而多样内容有助于兼顾语音与音乐,重复则同时带来识别下降与记忆上升。
针对法语语音自监督编码问题,论文用 data2vec 2.0 式师生预测潜表示并引入 10 万小时 INA 电视广播音频,语音多任务上达到或超过 LeBenchmark 基线,但 114k 小时在大模型上在 CommonVoice 验证集未继续降低词错误率。
论文复现基于频谱的句级嗓音强度回归并在新录音条件下发现其失效,进而用 Wav2Vec 2.0 浅层表示训练回归器,在 VIC 上把决定系数维持在 0.83 左右,代价是跨条件差距仍未完全消除。
论文把任务定为估计第二句相对第一句在九个反义维度上的印象差向量,对比可解释声学特征、自监督表示与多模态大模型三条路线,报告自监督表示在复杂印象上更稳,而多模态大模型零样本不可靠,代价是单女声优与同文本的强受控条件。
该文把 TTS 来源追溯写成先判断是否见过再归属到具体系统的两阶段问题,用 Wav2Vec2-BERT 嵌入加 Proxy-Anchor 学习结构化嵌入空间,在 MLAAD v9 合并架构类上报告 99.76% 闭集准确率与 2.04% 的 FPR@95,代价是依赖手动合并架构与保留校准集调阈值。
针对单模态噪声与跨模态语义鸿沟,BYOAVP 以自监督音频增强对齐视觉语义、以动量原型约束做像素级分类,在 AVSBench 与 VPO 六个子任务上取得最优,同时需承担双分支注意力与原型维护的额外开销。
该文用图像字幕先建视觉词表再过滤语音,用无监督词发现做两两对齐与堆叠评分定位关键词,在视觉监督下超过神经基线,但共现词与字幕噪声仍带来明显定位损失与计算代价。