ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
该研究针对孟加拉语会话缺少轮次结束标注问题,用播客音频加说话人日志加语言模型初标加人工全检构建 35374 条语料,并用 Whisper 编码器加多尺度池化做二分类,在 319 条异源平衡测试集上达到 84.33% 准确率,代价是误报率升至 23.75%。
针对复调录音中同音色音符互相泄漏的问题,论文用谐波与打击乐双流 NoteGrab 按音高与起止逐个抓取音符,再用自适应集合归属联合重分混合能量,在 SCNS-Eval 上中位 SI-SDR 达 7.39 dB,代价是逐音符推理与完整乐谱依赖。
针对日常视频中增益失衡叠加噪声与混响的问题,SSE 用视频加文字引导的流匹配生成做重混与增强,在 DegradedMix 与 MuddyMix 上以分布与对齐指标优于 VisAH,但单真值重建指标上优势收窄且依赖预训练编解码与分离权重。
针对多轮多音频时间问答中实例漏检会改变计数与总时长的问题,TEMA 用 Route 定音频范围、Span 记全全部实例区间再推理作答,在 Test253 上 Qwen2.5-Omni 基座的问答准确率达到 69.81%,代价是需要三阶段训练与完整逐轮证据监督,且跨音频比较仍有波动。
VietPrism 用 993.4 小时真人语音与说话人配对的伪造语音研究方言和越英混说下的检测脆弱性,最强证据是零样本检测器随说话人相似度升高而 EER 明显恶化,代价是小方言样本少且合成系统只有四种。
YODAS v3 针对开放语料偏向英语单声道窄带的问题,采用分语言关键词与保原始 48 kHz 多声道下载的构造路线,用 22 个语言超 10K 小时与 92.5% 录音有效带宽超 32 kHz 等证据支撑规模与保真判断,代价是弱标注依赖自动字幕与语言标签代理。
SPADE 针对长语音中局部篡改的检测与定位问题,用大模型改写文本加合成与编辑两类生成器构建 12 语言数据,并在定位模型上报告跨生成器、跨语言、跨声学环境三类泛化证据,主要代价是未见生成器下接近随机猜测且噪声下显著退化。
针对用户语音输入后用英语俳句语音回应的任务,HaikuS2S 采用自动语音识别加大型语言模型加语音合成的级联路线,配合通用诗歌与自录俳句两段微调,最强证据是俳句微调后音高对齐与可懂度改善,而代价是会话自然度评分下降与小规模录音带来的泛化限制。
MoSAT 针对空间音频加文本联合驱动人体动作的新任务,用运动 VAE 压缩加变换器流匹配分层融合条件,在 STAM 联合评测中对齐与分布质量占优,但强噪声与模态错位时仍会退化。
COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。
针对说话数据训练的模型在唱歌时出现节奏漂移和表情受限的问题,论文用三阶段过滤构建 29500 余段野外唱歌头数据,并在 Hallo 等架构上验证了唇同步与节奏对齐的提升,但高强度筛选只保留约 6.9% 原料且依赖人工打分融合。
针对音频大模型能转写却听不懂说话方式与声学环境的问题,论文用 22 维特征定义、120 万音频问答对与先单属性后多属性的两阶段课程训练 ParA-LLM,在 ParA-Bench 总体上报告 43.53% 准确率并在外部语音基准上同步提升,代价是声学单项仍弱于 GPT-4o-Audio 且绝对准确率仍远低于人类。
该文用 1000 组英文转写偏好标注比较词错率、字错率与多配置语义指标,发现词错率与人判断一致度最低而最优语义距离略优但未显著超过字错率,因此主张默认报告字错率并辅以语义指标。
该研究针对可公开复现的大规模音乐与文本配对缺失问题,选择以互联网档案馆中声明为知识共享许可的音频为源、轻量音频语言模型初标加分类标签与档案元数据聚合精修为方法,最强证据是 1500 段抽样下与 JamendoMaxCaps 相当的参考无关分数与正确性完整性约 4.2 分以上的人评,主要代价是长时体裁欠采样与语言流畅性仍落后于人工标注。
该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。
针对肺功能检查依赖设备与配合的问题,SpiroPhonia 用真实访谈中的自发语音提取抖动、频谱与停顿三类特征,在 201 人被试独立测试上报告 78% 准确率、80% F1 与 87% AUC,代价是小样本下置信区间宽且跨语言跨设备泛化待验证。
BioDCASE 用固定 PerchV2 嵌入和两层分类头比较了 14 种批量主动采样策略,最强方法以四子集平均学习曲线下面积 0.507 超过随机采样的 0.401,但增益在 HSN 高达 67.1% 而在 ATBFL 仅 8.0%,且更小批量带来两倍计算代价。
该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。
针对语音共情对话中只做情绪识别就直接生成的问题,ER-EDF 用感知加规则调节再提示生成的链路组织回复,在 IEMOCAP 与 MELD 构造的两种共情参考上多数情况下提升共情指标,但高强度表演式对话与小模型接地能力仍是代价与边界。