ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
论文用典型相关分析和留一组合重构检验冻结的 Wav2Vec2、HuBERT 和 CLAP 能否把未见声源组合表示成各声源贡献之和,最强证据是 CLAP 在 FSD50K 重复保持组合上同时超过置换与标签重叠基线,但三者都存在不可忽略的重构残差。
针对音频语言模型能懂语义却听不准声学细节的问题,EvoAudio 用当前模型的弱项决定下一轮练什么、工具合成波形保证答案可验证、GRPO 训练加留出集晋级做 13 轮递归进化,最强证据是五个不同骨干平均最高且总体最高提升 6.3 点,代价是工具覆盖不到的语义文化推理提升有限且后期收益变平。
针对语音模型泛化不到环境音、频谱模型保不住语音时序的问题,JASPER 在共享 Transformer 上联合预测时域伪标签与频域块标签,原文报告 2000 小时下平均准确率 81.74% 与 XARES-LLM 两轨 0.66 和 0.50 的领先均值,但频谱权重极偏向 0.01 且推理仍只用波形输入。
MoSAT 针对空间音频加文本联合驱动人体动作的新任务,用运动 VAE 压缩加变换器流匹配分层融合条件,在 STAM 联合评测中对齐与分布质量占优,但强噪声与模态错位时仍会退化。
该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。
该研究把双耳声波形直接映射为连续高采样率脑电,用约 250 小时异构数据训练一个因果编码器解码器,并在并行脑干响应、语音时间响应函数与双耳交互成分三类范式上复现了已知的形态与刺激依赖效应,但串行呈现幅值与部分响应幅度仍存在系统性偏差。
针对多编码器大音频语言模型靠直觉或穷举选编码器的问题,论文提出只用单编码器成绩算类别级与任务级相关性的 CUES 规则,在 XARES-LLM 上 Track A 选出三编码器提升 4.3% 而 Track B 主动只留双编码器提升 6.3%,代价是选择依赖开发集打分且仅在单 135M 骨干上验证。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
本文沿录制、测量与可视化三条动作重走从奥斯特电磁实验到爱迪生留声机、利萨如与柯尼希与亥姆霍兹光学装置、再到长笛与管风琴羽管键琴类比与斯特鲁伊肯单弦测听计的链条,最强证据是可用装置参数与操作步骤的原文对应,代价是它不提供可运行的定量比较实验与误差统计。
该研究用口语词云重组任务检验形容词长度与介词短语类型对法语形容词前置率的影响,最强证据是长形容词主效应系数 -2.29 且名词补语与动词补语都提升前置率,代价是韵律模式仍在分析中且样本限于双音节名词与特定音节组合。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该研究以约 80 分钟职业普通话脱口秀 64 个笑话检验笑点前停顿时长是否系统性拉长,并用 20 个陌生笑话各合成 5 种停顿时长检验听众好笑度评分,最强证据是笑点前停顿显著长于基线约 157 毫秒而感知端五条件无显著差异,代价是结论只在保留语义的音频单线索操纵下成立。
论文追问手势在新乐器与机器共创中如何被数据化与操控,提出以拉美赛博格主义重嵌社会语境,并以抗议分析、 telematic 拼贴与生态工作坊三例显示情境化方法的收益,其代价是缺乏可比指标与可复用系统评估。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
EMMA 从视频、音频与图表时间序列联合反推显式参数、隐式动力学与坐标不变量,在 75 个 Delfys 视频与 rover、无人机及仿真图表上给出可仿真验证的参数,并以约 1.4 倍于基线的单轮耗时换取多参数与隐式建模能力。
论文针对双算子 FM 同时估计载波与调制频率易陷局部极小的问题,提出把频率比约束在相邻低阶有理边界之间的多起点梯度优化,在 90 组受控合成测试中把成功率提高到 96.7%,代价是每个用例要并行跑 9 个候选且真值恰在边界上仍会失败。
Murzinograph 用三维确定性卷积自编码器把频谱图窗口序列压成三维加时间的轮廓轨迹,以牺牲精细重建为代价换取人可读的可视化,并在音乐、鸟鸣、鲸歌与约 2 小时的山谷田野录音上展示跨材料的一致性与社区解读价值。