会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

混合声能写成声源之和吗:冻结音频表示的加性组合诊断

论文用典型相关分析和留一组合重构检验冻结的 Wav2Vec2、HuBERT 和 CLAP 能否把未见声源组合表示成各声源贡献之和,最强证据是 CLAP 在 FSD50K 重复保持组合上同时超过置换与标签重叠基线,但三者都存在不可忽略的重构残差。

 · 约 19 分钟 · 9324 字 阅读 →
论文解读

听不清细节的音频大模型:用可验证的合成音频一轮轮自己出题

针对音频语言模型能懂语义却听不准声学细节的问题,EvoAudio 用当前模型的弱项决定下一轮练什么、工具合成波形保证答案可验证、GRPO 训练加留出集晋级做 13 轮递归进化,最强证据是五个不同骨干平均最高且总体最高提升 6.3 点,代价是工具覆盖不到的语义文化推理提升有限且后期收益变平。

 · 约 19 分钟 · 9393 字 阅读 →
论文解读

给波形编码器补上频谱课:JASPER 的时频联合掩码预训练

针对语音模型泛化不到环境音、频谱模型保不住语音时序的问题,JASPER 在共享 Transformer 上联合预测时域伪标签与频域块标签,原文报告 2000 小时下平均准确率 81.74% 与 XARES-LLM 两轨 0.66 和 0.50 的领先均值,但频谱权重极偏向 0.01 且推理仍只用波形输入。

 · 约 18 分钟 · 8958 字 阅读 →
论文解读

文本定意图、空间音频定方位与时机:MoSAT 的分层条件动作生成

MoSAT 针对空间音频加文本联合驱动人体动作的新任务,用运动 VAE 压缩加变换器流匹配分层融合条件,在 STAM 联合评测中对齐与分布质量占优,但强噪声与模态错位时仍会退化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10891 字 阅读 →
论文解读

离散还是连续:语义约束决定音频理解上限

该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。

 · 更新于 2026-09-24 · 约 22 分钟 · 10552 字 阅读 →
论文解读

一个因果音频到脑电模型如何同时复现脑干、皮层与双耳整合响应

该研究把双耳声波形直接映射为连续高采样率脑电,用约 250 小时异构数据训练一个因果编码器解码器,并在并行脑干响应、语音时间响应函数与双耳交互成分三类范式上复现了已知的形态与刺激依赖效应,但串行呈现幅值与部分响应幅度仍存在系统性偏差。

 · 更新于 2026-09-24 · 约 20 分钟 · 9805 字 阅读 →
论文解读

不穷举 220 种融合也能选编码器:用成绩相关性在互补与干扰之间划线

针对多编码器大音频语言模型靠直觉或穷举选编码器的问题,论文提出只用单编码器成绩算类别级与任务级相关性的 CUES 规则,在 XARES-LLM 上 Track A 选出三编码器提升 4.3% 而 Track B 主动只留双编码器提升 6.3%,代价是选择依赖开发集打分且仅在单 135M 骨干上验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10036 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

把声音变成可比的痕迹:从电磁记录到光学比较与乐器模型

本文沿录制、测量与可视化三条动作重走从奥斯特电磁实验到爱迪生留声机、利萨如与柯尼希与亥姆霍兹光学装置、再到长笛与管风琴羽管键琴类比与斯特鲁伊肯单弦测听计的链条,最强证据是可用装置参数与操作步骤的原文对应,代价是它不提供可运行的定量比较实验与误差统计。

 · 更新于 2026-09-24 · 约 20 分钟 · 9838 字 阅读 →
论文解读

法语形容词前后位置之争:句法邻近要求与韵律分组如何共同起作用

该研究用口语词云重组任务检验形容词长度与介词短语类型对法语形容词前置率的影响,最强证据是长形容词主效应系数 -2.29 且名词补语与动词补语都提升前置率,代价是韵律模式仍在分析中且样本限于双音节名词与特定音节组合。

 · 更新于 2026-09-24 · 约 20 分钟 · 9856 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

笑点前多停 157 毫秒:普通话脱口秀会标记笑点,但听众不靠它觉得好笑

该研究以约 80 分钟职业普通话脱口秀 64 个笑话检验笑点前停顿时长是否系统性拉长,并用 20 个陌生笑话各合成 5 种停顿时长检验听众好笑度评分,最强证据是笑点前停顿显著长于基线约 157 毫秒而感知端五条件无显著差异,代价是结论只在保留语义的音频单线索操纵下成立。

 · 更新于 2026-09-24 · 约 19 分钟 · 9206 字 阅读 →
论文解读

手势进机器之后还剩什么:拉美赛博格主义的三次智利实践

论文追问手势在新乐器与机器共创中如何被数据化与操控,提出以拉美赛博格主义重嵌社会语境,并以抗议分析、 telematic 拼贴与生态工作坊三例显示情境化方法的收益,其代价是缺乏可比指标与可复用系统评估。

 · 更新于 2026-09-24 · 约 22 分钟 · 11004 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

看不见输入时如何算出物理参数:EMMA 的多模态反演

EMMA 从视频、音频与图表时间序列联合反推显式参数、隐式动力学与坐标不变量,在 75 个 Delfys 视频与 rover、无人机及仿真图表上给出可仿真验证的参数,并以约 1.4 倍于基线的单轮耗时换取多参数与隐式建模能力。

 · 更新于 2026-09-24 · 约 21 分钟 · 10430 字 阅读 →
论文解读

有脊的搬土损失:低阶有理比如何卡住双算子 FM 频率估计

论文针对双算子 FM 同时估计载波与调制频率易陷局部极小的问题,提出把频率比约束在相邻低阶有理边界之间的多起点梯度优化,在 90 组受控合成测试中把成功率提高到 96.7%,代价是每个用例要并行跑 9 个候选且真值恰在边界上仍会失败。

 · 更新于 2026-09-24 · 约 17 分钟 · 8299 字 阅读 →
论文解读

看得清反而重建差:Murzinograph 用三维瓶颈把声音画成可走的轨迹

Murzinograph 用三维确定性卷积自编码器把频谱图窗口序列压成三维加时间的轮廓轨迹,以牺牲精细重建为代价换取人可读的可视化,并在音乐、鸟鸣、鲸歌与约 2 小时的山谷田野录音上展示跨材料的一致性与社区解读价值。

 · 更新于 2026-09-24 · 约 22 分钟 · 10804 字 阅读 →