ICLR 2026 语音/音频论文详细分析
共分析 133 篇 ICLR 2026 论文
共分析 133 篇 ICLR 2026 论文
MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。
针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。
共分析 62 篇语音/AI 论文
针对多乐器混合中只改部分音符又要保留其余音色与 concurrent 内容的问题,该文用冻结 HeartCodec 的标量量化潜变量做流匹配生成,用 MIDI Span 把帧内时刻保留为连续属性并做置换不变池化,最强证据是转录与重建误差分解显示量化只带来约 0.45 个百分点损失而转录本身带来 21.60 个百分点损失,主要代价是对 1-5 ms 微小起音偏 …
共分析 42 篇语音/AI 论文
论文用 124 位作曲家的旋律续写任务训练条件 Transformer,只以作曲家身份为监督,学到的 124×128 嵌入的第一主成分与出生年强相关并通过打乱检验,最强的向量算术例子同时暴露了旋律表征覆盖不了配器音色的代价。
共分析 26 篇语音/AI 论文
针对日语无切分与多音字难题,该研究用词典格子约束候选、用字符级语境打分选择路径,并用大模型标注约两百多万句训练,常用汉字读音基准上报告 99.62% 目标词准确率,代价是专有名词与数字归一化仍需外挂模块。
针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。
共分析 36 篇语音/AI 论文
针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。
共分析 29 篇语音/AI 论文
该文在约 400 小时面对面双人对话上把注视、头部、身体手部与面部动作单元接入语音活动投影模型,最优结构以交叉注意力加三帧差分与早期门控把语音活动投影损失从 2.166 降到 2.100,面部动作单元是最强的单一视觉组但全量组合仍最好,代价是需要多模态特征提取与更大的推理开销且划分不是按会话对隔离。
针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。
论文把传统编码再经神经音频编解码器转码后的来源识别定义为取证缺口,用分层因果与时序注意力建模 RVQ 序列,在固定码率下取得 97% 以上准确率,而 18 类联合任务为 89.34% 且高码率 MP3 与 Opus 仍易混淆。
该研究把时间戳与说话人归属做成对给定转录本的单遍占位填充,用双向大模型同时输出全部标签,在相同训练数据下比同类自回归模型更准且标注快一到两个数量级,但流水线总速度仍受前置语音识别限制。
共分析 59 篇语音/AI 论文
论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读