会议总览

ICLR 2026 语音/音频论文详细分析

共分析 133 篇 ICLR 2026 论文

 · 更新于 2026-09-24 · 约 406 分钟 · 203008 字 阅读 →
论文解读

跑调的人声如何借伴奏找回调:MIDIBack 的联合符号建模

MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。

 · 约 17 分钟 · 8452 字 阅读 →
论文解读

修音准节奏又不换嗓:整流流如何把遮罩补全做成风格保持的美化

针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。

 · 约 17 分钟 · 8144 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 约 112 分钟 · 55814 字 阅读 →
论文解读

在 25 Hz 潜变量上修音符:标量量化与 MIDI 跨度如何支撑多乐器混合的再合成

针对多乐器混合中只改部分音符又要保留其余音色与 concurrent 内容的问题,该文用冻结 HeartCodec 的标量量化潜变量做流匹配生成,用 MIDI Span 把帧内时刻保留为连续属性并做置换不变池化,最强证据是转录与重建误差分解显示量化只带来约 0.45 个百分点损失而转录本身带来 21.60 个百分点损失,主要代价是对 1-5 ms 微小起音偏 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

只用生成误差学作曲家风格:Composer2Vec 的时间轴从哪里来

论文用 124 位作曲家的旋律续写任务训练条件 Transformer,只以作曲家身份为监督,学到的 124×128 嵌入的第一主成分与出生年强相关并通过打乱检验,最强的向量算术例子同时暴露了旋律表征覆盖不了配器音色的代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9671 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-21

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25432 字 阅读 →
论文解读

放宽切分、收紧词典:用格子上的条件随机场做日语读音选择

针对日语无切分与多音字难题,该研究用词典格子约束候选、用字符级语境打分选择路径,并用大模型标注约两百多万句训练,常用汉字读音基准上报告 99.62% 目标词准确率,代价是专有名词与数字归一化仍需外挂模块。

 · 更新于 2026-09-24 · 约 19 分钟 · 9505 字 阅读 →
论文解读

矛盾本身就是信号:用差异建模识别犹豫与矛盾

针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
论文解读

看不清就撞一下再改路:TDGP 用令牌融合定方向、用碰撞删边改路径

针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8733 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

声音已很强时,脸还能帮轮流说话预测多少

该文在约 400 小时面对面双人对话上把注视、头部、身体手部与面部动作单元接入语音活动投影模型,最优结构以交叉注意力加三帧差分与早期门控把语音活动投影损失从 2.166 降到 2.100,面部动作单元是最强的单一视觉组但全量组合仍最好,代价是需要多模态特征提取与更大的推理开销且划分不是按会话对隔离。

 · 更新于 2026-09-24 · 约 19 分钟 · 9331 字 阅读 →
论文解读

秒级对齐加软标签:AVNet 如何让声音与画面在缺模态时仍能互补

针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。

 · 更新于 2026-09-24 · 约 18 分钟 · 8553 字 阅读 →
论文解读

神经转码盖不住旧痕迹:从离散 RVQ 令牌中追溯传统编码器来源

论文把传统编码再经神经音频编解码器转码后的来源识别定义为取证缺口,用分层因果与时序注意力建模 RVQ 序列,在固定码率下取得 97% 以上准确率,而 18 类联合任务为 89.34% 且高码率 MP3 与 Opus 仍易混淆。

 · 更新于 2026-09-24 · 约 20 分钟 · 9636 字 阅读 →
论文解读

给定时转录本后一次标全词时间戳与说话人:非自回归标注为何更快更准

该研究把时间戳与说话人归属做成对给定转录本的单遍占位填充,用双向大模型同时输出全部标签,在相同训练数据下比同类自回归模型更准且标注快一到两个数量级,但流水线总速度仍受前置语音识别限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9939 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →
论文解读

亲缘线索稀疏且跨库易失效时,用卷积加变换器做选择性聚合

论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。

 · 更新于 2026-09-24 · 约 18 分钟 · 8800 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →