论文解读

把风格决策写成指令:Interactive TTS 如何拆开理解与发声

针对多轮多模态对话中风格稀疏且易漂移说话人音色的问题,论文用显式风格指令拆开感知与合成,并用迭代拒绝采样与上下文偏好优化对齐生成器,在保持音色与可懂度的同时提升指令遵循与情境适配,但细粒度句内动态仍未解决。

 · 约 11 分钟 · 5500 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 约 112 分钟 · 55814 字 阅读 →
论文解读

把谁说了什么写对:用真实失败做偏好优化的端到端角色转写

针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。

 · 更新于 2026-09-24 · 约 19 分钟 · 9324 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

先想明白再开口:用数据清洗、蒸馏与偏好对齐修好上下文语音合成

针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9249 字 阅读 →
论文解读

干净语音上失灵的无参考分数:从评测崩塌到奖励作弊

论文用六个语料的成对偏好任务检验无参考语音质量分,发现有瑕疵时接近人类上限而双干净时跌到随机,最强证据是干净端单分数与时长基线持平,而域内校准复合与等权复合分别在评测和奖励端缓解但仍远离上限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8427 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

对齐不必最锐:用偏好门控把 CTC 约束放进 DPO

针对从零训练的解码器语音合成的内容幻觉问题,论文把只作用于优选样本的轻量 CTC 对齐项折进直接偏好优化,在 Seed-TTS 英文集上把严重幻觉率从 4.4% 降到约 0.6%,代价是需要切到 eager 注意力读图且过强加权会转入自信但错位的过锐区。

 · 更新于 2026-09-24 · 约 20 分钟 · 9655 字 阅读 →
论文解读

不学大语料也能变奏:把动机当轨迹、用可控噪声做表情完备的变体

针对大语料深度模型不适用个人作曲且只处理音高时值的问题,该文把带表情的动机表示为音程状态轨迹并以卡尔曼式随机偏离生成变体,用作曲家自己的选择在线调节方差与结构编辑概率,代价是只做单声部且无定量评测与用户研究。

 · 更新于 2026-09-24 · 约 20 分钟 · 9711 字 阅读 →
论文解读

不用学奖励模型:用人群密度地形图做对话式均衡的在线探索与离线打磨

针对自然语言到二维均衡参数的连续控制任务,论文用约 9 万次用户交互构建非参数偏好密度奖励面,先以 GRPO 做在线结构对齐再以 DPO 做峰值注入精修,在分布外概念上以 1.5B 模型达到与 GPT-4o mini 可比的听感,代价是混合管线对分组数敏感且仅适用于低维空间。

 · 更新于 2026-09-24 · 约 20 分钟 · 9787 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-14

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28192 字 阅读 →
论文解读

边听边说还不能卡:用因果扩散迫使头像实时接住用户

针对双人对话头像需要实时响应用户语音与动作、且倾听表情难以标注的问题,论文用因果扩散强迫在动作隐空间逐块生成并用丢用户条件的合成负样本做偏好优化,报告约 500 ms 延迟、6.8 倍加速与超 80% 人工偏好,代价是口型与画质只保持可比而非全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8137 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

看见鼓槌落下才发声:用音视频对齐的扩散变换器与语义时间偏好优化做视频生音频

针对无声视频生成音频时语义错位与时间错位并存的问题,论文用音视频时间对齐加图文语义引导的流匹配扩散变换器做基座,再用 ImageBind 与 Synchformer 自动排序的偏好优化做对齐微调,在 VGGSound 测试集上以 151M 参数取得分布与同步指标的领先,但高帧率编码与多轮偏好迭代仍带来额外开销与过优化风险。

 · 更新于 2026-09-24 · 约 19 分钟 · 9262 字 阅读 →
论文解读

用不相关扰动不变、相关损坏敏感拆开音视频:MoD-DPO 如何压制跨模态幻觉

针对全模态大模型把一模态线索误用到另一模态提问以及过度依赖文本先验的问题,论文提出在偏好优化中加入不相关模态不变与相关模态敏感两项解耦约束并叠加纯文本惩罚,用自动构造的约 1.8 万偏好样本训练,在幻觉基准上报告最高约 27% 的匹配任务提升,而代价是每步增加无需梯度的损坏输入前向与四分之一轮数的训练预算控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8945 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

听不清就靠编:用反事实硬负例把音频时间线对齐回声学证据

针对大音频语言模型在事件遗漏、身份误判、时序关系与定量时间四类细粒度推理上依赖语言先验的问题,论文以共享音频问题池同时构造偏好对齐数据与诊断基准并用直接偏好优化对齐 Qwen2.5-Omni-7B,报告在诊断集上定量与关系错误率大幅下降并在公开基准上小幅提升,代价是依赖字幕代理、人工筛选与自动裁判误差等条件约束。

 · 更新于 2026-09-24 · 约 18 分钟 · 8911 字 阅读 →
论文解读

把指令翻译成可测量的声音特征:BatonVoice 的指挥家与乐团分工

针对可控语音合成中指令理解与语音生成耦合导致标注昂贵的问题,该文把外部大语言模型定为指挥家生成逐段音高能量音色数值计划、把 BatonTTS 定为乐团按计划合成,最强证据是 1.7B 模型在英文情感准确率 57.6% 并零样本迁移到中文 56.2%,代价是依赖外部大模型生成计划并引入约 20 秒级计划延迟与两阶段推理链条。

 · 更新于 2026-09-24 · 约 18 分钟 · 8791 字 阅读 →
论文解读

不成对也能对准发音:用对比模型找出关键语音 token 再加权优化

针对日语多音字读错且成对偏好样本稀少的问题,论文用两个对比语言模型估计 token 级重要性权重再做加权 KTO,在报告中将日语准确率从 0.668 提升到 0.958 并把可利用样本从 1.5K 扩大到 9K,代价是需要先训练两个对比模型约 10 分钟 8 卡 A100 的额外预计算。

 · 更新于 2026-09-24 · 约 19 分钟 · 9274 字 阅读 →