论文解读

连续自回归做钢琴渲染:全局作曲、局部演奏与全序列精修如何分工

针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8939 字 阅读 →
论文解读

先互相增强语义再记忆历史:CTAN 用循环一致与时间门控做声音导航

针对深度与双耳音频简单拼接会丢失几何语义关联的问题,CTAN 用双向重构交叉注意力做主动语义增强、用门控时间记忆桥接听觉死区,在 Replica 与 Matterport3D 未见环境中相对 SoundSpaces 基线提升了未听过声音下的成功率与路径效率,但消融显示各模块贡献与听觉死区恢复能力仍受场景规模与声音泛化条件限制。

 · 更新于 2026-09-25 · 约 18 分钟 · 8723 字 阅读 →
论文解读

把谁说了什么写对:用真实失败做偏好优化的端到端角色转写

针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。

 · 更新于 2026-09-25 · 约 19 分钟 · 9324 字 阅读 →
论文解读

把情感拆成方向与强度:瓶颈专家分治处理多模态情绪

该文把视频多模态情感分析拆为极性判别与强度回归,用极性与强度瓶颈专家分别压缩各模态信息再做跨模态路由融合,在四个中英文数据集与多种语言模型上报告了路由设置与专家分工证据,但未公开代码与完整训练预算。

 · 更新于 2026-09-25 · 约 8 分钟 · 3732 字 阅读 →
论文解读

同一句话为何有时该让、有时该留:ECHO 用配对上下文检验全双工让轮

ECHO 把插入文本固定而重写前文对话来区分打断与非打断重叠,用必须两成员全对的配对指标报告了三系统重度让出偏置与仅 MiniCPM-o 4.5 相对均衡,代价是合成语音与受控声学带来的生态效度损失。

 · 更新于 2026-09-25 · 约 22 分钟 · 11022 字 阅读 →
论文解读

强音频压住弱情绪时:EMODY Flow 用辅助分类器找回情绪可控性

EMODY Flow 复用冻结 Qwen-3 Omni Talker 的 Mimi 音频嵌入驱动两个并行 DiT 流匹配模型分别生成身体与面部动作,在 BEAT2 上以 FGD 0.302 报告手势质量最优,并以 FGD 升至 0.362 的小幅代价换取身体动作的情绪可分性。

 · 更新于 2026-09-25 · 约 22 分钟 · 10738 字 阅读 →
论文解读

先唤醒编码器再整体微调:用轻量适配器补上语音大模型的声学短板

针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。

 · 更新于 2026-09-25 · 约 20 分钟 · 9557 字 阅读 →
论文解读

从一个人跳到一屋人跳:Encypher 把集体律动写成音乐提示

Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。

 · 更新于 2026-09-25 · 约 18 分钟 · 8986 字 阅读 →
论文解读

用稀疏局部图约束跨模态对齐,再让 Mamba 管长时序的轻量音视增强

针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。

 · 更新于 2026-09-25 · 约 18 分钟 · 8523 字 阅读 →
论文解读

同一段语音,不同理解:用固定音频区分语义推断与直接给词

HearInContext 用共享合成语音配对隐式与显式上下文研究同音歧义消解,报告 Qwen3-ASR-1.7B 隐式目标词召回中英分别提升 11.0 和 11.5 个百分点而通用识别误差变化低于 0.1 个百分点,代价是训练配比不当会损害无关上下文鲁棒性。

 · 更新于 2026-09-25 · 约 17 分钟 · 8083 字 阅读 →
论文解读

各层残差变化不同速,为何还要共用同一切分:LACE 的逐层压缩

针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。

 · 更新于 2026-09-25 · 约 17 分钟 · 8057 字 阅读 →
论文解读

名义延迟不够用:用实测词延迟联合奖励重排流式识别的输出时机

针对延迟流建模中结构延迟不能代表用户等待且固定对齐迫使模型晚输出的问题,论文引入词级实测延迟并在单点用准确率加延迟联合奖励做 GRPO 后训练,在 80 ms 处把词错误率相对降低 30.8% 且在 480 ms 处把中位延迟从 1.17s 降到 1.04s。

 · 更新于 2026-09-25 · 约 17 分钟 · 8503 字 阅读 →
论文解读

在多通道输出里做掩蔽:增强越强,残留干扰的空间感丢得越多吗

该文用理想比值掩蔽比较麦克风、波束形成器和 Ambisonics 三种域的增强,报告显示波束域语音质量最高而 Ambisonics 域更好地保留残留干扰的空间属性,且所有方法都保留目标声源定位线索,但以混响目标为期望才能保住混响。

 · 更新于 2026-09-25 · 约 15 分钟 · 7495 字 阅读 →
论文解读

移动声源下镜像源如何配对:用部分最优传输做房间冲激响应插值

针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。

 · 更新于 2026-09-25 · 约 22 分钟 · 10792 字 阅读 →
论文解读

缺口比模型阶数还短时,Etter 的双向自回归插值还能解吗

论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。

 · 更新于 2026-09-25 · 约 18 分钟 · 8983 字 阅读 →
论文解读

演得久就会露馅:RoleBreak 测语音角色扮演的长程一致性与声音情感

RoleBreak 用 310 个角色与 6688 个多轮语音轮次同时测语义角色保持与声音情感表达,发现最强系统仍在平均 10.4 轮出现人格失败且全部系统情感分低于 14.7,而把语言模型从 2B 放大到 27B 能推迟语义失败却几乎不改善声音情感。

 · 更新于 2026-09-25 · 约 18 分钟 · 8657 字 阅读 →
论文解读

不录音也能装上读音开关:用模型自己的声音教它读重音

针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。

 · 更新于 2026-09-25 · 约 15 分钟 · 7184 字 阅读 →
论文解读

说话人压过语言:卢森堡语与法语魅力韵律的方差从哪里来

论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。

 · 更新于 2026-09-25 · 约 20 分钟 · 9695 字 阅读 →
论文解读

元音管语言、辅音留个人:双语政治演讲的时间组织不对称

该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。

 · 更新于 2026-09-25 · 约 15 分钟 · 7237 字 阅读 →
论文解读

日常闲聊里藏着肺部信号:SpiroPhonia 如何用自发语音做 COPD 判别

针对肺功能检查依赖设备与配合的问题,SpiroPhonia 用真实访谈中的自发语音提取抖动、频谱与停顿三类特征,在 201 人被试独立测试上报告 78% 准确率、80% F1 与 87% AUC,代价是小样本下置信区间宽且跨语言跨设备泛化待验证。

 · 更新于 2026-09-25 · 约 17 分钟 · 8439 字 阅读 →