连续自回归做钢琴渲染:全局作曲、局部演奏与全序列精修如何分工
针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。
针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。
针对深度与双耳音频简单拼接会丢失几何语义关联的问题,CTAN 用双向重构交叉注意力做主动语义增强、用门控时间记忆桥接听觉死区,在 Replica 与 Matterport3D 未见环境中相对 SoundSpaces 基线提升了未听过声音下的成功率与路径效率,但消融显示各模块贡献与听觉死区恢复能力仍受场景规模与声音泛化条件限制。
针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。
该文把视频多模态情感分析拆为极性判别与强度回归,用极性与强度瓶颈专家分别压缩各模态信息再做跨模态路由融合,在四个中英文数据集与多种语言模型上报告了路由设置与专家分工证据,但未公开代码与完整训练预算。
ECHO 把插入文本固定而重写前文对话来区分打断与非打断重叠,用必须两成员全对的配对指标报告了三系统重度让出偏置与仅 MiniCPM-o 4.5 相对均衡,代价是合成语音与受控声学带来的生态效度损失。
EMODY Flow 复用冻结 Qwen-3 Omni Talker 的 Mimi 音频嵌入驱动两个并行 DiT 流匹配模型分别生成身体与面部动作,在 BEAT2 上以 FGD 0.302 报告手势质量最优,并以 FGD 升至 0.362 的小幅代价换取身体动作的情绪可分性。
针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。
Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。
针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。
HearInContext 用共享合成语音配对隐式与显式上下文研究同音歧义消解,报告 Qwen3-ASR-1.7B 隐式目标词召回中英分别提升 11.0 和 11.5 个百分点而通用识别误差变化低于 0.1 个百分点,代价是训练配比不当会损害无关上下文鲁棒性。
针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。
针对延迟流建模中结构延迟不能代表用户等待且固定对齐迫使模型晚输出的问题,论文引入词级实测延迟并在单点用准确率加延迟联合奖励做 GRPO 后训练,在 80 ms 处把词错误率相对降低 30.8% 且在 480 ms 处把中位延迟从 1.17s 降到 1.04s。
该文用理想比值掩蔽比较麦克风、波束形成器和 Ambisonics 三种域的增强,报告显示波束域语音质量最高而 Ambisonics 域更好地保留残留干扰的空间属性,且所有方法都保留目标声源定位线索,但以混响目标为期望才能保住混响。
针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。
论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。
RoleBreak 用 310 个角色与 6688 个多轮语音轮次同时测语义角色保持与声音情感表达,发现最强系统仍在平均 10.4 轮出现人格失败且全部系统情感分低于 14.7,而把语言模型从 2B 放大到 27B 能推迟语义失败却几乎不改善声音情感。
针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。
论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。
该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。
针对肺功能检查依赖设备与配合的问题,SpiroPhonia 用真实访谈中的自发语音提取抖动、频谱与停顿三类特征,在 201 人被试独立测试上报告 78% 准确率、80% F1 与 87% AUC,代价是小样本下置信区间宽且跨语言跨设备泛化待验证。