在自己的语音轨迹上学文本推理:CORD 的加权在策略跨模态自蒸馏
针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。
针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。
针对沃洛夫语音查法语文本的跨语言跨模态检索问题,论文比较晚融合与双编码器路线,最强证据是晚融合在自然口语检索与未见意图任务上保持可复述的优势,代价是依赖合成文档与较高维度推理开销。
针对日语多音字读错且成对偏好样本稀少的问题,论文用两个对比语言模型估计 token 级重要性权重再做加权 KTO,在报告中将日语准确率从 0.668 提升到 0.958 并把可利用样本从 1.5K 扩大到 9K,代价是需要先训练两个对比模型约 10 分钟 8 卡 A100 的额外预计算。
针对首尔韩语重音短语连续基频难以对应离散声调类别的问题,论文用双分支有监督对比学习整条轮廓的整体形状,在 10093 个短语上达到准确率 77.75% 与宏 F1 值 51.54%,代价是稀有类别与长低平尾音仍易混淆。
该文把语音幻觉检测转为推理时读取注意力图的二分类问题,用四个音频注意力指标加轻量逻辑回归在同域语音识别上超过不确定性基线,最强提升约 0.23 PR-AUC,但跨任务需重训且模型依赖明显,少头反而更利于域外泛化。
针对多语平行口语对话稀缺且翻译腔重的问题,论文用 WHO 知识库加对话行为大纲加母语者即兴实现的方法造出 6 千对话与 163 小时语音,基准显示英语检索与过滤持续领先而阿拉伯语最低,代价是内容未经临床验证且语音到文本检索几乎失效。
DIFFA-2 针对自回归音频大模型数据贵、串行解码慢的问题,选择冻结 Whisper-Large-V3 加语义与声学双适配器加 LLaDA-8B 扩散主干与四阶段课程,在 MMSU 总体 60.45 分等公开基准上追平同级自回归模型,代价是第一阶段词错误率略高于自回归对照且三元混合音频仍偏弱。
该文用 k-稀疏自编码器把三种语音自监督特征压成不同稀疏度,再在 SUPERB 六任务上测出最优 k 各不相同,并用信息瓶颈解释为说话人与情感偏压缩、音素与识别偏保留,而输入层质量只能小幅移动该权衡。
针对延续式语言模型把提示音色和韵律一起复制而无法独立控制的问题,DisCo-Speech 用三因子解耦编码器加内容韵律融合重建实现韵律延续与音色注入,消融显示软约束兼顾自然度与音色一致,代价是单阶段自回归的克隆相似度仍弱于多阶段流匹配系统。
该研究以语音情绪识别为探针比较四种神经元选择器,用失活与放大的自对交叉对照验证情绪敏感神经元的存在,其中均值偏离与对比间隔选择器显示约 11–15 个准确率点的自效应而交叉影响接近零,但标签无关的联合放大效果不稳定且存在跨数据集部分迁移的代价与边界。
针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。
论文用单词对齐的逐层干预揭示浅层保留声学细节而深层可大幅压缩的层级冗余,并提出训练无关的相似度合并与双阶段压缩,在三类语义任务上减少约 27.48% 预填充计算量,但中间过渡层敏感且细粒度声学影响尚未充分验证。
针对长会议中声学线索缺失与上下文碎片化问题,论文把会议建成多维异构图并用计划执行反思智能体检索生成,在 LongAudioQA 三套数据上以语义准确率为证据取得领先,但迭代规划带来更高推理开销且依赖上游识别与说话人分离质量。
针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。
针对先想后说首音等待过长而边想边说又破坏思维块原子性的矛盾,论文用流式掩蔽机制保证音频不欠载、用原子一致性修复重建逻辑因果,在 VoiceBench 上从 67.24 提升到 73.41 的同时把首次音频延迟从 20.35s 降到 3.65s、实时率从 7.04 降到 1.05,代价是依赖外部教师模型打分且复杂混合推理仍与串行思考存在小幅差距。
针对语音数据稀缺与跨语言扩展难的问题,CSLM 用持续预训练做模态内与跨语言对齐、再用语音文本分块交错微调做细粒度生成,在约 77 千小时语音数据下取得可比大数据的对齐与对话能力,但大语种覆盖与更大规模验证仍待补足。
该文研究无帧级肌电-音频对齐时如何从口面肌电合成语音,选择把肌电协方差功率映射到冻结 HuBERT 离散单元再用现成声码器发声,最强证据是 H 线性预测肌电功率达 r=0.85 且 vec(E) 加音素引导解码显著降低单元错误率,代价是词错误率仍在 50% 以上且仅单例 ALS 验证。
针对文本与音频信息量不等且离散分类忽略情绪远近的问题,EMART 以文本为主做音频参照融合,并用情绪轮角度约束对比学习,在 IEMOCAP 和 MELD 上报告了可复核的准确率与 F1 提升,但未引入视觉且依赖音频编码器选择。
EmotionTalk 用 19 名演员主题即兴的 23.6 小时双人对话同时给出 7 类离散标签、连续强度与四维说话风格描述,并以单模态、多模态融合与生成式描述三类基准验证了跨模态不一致带来的难度与融合的必要性。
针对语音共情对话中副语言信息易被转写或早压缩削弱的问题,ES4R 在编码前用轮内与轮间注意力构建情感上下文再做语音引导的语义融合与能量引导的语音合成,在 AvaMERG 上语义一致性最优但多样性指标未占优且合成风格集合有限。