历史转写不可靠时,为何还要保留历史语音:多模态对话上下文 ASR 的构造与训练
针对历史转写会传播实体错误并丢失发音与说话人信息的问题,该研究用场景可控的数据管线构造多模态对话历史并做上下文监督微调,最强证据是微调后语音加文本上下文在两个模型上取得最高的总体实体召回,但代价是需要合成语音过滤与条件匹配的微调,且无上下文基线与无关历史的鲁棒性仍有限。
针对历史转写会传播实体错误并丢失发音与说话人信息的问题,该研究用场景可控的数据管线构造多模态对话历史并做上下文监督微调,最强证据是微调后语音加文本上下文在两个模型上取得最高的总体实体召回,但代价是需要合成语音过滤与条件匹配的微调,且无上下文基线与无关历史的鲁棒性仍有限。
该研究针对诈骗话术快速演变且酷似正常客服来电的问题,用混合树生成共享开头的诈骗与合法近域通话并以月度冻结快照评测,证明近域负例把分类器宏平均 F1 从 1.000 拉低到 0.65 左右并暴露全判欺诈坍缩,代价是固定 2 比 1 类别先验与合成语音的真实性局限。
针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。
ECHO 把插入文本固定而重写前文对话来区分打断与非打断重叠,用必须两成员全对的配对指标报告了三系统重度让出偏置与仅 MiniCPM-o 4.5 相对均衡,代价是合成语音与受控声学带来的生态效度损失。
HearInContext 用共享合成语音配对隐式与显式上下文研究同音歧义消解,报告 Qwen3-ASR-1.7B 隐式目标词召回中英分别提升 11.0 和 11.5 个百分点而通用识别误差变化低于 0.1 个百分点,代价是训练配比不当会损害无关上下文鲁棒性。
RoleBreak 用 310 个角色与 6688 个多轮语音轮次同时测语义角色保持与声音情感表达,发现最强系统仍在平均 10.4 轮出现人格失败且全部系统情感分低于 14.7,而把语言模型从 2B 放大到 27B 能推迟语义失败却几乎不改善声音情感。
针对文本到音乐系统条件格式与访问方式不同难以直接比较的问题,TTM-Bench 用共享音乐规格加系统适配表达分别度量音乐内容对齐与计算效率,案例研究显示内容对齐更高并不系统性对应更低的计算需求。
针对只检内容而忽略说话人的不足,论文用文本查内容加参考语音定说话人的混合查询,构建 VoiceTrace-Bench 并训练统一音频语言模型的两阶段检索重排框架,在语义基准和混合基准上报告了可复现的召回与排序提升,但重排带来额外推理开销且多说话人仍明显更难。
该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。
针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。
针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。
论文研究长音频中分散证据的定位与整合问题,采用离线结构化元数据加按需音频片段的混合检索智能体路线,最强证据是混合检索加多模态证据比单模态平均答案准确率提高约 10 个百分点、理由准确率提高约 6 个百分点,代价是声学任务仍需灵活选择证据模态且答案正确会高估真实 grounding 能力。
针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
VoiceMOS 2026 把语音评估拆成增强语音的绝对分与比较分、情感合成的自然度与情绪匹配、编解码合成的说话人与口音相似度 3 类任务,用 18 支队伍的提交显示多数队伍超过基线,而比较分与口音相似度仍最难,优胜系统普遍用预训练特征加听众建模加集成换取排序一致性。
针对随机切分让同一艘船同时出现在训练与测试导致虚高的问题,UniqueShip 按 MMSI 隔离船舶、按天隔离背景构建 2460 小时船舶音频与 4218 艘船的基准,最强 Swin 加 Mel 基线在无泄漏下准确率为 0.665,而引入泄漏可抬高 0.08-0.21,且船数翻倍增益 2.4-2.6 点约为时长翻倍 0.8-1.3 点的两到三倍。
共分析 19 篇语音/AI 论文
论文用长字符串检索条件化短串韵律以免除逐条标注,构建四个韵律最小对基准并微调 wav2vec2-base 做二选一分类,在各自验证集上报告均超 90% 但存在音频重复导致偏高估计的代价。
MP-Bench 用合成四人语音与显式、隐式、消极三类轮次条件测语音智能体,12 个系统的最强证据是带完美说话人标签的文本上限接近满分而实时语音系统在游戏轮次上徘徊于随机水平,代价是完全受控合成、无重叠与单决策点评估。
SteerDuplex 针对全双工语音模型可操控性不足,用 Moshi 骨干加针对性监督微调建立语气人设语速操控,再用两阶段连续性感知的混合奖励强化学习改善打断响应与暂停等待,代价是仍存在过早让出话轮与奖励钻空子的权衡。