以文本为桥、语音分块交错生成:CSLM 的小数据跨语言语音建模
针对语音数据稀缺与跨语言扩展难的问题,CSLM 用持续预训练做模态内与跨语言对齐、再用语音文本分块交错微调做细粒度生成,在约 77 千小时语音数据下取得可比大数据的对齐与对话能力,但大语种覆盖与更大规模验证仍待补足。
针对语音数据稀缺与跨语言扩展难的问题,CSLM 用持续预训练做模态内与跨语言对齐、再用语音文本分块交错微调做细粒度生成,在约 77 千小时语音数据下取得可比大数据的对齐与对话能力,但大语种覆盖与更大规模验证仍待补足。
针对语音共情对话中副语言信息易被转写或早压缩削弱的问题,ES4R 在编码前用轮内与轮间注意力构建情感上下文再做语音引导的语义融合与能量引导的语音合成,在 AvaMERG 上语义一致性最优但多样性指标未占优且合成风格集合有限。
针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。
该文把语音智能体的文化能力重新定义为事件限定的交互能力,用语音事件与交互契约约束韵律时机与参与管理,并以附录的事件卡与最小对诊断补足词错率与平均意见分测不到的得体性,代价是增加人工判断与规范界定负担且不提供新数据集验证。
该文针对语音进语音出对话只用单轮语义奖励的问题,用四路独立偏好数据加单 DPO 目标联合训练,在保持轮次与块级解码兼容的同时,以语义与声学指标的联合提升为证据,代价是情感与可懂度之间出现轻微竞争。
针对长程语音角色扮演中崩人设难定位的问题,论文提出把文本路由与音频路由投影到共享情感空间做分路由、按轮次诊断的 PED 框架,并在端到端与级联两种 3B 量级系统上揭示出可分性受限、文本向中性集中、双路由弱耦合等可复述的诊断信号。
论文研究如何用极小子集替代上万条音频评测并对齐真人语音助手体验,用 50 条达到 0.93 以上基准相关、用 100 条回归达到 0.978 人类偏好相关,代价是仅 7 个模型的人评与英语对话场景限制。
针对中文多轮语音任务对话缺乏真实口语评测的问题,RealTalk-CN 用 5400 段真人录音与不流利标注和跨模态切换任务,测出槽填充比意图分类更怕口语化,而流水线与端到端各有胜负且老年与方言口音存在可测差距。
针对语音到语音模型只测语义、不测说话方式的问题,S2S-Arena 用四级交互协议与 1243 条语音查询做 1001 次语音内成对比较,最强证据是工业模型全面领先而学术模型在高难度表达层落后 300 分以上,代价是合成语音分布与短轮交互的局限。
针对语音到语音对话既要评语义又要评声学而级联评测会丢声学信息的问题,论文用大规模合成偏好数据加带解释理由的两阶段监督微调构建端到端语音裁判 SageLM,以 82.79% 的人类一致率超过级联与语音理解基线,代价是依赖合成语音分布与有限声学数据。
针对文本评测看不见韵律情感与书面腔问题,该工作用真实对合成与书面對口语两类多轮偏好对训练端到端奖励模型,在分层基准上以 96.61% 模态微平均等证据显示可运行优势,代价是绝对分值仍随域偏移需谨慎用于优化。
针对医疗语音数据稀缺与问诊能力缺失问题,论文用 405k 文本注入知识再用 198k 合成语音做模态重对齐,在多轮问诊与单轮问答上报告最优分数,代价是仍以普通话合成为主且只验证文本语音两种模态。
论文研究主用户与第三方同处一室时的打断处理,用可定制的应答策略加声学优先训练解决语义走捷径问题,最强证据是合成与真实录音上策略跟随与有用性同步提升,而代价是需要大量合成双说话人数据与难负样本约束。
论文把多轮语音风格保持定义为首轮指令后的逐轮指令遵循率,用同一话题与同一模拟用户测五类模型,报告首轮尚可但后续迅速退化,并显示显式回忆能部分缓解但需额外轮次代价。
针对英文为主和合成语音评测失真的问题,VCB Bench 用全真人中文语音构建指令跟随、知识理解与鲁棒性三维评测,在 9 个语音对话模型上显示常识问答最难而物理干扰比口误更致命。
VoxMind 针对端到端语音智能体规划弱与工具多时延迟高的问题,采用先显式推理再说话与并行动动态工具管理,并在 AgentChat 上训练,主评测总体 74.57 分超越基线,但推理轨迹带来固定开销且合成数据与真实口语仍有差距。
针对端到端语音对话中统一偏好优化易引起声学漂移的问题,WavAlign 用全 token 有监督微调做声学锚、用仅文本的组相对策略优化改语义并以 rollout 统计动态加权,在两种架构上同时提升语义与表达但仍受限于序列级奖励与音频评价可靠性。
针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。
该工作针对校园咨询资源不足与高风险漏检问题,用主动倾听对话流程加提示驱动的四级风险分类与双语语音链路组织系统,并以 400 小时语音与 40 例模拟加 15 人实测日志支撑分析,代价是未报告检测精度、延迟与误报成本。
S3-Bench 用 1980 条科学语音问答与 213 段多轮对话把一次问答拆为识别感知推理发音四段测量,发现前三段正向耦合而生成与上游负耦合,严格事实性与听众适配仍是主要代价。