冻住大模型做共情对话:用语义情绪解耦把文本共情搬到语音
针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。
针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。
针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。
该工作用流式语音识别加文本预处理加机器翻译加两阶段大模型压缩的级联管线做英译中自动字幕,在开发集上以压缩换合规并略微改善 SubER,而代价是保留时间戳不动且依赖确定性改写与人工规则阈值。
针对长时无切分英文到中文与德文离线语音翻译,论文采用 Silero VAD 加两遍转写与 150 词元语义合并的 Qwen3 级联路线,在 tst-2022 上报告 En-Zh COMET 0.8462 与 En-De 0.7854,最强证据来自两遍转写把 WER 压到 3.01%,代价是多模型串行推理与重分段计算开销。
针对一次指令只给一个预设、无法在已有参数上连续修改的问题,论文用大语言模型做效果选择与初始化、再用 CLAP 引导的优化做原地微调,在 SocialFX 均衡器词对上 10 组中有 9 组的最大均值差异低于重提词基线,但非可微效果与长时间优化仍不稳定且每轮需要秒级计算。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对看图说话中词汇语义与发音 timing 互补但贡献不均的问题,LAPE 以大语言模型文本表示为锚,把停顿与拖长写进转写并做事件保持组块与门控融合,在 ADReSS 与 ADReSSo 的五折与留一被试评估中均取得最高准确率,代价是依赖词时间戳与多路语音特征的完整流水线。
针对同一说话人说多种语言导致声纹捷径失效的问题,该系统用声学分类器加语音大模型加零样本音位模型做识别、用双转写加推理大模型做验证,开发集识别 95.2% 宏准确率与验证 0.90% 等错误率,评估集为 96.78% 与 3.06%,但开发到评估存在明显落差且融合参数依赖开发集估计。
针对重构训练的编码器与自回归语言模型目标不一致导致词元难学的问题,论文用未来词元预测与语义对齐改造编码器,在 SALMon 上报告 61.6% 准确率与 35 倍困惑度下降,同时语音 Mel 距离改善 5.0%,代价是需要配对文本与额外训练开销。
针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。
针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。
该工作用 Parakeet 做流式识别、Qwen 3.5 做流式翻译并以黑盒前缀策略控制提交时机,在 MCIF 长语音上以高延迟配置换质量、低延迟用掩码重翻译补足,并用词表增强与检索示例做上下文轨道,代价是更宽松策略会带来可测的质量回落与闪烁。
该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文把同传从读写时机控制改成包含切句、删除、压缩与代词化的动作选择,用统计感知的逐步提示在英中、英德、英日上同时改善语义与单调性延迟,但文本实验与启发式充分性检查仍留下语音端到端的待验证缺口。
S2ST-Omni 把多语语音到语音翻译拆成高精度语音到文本前端加可插拔语音合成后端,用先局部后全局的混合适配器和声学加语言两级源语言感知提升翻译,在 CVSS-C 法德西到英上取得平均 BLEU 35.67 的报告最好结果,代价是依赖大骨干与可靠语言标识且只验证了三对高资源方向。
针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。
论文用文本化多模态线索统一笑声检测、类型分类与原因解释,并以笑声自指令扩充与混合笑声专家提升泛化,主证据是文本大模型在三任务上优于音视频大模型,代价是依赖外部抽取器与伪标签校对。
针对噪声下单流纠错被音频质量卡住的问题,论文用独立 ASR 与 VSR 双路 N-best 假设加可靠性提示词做语言空间组合,在 LRS2 上把基线相对误差降低约一半,代价是依赖上下游识别头质量并增加大模型串行纠错开销。
针对多人重叠时只转写目标说话人并在目标缺席时拒识的问题,该报告用参考语音拼接混合语音加文本提示的端到端大语言模型方案,在合成与真实会议集上报告了目标说话人词错率下降,同时保留单人识别与空文本拒识能力,但拒识率与误拒之间仍需权衡。