同一事实换语言换模态就变答案:CCFQA 如何卡住多语言语音问答的一致性
论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。
论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。
ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。
针对卒中后构音障碍的交替与顺序轮替发音任务,CLINIC 用临床可解释声学特征联合频谱与自监督语音表示做三级严重度分类并用 Shapley 值归因,GENIE 再用检索到的相似病例生成韩文四维度解释,报告显示平衡准确率 0.952 且重度召回 1.000,专家保真度 4.94,但重度样本少且仅覆盖任务化语音。
DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。
DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。
论文用词义中性、对齐、冲突和无词四种条件对照文本、音频和图文三种输入,测六个大音频语言模型,发现中性词下音频分仅三成左右、冲突时塌缩到少数类别、非言语接近猜测,说明模型主要依赖词义而非声学线索。
论文用线性残差化减去音素与二三音子成分后,发现英文预训练的 HuBERT 和 wav2vec 2.0 靠后层仍能在帧级别线性预测词身份,并在词发现中验证去音素表示的改善,代价是依赖对齐标签且音素去除未降到机会水平。
论文针对边听边说的全双工语音模型,用固定无关语音研究有害请求后的打断能否抬高整轮有害率,以固定延迟与拒答触发两种可执行时机在四个开源模型和 720 条请求上验证,PersonaPlex 系最高上升约 39 个百分点,但效果随模型、措辞和时机剧烈变化且 BayLing 出现下降。
针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对音频频谱 token 远多于文本导致多模态 MoE 路由崩塌的问题,CoPRIME 用对比学习加 ELBO 路由与熵正则做音频文本对齐,在 MOSEI 和 IEMOCAP 零样本与少样本情绪任务上超过稠密与 LIMoE 式基线,代价是引入对比加 ELBO 加四个辅助损失共六项损失与两个权重的调参负担。
论文把信噪比失准归因于瞬时相位距离不可靠,用全向相位导数重写相关项得到 GOMPSNR,并在声码器与编解码器上验证其与听感指标更相关且导出损失能提升重建质量,但线性幅度等组合在小数据上存在过拟合代价。
针对语音到语音评价只看文字会漏掉语气、直接听音频又贵又不透明的问题,论文用先分内容音质副语言三维标注再把廉价声学信号写成文字蓝图交给大语言模型推理并按确定性规则融合的方法,在两个公开偏好集上提高了与人的一致性并把音频评测成本降到约三分之一。
针对对话语音中固定取前几句会引入无关冗余、取全量历史又成本过高的问题,论文提出多模态检索加精选方法 MARS,只取一条声学或语义最相关的历史来辅助当前句识别,并在 1.5K 小时训练下报告了优于 179K 小时顶级系统的混合错误率,代价是依赖微调 Whisper 建库与两遍解码的额外检索计算。
针对韩英混说识别缺乏公开非合成评测的问题,HiKE 以 1121 句自然录音加词/短语/句子三级与借词标注做细粒度评测,报告 10 个多语模型单语转混说时 MER 扩大 3 到 13 倍,而拼接单语合成的句级数据微调也能带来 6.8% 以上改善,但自然句内数据仍更优。
HPSU 针对真实口语中潜在意图与隐含情绪的理解缺口,用三阶段多模态半自动标注构建 2 万余中英样本与 16 个任务,并以 13 个模型与人类基线对比显示最好模型仅 62.6% 而人类达 87.3%,代价是依赖自动裁判与多模型协同标注带来的可复现性核对负担。
针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。
针对码切换话语中带矩阵语言口音的英语检出接近零的问题,论文用 80 条口音匹配英语做 LoRA 微调 MMS-LID 并引入 LangRank 排序评估,在印地-英语等四对语言上提升英语检出同时保持单语性能,代价是仍与 Oracle 有差距且依赖已知矩阵语言选口音。
IndexTTS2 针对自回归零样本语音合成难以精确控时长与情感易混入音色的问题,用语义标记数约束、风格与音色双提示解耦与 GPT 隐状态增强做级联合成,在多数据集上报告了词错误率、说话人相似度和情感相似度的领先结果,但强情感下清晰度与极端变速仍有代价。
针对扩散音频超分一次采样方差大、关键属性易丢失的问题,论文用冻结 AudioSR 加验证器打分与随机/零阶搜索选优,在 4 kHz 到 24 kHz 语音上报告最高约 9.70% 美学、15.20% 词错误率与 46.98% 频谱距离改善,代价是 120 路候选的成倍推理开销与单验证器过拟合风险。