论文解读

同一事实换语言换模态就变答案:CCFQA 如何卡住多语言语音问答的一致性

论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。

 · 更新于 2026-09-25 · 约 19 分钟 · 9136 字 阅读 →
论文解读

用光流解耦外观与运动、再用强度引导噪声搜索压住闪烁的说话头生成

ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9366 字 阅读 →
论文解读

从快速重复音节到可解释的重度判断:CLINIC-GENIE 如何把分类、归因和病历类比装进一条管线

针对卒中后构音障碍的交替与顺序轮替发音任务,CLINIC 用临床可解释声学特征联合频谱与自监督语音表示做三级严重度分类并用 Shapley 值归因,GENIE 再用检索到的相似病例生成韩文四维度解释,报告显示平衡准确率 0.952 且重度召回 1.000,专家保真度 4.94,但重度样本少且仅覆盖任务化语音。

 · 更新于 2026-09-25 · 约 22 分钟 · 10523 字 阅读 →
论文解读

双人同时动还要各像各的:DialoGen 如何把互动与个人风格分开建模

DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。

 · 更新于 2026-09-25 · 约 20 分钟 · 9954 字 阅读 →
论文解读

不用自回归也能听懂语音:DIFFA 以冻结扩散模型加双适配器做理解

DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。

 · 更新于 2026-09-25 · 约 19 分钟 · 9250 字 阅读 →
论文解读

只转写不倾听:用四种词义声学关系测音频大模型的情绪依据

论文用词义中性、对齐、冲突和无词四种条件对照文本、音频和图文三种输入,测六个大音频语言模型,发现中性词下音频分仅三成左右、冲突时塌缩到少数类别、非言语接近猜测,说明模型主要依赖词义而非声学线索。

 · 更新于 2026-09-25 · 约 18 分钟 · 8786 字 阅读 →
论文解读

词探针的高分是记住了发音,还是记住了词本身

论文用线性残差化减去音素与二三音子成分后,发现英文预训练的 HuBERT 和 wav2vec 2.0 靠后层仍能在帧级别线性预测词身份,并在词发现中验证去音素表示的改善,代价是依赖对齐标签且音素去除未降到机会水平。

 · 更新于 2026-09-25 · 约 15 分钟 · 7504 字 阅读 →
论文解读

拒答之后仍可被插话:全双工语音模型生成中安全的松动

论文针对边听边说的全双工语音模型,用固定无关语音研究有害请求后的打断能否抬高整轮有害率,以固定延迟与拒答触发两种可执行时机在四个开源模型和 720 条请求上验证,PersonaPlex 系最高上升约 39 个百分点,但效果随模型、措辞和时机剧烈变化且 BayLing 出现下降。

 · 更新于 2026-09-25 · 约 19 分钟 · 9092 字 阅读 →
论文解读

把病理性语音拉回正常编码:EA-VAE 用三处对齐做重构

针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。

 · 更新于 2026-09-25 · 约 22 分钟 · 10883 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

音频 token 太多、文本太少:CoPRIME 用 ELBO 路由让专家分工

针对音频频谱 token 远多于文本导致多模态 MoE 路由崩塌的问题,CoPRIME 用对比学习加 ELBO 路由与熵正则做音频文本对齐,在 MOSEI 和 IEMOCAP 零样本与少样本情绪任务上超过稠密与 LIMoE 式基线,代价是引入对比加 ELBO 加四个辅助损失共六项损失与两个权重的调参负担。

 · 更新于 2026-09-25 · 约 18 分钟 · 8902 字 阅读 →
论文解读

信噪比为何失准:从相位距离重写音频生成的度量与损失

论文把信噪比失准归因于瞬时相位距离不可靠,用全向相位导数重写相关项得到 GOMPSNR,并在声码器与编解码器上验证其与听感指标更相关且导出损失能提升重建质量,但线性幅度等组合在小数据上存在过拟合代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9170 字 阅读 →
论文解读

不用听原声也能评声音:先分维标注再用文字蓝图推理的语音评价

针对语音到语音评价只看文字会漏掉语气、直接听音频又贵又不透明的问题,论文用先分内容音质副语言三维标注再把廉价声学信号写成文字蓝图交给大语言模型推理并按确定性规则融合的方法,在两个公开偏好集上提高了与人的一致性并把音频评测成本降到约三分之一。

 · 更新于 2026-09-25 · 约 19 分钟 · 9444 字 阅读 →
论文解读

听到更多却用更少:为对话语音检索并精选一条最相关的历史

针对对话语音中固定取前几句会引入无关冗余、取全量历史又成本过高的问题,论文提出多模态检索加精选方法 MARS,只取一条声学或语义最相关的历史来辅助当前句识别,并在 1.5K 小时训练下报告了优于 179K 小时顶级系统的混合错误率,代价是依赖微调 Whisper 建库与两遍解码的额外检索计算。

 · 更新于 2026-09-25 · 约 21 分钟 · 10079 字 阅读 →
论文解读

单语很强、混着说就错:HiKE 用三级切换与借词标注拆解韩英代码切换识别

针对韩英混说识别缺乏公开非合成评测的问题,HiKE 以 1121 句自然录音加词/短语/句子三级与借词标注做细粒度评测,报告 10 个多语模型单语转混说时 MER 扩大 3 到 13 倍,而拼接单语合成的句级数据微调也能带来 6.8% 以上改善,但自然句内数据仍更优。

 · 更新于 2026-09-25 · 约 16 分钟 · 7799 字 阅读 →
论文解读

从能转写到能听懂言外之意:HPSU 如何检验语音大模型的类人听觉

HPSU 针对真实口语中潜在意图与隐含情绪的理解缺口,用三阶段多模态半自动标注构建 2 万余中英样本与 16 个任务,并以 13 个模型与人类基线对比显示最好模型仅 62.6% 而人类达 87.3%,代价是依赖自动裁判与多模型协同标注带来的可复现性核对负担。

 · 更新于 2026-09-25 · 约 18 分钟 · 8751 字 阅读 →
论文解读

三模态互相拆台时,HuMo 如何让文本、图像与音频协同

针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。

 · 更新于 2026-09-25 · 约 18 分钟 · 8698 字 阅读 →
论文解读

认不出带口音的英语:码切换语音识别先补口音英语再谈排序

针对码切换话语中带矩阵语言口音的英语检出接近零的问题,论文用 80 条口音匹配英语做 LoRA 微调 MMS-LID 并引入 LangRank 排序评估,在印地-英语等四对语言上提升英语检出同时保持单语性能,代价是仍与 Oracle 有差距且依赖已知矩阵语言选口音。

 · 更新于 2026-09-25 · 约 18 分钟 · 8676 字 阅读 →
论文解读

自回归也能定长:IndexTTS2 用标记计数与情感解耦做可控零样本合成

IndexTTS2 针对自回归零样本语音合成难以精确控时长与情感易混入音色的问题,用语义标记数约束、风格与音色双提示解耦与 GPT 隐状态增强做级联合成,在多数据集上报告了词错误率、说话人相似度和情感相似度的领先结果,但强情感下清晰度与极端变速仍有代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10400 字 阅读 →
论文解读

不增加采样步数:用验证器引导的多轨搜索做音频超分

针对扩散音频超分一次采样方差大、关键属性易丢失的问题,论文用冻结 AudioSR 加验证器打分与随机/零阶搜索选优,在 4 kHz 到 24 kHz 语音上报告最高约 9.70% 美学、15.20% 词错误率与 46.98% 频谱距离改善,代价是 120 路候选的成倍推理开销与单验证器过拟合风险。

 · 更新于 2026-09-25 · 约 19 分钟 · 9167 字 阅读 →