论文解读

压哪里比压多少更关键:只压 MLP 投影的编解码压缩

该研究固定 Qwen2-Audio-7B-Instruct 做受限英译中语音翻译,只对 gate_proj、up_proj 和 down_proj 做有损量化加无损 Zstandard 压缩,本地 416 条对比中 q3 加 Zstd 以 0.7767 的 COMET 最接近 0.7792 的基线而体积降到 10.312 GB,q2 加 Zstd 以 …

 · 更新于 2026-09-25 · 约 17 分钟 · 8375 字 阅读 →
论文解读

只给一小时新语言音频:把快速适应做成内外环分工的语音表示学习

论文把新语言低资源表示学习定义为跨语言元学习,用多任务自适应预训练构造适应 эпизод并以一阶双层优化实现可扩展更新,在三语平均上用 1 小时无标注适应追平 6000 小时域内上限,但零样本起点变弱且外环仍依赖源语言音素标注。

 · 更新于 2026-09-25 · 约 21 分钟 · 10261 字 阅读 →
论文解读

减去语言噪声、加回说话人线索:双路径解耦如何同时做说话人与语种识别

针对跨语言说话人确认退化与语种识别走说话人捷径的纠缠问题,论文用冻结 W2V-BERT 2.0 加小波前缀调谐与减加双路径融合,在 TidyVoice 上报告 3.16% 和 4.35% 等错误率,代价是依赖后处理校准与多阶段调参。

 · 更新于 2026-09-25 · 约 21 分钟 · 10425 字 阅读 →
论文解读

说话人确认为何换个语言就变差:四种架构跨语言迁移的对照

论文用跨语言迁移矩阵比较四种说话人确认架构在 44 种语言上的迁移结构,发现 ECAPA-TDNN 最接近语言无关而 HuBERT-SID 语言依赖最重,代价是结论只在受控小数据区间和 AUC 度量下成立。

 · 更新于 2026-09-25 · 约 20 分钟 · 9889 字 阅读 →
论文解读

同一事实换语言换模态就变答案:CCFQA 如何卡住多语言语音问答的一致性

论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。

 · 更新于 2026-09-25 · 约 19 分钟 · 9136 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

低资源 TTS 要换声不要换口音:多语言训练跨语言迁移为何更稳

该文在 nêhiyawêwin 与 SENĆOTEN 上比较推理时改风格嵌入、现成 SeedVC 与英数据多语言训练三路线,报告带语言嵌入的多语言训练匿名化最稳,而无语言嵌入与 SeedVC 分别付出英语口音与质量下降代价。

 · 更新于 2026-09-25 · 约 16 分钟 · 7665 字 阅读 →
论文解读

去掉语言可预测成分后跨语言帕金森检测为何能找回灵敏度

针对目标语言只有健康人语音时分类器把目标语言当成健康信号的问题,论文用健康人拟合的岭回归残差去除语言可预测成分,在 5 个骨干、3 个任务、3 个目标语言上把平均 F1 从 0.52 提升到 0.87,但语言信息并未完全消除且评估仍限于印欧语系。

 · 更新于 2026-09-25 · 约 20 分钟 · 9640 字 阅读 →
论文解读

只用英文文本把多语言接入冻结多模态空间的轻量映射

M2M 只用英文文本训练 2 个线性层完成多语言到多模态的映射,在 XTD 上英文达到 94.9% 的 Recall@10 而 11 个语言平均为 89.5%,代价是生成保真度和超大检索库上的差距仍然存在。

 · 更新于 2026-09-25 · 约 17 分钟 · 8267 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4034 字 阅读 →
论文解读

Accent Conversion: A Problem-Driven Survey of Sociolinguistic and Technical Constraints

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3936 字 阅读 →
论文解读

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

说话人验证 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5273 字 阅读 →
论文解读

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6131 字 阅读 →
论文解读

QE-XVC: Zero-Shot Cross-Lingual Voice Conversion via Query-Enhancement and Conditional Flow Matching

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4561 字 阅读 →
论文解读

SmoothCLAP: Soft-Target Enhanced Contrastive Language-Audio Pretraining for Affective Computing

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3757 字 阅读 →