论文解读

现学没见过的语言:多模态示范如何帮语音大模型做低资源识别

论文研究语音大模型能否用音频加文本示范现学未见濒危语言,报告多模态示范降低困惑度且跨语言微调接近目标语言微调,并提出用声学模型产生候选再由语音大模型重排来改善词错误率,但直接生成转写仍很弱且重排带来显存与耗时开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8692 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

用非言语笑声哭声做监督:韵律如何跨到多语言言语情绪识别

论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9179 字 阅读 →
论文解读

不用每语一个适配器:PUMA 以共享投影加语言令牌做多语 ASR

针对十种非洲低资源语言的转写任务,PUMA 用冻结的 wav2vec 2.0 特征加可训练的通用语言投影与语言令牌和 CTC 训练,在同时训练平均词错误率 0.314 上报告优于 MMS 的 0.419 和 Whisper-large 的 0.339,代价是零样本下仍落后于 7B 量级系统且阿拉伯语等难语言更依赖语言令牌。

 · 更新于 2026-09-24 · 约 18 分钟 · 8773 字 阅读 →
论文解读

整段对话只有一个标签时,如何让稀疏病症线索被三层粒度共同抓住

针对整段临床对话只有一个会话级标签且病理性表现稀疏不均匀的问题,该工作用会话级聚合、片段级伪标签与帧级一致性三层联合的纯音频半监督框架学习,在中英文抑郁与阿尔茨海默数据上以极少标注逼近全监督,并以消融与伪标签演化分析揭示收益与代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8172 字 阅读 →
论文解读

低资源多口音下毒性语音为何失效:冻结音频大模型加三段软提示的解法

针对级联转写在低资源语言和口音下丢失声学线索且误差传播的问题,论文用冻结 MiMo-Audio-7B 加任务加共享加语言残差三段软提示做端到端二分类,在 PolySpeechTox 上报告微平均 ROC-AUC 为 98.07%,代价是只验证了单一骨干且依赖语言口音标签做训练路由。

 · 更新于 2026-09-24 · 约 18 分钟 · 8674 字 阅读 →
论文解读

低资源下直接翻译为何胜过级联:QUESPA 以 SpeechT5 加增强与新语料推进克丘亚语语音翻译

针对克丘亚语到西班牙语低资源语音翻译,QUESPA 比较了级联与端到端路线,最强证据是端到端微调 SpeechT5 结合 SIDON 增强、数据增广与 Collao 语料在官方集上取得 27.2 的 BLEU,代价是 CHRF 未同步提升且大模型提示翻译仍远低于微调基线。

 · 更新于 2026-09-24 · 约 17 分钟 · 8151 字 阅读 →
论文解读

多语言一起训反而互相拖累:用梯度冲突定位瓶颈再做局部专化

针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。

 · 更新于 2026-09-24 · 约 18 分钟 · 8755 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 79 分钟 · 39128 字 阅读 →
论文解读

口音表征记住说话人:先测泄漏再做去说话人化

该研究陈述针对带口音语音识别中口音表征混入说话人身份的问题,提出用宽松划分对比与探针等方法度量纠缠,再以梯度反转去说话人化加有界条件适配在冻结 Whisper 上缓解,但全文是研究计划而非已验证结果,未报告词错误率数字与公平性收益。

 · 更新于 2026-09-24 · 约 19 分钟 · 9114 字 阅读 →
论文解读

低资源希腊语合成靠确定性提示词稳住说话人:多语先验加两阶段适配

针对希腊语干净单说话人数据稀缺导致音色漂移的问题,论文用 WhisperX 清洗与切分搭建希腊语适配数据,再对 880M 参数 Parler-TTS 做多说话人全量微调加 3.5 小时单说话人 LoRA,并以确定性提示词替代大模型生成提示词,最优配置报告 WER 10.7%、MOS-I 4.00、MOS-C 4.24,但频谱保真与目标说话人相似度仍有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8144 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

低资源 TTS 要换声不要换口音:多语言训练跨语言迁移为何更稳

该文在 nêhiyawêwin 与 SENĆOTEN 上比较推理时改风格嵌入、现成 SeedVC 与英数据多语言训练三路线,报告带语言嵌入的多语言训练匿名化最稳,而无语言嵌入与 SeedVC 分别付出英语口音与质量下降代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7665 字 阅读 →
论文解读

低资源下保住音高与细节:HQ-SVC 用解耦编解码加两级合成做零样本歌声转换

HQ-SVC 针对无目标说话人数据、无微调的零样本歌声转换,用冻结的解耦编解码同时取内容与音色特征,再经 EVA 模块融合音高能量并用 DDSP 加扩散两级重建 44.1 kHz 梅尔谱,在不足 80 小时数据与单张消费级 GPU 条件下取得比大资源基线更高的自然度与音高准确性,代价是音色相似度客观指标未全面领先且重建引入可接受的发音音高误差。

 · 更新于 2026-09-24 · 约 20 分钟 · 9818 字 阅读 →
论文解读

错误稀疏下只改该改的片段:韩语咨询对话的检测门控纠错

针对无法使用音频、只能做纯文本后编辑且错误稀疏的韩语咨询对话,论文用真实呼叫数据构建 DasanCallDial 并提出先检测后纠错的 DCSC,主证据是 pkoT5 版本把平衡词错误率指标值从 14.67 降到 13.30,把错误句词错误率指标值从 29.35 降到 26.27,代价是检测门仍会漏检且纠错器对部分已送入错误保持保守。

 · 更新于 2026-09-24 · 约 20 分钟 · 10017 字 阅读 →
论文解读

小模型微调为何压过大模型提示:印地语后纠错的规模与领域证据

论文把印地语后纠错做成高重叠文本编辑,对比微调的 mT5、ByT5 与提示或微调的大模型,发现小模型纠错后词错误率更低,而零样本大模型呈先升后降的 n 形曲线,代价是跨域仍会退化并需要混合多源假设来缓解。

 · 更新于 2026-09-24 · 约 16 分钟 · 7657 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34318 字 阅读 →
论文解读

在连续隐空间里一次生成一小段:SCAPES 如何用语义嵌入控制环境声纹理

SCAPES 针对环境声纹理的语义可控合成问题,用连续归一化流在 EnCodec 连续隐空间上按原子段自回归建模,并以 CLAP 语义嵌入和历史原子为条件,在约 34 分钟数据、单张消费级 GPU 约 1 小时训练的条件下实现长时稳定生成,代价是难以处理语音与复调音乐所需的长程结构。

 · 更新于 2026-09-24 · 约 20 分钟 · 9749 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 72 分钟 · 35908 字 阅读 →
论文解读

15 秒参考合成整库:固定音色泰语 TTS 的质量与覆盖取舍

该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。

 · 更新于 2026-09-24 · 约 20 分钟 · 9770 字 阅读 →