现学没见过的语言:多模态示范如何帮语音大模型做低资源识别
论文研究语音大模型能否用音频加文本示范现学未见濒危语言,报告多模态示范降低困惑度且跨语言微调接近目标语言微调,并提出用声学模型产生候选再由语音大模型重排来改善词错误率,但直接生成转写仍很弱且重排带来显存与耗时开销。
论文研究语音大模型能否用音频加文本示范现学未见濒危语言,报告多模态示范降低困惑度且跨语言微调接近目标语言微调,并提出用声学模型产生候选再由语音大模型重排来改善词错误率,但直接生成转写仍很弱且重排带来显存与耗时开销。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。
针对十种非洲低资源语言的转写任务,PUMA 用冻结的 wav2vec 2.0 特征加可训练的通用语言投影与语言令牌和 CTC 训练,在同时训练平均词错误率 0.314 上报告优于 MMS 的 0.419 和 Whisper-large 的 0.339,代价是零样本下仍落后于 7B 量级系统且阿拉伯语等难语言更依赖语言令牌。
针对整段临床对话只有一个会话级标签且病理性表现稀疏不均匀的问题,该工作用会话级聚合、片段级伪标签与帧级一致性三层联合的纯音频半监督框架学习,在中英文抑郁与阿尔茨海默数据上以极少标注逼近全监督,并以消融与伪标签演化分析揭示收益与代价。
针对级联转写在低资源语言和口音下丢失声学线索且误差传播的问题,论文用冻结 MiMo-Audio-7B 加任务加共享加语言残差三段软提示做端到端二分类,在 PolySpeechTox 上报告微平均 ROC-AUC 为 98.07%,代价是只验证了单一骨干且依赖语言口音标签做训练路由。
针对克丘亚语到西班牙语低资源语音翻译,QUESPA 比较了级联与端到端路线,最强证据是端到端微调 SpeechT5 结合 SIDON 增强、数据增广与 Collao 语料在官方集上取得 27.2 的 BLEU,代价是 CHRF 未同步提升且大模型提示翻译仍远低于微调基线。
针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。
共分析 42 篇语音/AI 论文
该研究陈述针对带口音语音识别中口音表征混入说话人身份的问题,提出用宽松划分对比与探针等方法度量纠缠,再以梯度反转去说话人化加有界条件适配在冻结 Whisper 上缓解,但全文是研究计划而非已验证结果,未报告词错误率数字与公平性收益。
针对希腊语干净单说话人数据稀缺导致音色漂移的问题,论文用 WhisperX 清洗与切分搭建希腊语适配数据,再对 880M 参数 Parler-TTS 做多说话人全量微调加 3.5 小时单说话人 LoRA,并以确定性提示词替代大模型生成提示词,最优配置报告 WER 10.7%、MOS-I 4.00、MOS-C 4.24,但频谱保真与目标说话人相似度仍有限。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该文在 nêhiyawêwin 与 SENĆOTEN 上比较推理时改风格嵌入、现成 SeedVC 与英数据多语言训练三路线,报告带语言嵌入的多语言训练匿名化最稳,而无语言嵌入与 SeedVC 分别付出英语口音与质量下降代价。
HQ-SVC 针对无目标说话人数据、无微调的零样本歌声转换,用冻结的解耦编解码同时取内容与音色特征,再经 EVA 模块融合音高能量并用 DDSP 加扩散两级重建 44.1 kHz 梅尔谱,在不足 80 小时数据与单张消费级 GPU 条件下取得比大资源基线更高的自然度与音高准确性,代价是音色相似度客观指标未全面领先且重建引入可接受的发音音高误差。
针对无法使用音频、只能做纯文本后编辑且错误稀疏的韩语咨询对话,论文用真实呼叫数据构建 DasanCallDial 并提出先检测后纠错的 DCSC,主证据是 pkoT5 版本把平衡词错误率指标值从 14.67 降到 13.30,把错误句词错误率指标值从 29.35 降到 26.27,代价是检测门仍会漏检且纠错器对部分已送入错误保持保守。
论文把印地语后纠错做成高重叠文本编辑,对比微调的 mT5、ByT5 与提示或微调的大模型,发现小模型纠错后词错误率更低,而零样本大模型呈先升后降的 n 形曲线,代价是跨域仍会退化并需要混合多源假设来缓解。
共分析 38 篇语音/AI 论文
SCAPES 针对环境声纹理的语义可控合成问题,用连续归一化流在 EnCodec 连续隐空间上按原子段自回归建模,并以 CLAP 语义嵌入和历史原子为条件,在约 34 分钟数据、单张消费级 GPU 约 1 小时训练的条件下实现长时稳定生成,代价是难以处理语音与复调音乐所需的长程结构。
共分析 38 篇语音/AI 论文
该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。