跳过转写直接做摘要:用句子向量把多语言语音送进法语摘要器
该研究把长语音切成片段并编码为与法语句向量对齐的语音片段向量,直接送入改造后的法语编码器解码器生成法语摘要,在呼叫中心对话和小规模跨语言合成语音上报告了与级联和音频大模型对照的可核对结果,但大模型对照为零样本且跨语言语音为合成。
该研究把长语音切成片段并编码为与法语句向量对齐的语音片段向量,直接送入改造后的法语编码器解码器生成法语摘要,在呼叫中心对话和小规模跨语言合成语音上报告了与级联和音频大模型对照的可核对结果,但大模型对照为零样本且跨语言语音为合成。
研究以双音节英语重音辨别与粤语声调同化任务检验知觉同化解释,粤语组辨别灵敏度显著高于英语组并把首末音节分别同化为 T1/T3 与 T4/T1 的两类对立,但证据限于无元音弱化的双音节词与行为选择数据。
针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文以固定 Wav2Vec2-XLSR 基线检验语系分组对跨语言语音情感识别的影响,最强证据是同语系内留一语言泛化优于跨语系泛化,而代价是跨语系直接迁移大幅掉点且受数据量与标注不一致制约。
该研究用四种自监督前端搭配四种后端、在三种多语料组合与六个评测集上对照,报告显示 XLSR 搭配 ResNet 平均等错误率最低,加入外部语料让 ASVspoof 5 编解码子集等错误率走高而野外子集走低,约 8 小时西班牙语伪造音频让西班牙语评测大幅改善而中文评测维持原量级。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该研究以英语参考音频为输入对比四种零样本跨语种克隆系统,报告了以 VoxCPM2 在阿拉伯语上同时取得 0.25 词错误率和 0.72 说话人相似度为代表的权衡证据,而代价是多数系统仍在可懂度与身份保留之间此消彼长且仅两套系统支持阿拉伯语。
针对可控语音合成中指令理解与语音生成耦合导致标注昂贵的问题,该文把外部大语言模型定为指挥家生成逐段音高能量音色数值计划、把 BatonTTS 定为乐团按计划合成,最强证据是 1.7B 模型在英文情感准确率 57.6% 并零样本迁移到中文 56.2%,代价是依赖外部大模型生成计划并引入约 20 秒级计划延迟与两阶段推理链条。
针对加泰罗尼亚语到英语方言语音翻译任务,论文比较了两种级联与一种端到端系统,最强证据是 Whisper-v3 加 NLLB 级联取得 44.7 BLEU 和 65.1 chrF,而代价是依赖大规模外部语音与文本预训练和两段式推理链路。
针对沃洛夫语音查法语文本的跨语言跨模态检索问题,论文比较晚融合与双编码器路线,最强证据是晚融合在自然口语检索与未见意图任务上保持可复述的优势,代价是依赖合成文档与较高维度推理开销。
针对语音数据稀缺与跨语言扩展难的问题,CSLM 用持续预训练做模态内与跨语言对齐、再用语音文本分块交错微调做细粒度生成,在约 77 千小时语音数据下取得可比大数据的对齐与对话能力,但大语种覆盖与更大规模验证仍待补足。
针对中法跨语言音色克隆,该工作用 Qwen3-TTS-12 Hz-1.7B-Base 做零样本批量合成,配合 10 秒窗 5 秒步长的滑动切分与 ECAPA-TDNN 余弦选优,在中文 CER 低至 1.39% 至 2.25%、法语 WER 多为 4.40% 至 8.52% 的条件下得到中文最高 0.7052 与法语最高 0.7173 的余弦相似度,代价是保 …
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
该工作以 FishAudio-S2-Pro 为基座研究英语参考到法语阿拉伯语汉语的跨语种克隆,用母语文字语言标签减少口音泄漏并以 GRPO 强化微调改善可懂度,再用推理时参考检索做词项匹配以稳住领域词发音,代价是汉语基线一度波动且说话人相似度与自然度总体保持稳定而非大幅提升。
论文研究语音大模型能否用音频加文本示范现学未见濒危语言,报告多模态示范降低困惑度且跨语言微调接近目标语言微调,并提出用声学模型产生候选再由语音大模型重排来改善词错误率,但直接生成转写仍很弱且重排带来显存与耗时开销。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …
针对附和预测中缺视频、模态时间不对齐和只盯触发点的问题,论文用多层跨模态对齐加两阶段课程学习,在韩语 KC-Dialog 上宏 F1 达到 58.53,代价是视频推理耗时从 18.868 毫秒增至 20.083 毫秒。