论文解读

手势顶点为何在 Babanki 音节里更早:双语者音节内重音时序的跟随证据

以 7 名 Babanki-英语双语者自然对话为对象,论文用话语新旧引出的时长线索与手势顶点到元音起始的时滞比较,报告 Babanki 中手势与加长线索更靠音节首,而英语更靠元音,支持手势跟踪亚音节重音时序,但证据限于单音节词与首提及对照。

 · 更新于 2026-09-25 · 约 19 分钟 · 9351 字 阅读 →
论文解读

把未知系统推出去:用代理锚定学习做语音合成来源归属与开放集检测

该文把 TTS 来源追溯写成先判断是否见过再归属到具体系统的两阶段问题,用 Wav2Vec2-BERT 嵌入加 Proxy-Anchor 学习结构化嵌入空间,在 MLAAD v9 合并架构类上报告 99.76% 闭集准确率与 2.04% 的 FPR@95,代价是依赖手动合并架构与保留校准集调阈值。

 · 更新于 2026-09-25 · 约 18 分钟 · 8741 字 阅读 →
论文解读

看不见脸时说话人是谁:CineSRD 用视觉锚点加语音语义补齐影视对白

针对影视长视频、多说话人和音画不同步问题,CineSRD 先用视觉锚点聚类注册说话人再用音频语言模型做轮次检测与幕后补充,在 SubtitleSD 上报告更低的 DER 与 JER,代价是多阶段集成而非端到端且依赖人脸与字幕时间轴。

 · 更新于 2026-09-25 · 约 17 分钟 · 8047 字 阅读 →
论文解读

解码器才是瓶颈:冻结语音编码器与印度大模型做印英混读识别

针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。

 · 更新于 2026-09-25 · 约 15 分钟 · 7235 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 212 分钟 · 106059 字 阅读 →
论文解读

先调语言模型还是先调声学解码器:法语德语适配的部件级取舍

该研究以 CosyVoice2 为骨干解决法语和德语零样本段落合成可懂度低的问题,选择只微调文本语音语言模型加流解码器并冻结声码器,最强证据是在 250 小时法语和 500 小时德语下相对词错误率下降 83 到 91%,代价是微调声码器会损害可懂度且超量加长数据会因复杂度多样性失配使词错误率回升。

 · 更新于 2026-09-25 · 约 16 分钟 · 7925 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不用改 vocoder 结构,只换条件特征:群延迟乘积谱能否替代梅尔谱

该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。

 · 更新于 2026-09-25 · 约 16 分钟 · 7539 字 阅读 →
论文解读

语系相近是否可迁移:以新拉丁语族检验跨语言语音情感识别的边界

该文以固定 Wav2Vec2-XLSR 基线检验语系分组对跨语言语音情感识别的影响,最强证据是同语系内留一语言泛化优于跨语系泛化,而代价是跨语系直接迁移大幅掉点且受数据量与标注不一致制约。

 · 更新于 2026-09-25 · 约 22 分钟 · 10809 字 阅读 →
论文解读

把离线 Canary 搬进同传:AlignAtt 截断如何换来口袋模型的低延迟

该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。

 · 更新于 2026-09-25 · 约 17 分钟 · 8024 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
论文解读

转录质量决定翻译上限:WhiNN-ST 用级联与路由选择做低资源语音翻译

该研究针对博杰普尔语到印地语和爱尔兰语到英语的低资源语音翻译,采用先转录后翻译的级联路线,比较不同语音识别前端与直接和经中间语言的翻译路由,最强证据是博杰普尔语开发集上直接翻译取得 BLEU 25.59、chrF++ 42.48、TER 63.83,代价是爱尔兰语需换专用识别模型才达到全覆盖且仍依赖代理诊断而无标准翻译分数。

 · 更新于 2026-09-25 · 约 19 分钟 · 9225 字 阅读 →
论文解读

临床印地-英语混说下谁在说话:DiariZen 为何要解冻 WavLM 才跟得上

针对两说话人 Hindi-English 医疗对话的说话人日志任务,论文比较 Diaper、Pyannote 3.1 与 DiariZen 并做域自适应,最强证据是解冻 WavLM 的 DiariZen-large 在 dev2 上达 8.57% DER、六系统融合后达 8.48% DER,代价是半监督策略高度依赖模型且融合增加系统复杂度。

 · 更新于 2026-09-25 · 约 18 分钟 · 8756 字 阅读 →
论文解读

两端多学中间少动:按深度分配低秩容量的低资源多语种适配

针对统一低秩适配破坏解码器中间层共享语义的问题,该研究按 U 形结构分配秩并用奇异值尾部方向冻结中间层,在 18 个低资源语言上以约五分之一参数达到与标准低秩相当的平均词错误率,并在极低数据下更稳定,代价是平均掩盖了分语言差异且未验证推理延迟。

 · 更新于 2026-09-25 · 约 19 分钟 · 9472 字 阅读 →
论文解读

母语和语音一换就失灵:Afri-MCQA 拆解非洲文化问答的语言与模态瓶颈

论文用 15 种非洲语言、约 7.5k 对图文加母语录音的平行问答测文化理解,最强闭源模型文本选择题仅 78% 而开放问答仅 38%,开源模型在母语语音开放问答上近零分且语音识别与语种识别先失灵。

 · 更新于 2026-09-25 · 约 18 分钟 · 8682 字 阅读 →
论文解读

没有交叉注意力时如何做 AlignAtt:把源文钉在提示词里再重算对齐块

论文把英语语音同传拆成 Qwen3 语音识别加强制对齐与 Gemma-4 解码器翻译的同步级联,用显式源文区间加离线挑选的 8 个对齐头加 qk-fast 重算实现解码器侧 AlignAtt,在英德和英意低延迟约 2 秒与高延迟 4 秒内超过主办方基线,代价是中文方向不稳定且全头重算会明显抬高计算感知延迟。

 · 更新于 2026-09-25 · 约 20 分钟 · 9819 字 阅读 →
论文解读

注册分散比拉长更有效:SRE24 音频轨的条件拆解

SRE24 音频轨围绕电话与视频伴音、变长注册与短测试、多语言与多人语音组织说话人确认试验,分析报告三段注册优于单段长注册、电话匹配优于视频伴音匹配、短测试与多人测试明显更难,而放宽训练数据的改善大于多系统融合的改善。

 · 更新于 2026-09-25 · 约 18 分钟 · 8683 字 阅读 →
论文解读

不做跨注意力:把音频当作前缀塞进冻结大模型的翻译管线

AURA-ST 针对豪萨语、伊博语、约鲁巴语到英语的低资源语音翻译,用双流声学编码加 4 倍卷积压缩把音频变成冻结 Gemma-4-E2B 的前缀,并只调 MLP 的 LoRA,在教师强制代理 BLEU 上达到 91.29,但自由自回归解码的 SpBLEU 仅为 19.5、5.2 和 4.6,暴露了严重的暴露偏置代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9452 字 阅读 →
论文解读

总词错率相同,切换处却不同:英语-约鲁巴语码切换转写的边界失效

该研究在 2000 句共享英语-约鲁巴语码切换集上对比 6 个专用语音识别系统与 5 个音频语言模型,报告 Parakeet 与 Kimi-Audio 总词错率几乎相同但后者在切换边界显著更好,代价是约鲁巴语词错误普遍超过 97% 且生成式模型存在提示依赖的过度生成。

 · 更新于 2026-09-25 · 约 18 分钟 · 8763 字 阅读 →