每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 79 分钟 · 39128 字 阅读 →
论文解读

以单语微调对抗多语诅咒:BuzzASR 的百语种适配路线

BuzzASR 用单语微调与分词器替换加文本多任务两条路线适配 102 种语言,在 77 种语言上超过 Whisper-large-v3 并在 27 种语言上达到开源最优,代价是逐语维护模型与域内评测带来的可比性限制。

 · 更新于 2026-10-01 · 约 19 分钟 · 9283 字 阅读 →
会议总览

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 75 分钟 · 37568 字 阅读 →
论文解读

错误稀疏下只改该改的片段:韩语咨询对话的检测门控纠错

针对无法使用音频、只能做纯文本后编辑且错误稀疏的韩语咨询对话,论文用真实呼叫数据构建 DasanCallDial 并提出先检测后纠错的 DCSC,主证据是 pkoT5 版本把平衡词错误率指标值从 14.67 降到 13.30,把错误句词错误率指标值从 29.35 降到 26.27,代价是检测门仍会漏检且纠错器对部分已送入错误保持保守。

 · 更新于 2026-10-01 · 约 20 分钟 · 10017 字 阅读 →
论文解读

小模型微调为何压过大模型提示:印地语后纠错的规模与领域证据

论文把印地语后纠错做成高重叠文本编辑,对比微调的 mT5、ByT5 与提示或微调的大模型,发现小模型纠错后词错误率更低,而零样本大模型呈先升后降的 n 形曲线,代价是跨域仍会退化并需要混合多源假设来缓解。

 · 更新于 2026-10-01 · 约 16 分钟 · 7657 字 阅读 →
论文解读

浅正字法不等于无重音:用弱监督让 ByT5 在句子级学会菲律宾语重音

针对菲律宾语重音需靠句子上下文消歧但句子级音素标注稀缺的问题,该研究用 Wiktionary 词典加 LLM 辅助管线合成句子级弱监督数据微调 CharsiuG2P 初始化的 ByT5,在 1173 句人工校对集上把音素错误率从约 19.74% 降到约 0.54%、字符错误率降到约 2.50%,代价是 malumi 类与非标准词仍易错且大合成集增益主要体现在 …

 · 更新于 2026-10-01 · 约 16 分钟 · 7843 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 69 分钟 · 34318 字 阅读 →
论文解读

停顿不等于结束:泰米尔电话语音的语义轮次终点如何被验证与复现

针对泰米尔电话语音在每次停顿判断是否说完的问题,论文用 116 通双通道电话切出 18485 个边界并以音频大模型重标,再把 Smart Turn v3 微调为 8.7 MB 与 21 MB 两个纯音频模型,在 30 通未见来电的 4168 条上把准确率从 70.30% 提到 86.13%,代价是生产端 VAD 与流式切窗再扣约 2.60 点且部分边界根本不 …

 · 更新于 2026-10-01 · 约 18 分钟 · 8617 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 93 分钟 · 46170 字 阅读 →
论文解读

合成之前先对账:说话计划能否证明 delivery 真用了源记录

论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。

 · 更新于 2026-10-01 · 约 20 分钟 · 9581 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 40 分钟 · 19562 字 阅读 →
论文解读

长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起

音频字幕生成 | 6.8/10

 · 更新于 2026-10-01 · 约 21 分钟 · 10434 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 151 分钟 · 75584 字 阅读 →
论文解读

Preference Optimization for Non-Verbal Vocalization Synthesis

语音合成 | 7.1/10

 · 更新于 2026-10-01 · 约 13 分钟 · 6013 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 68 分钟 · 33830 字 阅读 →
论文解读

A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer

语音交互 | 9.7/10

 · 更新于 2026-10-01 · 约 12 分钟 · 5555 字 阅读 →
论文解读

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

音视频理解 | 10.0/10

 · 更新于 2026-10-01 · 约 10 分钟 · 4537 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-25

共分析 46 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 101 分钟 · 50381 字 阅读 →
论文解读

ARENA: Automated Red-Teaming for Large Audio Language Models

音频理解 | 6.5/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7088 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 129 分钟 · 64264 字 阅读 →