每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

预训练会弹琴却不懂调式:把大/小调先验注入最弱层的情绪识别补课

针对 MIDIBERT 做符号音乐情绪识别时调式-情感关联缺失的问题,用 Krumhansl-Kessler 提取大/小调并以 FiLM 注入第一层,在 EMOPIA 达 75.2% 准确率、VGMIDI 达 59.1% 准确率,代价是只用二分类调式并依赖自动调式估计的正确性。

 · 更新于 2026-09-24 · 约 23 分钟 · 11071 字 阅读 →
论文解读

借英语占位撬动马普敦贡语翻译:冻结大模型只练一个小适配器

针对马普敦贡语到西班牙语的极低资源语音翻译,论文冻结 Canary-1B-v2 并只训练约 589k 参数的线性适配器、用英语源语言占位实现翻译方向劫持,开发集上时长过滤版本取得 1.56 的词错率和 3.7 的 BLEU,测试集上过滤版本取得 0.82 的 BLEU 和 14.31 的 chrF2++,代价是仍存在重复解码和极低的绝对分数。

 · 更新于 2026-09-24 · 约 25 分钟 · 12472 字 阅读 →
论文解读

先对齐再翻译:S2ST-Omni 用分层语言感知桥接语音与大模型

S2ST-Omni 把多语语音到语音翻译拆成高精度语音到文本前端加可插拔语音合成后端,用先局部后全局的混合适配器和声学加语言两级源语言感知提升翻译,在 CVSS-C 法德西到英上取得平均 BLEU 35.67 的报告最好结果,代价是依赖大骨干与可靠语言标识且只验证了三对高资源方向。

 · 更新于 2026-09-24 · 约 20 分钟 · 9617 字 阅读 →
论文解读

不用自回归也能听懂语音:DIFFA 以冻结扩散模型加双适配器做理解

DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。

 · 更新于 2026-09-24 · 约 19 分钟 · 9250 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

按语系共享连接器:多语言语音大模型何时该合练、何时该单练

该文研究冻结语音编码器加冻结大语言模型、只训练轻量连接器的多语言识别中按单语言还是按语系组织训练数据的问题,在近四十种语言上报告家族级连接器多数更低更稳但在内部差异大的语系会失效,并以通用连接器对照说明增益来自亲缘性而非单纯数据量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8590 字 阅读 →
论文解读

在词元空间同时回答谁在说、说了什么、何时说:WhisperDiari 的联合建模

针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9303 字 阅读 →
论文解读

用可学习的分组有理激活替换固定激活:KanAdapter 在语音基座模型上的并行瓶颈适配

针对全量微调语音自监督基座模型代价高、MLP 适配器表达受限的问题,KanAdapter 以并行瓶颈中的 GR-KAN 可学习有理激活替换固定激活,在说话人验证、情感识别与伪造检测上以减少 94.7% 至 97.5% 可训练参数接近全量微调,并在两阶段持续学习上相对全量微调降低 83.6% 错误率。

 · 更新于 2026-09-24 · 约 21 分钟 · 10098 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 72 分钟 · 35908 字 阅读 →
论文解读

当解码器缺的不是声音,而是下一词的语义证据

语音识别 | 8.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11111 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 151 分钟 · 75584 字 阅读 →
论文解读

让每个频率格为自己的关系负责:DS 接入音乐模型

音乐理解 | 7.2/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4422 字 阅读 →
论文解读

谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车

语音识别 | 5.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4240 字 阅读 →
论文解读

别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5815 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26637 字 阅读 →
论文解读

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

音视频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6485 字 阅读 →
论文解读

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8252 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 129 分钟 · 64264 字 阅读 →
论文解读

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

音视频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5281 字 阅读 →