论文解读

门控只在新模态上打开:在冻结嵌入模型里加音频与热成像而不改动旧输出

该文把瓶颈适配器装进冻结解码器每一层并用输入成分做二进制门控,使旧模态走原计算图实现逐位不变,同时用对照实验显示音频检索提升与热成像包的可组合性,代价是新增模态的文本混排输入属于新行为且双门同开不在保证内。

 · 约 16 分钟 · 7898 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 约 112 分钟 · 55814 字 阅读 →
论文解读

不抢话也不漏话:Voice-Light 用因果检查管住推测与历史

Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。

 · 更新于 2026-09-24 · 约 21 分钟 · 10404 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-21

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25432 字 阅读 →
论文解读

先唤醒编码器再整体微调:用轻量适配器补上语音大模型的声学短板

针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。

 · 更新于 2026-09-24 · 约 20 分钟 · 9557 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

最后一层未必最好:CAL-MOS 用逐层校准让冻结骨干的多层融合更稳

针对非侵入式 MOS 预测中语音基础模型层利用不稳定的问题,论文在 10 个骨干与 4 个数据集上对比末层探测、最优单层、朴素加权融合与全量微调,并评估逐层适配器校准后聚合的冻结骨干方案,最强证据是 Wav2BERT A+M 在四库平均上达到话语级 0.388/0.749 与系统级 0.052/0.932,代价是仍需为每个层训练独立适配器与回归头且最优深度随 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9631 字 阅读 →
论文解读

冻住源语言适配器再叠一层:跨语言低资源适配为何选择串行堆叠

针对 Whisper 不支持的三种低资源语言,研究比较暖初始化、注意力融合与顺序适配器堆叠三种源适配器复用方式,最强证据是最近源上的顺序堆叠在全量数据上相对全量微调降低词错误率 5-8%,在一小时数据上降低 12-26%,代价是需先在约 120 小时源语言数据上训练并冻结源适配器。

 · 更新于 2026-09-24 · 约 18 分钟 · 8808 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →
论文解读

用一次算好的键值记忆,给冻结的音乐大模型加上可组合的音频控制

针对文字难以规定节拍、旋律与演绎细节的问题,该工作用与主干同构的模板把控制音频转成逐层键值记忆注入冻结的生成分支,在单控制评测中把五类控制依从指标推到基线之上,同时自动音质与文本对齐分数与基线大体相当但存在指标级回落。

 · 更新于 2026-09-24 · 约 18 分钟 · 8540 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-14

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28192 字 阅读 →
论文解读

解码器才是瓶颈:冻结语音编码器与印度大模型做印英混读识别

针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。

 · 更新于 2026-09-24 · 约 15 分钟 · 7235 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

看得见撞击,还要听得出轻重:PAVAS 把质量与速度写进视频生音频

针对视频生音频只学外观关联而忽视撞击轻重的问题,PAVAS 用估计出的物体质量与速度去调制潜在扩散模型,在 VGGSound 与 VGG-Impact 上同时报告了分布、感知与物理一致性证据,但依赖多组冻结视觉模块且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 24 分钟 · 11524 字 阅读 →
论文解读

不重训语音大模型,用无声图文与门控交叉注意力教它看图说话

MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。

 · 更新于 2026-09-24 · 约 20 分钟 · 9950 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

冻住大模型做共情对话:用语义情绪解耦把文本共情搬到语音

针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9741 字 阅读 →
论文解读

低资源下直连还是级联:博杰普尔语语音翻译的适配器与质量估计融合

针对博杰普尔语到印地语新闻领域语音翻译,论文比较了 Wav2Vec2 加 NLLB 解码器的端到端适配方案与 Whisper 加 NLLB 的级联加 QE 融合方案,最强可复述证据是开发集端到端 32.77 分与级联经 QE 融合后 COMET 提升,但测试集大幅回落暴露了标注噪声与适配器泛化瓶颈。

 · 更新于 2026-09-24 · 约 23 分钟 · 11075 字 阅读 →