论文解读

不重编音频也能验声:复用编码器状态删掉无据事件提及

针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。

 · 约 16 分钟 · 7925 字 阅读 →
论文解读

先听清再推理:用声音证据校准无标签测试时更新

论文先量化大音频语言模型对声音的依赖再提出感知 grounded 的测试时强化学习,用多数票伪标签乘以声学支撑权重更新策略,在 MMAR 上最高提升 4.6 个点、在 MMAU 上最高提升 4.9 个点,代价是每步需额外做遮蔽前向与分组投票计算。

 · 更新于 2026-09-24 · 约 20 分钟 · 9639 字 阅读 →
论文解读

不碰权重只改掩码:BLINC 用盲估计双峰分布做免训练校准

针对掩码型语音增强在域偏移下掩码双峰性退化的问题,BLINC 冻结模型并用直方图匹配把预测掩码重映射到由含噪信号盲特征决定的双峰目标分布,在几乎不增加耗时的条件下提升了感知质量,但以信号级指标下降和无法修复排序错误为代价。

 · 更新于 2026-09-24 · 约 15 分钟 · 7245 字 阅读 →
论文解读

目标缺席要稳、声纹漂移要跟:流式提取中启发式前沿为何卡住,可学习的说话人状态如何跨过

论文冻结分离主干只换状态机制,用 22 组启发式更新测出稳定性-可塑性前沿,再用闭环元训练的 41k 参数锚定快权重在严重失配下达 10.9 dB 并在 30 s 缺席后保留 6.2 dB,代价是匹配短句略低于静态注册且依赖通道增强覆盖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9716 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不是每句被听清的话都是叫你:用事后反馈纠正误唤醒

针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

可预测就电一下:用现场学习的惩罚迫使即兴演奏者不断换招

该研究针对无预训练的即兴场景,用声音与肌电的四个在线预测器判断演奏是否可预测并以电刺激惩罚,报告预测准确率约为随机猜测的 1.5 至 2.5 倍,代价是误报多、演奏者注意力被算法牵走且只在作者本人的电子乐器演出中验证。

 · 更新于 2026-09-24 · 约 23 分钟 · 11296 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

先问该听谁再解码:用自评估权重压住跨模态幻觉的 MAD

针对音视频大模型中一个模态错误污染另一模态描述的跨模态幻觉,MAD 用免训练的两步流程先让模型自评问题需要音频、视频还是两者,再用权重调节四路对比解码,在 CMM 和 AVHBench 上提升 VideoLLaMA2-AV 与 Qwen2.5-Omni 的准确率,代价是每步需计算多组 logits 且依赖模型自身判断的可靠性。

 · 更新于 2026-09-24 · 约 18 分钟 · 8746 字 阅读 →
论文解读

基座也缺数据时:TAPE 用任务适配空间与推理期原型演化做全少样本音频增量分类

针对基座会话与增量会话都只有极少标注音频的全少样本类增量音频分类问题,TAPE 冻结 CLAP 音频编码器并学习任务适配投影与推理期低熵原型演化,在三套音频任务上报告平均准确率与性能下降率的同步改善,代价是每类需维护推理期优先队列并按会话重置原型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8516 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

回归标签太粗、增强又破坏融合:用潜在情感分组做测试时自监督

针对多模态情感回归在测试时分布偏移下的适配问题,GMEL 用 vMF 混合建模潜在情感分组提供自监督,并用多尺度重 dropout 保持模态完整性,在三数据集五种跨域设置上报告平均 ACC 提升 2.53 个百分点、F1 提升 3.70 个百分点、MAE 降低 0.05,代价是需离线访问全部目标数据并估计分组数。

 · 更新于 2026-09-24 · 约 19 分钟 · 9488 字 阅读 →
论文解读

多轮修音不推倒重来:用大模型定方向、用听觉优化守住上一轮

针对一次指令只给一个预设、无法在已有参数上连续修改的问题,论文用大语言模型做效果选择与初始化、再用 CLAP 引导的优化做原地微调,在 SocialFX 均衡器词对上 10 组中有 9 组的最大均值差异低于重提词基线,但非可微效果与长时间优化仍不稳定且每轮需要秒级计算。

 · 更新于 2026-09-24 · 约 18 分钟 · 8855 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

不做离散量化:KALL-E 以逐帧分布预测实现低帧率连续语音合成

KALL-E 针对离散语音切分的信息损失与高帧率不稳定问题,用 Flow-VAE 提取 512 维 12.5 Hz 连续隐分布并让自回归 Transformer 逐帧预测均值方差,以 KL 散度为目标在 Seed-TTS 上取得 0.96 中文 CER 与 1.94 英文 WER,代价是保留强 KL 约束与单样本测试时微调的额外开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

把文字方向做成向量:语音基础模型中线性的文字表征与免训练转写控制

针对多文种语音识别中同一语言输出文字不确定的问题,论文用解码器激活均值差提取文字向量并在推理时相加,在塞尔维亚语和中文混淆缓解与跨语言罗马化、西里尔化上验证效果,但西里尔化弱语言与编码器干预仍有限。

 · 更新于 2026-09-24 · 约 23 分钟 · 11447 字 阅读 →
论文解读

情绪幻觉为何分面而治:从六维评估到记忆引导的生成校正

论文针对开放式情绪推理中多面幻觉难评估、粗粒度缓解顾此失彼的问题,提出六面 EHR 评估与免训练 HMER 框架,在 19 个模型上显示幻觉普遍存在,而 HMER 在多数据集上降低总体幻觉率并保持情绪预测准确率,代价是迭代评估带来额外 token 与延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9490 字 阅读 →
论文解读

高唤醒一用力就含糊:用矫正起点与动态引导拉住情感轨迹

针对尖叫哭喊等高唤醒合成中保字准就会丢情感、追情感就会念糊的矛盾,论文提出只改推理的情感矫正噪声先验与似然逆引导,在不重训下把 F5-TTS 词错率从 4.41% 降到 2.53% 并提升情感分,但纯度与截断仍需折中且不适用于非迭代架构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8940 字 阅读 →