论文解读

听不清细节的音频大模型:用可验证的合成音频一轮轮自己出题

针对音频语言模型能懂语义却听不准声学细节的问题,EvoAudio 用当前模型的弱项决定下一轮练什么、工具合成波形保证答案可验证、GRPO 训练加留出集晋级做 13 轮递归进化,最强证据是五个不同骨干平均最高且总体最高提升 6.3 点,代价是工具覆盖不到的语义文化推理提升有限且后期收益变平。

 · 约 19 分钟 · 9393 字 阅读 →
论文解读

短到长真的教会了模型吗:把排序、组批与损失归一化解开

论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。

 · 约 7 分钟 · 3371 字 阅读 →
论文解读

删掉画面还要删掉声音:文本与已编辑视频如何共同指定要压制的声源

针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。

 · 约 17 分钟 · 8034 字 阅读 →
论文解读

从干净音素到真实唇读错误:用三阶段课程让重建模型适应噪声

针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9118 字 阅读 →
论文解读

不只听懂说了什么:用 22 个副语言特征和两阶段课程统一说话方式与声学环境理解

针对音频大模型能转写却听不懂说话方式与声学环境的问题,论文用 22 维特征定义、120 万音频问答对与先单属性后多属性的两阶段课程训练 ParA-LLM,在 ParA-Bench 总体上报告 43.53% 准确率并在外部语音基准上同步提升,代价是声学单项仍弱于 GPT-4o-Audio 且绝对准确率仍远低于人类。

 · 更新于 2026-09-24 · 约 17 分钟 · 8324 字 阅读 →
论文解读

稀疏舞蹈线索到稠密音乐之间:用分层专家监督补上中间表示

针对舞蹈线索稀疏而作曲需要稠密结构的问题,CMA-OT 用 Jukebox 多尺度专家对 DiT 隐表示做由粗到细的课程对齐与尺度自适应 FGW 软对齐,并以流匹配生成损失联合训练,在 AIST++ 与 TikTok 上报告了节奏与质量提升,代价是训练侧引入多尺度 OT 与课程调度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10119 字 阅读 →
论文解读

数得准还要指得出:长视频线索级音视计数的基准与能力迁移训练

论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。

 · 更新于 2026-09-24 · 约 20 分钟 · 9734 字 阅读 →
论文解读

链式推理何时帮倒忙:语音理解与描述中的显式思维链、课程学习与槽填充对照

论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。

 · 更新于 2026-09-24 · 约 18 分钟 · 8810 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

先对准频率再抠位置:ALAMODE 用三阶段差分进化反演平板混响参数

针对给定目标脉冲响应反推虚拟平板混响器六维物理与空间参数的问题,ALAMODE 用无梯度差分进化分三阶段依次锁定频率、位置与整体能量参数,在 128 条合成与 16 条挑战数据上实现高谱重合,但第三阶段质量密度精度与仿真速度仍受限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9639 字 阅读 →
论文解读

不用转写也能打分:HydraQE 把语音和译文一起编码做质量估计

HydraQE 针对语音翻译无参考质量估计,用 Qwen3-ASR 同时编码源语音和译文假设,经稀疏层混合与双向重编码得到共享表示并用 DA、MetricX、xCOMET 三头监督加课程采样训练,在 IWSLT 2026 开发集与测试集段级别上超过级联文本基线,但不同预测头在语种与段级和系统级之间存在权衡且开发集系统级分数不稳定。

 · 更新于 2026-09-24 · 约 17 分钟 · 8320 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

从跳变的数值解到连续的 learned 逆映射:二次差频谱合成如何变得可演奏

该文把求载波复音以产生目标二次差频谱的问题转成学习失真函数连续近似逆,用齐次结构加课程式训练换来可实时插值的合成器,代价是重建误差略高于随机牛顿迭代。

 · 更新于 2026-09-24 · 约 19 分钟 · 9361 字 阅读 →
论文解读

总体学好了不等于每种攻击都学好:高影响攻击的主导与课程缓解

该文在 ASVspoof 2019 上用省略敏感性与熵损失诊断出 A1 与 A4 等高影响攻击,再用先学低影响后适配高影响的重放课程把跨数据集总体 EER 明显压低,代价是两阶段训练与四项正则的额外复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8779 字 阅读 →
论文解读

先听片段再分流:用文本可答性把死记训练和听觉强化分开

针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8830 字 阅读 →
论文解读

把结构化语音与非结构化音效装进同一指令接口:UniSonate 的对齐与课程设计

UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9402 字 阅读 →
论文解读

无标签也要会切歌:UniVocal 用语义推断驱动说唱切换

UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9094 字 阅读 →