论文解读

从歌曲证据到可执行分镜:MVWeaver 为何用层次规划加歌曲到视觉的桥接来做长篇音乐视频

针对全曲音乐视频需要把歌曲语义与音乐结构转成连贯视觉发展的难题,MVWeaver 用层次化规划把总概念逐级展开为可渲染镜头,并用从真实歌曲-MV 对中学习到的歌曲到视觉桥接来条件化规划,证据显示其在歌曲贴合与长程连贯上优于同条件基线,但增益依赖桥接监督与层次资产复用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10949 字 阅读 →
论文解读

以不完美证据约束自回归生成:码空间接地与局部精修如何兼顾忠实与自然

该工作把确定性增强输出当作有观测支撑但不完美的证据,用有限标量量化码空间的汉明距离在解码时约束自回归大语言模型,并按残余信噪比自适应接地强度再做局部重排,在低信噪比下保住内容忠实度的同时挽回感知质量,但强接地仍会带来感知代价且极端尾部错误不能完全消除。

 · 更新于 2026-09-24 · 约 18 分钟 · 8865 字 阅读 →
论文解读

把级联状态机装进大模型:TurnFSM 如何串行做提交与拒绝

TurnFSM 把语义 VAD 与 utterance 级拒绝写成先提交后接受或拒绝的有限状态转移并用一阶依赖实现流式预测,在内部语义 VAD 上报告成功率 82.41% 与成功延迟 80.9 ms,在拒绝上报告 FAR 3.35% 与 FRR 16.04%,代价是仍需两阶段对齐与大模型推理开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9518 字 阅读 →
论文解读

轮次向真实语音学,语义向可配文本学:有限状态机全双工的解耦数据路线

针对合成文本同时学轮次与语义不可靠的问题,该工作用真实人与人语音学轮次、用可改写的人与智能体文本保语义,配合规则化事件转磁带与来源感知校准损失,在等量 token 下把轮次 F1 从约 0.34 提升到约 0.65 并把语义恢复到接近基座上限,代价是暂停处理仍弱于保守系统且单带离散化会丢信息。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →
论文解读

既要一字不差又要好看易读:双形式语音识别如何决定数字该不该变

针对中文语音识别中口语忠实转写与书面可读转写难以兼顾的问题,论文用成对监督加提示词选形式训练一个共享模型,并以数字关键词加权的序列优化和分开考核必须改与禁止改的协议证明其在必须规范化上达到 4.64% I-CER 与 94.85% 关键词 F1、在禁止改上达到 95.18% 保留率,而无数字控制集上未引入虚假数字。

 · 更新于 2026-09-24 · 约 10 分钟 · 4935 字 阅读 →
论文解读

卡住最强翻译模型:难例众包与逐条验证规则

该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。

 · 更新于 2026-09-24 · 约 22 分钟 · 10621 字 阅读 →
论文解读

热启动之后再听一次:用隐状态夹角找出语义词并只在那里纠错

论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7795 字 阅读 →
论文解读

导演喊“再来一条”时,机器如何既不变声又听懂弦外之音

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10186 字 阅读 →
论文解读

想练好一句难开口的话,机器得先学会怎么“演人”:Conversation Coach 的延迟与演技取舍

语音交互 | 6.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12239 字 阅读 →
论文解读

别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读

语音合成 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11235 字 阅读 →
论文解读

只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口

语音情感识别 | 7.1/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11195 字 阅读 →
论文解读

朗读课文不该读出抑郁:用证据边界把筛查关进可审计的笼子

语音情感识别 | 7.0/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11117 字 阅读 →
论文解读

提示词动了,词错误率为什么不动:一次生产级口述史转录的预注册阴性消融

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11646 字 阅读 →
论文解读

听得更干净,却想得更错:当语音增强把大模型带偏

语音增强 | 8.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10322 字 阅读 →
论文解读

别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11536 字 阅读 →
论文解读

把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分

音视频理解 | 5.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9507 字 阅读 →
论文解读

听错一句,机器就敢动手:语音误差如何撬开具身智能的安全锁

语音交互 | 5.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8038 字 阅读 →
论文解读

在干净与噪声之间不敢用力的对比解码:用注意力给干预装上刹车

语音识别 | 6.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8147 字 阅读 →
论文解读

会数停顿的尺子,为什么比会说话的模型更懂流利度?

语音质量评估 | 6.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9539 字 阅读 →
论文解读

同音不同形,真的同音吗?当语义在频谱里留下指纹

语音识别 | 6.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8782 字 阅读 →