论文解读

无标签也要会切歌:UniVocal 用语义推断驱动说唱切换

UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。

 · 更新于 2026-09-25 · 约 19 分钟 · 9094 字 阅读 →
论文解读

只看画面能懂笑点吗:v-HUB 逼模型从视觉和环境声里找幽默

v-HUB 把视频幽默拆成字幕匹配、幽默解释和开放问答三类可核对任务,用文本、纯视频、视频加音频三组输入对照测出模型重度依赖文字线索,而环境声和画面内文字只带来小而稳定的增益且历史默片更难。

 · 更新于 2026-09-25 · 约 20 分钟 · 9544 字 阅读 →
论文解读

先看再听:用两段式推理链约束幻灯片辅助转写

针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。

 · 更新于 2026-09-25 · 约 18 分钟 · 8645 字 阅读 →
论文解读

真人中文语音做考题:VCB Bench 为何要同时考听话、懂知识和抗干扰

针对英文为主和合成语音评测失真的问题,VCB Bench 用全真人中文语音构建指令跟随、知识理解与鲁棒性三维评测,在 9 个语音对话模型上显示常识问答最难而物理干扰比口误更致命。

 · 更新于 2026-09-25 · 约 16 分钟 · 7773 字 阅读 →
论文解读

看着脸听声音:多模态大模型为何在英语里幻听口音、在韩语里加分

论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。

 · 更新于 2026-09-25 · 约 17 分钟 · 8234 字 阅读 →
论文解读

把主唱和和声分开:VocalRep 用角色一致性重做人声表示

针对双轨分离把主唱与和声混为一轨导致的下游含混问题,VocalRep 用全局身份条件加排序约束做三轨分离,在保持可比分离分的同时以更干净的主唱提升歌声转换可懂度与音高稳定性和唇同步精度,代价是求和比较时累积误差与多人主唱假设受限。

 · 更新于 2026-09-25 · 约 18 分钟 · 8832 字 阅读 →
论文解读

用进度刻度对齐文本与语音:VoiceStar 如何同时做到时长可控与超长外推

针对零样本语音克隆中对齐脆弱、时长不可控和长于训练则崩溃的问题,VoiceStar 用进度监控旋转位置编码与延续加提示混合训练实现时长控制与外推,最强证据是 40s-50s 外推下词错率 11.91 对 F5-TTS 的 52.44,代价是长上下文下说话人相似度略低与自回归推理慢。

 · 更新于 2026-09-25 · 约 16 分钟 · 7959 字 阅读 →
论文解读

先想后说再调工具:VoxMind 如何把语音对话做成可规划的端到端智能体

VoxMind 针对端到端语音智能体规划弱与工具多时延迟高的问题,采用先显式推理再说话与并行动动态工具管理,并在 AgentChat 上训练,主评测总体 74.57 分超越基线,但推理轨迹带来固定开销且合成数据与真实口语仍有差距。

 · 更新于 2026-09-25 · 约 18 分钟 · 8998 字 阅读 →
论文解读

偏好只改文字、锚定稳住声音:WavAlign 的模态分工混合后训练

针对端到端语音对话中统一偏好优化易引起声学漂移的问题,WavAlign 用全 token 有监督微调做声学锚、用仅文本的组相对策略优化改语义并以 rollout 统计动态加权,在两种架构上同时提升语义与表达但仍受限于序列级奖励与音频评价可靠性。

 · 更新于 2026-09-25 · 约 19 分钟 · 9124 字 阅读 →
论文解读

吴语没有数据就没有模型:用八千小时多维标注把理解与生成一起补齐

针对吴语语音数据极少、无公开基准和可用模型的问题,论文用约 8000 小时多维自动标注语料加人工基准与分阶段模型验证,在识别与理解任务上大幅降低误差并提升翻译与属性判断,但数据分布不均与自动标注噪声仍限制泛化。

 · 更新于 2026-09-25 · 约 19 分钟 · 9033 字 阅读 →
论文解读

词级定位而非句级知道:WESR 把笑声哭声放回词的位置

针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。

 · 更新于 2026-09-25 · 约 21 分钟 · 10205 字 阅读 →
论文解读

出错时才见结构:神经语音模型的音位混淆是局部且不对称的

该文把音位识别错误转到 39 维区别特征空间做可复述诊断,报告跨 12 种语言替换错误中位距离 4 对随机基线 9、平均差约 2.8 且 PS 约 0.64,代价是只分析替换错误并依赖 soundvectors 特征与自举区间判断。

 · 更新于 2026-09-25 · 约 19 分钟 · 9069 字 阅读 →
论文解读

单句之内,声音比文字多说多少:讽刺、情感与疑问的信息分工

论文把讽刺、情感、是否疑问作为离散目标,用文本模型与语音模型分类器的交叉熵估计互信息,在单句无长上下文条件下报告讽刺和情感的音频信息比文本高出一个量级以上、疑问句仅约 2.4 倍,并以音频增量近似韵律独有信息,代价是韵律无独立模型且结论受标注与模型上界约束。

 · 更新于 2026-09-25 · 约 18 分钟 · 8661 字 阅读 →
论文解读

深度冗余时做减法:用浅层对齐让伪造语音检测走得更远

针对 Transformer 伪造语音检测器深层冗余且域外泛化差的问题,论文用 XLS-R 加 1 到 4 层 MTLA 分类器并以角距离把浅层向末层对齐,在 19LA 训练、多域评测下以 479.11K 分类器参数取得域外增益,但过强对齐与过深堆叠仍会退化。

 · 更新于 2026-09-25 · 约 20 分钟 · 9858 字 阅读 →
论文解读

声音对不上长相时,多模态队友先信谁:配对偏置与场景刻板印象的分流

该研究用声音性别与头像外观正交变化的协作游戏二选一任务审计 10 个多模态大模型,发现闭源模型近乎强制声音外观一致、开源模型偏向高风险场景选男性且两种偏置可独立出现,而降低写实度只在部分强配对模型中减弱声音效应。

 · 更新于 2026-09-25 · 约 17 分钟 · 8353 字 阅读 →
论文解读

不靠语义猜声音:用海洋哺乳动物叫声逼模型真正去听

该研究用分布外海洋哺乳动物叫声构造感知与认知两类选择题,测低层听觉,最强证据是人类 Remember 达 97.1% 而模型仅 57.1% 左右,代价是题型限于单选题且只覆盖单一生态域。

 · 更新于 2026-09-25 · 约 18 分钟 · 8578 字 阅读 →
论文解读

以混合检索补压缩短板:XLSR-MamBo 如何用 Mamba 与注意力检出伪造语音

针对纯因果状态空间模型难以全局检索频域伪造痕迹的问题,论文提出 XLSR 前端加 Mamba 与注意力混合后端的模块化框架,最强证据是 MamBo-3-Hydra-N3 在三组跨域评测上取得有竞争力的等错误率,代价是堆叠深度与变体选择敏感且浅层检查点方差大。

 · 更新于 2026-09-25 · 约 17 分钟 · 8208 字 阅读 →
论文解读

低码率下语义与音质为何互相拖累:XY-Tokenizer 用双塔与两阶段分开建模

针对约 1 kbps 下语义对齐与波形重建互相冲突的问题,XY-Tokenizer 用语义与声学双编码器加残差矢量量化与先联合对齐后冻结细化的两阶段训练,在英中多数据集上同时取得低识别错误率与高说话人相似度,代价是更大的编码器规模与更重的训练流程。

 · 更新于 2026-09-25 · 约 24 分钟 · 11812 字 阅读 →
论文解读

不更新参数如何让阿拉伯方言识别变准:提示、前缀与代理重排的三条推理时通路

针对阿拉伯语标准语与多方言零样本识别落差,论文用解码器提示、编码器加解码器前缀和 CTC 代理引导 n-best 重选三种免训练上下文接入,在十个条件下取得 MSA 相对 22.29% 等词错率下降,代价是首遍解码、检索与合成带来的额外延迟与对辅助信号质量的依赖。

 · 更新于 2026-09-25 · 约 22 分钟 · 10589 字 阅读 →
论文解读

直接学对话会失语:用课程学习与说话轮次嵌入让流匹配学会双人对话

针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。

 · 更新于 2026-09-25 · 约 20 分钟 · 9541 字 阅读 →