Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost

📄 Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost 标签:#语音识别 #自回归模型 #高效推理 #多语言 7.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #自回归模型 | #高效推理 #多语言 | arxiv 👥 作者与机构 第一作者:Xinyu Wang(机构未说明;论文给出邮箱 xinyu@boson.ai) 通讯作者:未说明 作者列表:Xinyu Wang、Huapeng Zhou、Ziyu Zhao、Silin Meng、Ke Bai、Dongming Shen、Xiao-Wen Chang、Alex Smola(机构均未明确标注) 💡 毒舌点评 这篇文章的真正贡献不是“投机解码能加速 ASR”,而是把 ASR 单模型投机解码的失败定位到了浅层草稿在无 target 干预期间丢失音频位置。它用 restart/continuation 分解、固定宽度窗口干预、验证注意力读出和 AnchorDraft 训练目标形成了一套机制证据链。短板是证据链部分依赖离线强制对齐 oracle,运行时修正在 clean 上净收益不显著,训练修正数据量小,且没有可访问代码、权重或 demo;因此方法价值大于直接可复现价值。 ...

2026-08-14 · 更新于 2026-08-14 · 6 min · 1103 words

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

📄 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 标签:#音频生成 #流匹配 #自回归模型 #强化学习 #数据集 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #流匹配 | #自回归模型 #强化学习 | arxiv 👥 作者与机构 第一作者:Wenxiang Guo(浙江大学) 通讯作者:Zhou Zhao(浙江大学) 作者列表:Wenxiang Guo(浙江大学)、Changhao Pan(浙江大学)、Ziyue Jiang(浙江大学)、Fei Wu(浙江大学)、Zhou Zhao(浙江大学) 💡 毒舌点评 VoxAudio 用“随机 chunk 边界 + 异步流匹配 + 多奖励 NFT”这一套组合拳,确实把 vocalized audio synthesis 从一个被 T2A/TTS 各管一段的尴尬地带推进到了可流式、可控时序的 unified 方案,尤其在 WER 和区间定位上提升明显。然而,这篇工作更像是一次高质量的工程集成而非方法级突破:VoxCorpus 的模拟+清洗管线和 RL 奖励设计虽然完整,但很多结论依赖单 baselines 和外部模型评估,跨域泛化性与真实噪声鲁棒性仍欠说服力。更令人担心的是,该方法在 MECAT 上的分布指标大幅落后于 Dasheng-AudioGen,作者却以“领域差异”轻轻带过,审稿人不应放过这一点。 ...

2026-08-14 · 更新于 2026-08-14 · 5 min · 1025 words

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

📄 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder 标签:#语音合成 #自回归模型 #语音克隆 #多语言 #零样本 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #自回归模型 | #语音克隆 #多语言 | arxiv 👥 作者与机构 第一作者:Huaxuan Wang(NetEase Youdao, Beijing, China) 通讯作者:未说明 作者列表:Huaxuan Wang(NetEase Youdao, Beijing, China)、Huimin Wang(NetEase Youdao, Beijing, China)、Ruiyu Zhang(NetEase Youdao, Beijing, China)、Yingjie Li(NetEase Youdao, Beijing, China)、Yitao Duan(NetEase Youdao, Beijing, China) 💡 毒舌点评 这是一份工业级多语言 zero-shot TTS 系统报告,联合训练的 SSL speaker encoder 让参考音频不再依赖转录,跨语言 WER 和主观排名确实能打;但创新更偏工程集成而非方法突破,且全文没有单组件消融、延迟/吞吐和显著性检验,审稿人难以判断各项设计到底贡献了多少。 ...

2026-08-13 · 更新于 2026-08-14 · 4 min · 763 words

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

📄 Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization 标签:#语音合成 #流匹配 #语音转换 #自回归模型 #零样本 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #流匹配 | #语音转换 #自回归模型 | arxiv 👥 作者与机构 团队:L-Lab Phoenix-Audio Team 机构:Didichuxing Co. Ltd 核心贡献者:Peijie Chen、Zhuanling Zha、Zhipeng Nie、Weijie Wu、Yiming Liu、Daiyu Huang、Junbo Li、Jun Fang、Naiqiang Tan、Hua Chai(均 Didichuxing Co. Ltd) 顾问:Qingyang Hong(厦门大学) 通讯作者:未说明 💡 毒舌点评 本文用 flow matching 梯度反传把语义 tokenizer 和声学解码器焊在一起,确实把 WER 压到 GT 以下、SIM 在多基准上登顶,联合训练的证据链清楚。但全篇没有任何开源迹象,mask 策略与损失权重等关键实现细节一笔带过,且“超过 GT”这类表述应更谨慎解读。推理延迟、吞吐、训练成本对比等系统级指标全缺,工业部署价值难以独立判断。 ...

2026-08-13 · 更新于 2026-08-14 · 6 min · 1095 words

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

📄 A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies 标签:#音频生成 #生成模型 #自回归模型 #扩散模型 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.1/0.5 | 工程 0.6/1.5 ✅ 6.5/10 | 前50% | 文档类型:理论研究 | 评分置信度:中 | #音频生成 | #生成模型 | #自回归模型 #扩散模型 | arxiv 👥 作者与机构 第一作者:Dongchao Yang(The Chinese University of Hong Kong,dcyang@se.cuhk.edu.hk) 通讯作者:论文未明确标注通讯作者;由于论文仅有一名作者,该唯一作者承担通讯角色。 作者列表:Dongchao Yang(The Chinese University of Hong Kong) 💡 毒舌点评 这篇立场论文最聪明的地方是拆掉“离散 vs 连续”这堵假墙:它指出真正决定架构选择的是依赖时域与条件歧义,而不是输出接口的类别;RVQ“残差有序但语义无序”的澄清,也比常见综述里“低层语义、高层声学”的说法准确得多。然而,这个“统一视角”的骨架几乎全是信息论恒等式——恒等式没有错,但它们本身不产生预测。全文没有给出任何一个可证伪的量化声明:依赖时域怎么测、条件歧义怎么算、式 (2) 的经验可建模性剖面具体长什么样,统统没有。概念框架像一张精美的地图,但没有标出任何一条实际走过的路。作为观点文章,清晰度够格;作为可检验的“框架”,验证基本缺位。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 459 words

CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

📄 CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis 标签:#语音合成 #扩散模型 #语音克隆 #自回归模型 #零样本 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #扩散模型 | #语音克隆 #自回归模型 | arxiv 👥 作者与机构 第一作者:Zhisheng Zheng(德克萨斯大学奥斯汀分校,由邮箱 zszheng@utexas.edu 确认) 通讯作者:未说明(论文正文未标注通讯作者;David Harwath 提供邮箱 harwath@utexas.edu,但未被明确指定为通讯作者) 作者列表:Zhisheng Zheng、Xiaohang Sun、Zhu Liu、Caren Chen、Rohith Kumar、Manoj Aggarwal、Gerard Medioni、David Harwath 机构信息:论文页脚标注两个单位——1. The University of Texas at Austin,2. Amazon;各作者与机构的对应关系未逐人标出。除上述两位由邮箱确认外,其余作者的机构归属无法确认。 💡 毒舌点评 把 DiTAR 的连续潜空间、CAM++ 声纹和逐音素韵律控制信号整合成一套可用的可控 TTS,工程上确实完整,0.6B 在零样本克隆上也略优于复现的 DiTAR。但“可控性”全程只拿对 GT 的 RMSE/MAE 说话,既没有验证对任意给定非 GT 目标韵律的跟随能力,也没有对 pitch/loudness 逐项消融,更没有控制效果的主观听感测试;0.1B 模型在零样本合成中 WER 明显退化也完全未解释。以顶会标准看,这只能证明“显式控制信号能降低与 GT 的声学误差”,还不足以支撑“用户可控表达性语音合成”的强声明。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 976 words

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

📄 CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents 标签:#语音合成 #自回归模型 #流匹配 #知识蒸馏 #零样本 7.0/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #自回归模型 | #流匹配 #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Yuqian Zhang(上海创新研究院、复旦大学;论文脚注标注“实习期间在 OPPO 完成”) 通讯作者:Shuang Chen(上海创新研究院、复旦大学) 作者列表: Yuqian Zhang(上海创新研究院、复旦大学;OPPO 实习) Yao Shi(OPPO AI Center) Kexin Huang(复旦大学) Botian Jiang(上海创新研究院、复旦大学) Zhe Xu(上海创新研究院、复旦大学) Yiwei Zhao(上海创新研究院、复旦大学) Min Liang(OPPO AI Center) Shuang Chen(上海创新研究院、复旦大学) Xipeng Qiu(上海创新研究院、复旦大学) 机构说明:论文仅给出三个机构编号(1=上海创新研究院、2=OPPO AI Center、3=复旦大学),未提供更细的实验室/部门层级,未说明的内容不额外猜测。 💡 毒舌点评 CuteTTS 的工程完成度确实亮眼——0.2B 参数在 49ms 首包延迟下交出 WER 2.16%/SIM 78.9 的 LibriSpeech 成绩,guidance–step 蒸馏把双分支 CFG 与 10 NFE 压成单分支 4 NFE 的思路也值得后续工作借鉴。但审稿人最想追问的是:SIM 评测器与被蒸馏的说话人编码器同属 WavLM 家族,表 1 中 78.9 对 VoxCPM2 的明显领先有多少来自表征空间亲缘性而非真实音色还原?全文没有 demo 链接、没有显著性检验、主观评测仅 7 名标注者×400 比较项,却要支撑“high-quality synthesis”这个核心卖点,证据链偏细。 ...

2026-08-11 · 更新于 2026-08-14 · 7 min · 1334 words

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

📄 MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation 标签:#音乐生成 #自回归模型 #模型评估 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #自回归模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Shuyu Li(浙江大学人工智能学院) 通讯作者:Kejun Zhang(浙江大学人工智能学院;长三角一体化创新中心) 作者列表:Shuyu Li(浙江大学人工智能学院)、Kejun Zhang(浙江大学人工智能学院)、Jiahe Lei(香港中文大学)、Shulei Ji(浙江大学计算机科学与技术学院)、Zihao Wang(浙江大学计算机科学与技术学院/山东大学)、Jiaxing Yu(浙江大学人工智能学院)、Wanying Wu(浙江大学竺可桢学院)、Lei Wang(蚂蚁集团) 💡 毒舌点评 用显式布局规划替代隐式全局prompt,方向正确且及时。方法整体是一个“在ACE-Step的LM token流中插入一段结构化文本”的增量式改造,胜在工程闭环完整,但结论的适用范围需要仔细甄别:相对匹配数据no-layout控制确实全面更优,这是最有力的证据;然而在外部基线对比中,生成布局只在FreeMIDI上FAD/KL最优,MuChin真实音频域FAD高达3.456(显著差于XL-Turbo的1.994和Stable Audio的2.007),CLAPScore也始终低于Stable Audio,说明显式规划并不能统一提升全局文本对齐。布局操作实验仅有4个手工挑选的成功案例和谱图可视化,无量化指标和失败案例;主观评价样本量小、无显著性检验。全文无代码/权重/demo链接,可复现性仅停留在“附录写得很详细”的层面。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 574 words

MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering

📄 MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering 标签:#音乐生成 #自回归模型 #可解释性 #模型评估 7.1/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #自回归模型 | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Jakub Poćwiardowski(华沙理工大学计算机科学研究所) 第二作者:Mateusz Modrzejewski(华沙理工大学计算机科学研究所) 通讯作者:论文未标注通讯作者 💡 毒舌点评 这篇工作把线性探针、logit/tuned lens、activation patching 和 steering 成套搬到文本到 MIDI 的符号音乐生成模型上,跨模型对比和双向干预分解是明显亮点,确实补了一个此前空白的方向。但它本质上是成熟可解释性工具的领域迁移与组合,且“架构决定预测形成方式”的核心判断建立在每种架构只有一个模型的基础上,无法排除分词、预训练数据和条件注入方式的混杂,作为因果结论仍然偏弱。更有经验的研究者会期待至少一个同架构不同 tokenizer/conditioning 的对照,或对 steering 方向做随机方向基线。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 834 words

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

📄 SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation 标签:#语音合成 #自回归模型 #歌唱生成 #流匹配 #零样本 7.0/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #自回归模型 | #歌唱生成 #流匹配 | arxiv 👥 作者与机构 第一作者:Hanke Xie(机构编号 1/2,机构名称未说明;论文脚注标注实习期间于 Soul AI Lab 完成部分工作) 共同第一作者:Haopeng Lin(机构编号 2,机构名称未说明) 通讯作者:Lei Xie(机构编号 1)、Xinsheng Wang(机构编号 2) 作者列表: Hanke Xie Haopeng Lin Jiale Qian Dake Guo Yuepeng Jiang Zhichao Wang Wenxiao Cao Jingbin Hu Guobin Ma Wenhao Li Huakang Chen Chengyou Wang Ming Tao Zhonghua Fu Lei Xie Xinsheng Wang 机构名称未在论文中说明;仅能从编号区分两组机构。 💡 毒舌点评 把离散语义 token 当作“训练期状态锚点”而不是“推理期生成目标”,这个定位确实比连续特征对齐更干净:它不要求隐藏状态复刻 teacher 表示的完整几何,只要求状态能够线性分类出语义类别。但论文的最强系统对比并不与受控消融完全同条件:系统级模型改用 120K 小时联合 TTS-SVS 训练且使用 Anchor@24,而受控消融默认 Anchor@32。VoxCPM2 在 Seed-TTS-Eval 中文硬子集上仍以 8.13 CER / 0.753 SIM 同时压过 SemBridge 的 9.79 CER / 0.717 SIM,说明 SemBridge 的价值更多在于“用更小模型获得有竞争力的内容-音色平衡”,而不是全面 SOTA。 ...

2026-08-10 · 更新于 2026-08-14 · 5 min · 1046 words