Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

📄 Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech #语音合成 #扩散模型 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8/10 | 前25% | #语音合成 | #扩散模型 | arxiv 👥 作者与机构 第一作者:Vadim Popov(Huawei Noah’s Ark Lab, National Research University Higher School of Economics) 通讯作者:Vadim Popov(popov.vadim1@huawei.com) 作者列表:Vadim Popov(Huawei Noah’s Ark Lab, National Research University Higher School of Economics)、Wenju Gu(Huawei Noah’s Ark Lab)、Tasnima Sadekova(Huawei Noah’s Ark Lab, National Research University Higher School of Economics)、Georgii Aparin(Huawei Noah’s Ark Lab, National University of Science and Technology MISIS)、Assel Yermekova(Huawei Noah’s Ark Lab) 💡 毒舌点评 这篇论文巧妙地将 FSQ 的几何结构注入了连续扩散混合生成的理论框架, 从路径测度 KL 散度给出了一个漂亮的解释, 并用一套完整的 TTS 系统秀了肌肉。但理论的华美长袍下藏着“等先验”的致命伤疤, 一旦面对真实世界中不平衡的 token 分布, 所谓“最优性”可能瞬间沦为纸上谈兵, 而作者在实验中对此几乎是讳莫如深。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 783 words

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

📄 ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models #语音编码 #语音合成 8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.4/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8/10 | 前25% | #语音编码 | #流匹配 | #语音合成 | arxiv 👥 作者与机构 第一作者:Sang-Hoon Lee(Ajou University, Department of Artificial Intelligence) 通讯作者:Sang-Hoon Lee(Ajou University, Department of Artificial Intelligence) 第二作者:Ha-Yeong Choi(KT Corp., Seoul, Korea) 💡 毒舌点评 本文将火爆的表示对齐(REPA)升级为层次化多提示表示生成,配合自己捣鼓的“广义流匹配(GFM)”,在12.5Hz极低维度下重建出可懂语音,胆识过人不假。但GFM只是GED的简单速度场移植,理论深度存疑;排斥项的超参搜索如同开盲盒,且对比基线全倾向GAN编解码器,与同宗同源的纯扩散基线(如FlowDec)连个照面都没打。代码和权重还锁在保险柜里,评审能给的信任额度实在有限。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 429 words

Scaling Transformers for End-to-End Discrete Audio Tokenization

📄 Scaling Transformers for End-to-End Discrete Audio Tokenization #音频编码 #语音合成 #语音识别 #Transformer #自回归模型 #多任务学习 #流式处理 7.1/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 ✅ 7.1/10 | 前50% | #音频编码 | #Transformer | #语音合成 #语音识别 | arxiv 👥 作者与机构 第一作者:Yitian Gong(复旦大学、上海创新研究院、MOSI Intelligence) 通讯作者:Xipeng Qiu(复旦大学、上海创新研究院、MOSI Intelligence) 作者列表:Yitian Gong、Kuangwei Chen、Zhaoye Fei、Xiaogui Yang、Ke Chen、Yang Wang、Kexin Huang、Mingshu Chen、Ruixiao Li、Qinyuan Cheng、Shimin Li、Xipeng Qiu 💡 毒舌点评 TAC 把 ConvNet、预训练编码器、语义蒸馏这些被社区用了好几年的“拐杖”全扔掉,用一套纯因果 Transformer 从零开始联合优化所有模块,重建质量和下游任务效果确实能打。但“统一可扩展接口”的口号,在代码、模型、数据全部闭源面前,听起来更像是为自家闭源生态写的一份白皮书。另外,靠着碾压同行的内部数据量去比公开数据训出来的模型,然后说架构更好——这种“降维打击”,审稿人心里是不会给足创新分和公平性分的。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 638 words

Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech

📄 Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech #语音合成 #语音情感识别 #大语言模型 #可解释性 #零样本 7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7/10 | 前50% | #语音合成 | #大语言模型 | #语音情感识别 #可解释性 | arxiv 👥 作者与机构 第一作者:Hongfei Du(威廉玛丽学院计算机系) 通讯作者:Ye Gao(威廉玛丽学院计算机系) 作者列表:Hongfei Du、Jiacheng Shi、Sidi Lu、Gang Zhou、Ye Gao(均来自威廉玛丽学院计算机系) 💡 毒舌点评 用SAE在LLM-TTS语义残差流中寻找情感稀疏特征的想法颇具启发性,论证了情感并非单一全局向量偏移,而是少数几个潜在方向协调作用的结果,构成了本文最核心的分析贡献。但方法高度耦合于IndexTTS2单个骨干,且在特征选择上完全依赖配对情感数据,让“即插即用”的承诺在通用性上打了折扣;缺乏与最新激活转向工作(如EmoSteer-TTS)的直接对比,也让SOTA声明略显仓促。 📌 核心摘要 本文针对LLM-based TTS系统情感控制缺乏可解释性的问题,提出利用稀疏自编码器(SAE)在语义骨干中学习并调控情感相关稀疏特征。核心管线的第一步是在冻结的TTS骨干(IndexTTS2)上训练一个过完备的Top-k SAE(维度1280→4096→1280, k=32),将残差流中稠密的隐状态分解为可解释的稀疏特征激活。第二步,在离线分析阶段,通过对齐文本和说话人音色,构建配对的中性-情感样本,并基于提出的句子级情感选择性评分(emotion selectivity score,简化为配对激活频率差),可靠地筛选出与目标情感高度相关的Top-m个潜在特征。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 440 words

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

📄 STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits #音视频生成 #语音合成 #扩散模型 #自回归模型 #多模态模型 6.8/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | #音视频生成 | #扩散模型 | #语音合成 #自回归模型 | arxiv 👥 作者与机构 第一作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 通讯作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 作者列表:Foivos Paraperas Papantoniou(Imperial College London, UK)、Stathis Galanakis(Imperial College London, UK)、Rolandos Alexandros Potamias(Imperial College London, UK)、Bernhard Kainz(Imperial College London, UK; FAU Erlangen–Nürnberg, Germany)、Stefanos Zafeiriou(Imperial College London, UK) 💡 毒舌点评 这篇论文把一个音频驱动说话人脸生成和一个新视角合成任务塞进了同一个框架,工程整合能力值得肯定,自强迫训练策略和纯ID驱动生成确实让动画没那么“僵尸”了。但本质上,它就是拿Arc2Face当骨架,套上AnimateDiff的时间层,加个ReferenceNet,再用自强迫和唇读损失微调一下——每个组件都是现成的,论文没在理论或架构上给出让人眼前一亮的新洞见。最致命的还是不提供代码和模型,在如今“没有开源就别想拿高分”的顶会气氛下,这种做法无异于自断一臂,尤其是实验结果里那些微小的LSE-C领先,没给置信区间,完全是给人留质疑的把柄。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 761 words

Two-dimensional quantization for geometry-aware audio coding

📄 Two-dimensional quantization for geometry-aware audio coding #语音编码 #语音合成 #音频生成 7.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 7.6/10 | 前25% | #语音编码 | #语音合成 | #音频生成 | arxiv 👥 作者与机构 第一作者/通讯作者:Tal Shuster (School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Be’er Sheva, Israel) 作者:Eliya Nachmani (School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Be’er Sheva, Israel) 注:原文脚注中通讯作者仅为 Tal Shuster,与已有分析不同。 💡 毒舌点评 这篇论文用一个巧妙的几何直觉——将独立标量量化扩展到二维结构化网格——解决了神经音频编解码中效率和利用率的两难问题。实验覆盖度不错,尤其是在低码率下能用一个量化器挑战一堆级联 RVQ 的基线,很有杀伤力。但论文对为什么是二维、为什么菱形网格更好的分析偏经验主义,缺乏从率失真理论或音频特征统计特性角度的深刻解释;此外,仅在与 FSQ 和 WavTokenizer 的对比中严格控制了训练数据和配置变量,与其他 SOTA 模型对比时使用了异构的训练数据和配置,削弱了部分 SOTA 声明的直接可比性。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 740 words

Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

📄 Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning #语音交互 #语音大模型 #模型融合 #参数高效微调 #指令微调 #语音合成 6.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.7/10 | 前50% | #语音交互 | #模型融合 | #语音大模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Congrui Du(University of California, Santa Barbara, USA) 通讯作者:Yang Zhang(MIT-IBM Computing Research Lab, IBM Research, USA) 其他作者:Kaizhi Qian(MIT-IBM Computing Research Lab, IBM Research)、Shiyu Chang(University of California, Santa Barbara) 💡 毒舌点评 这篇论文用一个极其简单的权重算术绕过了SLM领域“卷数据”的军备竞赛,洞察深刻,但成也萧何败也萧何——仅用30k小时数据就达成此性能令人眼前一亮,但其方法的脆弱性同样引人注目:输出格式极度依赖后期强制修正、语音能力上限被韵律分词器锁死、对预训练数据结构的病态依赖,以及依赖外部ASR的pipeline设计,使其离一个实用、鲁棒的SLM新范式尚有距离。它更像一个巧妙的概念验证,而非可直接部署的突破。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 547 words

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

📄 An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation #语音合成 #语音识别 #多模态模型 6.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ✅ 6.8/10 | 前50% | #语音合成 | #自回归模型 | #语音识别 #多模态模型 | arxiv 👥 作者与机构 第一作者:Haoran Wang(Carnegie Mellon University, Shanghai Jiao Tong University) 通讯作者:未说明 作者列表:Haoran Wang(Carnegie Mellon University, Shanghai Jiao Tong University)、Jinchuan Tian(Carnegie Mellon University)、Siddhant Arora(Carnegie Mellon University)、Shinji Watanabe(Carnegie Mellon University) 💡 毒舌点评 这篇文章为解决语音语言模型的高通量推理痛点提供了一个精巧的工程方案,尤其是 Paired Request Co-Scheduling 对 CFG 开销的消解颇具巧思,不是简单的“拼组件”。然而,实验对比维度过于单薄,仅与原始 PyTorch 串行推理比较,缺乏与 naive CFG 实现或其他推理框架的横向对打,让“80% 吞吐保持”这一核心卖点缺少足够的说服力。更关键的是,全文未提供任何延迟指标,对于实时语音交互场景而言,这几乎是不可接受的遗漏。 ...

2026-07-03 · 更新于 2026-07-24 · 3 min · 626 words

SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings

📄 SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings #语音合成 #对比学习 #自监督学习 #低资源 #参数高效微调 5.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 📝 5.8/10 | 前50% | #语音合成 | #对比学习 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Priyam Mazumdar(University of Illinois Urbana-Champaign) 通讯作者:未说明 作者列表:Priyam Mazumdar(University of Illinois Urbana-Champaign)、Yurii Halychanskyi(University of Illinois Urbana-Champaign)、Steven Guo(University of Illinois Urbana-Champaign)、Mark Hasegawa-Johnson(University of Illinois Urbana-Champaign)、Volodymyr Kindratenko(University of Illinois Urbana-Champaign, National Center for Supercomputing Applications) 💡 毒舌点评 本文利用对比学习将Wav2Vec2声学信息注入字符嵌入以替换G2P模块,在极低资源英语TTS上取得了显著的WER下降(如1小时数据从24.7%降至7.5%)。思路直接,工程落地价值清晰。但是,实验对比严重不足,未能与任何基于SSL离散单元或其连续表征直接建模的TTS强基线进行对比,导致无法判断“声学注入”方案相较于完全端到端声学模型的独特价值。音素基线仅使用与下游语音域不匹配的g2pE,这一对比漏洞使得SPARCLE的巨大优势说服力存疑。此外,模型和代码的零开源承诺让社区无法验证其有效性,削弱了研究贡献。 ...

2026-07-03 · 更新于 2026-07-24 · 2 min · 247 words

Using embeddings to predict spoken word duration and pitch in Mandarin monosyllabic words

📄 Using embeddings to predict spoken word duration and pitch in Mandarin monosyllabic words #语音合成 4/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.6/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0/1.5 📝 4/10 | 后50% | #语音合成 | #语音合成 | arxiv 👥 作者与机构 第一作者:Xiaoyun Jin(University of Tuebingen, Quantitative Linguistik) 通讯作者:未说明 作者列表:Xiaoyun Jin(University of Tuebingen, Quantitative Linguistik)、Mirjam Ernestus(Radboud University, Center for Language Studies)、R.Harald Baayen(University of Tuebingen, Quantitative Linguistik) 💡 毒舌点评 本文试图从语境化嵌入中"榨取"时长和基频的预测信号,思路有趣但方法过于简陋:全程仅用线性映射,且在f0轮廓预测上未能击败词类内部排列基线,暴露出语义嵌入对词例级韵律细节解释力的天花板。论文的实证贡献仅停留仅停留在"存在预测力"的层面,未与任何现代韵律模型对比,代码数据双缺,导致结论的可信度和工程启发性均大打折扣。 ...

2026-07-03 · 更新于 2026-07-24 · 2 min · 273 words