CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

📄 CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis 标签:#语音合成 #扩散模型 #语音克隆 #自回归模型 #零样本 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #扩散模型 | #语音克隆 #自回归模型 | arxiv 👥 作者与机构 第一作者:Zhisheng Zheng(德克萨斯大学奥斯汀分校,由邮箱 zszheng@utexas.edu 确认) 通讯作者:未说明(论文正文未标注通讯作者;David Harwath 提供邮箱 harwath@utexas.edu,但未被明确指定为通讯作者) 作者列表:Zhisheng Zheng、Xiaohang Sun、Zhu Liu、Caren Chen、Rohith Kumar、Manoj Aggarwal、Gerard Medioni、David Harwath 机构信息:论文页脚标注两个单位——1. The University of Texas at Austin,2. Amazon;各作者与机构的对应关系未逐人标出。除上述两位由邮箱确认外,其余作者的机构归属无法确认。 💡 毒舌点评 把 DiTAR 的连续潜空间、CAM++ 声纹和逐音素韵律控制信号整合成一套可用的可控 TTS,工程上确实完整,0.6B 在零样本克隆上也略优于复现的 DiTAR。但“可控性”全程只拿对 GT 的 RMSE/MAE 说话,既没有验证对任意给定非 GT 目标韵律的跟随能力,也没有对 pitch/loudness 逐项消融,更没有控制效果的主观听感测试;0.1B 模型在零样本合成中 WER 明显退化也完全未解释。以顶会标准看,这只能证明“显式控制信号能降低与 GT 的声学误差”,还不足以支撑“用户可控表达性语音合成”的强声明。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 976 words

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

📄 CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents 标签:#语音合成 #自回归模型 #流匹配 #知识蒸馏 #零样本 7.0/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #自回归模型 | #流匹配 #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Yuqian Zhang(上海创新研究院、复旦大学;论文脚注标注“实习期间在 OPPO 完成”) 通讯作者:Shuang Chen(上海创新研究院、复旦大学) 作者列表: Yuqian Zhang(上海创新研究院、复旦大学;OPPO 实习) Yao Shi(OPPO AI Center) Kexin Huang(复旦大学) Botian Jiang(上海创新研究院、复旦大学) Zhe Xu(上海创新研究院、复旦大学) Yiwei Zhao(上海创新研究院、复旦大学) Min Liang(OPPO AI Center) Shuang Chen(上海创新研究院、复旦大学) Xipeng Qiu(上海创新研究院、复旦大学) 机构说明:论文仅给出三个机构编号(1=上海创新研究院、2=OPPO AI Center、3=复旦大学),未提供更细的实验室/部门层级,未说明的内容不额外猜测。 💡 毒舌点评 CuteTTS 的工程完成度确实亮眼——0.2B 参数在 49ms 首包延迟下交出 WER 2.16%/SIM 78.9 的 LibriSpeech 成绩,guidance–step 蒸馏把双分支 CFG 与 10 NFE 压成单分支 4 NFE 的思路也值得后续工作借鉴。但审稿人最想追问的是:SIM 评测器与被蒸馏的说话人编码器同属 WavLM 家族,表 1 中 78.9 对 VoxCPM2 的明显领先有多少来自表征空间亲缘性而非真实音色还原?全文没有 demo 链接、没有显著性检验、主观评测仅 7 名标注者×400 比较项,却要支撑“high-quality synthesis”这个核心卖点,证据链偏细。 ...

2026-08-11 · 更新于 2026-08-14 · 7 min · 1334 words

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

📄 MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection 标签:#音视频理解 #多模态模型 #基准测试 #语音合成 #音频生成 6.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.5/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频理解 | #多模态模型 | #基准测试 #语音合成 | arxiv 👥 作者与机构 作者列表:Yanqiu Li、Yang Xiao、Jisheng Bai、Bin Chen、Hong Jia、Ting Dang。 机构编号为 1、2、3;具体机构名称在提供的论文原文片段中未披露。 通信作者信息未披露。 💡 毒舌点评 论文把“环境音频”从被长期忽视的背景音升级成了独立伪造组件,但复现所需的代码、数据和模型权重却被藏成了未披露的第三个组件。行文与表格中存在大量排版损坏字符,读起来像从 PDF 里抢救出来的半成品;实验设计值得肯定,工程开源程度却让“rigorous foundation”显得有点嘴硬。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 561 words

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

📄 PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue 标签:#语音交互 #大语言模型 #语音识别 #语音合成 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音交互 | #大语言模型 | #语音识别 #语音合成 | arxiv 👥 作者与机构 第一作者:Shibo Wang(Alibaba Group)、Zicheng Zhang(Alibaba Group),论文标注为Co-first authors(共同第一作者) 通讯作者:Libo Wang(Alibaba Group),论文标注为Corresponding author 作者列表:Shibo Wang(Alibaba Group)、Zicheng Zhang(Alibaba Group)、Libo Wang(Alibaba Group)、Junfeng Ma(Alibaba Group) 💡 毒舌点评 PACE 用"播放边界"这个系统可观测信号把 LLM 全双工语音对话中最隐蔽的上下文错位问题变成了可工程化修复的问题,GCM 的提法本身很有价值,且 25.0%→96.3% 的 RAA 提升令人印象深刻;但整个验证只基于 DashScope 单一家后端、TTS 合成的用户轨迹和 ChatGPT 5.5 单一裁判,“provider-independent” 的系统级卖点目前还停留在架构声明层面,且 PACE 核心代码未开源,独立复现门槛较高。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 771 words

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

📄 SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation 标签:#音频生成 #流匹配 #语音合成 #音乐生成 #统一音频模型 7.6/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.6/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频生成 | #流匹配 | #语音合成 #音乐生成 | arxiv 👥 作者与机构 第一作者:Yunrui Cai(香港中文大学;实习于快手 Kling Team) 通讯作者:Xu Li(快手 Kling Team)、Helen Meng(香港中文大学) 作者列表: Yunrui Cai(香港中文大学;快手 Kling Team) Xu Li(快手 Kling Team) Yucheng Zhou(快手 Kling Team) Jinchao Li(快手 Kling Team) Dingdong Wang(香港中文大学) Dongchao Yang(香港中文大学) Xixin Wu(香港中文大学) Chen Zhang(快手 Kling Team) Zhiyong Wu(清华大学深圳国际研究生院) Pengfei Wan(快手 Kling Team) Helen Meng(香港中文大学) 💡 毒舌点评 用“连续音频块路由 + 先验/证据冲突门”把条件计算从 token 级提升到局部连续结构,确实比任务级或帧级 MoE 更贴合语音/音乐/音效的短时连续性,受控消融和路由可视化初步撑起了核心 claim。但公开基准上并未全面压过专用 SOTA,复杂场景优势主要靠自家 100 条提示 + Gemini 参考无关裁判背书;代码仓库虽然挂在项目主页,但权重和训练数据依然没有放出,“统一音频场景生成”的增量价值仍需要更独立、更可复现的验证。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 976 words

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

📄 SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation 标签:#语音合成 #自回归模型 #歌唱生成 #流匹配 #零样本 7.0/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #自回归模型 | #歌唱生成 #流匹配 | arxiv 👥 作者与机构 第一作者:Hanke Xie(机构编号 1/2,机构名称未说明;论文脚注标注实习期间于 Soul AI Lab 完成部分工作) 共同第一作者:Haopeng Lin(机构编号 2,机构名称未说明) 通讯作者:Lei Xie(机构编号 1)、Xinsheng Wang(机构编号 2) 作者列表: Hanke Xie Haopeng Lin Jiale Qian Dake Guo Yuepeng Jiang Zhichao Wang Wenxiao Cao Jingbin Hu Guobin Ma Wenhao Li Huakang Chen Chengyou Wang Ming Tao Zhonghua Fu Lei Xie Xinsheng Wang 机构名称未在论文中说明;仅能从编号区分两组机构。 💡 毒舌点评 把离散语义 token 当作“训练期状态锚点”而不是“推理期生成目标”,这个定位确实比连续特征对齐更干净:它不要求隐藏状态复刻 teacher 表示的完整几何,只要求状态能够线性分类出语义类别。但论文的最强系统对比并不与受控消融完全同条件:系统级模型改用 120K 小时联合 TTS-SVS 训练且使用 Anchor@24,而受控消融默认 Anchor@32。VoxCPM2 在 Seed-TTS-Eval 中文硬子集上仍以 8.13 CER / 0.753 SIM 同时压过 SemBridge 的 9.79 CER / 0.717 SIM,说明 SemBridge 的价值更多在于“用更小模型获得有竞争力的内容-音色平衡”,而不是全面 SOTA。 ...

2026-08-10 · 更新于 2026-08-14 · 5 min · 1046 words

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

📄 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 标签:#语音伪造检测 #基准测试 #语音合成 #语音转换 #音频理解 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.4/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音伪造检测 | #基准测试 | #语音合成 #语音转换 | arxiv 👥 作者与机构 第一作者:Aurosweta Mahapatra(Johns Hopkins University) 通讯作者:Berrak Sisman(Johns Hopkins University) 作者列表:Aurosweta Mahapatra(Johns Hopkins University)、Xiutian Zhao(Johns Hopkins University)、Shreeram Suresh Chandra(Johns Hopkins University)、Zihan Zhang(Johns Hopkins University)、Zongyang Du(Johns Hopkins University)、Ismail Rasim Ulgen(Johns Hopkins University)、Kong Aik Lee(Hong Kong Polytechnic University)、Nicholas Andrews(Johns Hopkins University)、Carlos Busso(Carnegie Mellon University)、Berrak Sisman(Johns Hopkins University) 💡 毒舌点评 AffectDF 在情感伪造攻击的覆盖广度上确实做出了有分量的贡献:21种攻击、约260小时、五种情绪、同时含表演性与自发性语音,直接填补了现有情感伪造基准规模小、攻击范式单一的空白。但训练集仅有4个说话人、LALM微调只验证了Voxtral一个模型、所有EER均为点估计且无置信区间,基准的"全面性"尚未完全转化为结论的"稳健性"。更关键的是,“情感训练无法一致提升跨域鲁棒性"这一核心反直觉发现主要建立在少数模型的行为分歧之上,论文未能说明训练数据变化为何会反转表演/自发风格的难度方向。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 805 words

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

📄 EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot 标签:#音视频交互 #大语言模型 #语音合成 #语音情感识别 #多模态模型 7.1/10 | 创新 1.1/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.1/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #大语言模型 | #语音合成 #语音情感识别 | arxiv 👥 作者与机构 第一作者:Jie Yang(新加坡国立大学,National University of Singapore) 通讯作者:Hao Fei(牛津大学,University of Oxford;论文中标注为 Corresponding author) 作者列表:Jie Yang(新加坡国立大学)、Wenhao Xu(新加坡国立大学)、Shuhui Lin(清华大学,Tsinghua University)、Hao Fei(牛津大学,University of Oxford) 💡 毒舌点评 把 ASR/SER/TTS/3DGS 这些开源模块用 LLM 编排成一个可运行的 empathetic avatar 系统,工程完成度和开源诚意值得肯定,尤其在“Response Planning”将情感意图显式传给语音和渲染模块这一点上设计清晰。但论文把“Tri-Agent”和“Response Planning”讲得很重,实际更像分层提示词与 JSON 合约,实验也没有对这两项做任何组件消融;45.8 秒的平均端到端延迟更让它离“live chatbot”还有实质性距离。整体是一个有价值的工程基线和测试平台,但不是论文所暗示的智能突破。 ...

2026-08-06 · 更新于 2026-08-14 · 5 min · 1043 words

Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces

📄 Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces 标签:#语音合成 #音频理解 #Transformer #模型评估 5.2/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.2/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #Transformer | #音频理解 #模型评估 | arxiv 👥 作者与机构 第一作者:Wangzixi Zhou(Nara Institute of Science and Technology, Japan) 通讯作者:Sakriani Sakti(Nara Institute of Science and Technology, Japan) 作者列表:Wangzixi Zhou(Nara Institute of Science and Technology)、Bagus Tris Atmaja(Nara Institute of Science and Technology)、Sakriani Sakti(Nara Institute of Science and Technology) 💡 毒舌点评 这篇论文捕捉到了情感TTS中个体与文化感知差异这一核心痛点,提出的轻量级交互式个性化框架思路清晰、工程务实,巧妙地绕过了重训大模型的高昂成本。然而,概念上的亮点被孱弱的实验验证严重拖累:30名东亚参与者的极小样本、缺失的关键基线对比(如随机搜索、RLHF)、以及完全未讨论的逐用户交互成本,使得“超越one-size-fits-all”的结论在统计效力和实际部署可行性上均显得站不住脚。这目前更像一个设计精巧的概念验证demo,离一篇扎实的顶会论文还有显著距离。 ...

2026-08-05 · 更新于 2026-08-14 · 2 min · 343 words

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

📄 GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model 标签:#语音合成 #强化学习 #流匹配 #自回归模型 #音频理解 8.0/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #强化学习 | #流匹配 #自回归模型 | arxiv 👥 作者与机构 第一作者:Guanrou Yang (1,2, 未说明具体机构) 通讯作者:Xie Chen (1,2, 未说明具体机构, 标注为corresponding author) 作者列表: Guanrou Yang (1,2), Tian Tan (1), Qian Chen (4), Ziyang Ma (1,2), Yakun Song (1,2), Zhikang Niu (1,2), Qi Chen (1,2), Wenming Tu (1), Haitao Li (2,5), Shan Yang (3), Xie Chen (1,2) 注:原文脚注1-5对应不同机构,但具体机构名称在正文中完全未给出,无法获知作者所属单位。 ...

2026-08-05 · 更新于 2026-08-14 · 5 min · 987 words