MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data

📄 MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data #语音合成 7.9/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 ✅ 7.9/10 | 前25% | #语音合成 | #语音合成 | arxiv 👥 作者与机构 Paarth Neekhara, Shehzeen Hussain, Ryan Langman, Xuesong Yang, Roy Fejgin, Subhankar Ghosh, Jason Li。隶属于 NVIDIA Corporation。 💡 毒舌点评 这篇论文精准地戳中了现有TTS系统在长文本生成上的痛点(韵律漂移、边界伪影),并提出了一个非常实用、即插即用的“纯推理时”解决方案。其核心价值在于“不改模型,只改策略”,具有很强的工程吸引力。然而,论文在技术细节的深挖(如超参数为何如此选择)、新数据集的公开透明度、以及泛化性声明的严谨性上,都留有明显的“草稿感”,像是一个出色的工程实践报告,而非一篇理论扎实、无懈可击的学术论文。 📌 核心摘要 本文提出了 MagpieTTS-LF,一种无需在长文本数据上重新训练,仅在推理时对现有 MagpieTTS 模型进行改进以生成连贯长文本语音的方法。其核心创新在于:1) 引入软注意力先验分布,引导模型在保持单调对齐的同时保留远距离上下文信息;2) 设计一种有状态的块生成算法,在独立的句子块之间传播注意力先验状态、编码器隐藏状态和文本历史,以维持韵律连续性和说话人一致性;3) 利用历史文本历史进行话语级的韵律规划。在自建的长文本评估集上,MagpieTTS-LF 在可懂度(WER/CER)、韵律边界连续性(Δ Energy)、说话人一致性(SSIM)和自然度稳定性(UTMOSv2)等多个维度上,均显著优于 XTTS、Qwen3-TTS 和 VibeVoice 等基线模型。 ...

2026-06-18 · 更新于 2026-07-27 · 3 min · 429 words

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

📄 Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors #语音合成 #语音生成 7.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 7.3/10 | 前50% | #语音合成 | #语音生成 | arxiv 👥 作者与机构 作者:Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen 机构:Lightricks, Tel Aviv University (特拉维夫大学) ...

2026-06-18 · 更新于 2026-07-27 · 2 min · 412 words

Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs

📄 Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs #语音合成 #自监督学习 #正则化微调 #强化学习 #知识蒸馏 #低资源 7.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.4/10 | 前50% | #语音合成 | #自监督学习 | #正则化微调 #强化学习 | arxiv 👥 作者与机构 作者:Ali Asaria, Tony Salomone, Deep Gandhi 机构:Transformer Lab 通讯作者:deep@lab.cloud ...

2026-06-18 · 更新于 2026-07-27 · 2 min · 382 words

An Analysis of the Effectiveness of Synthetic Speech Data for ASR Fine-tuning in Selected Indic Languages

📄 An Analysis of the Effectiveness of Synthetic Speech Data for ASR Fine-tuning in Selected Indic Languages #语音合成 #语音识别 #数据增强 #低资源 5.7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.3/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 📝 5.7/10 | 前50% | #语音识别 | #数据增强 | #语音合成 #低资源 | arxiv 👥 作者与机构 作者:Pulikodan, Basu, Kumar, Bhat, Sanka, Desai, Kumar Ghosh, Sujith Agneedh, Pavan, Pranav, Visruth, Nihar, Prasanta 机构:1 AI & Robotics Technology Park (ARTPARK), I-Hub @ IISc, Bangalore, India; 2 Department of Electrical Engineering, Indian Institute of Science, Bangalore, India ...

2026-06-17 · 更新于 2026-07-27 · 3 min · 587 words

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

📄 DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention #语音合成 #数据增强 7.3/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | #语音合成 | #数据增强 | arxiv 👥 作者与机构 作者:Wenqiu Tang, Zhen Wan, Takahiro Komamizu, Ichiro Ide 机构:1 Nagoya University, Nagoya, Aichi, Japan; 2 National Institute of Informatics, Tokyo, Japan 💡 毒舌点评 这篇论文的工作扎实,像一块精心打磨的积木,结构清晰,目标明确——解决语音角色扮演中“认知”与“表达”解耦的老问题。其核心的“双层控制向量”设计,如同在LLM大脑中安装人格旋钮,在TTS声带上安装情绪推子,思路很巧妙。然而,这块积木的高度受限于它所依赖的两块基石(冻结的LLM和TTS)。论文的“训练免费”卖点既是优势也是枷锁,它规避了训练成本,但也放弃了针对任务深度优化的可能性,导致在高度风格化的场景下显得力不从心,如同一位训练有素的配音演员突然要去模仿夸张的动漫角色,虽尽力但总差些火候。实验数据是实打实的,尤其是消融实验设计得不错,但与GPT-4o的对比更像是一场“宣布参与奖”的比赛,自然度等核心指标的差距被轻描淡写。最令人扼腕的是其“开源”的吝啬——一个演示链接,对于想要复现或改进的研究者而言,这无异于只给看菜谱不给开火。总体来说,这是一篇完成度不错、有实用价值的工作,但在理论深度、方法普适性和开源贡献上,离顶会的顶尖要求还有一步之遥。 ...

2026-06-17 · 更新于 2026-07-27 · 2 min · 411 words

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

📄 JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence #多模态模型 #语音合成 #强化学习 #低资源 7.7/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 0.6/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ✅ 7.7/10 | 前50% | #语音合成 | #强化学习 | #多模态模型 #低资源 | arxiv 👥 作者与机构 作者:Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan, Jiaqi Wang 机构:JD.com ...

2026-06-17 · 更新于 2026-07-27 · 2 min · 249 words

Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction

📄 Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction #语音合成 #语音识别 #流式处理 #多任务学习 #自监督学习 #参数高效微调 #实时处理 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ✅ 7.9/10 | 前50% | #语音合成 | #多任务学习 | #语音识别 #流式处理 | arxiv 👥 作者与机构 Tristan Tsoi, Jiajun Deng, Yingke Zhu, Huu Quyen Dang, Tianxiang Cao, Nikita Kuzmin, Tao Zhong, Simon Lui 华为中央媒体技术学院, 香港中文大学, 南洋理工大学 ...

2026-06-17 · 更新于 2026-07-27 · 3 min · 585 words

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

📄 One-Step Token-to-Waveform Generation with MeanFlow in Latent Space #语音合成 #生成模型 #自回归模型 #流匹配 #扩散模型 #Transformer 9.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 9.3/10 | 前10% | #语音合成 | #Transformer | #生成模型 #自回归模型 | arxiv 👥 作者与机构 作者:Zheqi Dai, Guangyan Zhang, Zhen Ye, Jingyu Li, Haolin He, Chunyat Wu, Yiwen Guo, Qiuqiang Kong 机构:1 The Chinese University of Hong Kong, Hong Kong SAR, China; 2 LIGHTSPEED, Tencent, Hong Kong SAR, China; 3 The Hong Kong University of Science and Technology, Hong Kong SAR, China; 4 Independent Researcher ...

2026-06-17 · 更新于 2026-07-27 · 3 min · 500 words

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

📄 SpeechDx: A Multi-Task Benchmark for Clinical Speech AI #语音识别 #语音合成 #语音增强 7.6/10 ✅ 7.6/10 | 前25% | #语音识别 | #语音合成 | #语音增强 | arxiv 👥 作者与机构 作者:Sejal Bhalla, Larry Kieu, Aina Merchant, Eyal de Lara, Alex Mariakakis 机构:多伦多大学 💡 毒舌点评 这篇论文就像是临床语音AI领域的“标准化考试大纲”——它精心设计了“考场”(基准),并给所有“考生”(模型)安排了“统一考试”(线性探测)。考试题目(任务)的分类法(按言语生产机制)设计得颇有生物启发性,这比随意堆砌任务要高级不少。最大的亮点是“考试成绩”很诚实:考出了当前所有“考生”的“偏科”现象(领域特定模型的局限性)和“集体短板”(跨条件泛化失败)。然而,这份“考试大纲”的“试题库”(数据集)本身就存在“出题不公”(标签噪声、生态效度)和“地域偏见”(英语为主)的问题,这在一定程度上削弱了“考试”结论的绝对说服力。作者在讨论“考试”局限性时还算坦诚,但“考试”后的“错题本”分析(失败分析、可解释性)做得不够深入。总的来说,它是一份扎实的“考卷”,但“考生”们离“满分毕业”(临床部署)还远着呢。 📌 核心摘要 本文针对临床语音AI领域因数据集孤立、评估协议不一致导致的难以比较结果和评估泛化能力的困境,提出了SpeechDx基准。该基准包含12个公开数据集、27个任务,其核心创新在于依据Berisha和Liss提出的言语生产生理阶段框架,将任务划分为概念化、构思和发音三个类别。利用该基准,作者系统评估了12个代表不同预训练范式(自监督、监督、领域特定)和数据规模的音频编码器。评估分为两部分:一是所有任务上的线性探测性能,二是零样本跨条件迁移性能。主要结论是:大规模通用语音模型(如Whisper, Qwen3)表现最稳健;领域特定模型(如emotion2vec+)仅在紧密匹配的狭窄任务上有优势;当前尚无一种表示能够可靠地泛化到整个临床语音景观。零样本迁移分析揭示了跨条件学习的非对称性,例如从低级声学特征(如呼吸/发声)向高级认知任务(如概念化)的迁移效果优于反向。 🔗 开源详情 代码:提供了匿名代码仓库链接:https://anonymous.4open.science/r/SpeechDx-F584。 模型权重:论文中未提供所评估模型(如wav2vec 2.0, Whisper等)的权重下载链接。这些权重需从各模型原始出处获取。 数据集:论文中列出了12个数据集的详细信息和访问方式(见附录A表2)。大部分数据集需申请访问或遵循特定许可证。 Demo:未提及。 复现材料:论文在附录D和E中提供了详细的实验复现信息,包括数据增强、训练设置、超参数优化方法及数据效率分析配置。所有复现脚本和说明包含在代码仓库中。 论文中引用的开源项目: SpeechBrain:用于数据增强(编号[81, 82])。 🏗️ 方法概述和架构 SpeechDx的基准方法流程可分为数据准备、模型评估和迁移分析三个核心阶段,其架构体现了系统性与可复现性的设计思想。 数据准备与任务定义: 数据集整合与划分:基准整合了12个公开的临床语音数据集(如表1所示)。对于每个数据集,论文明确了数据划分策略:优先使用官方划分;若无,则采用基于说话人隔离的策略,包括70/10/20的训练/验证/测试集划分(针对说话人数量大的数据集)或5折交叉验证(针对说话人数量小的数据集)。所有划分均尽可能按标签、性别和年龄进行分层。特别地,针对COVID-19 Sounds数据集中存在的说话人泄漏问题,作者替换了其官方划分,采用了自定义的说话人隔离划分。 任务分类与形式化:所有27个任务被系统地归类到三个言语生产阶段:概念化(如抑郁检测、情绪分类)、构思(如痴呆检测、失语症检测)和发音。任务类型包括分类(C)、多标签分类(M)和回归(R)。表1详细列出了每个任务的ID、类型、划分方式及样本量。 模型评估协议: 模型选择:评估了12个覆盖不同范式和规模的音频/语音编码器,具体模型列表见表4及附录C。这些模型分为三大类:语音模型(如wav2vec 2.0, HuBERT, Whisper)、通用音频模型(如AudioMAE, AST)和领域特定模型(如emotion2vec+, OPERA-GT)。 线性探测:核心评估方法采用冻结预训练编码器权重、仅训练顶层线性层的线性探测协议。编码器输出经过平均池化以处理变长输入。对于分类任务,线性层输出类别数维度的logits;对于回归任务,输出单个值。这种方法计算高效,且在小数据量临床任务中可减少过拟合风险。 实现细节:所有音频预处理为16kHz单声道并归一化。嵌入提取在8xH100 GPU上进行,耗时约288 GPU小时。线性层训练使用交叉熵损失(分类)或加权MSE损失(回归),并通过逆频率加权处理类别不平衡。超参数(学习率、权重衰减)通过Optuna在5次试验中基于验证损失进行优化。数据增强(添加噪声、混响、速度扰动)仅应用于训练集,使用SpeechBrain库实现。 零样本跨条件迁移分析: ...

2026-06-17 · 更新于 2026-07-27 · 2 min · 243 words

An Empirical Study on Learning Latent Representations for Emotional Speech Synthesis

📄 An Empirical Study on Learning Latent Representations for Emotional Speech Synthesis #语音合成 #情感语音合成 #低资源 #数据增强 #语音增强 8.2/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 后50% | #语音合成 | #数据增强 | #情感语音合成 #低资源 | arxiv 👥 作者与机构 作者:Dang Quang Vinh, Ngo Quang Huy 机构:Aimesoft JSC,河内,越南 💡 毒舌点评 这篇论文就像一次未经充分准备的实验室报告:作者将一个标准模型(FastSpeech 2)稍作修改,便应用于一个竞赛任务,然后汇报了极其糟糕的结果(MOS接近噪音水平,音节错误率超过60%)。然而,在结论中,作者却使用“promisingly”和“favourable”这样的词汇来形容其系统,这与报告的客观数据形成了近乎荒诞的矛盾。论文既没有尝试与基线进行对比以证明修改的有效性,也没有深入分析失败的原因,只是将问题归咎于数据集噪声并简单提及修复过程。作为一篇“实证研究”,其核心价值——对方法有效性的分析——完全缺失,提供的更多是一份失败的系统日志。 📌 核心摘要 本文是针对VLSP 2022情感语音合成竞赛任务的系统描述。作者在FastSpeech 2框架上进行了修改:对于单说话人子任务(Sub-task 1),添加了情感嵌入(查找表);对于说话人适配子任务(Sub-task 2),同时添加了说话人和情感嵌入,并引入了一个灵感来源于Pan and He (2021)的“韵律瓶颈”(prosody bottleneck)模块。实验使用了竞赛方提供的数据集,经过了降噪、文本修正等预处理。最终系统在官方评估中表现不佳,报告的MOS自然度得分低,音节错误率(SER)高。论文未提供与基线的对比,也未分析失败原因。 ...

2026-06-16 · 更新于 2026-07-27 · 2 min · 298 words