Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

📄 Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models #语音合成 #语音识别 #多模态模型 7.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 1.5/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #语音识别 | #多模态模型 | arxiv 👥 作者与机构 Wan Team, Alibaba Group 💡 毒舌点评 这篇工作野心很大,试图用一个模型解决实时交互的“全双工”问题。优点是系统集成度高,从感知到生成一气呵成。但作为一篇会议论文,它更像是一份优秀的工程报告,而非一篇算法或理论创新驱动的学术论文。最令人遗憾的是,几乎所有关键的技术细节都被“黑箱化”了:Transformer的具体结构?多模态token如何调度?流匹配解码器细节?统统没有。实验部分更是避重就轻,用大量篇幅和不规范的表格对比“延迟”,却对生成质量避而不谈。消融实验?不存在的。这就像一个厨师说他的新菜“又快又好吃”,但拒绝透露菜谱、食材和火候,只给你看了一个计时器。对于顶会论文而言,这种程度的细节披露严重不足,可复现性基本为零。作者提出的v0.1版和192p分辨率也暗示这更像一个技术演示而非成熟方案。 📌 核心摘要 Wan-Streamer是一个原生流式、端到端的实时交互基础模型,旨在实现低延迟、全双工的音视频交互。它在一个单一的Transformer中建模文本、音频和视频的输入与输出,无需依赖外部的ASR、TTS、动画或视频生成等级联模块。论文的核心贡献包括:1)提出了一种全因果的多模态架构,包括因果VAE、因果编解码器、块因果注意力以及全历史自回归流式处理;2)设计了“思想家-执行者”(thinker-performer)推理流水线,通过KV缓存交换实现理解与生成过程的重叠,实现了约200毫秒的模型端响应延迟和约550毫秒(含350ms网络延迟)的总交互延迟。论文强调,这种端到端设计使得感知、推理、生成、响应时机控制和轮次管理能在统一的模型中联合优化,从而减少流水线延迟和误差累积。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:论文中未提及 Demo:https://wan-streamer.com/ 复现材料:论文中未提及 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 Wan-Streamer的设计核心是“流式性作为建模约束”,其整个技术栈均围绕因果性进行重构。 ...

2026-06-25 · 更新于 2026-08-14 · 1 min · 94 words

BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset

📄 BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset #音频深度伪造检测 #语音合成 #低资源 9/10 | 创新 1/2 | 严谨 1.5/1.5 | 实验 0.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 9/10 | 后50% | #音频深度伪造检测 | #语音合成 | #低资源 | arxiv 👥 作者与机构 Istiaq Ahmed Fahad, Kamruzzaman Asif, Sifat Sikder Institute of Information Technology, University of Dhaka, Bangladesh 💡 毒舌点评 这是一篇典型的“填补空白”式工作,对于孟加拉语社区来说是个不错的资源,但顶会水平?它甚至没敢声称自己的生成模型是SOTA。论文的核心价值是发布了一个“存在”的数据集,而不是推进了检测技术。评估部分只有主观打分和一张看不清的t-SNE图,缺乏任何有说服力的定量实验来证明这个数据集真的能提升现有检测器的性能。如果连在最简单的baseline上跑个数都省了,那么发布数据集的“核心贡献”就打了一半折扣。作者未来的工作展望(加说话人)听起来像是这篇论文本该完成的部分。 ...

2026-06-24 · 更新于 2026-08-14 · 2 min · 228 words

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

📄 CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation #语音合成 #数据集 9.2/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 9.2/10 | 前10% | #语音合成 | #数据集 | arxiv 👥 作者与机构 作者:Shijun Luo 机构:未明确说明 💡 毒舌点评 这篇工作像一份严谨的“体检报告”,把当前中文新闻TTS产品的“发音健康状况”摆上了台面。优点在于问题定义清晰、评测协议扎实、工程复现性强,为社区提供了一个急需的、标准化的评测工具。缺点是它本质上是“测量尺”的研发,而非“治病方法”的提出;数据集为合成数据,可能无法完全覆盖真实新闻的复杂性和分布。对于追求算法创新的读者来说,贡献可能显得偏工程化;但对于整个语音合成社区,尤其是工业界,这是一份非常实用且必要的基准。作者在ASR路由的异质性分析和消融实验上展现了足够的严谨性,这是亮点。 📌 核心摘要 本文提出了CN-NewsTTS Bench v0.1,一个针对中文新闻TTS系统在处理原始文本中密集出现的书面化形式(如比分、型号、单位、缩写等)时发音准确性的开放式、目标级自动评测基准。基准包含一个合成新闻风格句子数据集(200条记录开发集,800条记录公开测试集,共1260个评测目标)、一个基于三个异构ASR系统多数投票的自动评分协议,以及对七个商业TTS系统的初始评测结果。结果显示,最佳系统(Volcano)的严格准确率为0.879,而多个广泛使用的系统低于0.60,且性能在不同文本类别上差异巨大。该基准强调“原始输入产品赛道”,禁止用户侧的文本预处理,以评估TTS产品端到端的处理能力。 🔗 开源详情 代码:https://github.com/Jayden-X-L/cn-news-tts-bench 模型权重:论文中未提及 数据集:CN-NewsTTS Bench v0.1 数据集(开发集200条记录,公开测试集800条记录)。可通过上述代码仓库的 v0.1 发布(Release)获取。 Demo:论文中未提及 复现材料:复现所需的所有材料(数据、模式、评分代码、固定的ASR转录本、排行榜文件、仪表板、校验和等)均包含在代码仓库的 v0.1 发布中。最小化复现步骤包括验证公开数据集、评分模型的ASR结果文件、聚合排行榜并校验清单。代码仓库的提交 ID 为 f94a679fc7fc。 论文中引用的开源项目: FunAudioLLM/FunASR 生态系统,包含: SenseVoiceSmall:开源本地语音识别器。 Paraformer-zh:开源本地语音识别器。 (论文中未给出具体链接,仅提及来自该生态系统) 标签 #语音合成 #评测基准 #数据集 #开源 主任务标签:#语音合成 主方法标签:#评测基准 补充标签:#数据集 #开源 ...

2026-06-24 · 更新于 2026-08-14 · 2 min · 399 words

ZONOS2 Technical Report

📄 ZONOS2 Technical Report #语音合成 #多语言 #自回归模型 10/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.4/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 10/10 | 前25% | #语音合成 | #多语言 | #自回归模型 | arxiv 👥 作者与机构 作者:Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge 机构:Zyphra 💡 毒舌点评 这篇技术报告读起来像一份精心包装的产品发布说明书,而非一篇严谨的学术论文。最大的槽点在于“过度声明”与“选择性对比”:摘要中声称“state-of-the-art naturalness, prosody, and voice cloning fidelity”,但结果表(IV, V)显示,在关键指标如WER和UTMOS上,ZONOS2在多个语言上显著落后于闭源模型(如Eleven Labs V3, Gemini 3.1 Flash)和部分开源模型(如Fish S2 Pro, VoxCPM 2)。其所谓“竞争力”高度依赖自家提出的ZTTS1-Eval基准,而在这个基准上,其“Quality Mode”虽提升了一些指标,但往往以牺牲说话人相似度为代价(对比表IV/ V 中“8B”与“Quality Mode”行)。此外,将80%以上的英文训练数据(图3)归因于“公开语音语料库、播客”等,却未提供这些数据集的任何链接或开源协议,使得“开源”光环下的数据透明度大打折扣,存在“数据黑箱”的嫌疑。讨论部分(VII)对MoE训练不稳定性的承认倒是挺实在的。 ...

2026-06-24 · 更新于 2026-08-14 · 7 min · 1346 words

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

📄 Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR #语音识别 #语音合成 #参数高效微调 #低资源 7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.9/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7/10 | 前50% | #语音识别 | #参数高效微调 | #语音合成 #低资源 | arxiv 👥 作者与机构 Enes Yavuz Ugan¹², Alexander Waibel¹² ¹Interactive Systems Lab, Karlsruhe Institute of Technology (KIT), Germany ²InterACT, Carnegie Mellon University (CMU), USA ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 345 words

An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis

📄 An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis #语音合成 #数据集 6.9/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 6.9/10 | 前50% | #语音合成 | #数据集 | arxiv 👥 作者与机构 作者: Mateo Cámara (1), José Luis Blanco (1), Juan Ignacio Godino-Llorente (1,3), Jeung-Yoon Choi (2), Stefanie Shattuck-Hufnagel (2) 机构: Signal Processing Applications Group, Information Processing & Telecomm. Center, Universidad Politécnica de Madrid, Spain Speech Communication Group, Research Laboratory of Electronics, Massachusetts Institute of Technology, USA Bioengineering and Optoelectronics Lab., Universidad Politécnica de Madrid, Spain 邮箱: mateo.camara@upm.es, jl.blanco@upm.es, ignacio.godino@upm.es, jyechoi@mit.edu, sshuf@mit.edu 💡 毒舌点评 这篇论文就像一位严谨的工匠,用一套自己打造的精密模具(Pink Trombone)批量生产语音零件,并为每个零件贴上了绝对精准的“制造时刻”标签(地标)。它不关心这些零件组装成自然流畅的语音时是否足够逼真,只确保每个零件的诞生点都记录得清清楚楚。对于地标理论的研究者来说,这提供了一个近乎完美的“纯净沙盒”——没有自然语音中那些恼人的协同发音“噪音”和标注歧义。然而,对于追求“自然度”的主流语音合成社区,或者希望验证地标检测器在现实世界表现的学者,这盘“罐头语音”可能显得过于“人工”和“无菌”。它的价值不在于生成能以假乱真的语音,而在于为声学事件的底层规律研究提供一个绝对受控的、可重复的实验平台。作为一个资源发布工作,它扎实、规范、慷慨;但若作为一篇追求方法论突破的顶会论文,其理论深度和实验验证的全面性就显得有些单薄了。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 360 words

An Evaluation Framework for Text-to-Speech Voice Reconstruction

📄 An Evaluation Framework for Text-to-Speech Voice Reconstruction #语音合成 #语音识别 8.8/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 🔥 8.8/10 | 前25% | #语音合成 | #语音识别 | arxiv 👥 作者与机构 Ariadna Sanchez, Christoph Minixhofer, Korin Richmond, Ondřej Klejch, Peter Bell, Simon King The Centre for Speech Technology Research, University of Edinburgh, UK 💡 毒舌点评 这篇论文解决了一个真实且重要的痛点:如何评估为语音障碍患者重建声音的TTS系统。作者没有满足于简单套用现有的MOS或WER指标,而是深刻地认识到任务的核心矛盾——提高可懂度与保持说话人身份之间的权衡。提出的框架,无论是情境化BWS的主观评估,还是双参考TTSDS Mean的客观评估,都直指这一矛盾,逻辑清晰,动机充分。然而,其“严苛”体现在何处?首先,论文的实验部分虽然规模可观(17个系统,193位说话人),但作者在分析时过于强调框架的优越性,而对观察到的现象(如零样本系统在低可懂度说话人上的普遍失败)缺乏更深入的机制探讨和假设验证。其次,提出的TTSDS Mean指标虽然有效,但其设计(简单平均)较为朴素,缺乏消融实验来证明这种平均方式是最佳选择,还是仅是一种启发式方案。最后,开源程度极低(仅提供Demo页面),对于一个旨在建立评估标准的框架而言,这大大削弱了其可复现性和社区影响力,是一个明显的短板。总体而言,这是一个扎实、有用的工作,但在方法的深度剖析和实践推广的完备性上仍有提升空间。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 284 words

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

📄 AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation #语音合成 #音频生成 #音乐生成 #自回归模型 #流匹配 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | #语音合成 | #音频生成 | #音乐生成 #自回归模型 | arxiv 👥 作者与机构 作者:Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma, Xiangang Li, Wei Xue 机构:香港科技大学 (HKUST), 通义团队, 阿里巴巴集团 (Tongyi Fun Team, Alibaba Group) ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 436 words

Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning

📄 Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning #语音情感识别 #语音合成 #自监督学习 7/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7/10 | 前50% | #语音情感识别 | #自监督学习 | #语音合成 | arxiv 👥 作者与机构 作者:Yongbin Huang, Xihao Xie, Jia Zhang 机构:未在提供的论文片段中明确说明。 💡 毒舌点评 这篇论文精准地戳中了当前语音情感识别(SER)系统,尤其是基于自监督预训练模型的流水线,在数据供应链上的一个致命软肋:对TTS生成投毒样本的毫无防备。作者们的工作动机非常清晰且现实,指出了TTS技术如何极大降低了发起高效后门攻击的门槛。实验设计也比较扎实,覆盖了多语言数据集和多种主流自监督模型,验证了攻击的普遍脆弱性。然而,论文的“系统性”研究在深度上仍有欠缺:对触发器的声学特性、为何TTS合成的特定片段(一个“标准中性TTS语音”)能成为有效触发器,缺乏更底层的分析。此外,威胁模型过于理想化(“能注入TTS样本”),对攻击在现实数据收集流程中如何实施的讨论几乎为空白。最后,讨论部分草草收场,面对已证实的严重漏洞,却没有提供任何有意义的防御思路或后续研究方向,这极大地削弱了工作的完整性。总的来说,一篇合格的、指明了问题的工作,但离一篇令人印象深刻、引领方向的顶会论文还有距离。 📌 核心摘要 本文首次系统性地研究了针对语音情感识别(SER)系统的、基于文本转语音(TTS)生成投毒样本的后门攻击。作者提出了一种隐蔽的低能量声学触发器,并构建了包含触发器生成、后门注入(波形域叠加)和推理阶段激活的攻击框架。通过在四个公开情感语音数据集(ANAD, CaFE, CASIA, JL Corpus)上对四种自监督语音模型(wav2vec2-base, wavlm-base, data2vec-base, unispeech-sat-base)进行广泛实验,证明了该攻击的有效性(高攻击成功率)、隐蔽性(干净准确率下降小)和跨模型/跨数据集迁移性。研究揭示了现代SER流水线的关键安全漏洞,并表明TTS技术显著降低了发起此类攻击的门槛,亟需开发专门的防御机制。 ...

2026-06-23 · 更新于 2026-08-14 · 2 min · 282 words

Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

📄 Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption #语音合成 7.6/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.3/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | #语音合成 | #自监督学习 | arxiv 👥 作者与机构 作者:Xun Gong, Tian Wang, Jinchuan Chen, Haoran Watanabe, Shinji Qian, Yanmin 机构:1 上海交通大学听觉认知与计算声学实验室,中国上海;2 卡内基梅隆大学语言技术研究�� 💡 毒舌点评 论文想法不错,把复杂的音频编辑问题转化为文本空间的改写问题,是个巧妙的“曲线救国”策略。但是,论文在自我吹嘘“性能与专家模型相当”时,有点避重就轻。在语音转录编辑这个最核心的任务上,WER和编辑准确率都明显落后于CosyVoice-3,却在情感和风格编辑上挽回了一些颜面,这能叫“大多数情况”吗?另外,整个评估体系严重依赖自动指标和另一个AI的打分(LLM score),就是不肯做点真正的人工听测,这让“性能相当”的结论显得底气不足。最后,论文宣称“零样本”,但训练数据里塞了YODAS、AudioSet等好几个大公开数据集,虽然不是配对编辑数据,但这“零样本”的含金量需要打个问号。 📌 核心摘要 本文提出了Bagpiper-Edit,一个用于开放式音频编辑的零样本框架。其核心思想是将编辑任务重新定义为基于“富文本描述”的文本空间改写任务。方法首先从原始音频中提取一个详细的文本描述(rich caption),然后利用一个强大的文本大语言模型(LLM)根据用户的自由形式编辑请求,将这个原始描述改写为目标描述。最后,以前者作为“声学锚点”,根据目标描述生成编辑后的音频。为使模型学会在生成时保持原始音频的声学一致性(如背景音、音色),论文提出了一种新颖的自监督训练范式:通过将连续音频分割为相邻片段或重复同一音频,构建无需人工标注的训练对。在语音、音效和自由形式编辑的评估中,该方法展示了其在保持原始音频一致性的同时,实现复杂编辑的能力,其多轮(MT)训练模式的性能在多项指标上优于单轮(ST)模式。 🔗 开源详情 代码:论文中未提及代码链接(论文中提到“We will release the code and evaluation scripts upon acceptance”)。 ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 450 words