Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant

📄 Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant #语音识别 #语音合成 #自监督学习 #低资源 #数据增强 6.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5 ✅ 6.2/10 | 前50% | #语音识别 | #自监督学习 | #语音合成 #低资源 | arxiv 👥 作者与机构 作者:Milosz Dudek, Kamil Hemmerling, Maciej Kwarciak, Maria Stroinski, Mateusz Pensko, Kamil Kowalewski, Leonid Pavlovskyi, Sebastian Jurczak, Anna-Mariia Vitkovska, Zuzanna Miodonska, Natalia Mocko, Michal Krecichwost。 机构:1 AGH University of Krakow, Cracow, Poland; 2 SoftServe, Cracow, Poland; 3 Department of Biomedical Engineering, Silesian University of Technology, Poland; 4 Institute of Linguistics, Faculty of Humanities, University of Silesia in Katowice, Poland. ...

2026-06-25 · 更新于 2026-07-27 · 4 min · 790 words

Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

📄 Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis #语音合成 #语音生成 #数据增强 7.3/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.3/10 | 前50% | #语音合成 | #数据增强 | #语音生成 | arxiv 👥 作者与机构 作者:Lianbo Liu, Shiao Zhu, Kai Washizaki, Reo Yoneyama, Haesung Jeon, Mengjie Zhao, Yusuke Fujita, Hao Shi, Nao Yoshida, Yuan Gao, Roman Koshkin, Yukiya Hono, Yui Sudo。机构:SB Intuitions。 ...

2026-06-25 · 更新于 2026-07-27 · 1 min · 122 words

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

📄 STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity #语音翻译 #语音合成 #语音识别 #多模态模型 #大语言模型 7.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前50% | #语音翻译 | #语音合成 | #语音识别 #多模态模型 | arxiv 👥 作者与机构 作者:Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue 单位:香港科技大学,腾讯优图实验室,清华大学深圳国际研究生院 ...

2026-06-25 · 更新于 2026-07-27 · 3 min · 567 words

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

📄 Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models #语音合成 #语音识别 #多模态模型 7.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 1.5/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #语音识别 | #多模态模型 | arxiv 👥 作者与机构 Wan Team, Alibaba Group 💡 毒舌点评 这篇工作野心很大,试图用一个模型解决实时交互的“全双工”问题。优点是系统集成度高,从感知到生成一气呵成。但作为一篇会议论文,它更像是一份优秀的工程报告,而非一篇算法或理论创新驱动的学术论文。最令人遗憾的是,几乎所有关键的技术细节都被“黑箱化”了:Transformer的具体结构?多模态token如何调度?流匹配解码器细节?统统没有。实验部分更是避重就轻,用大量篇幅和不规范的表格对比“延迟”,却对生成质量避而不谈。消融实验?不存在的。这就像一个厨师说他的新菜“又快又好吃”,但拒绝透露菜谱、食材和火候,只给你看了一个计时器。对于顶会论文而言,这种程度的细节披露严重不足,可复现性基本为零。作者提出的v0.1版和192p分辨率也暗示这更像一个技术演示而非成熟方案。 📌 核心摘要 Wan-Streamer是一个原生流式、端到端的实时交互基础模型,旨在实现低延迟、全双工的音视频交互。它在一个单一的Transformer中建模文本、音频和视频的输入与输出,无需依赖外部的ASR、TTS、动画或视频生成等级联模块。论文的核心贡献包括:1)提出了一种全因果的多模态架构,包括因果VAE、因果编解码器、块因果注意力以及全历史自回归流式处理;2)设计了“思想家-执行者”(thinker-performer)推理流水线,通过KV缓存交换实现理解与生成过程的重叠,实现了约200毫秒的模型端响应延迟和约550毫秒(含350ms网络延迟)的总交互延迟。论文强调,这种端到端设计使得感知、推理、生成、响应时机控制和轮次管理能在统一的模型中联合优化,从而减少流水线延迟和误差累积。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:论文中未提及 Demo:https://wan-streamer.com/ 复现材料:论文中未提及 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 Wan-Streamer的设计核心是“流式性作为建模约束”,其整个技术栈均围绕因果性进行重构。 ...

2026-06-25 · 更新于 2026-07-27 · 1 min · 94 words

BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset

📄 BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset #音频深度伪造检测 #语音合成 #低资源 9/10 | 创新 1/2 | 严谨 1.5/1.5 | 实验 0.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 9/10 | 后50% | #音频深度伪造检测 | #语音合成 | #低资源 | arxiv 👥 作者与机构 Istiaq Ahmed Fahad, Kamruzzaman Asif, Sifat Sikder Institute of Information Technology, University of Dhaka, Bangladesh 💡 毒舌点评 这是一篇典型的“填补空白”式工作,对于孟加拉语社区来说是个不错的资源,但顶会水平?它甚至没敢声称自己的生成模型是SOTA。论文的核心价值是发布了一个“存在”的数据集,而不是推进了检测技术。评估部分只有主观打分和一张看不清的t-SNE图,缺乏任何有说服力的定量实验来证明这个数据集真的能提升现有检测器的性能。如果连在最简单的baseline上跑个数都省了,那么发布数据集的“核心贡献”就打了一半折扣。作者未来的工作展望(加说话人)听起来像是这篇论文本该完成的部分。 ...

2026-06-24 · 更新于 2026-07-27 · 2 min · 228 words

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

📄 CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation #语音合成 #数据集 9.2/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 9.2/10 | 前10% | #语音合成 | #数据集 | arxiv 👥 作者与机构 作者:Shijun Luo 机构:未明确说明 💡 毒舌点评 这篇工作像一份严谨的“体检报告”,把当前中文新闻TTS产品的“发音健康状况”摆上了台面。优点在于问题定义清晰、评测协议扎实、工程复现性强,为社区提供了一个急需的、标准化的评测工具。缺点是它本质上是“测量尺”的研发,而非“治病方法”的提出;数据集为合成数据,可能无法完全覆盖真实新闻的复杂性和分布。对于追求算法创新的读者来说,贡献可能显得偏工程化;但对于整个语音合成社区,尤其是工业界,这是一份非常实用且必要的基准。作者在ASR路由的异质性分析和消融实验上展现了足够的严谨性,这是亮点。 📌 核心摘要 本文提出了CN-NewsTTS Bench v0.1,一个针对中文新闻TTS系统在处理原始文本中密集出现的书面化形式(如比分、型号、单位、缩写等)时发音准确性的开放式、目标级自动评测基准。基准包含一个合成新闻风格句子数据集(200条记录开发集,800条记录公开测试集,共1260个评测目标)、一个基于三个异构ASR系统多数投票的自动评分协议,以及对七个商业TTS系统的初始评测结果。结果显示,最佳系统(Volcano)的严格准确率为0.879,而多个广泛使用的系统低于0.60,且性能在不同文本类别上差异巨大。该基准强调“原始输入产品赛道”,禁止用户侧的文本预处理,以评估TTS产品端到端的处理能力。 🔗 开源详情 代码:https://github.com/Jayden-X-L/cn-news-tts-bench 模型权重:论文中未提及 数据集:CN-NewsTTS Bench v0.1 数据集(开发集200条记录,公开测试集800条记录)。可通过上述代码仓库的 v0.1 发布(Release)获取。 Demo:论文中未提及 复现材料:复现所需的所有材料(数据、模式、评分代码、固定的ASR转录本、排行榜文件、仪表板、校验和等)均包含在代码仓库的 v0.1 发布中。最小化复现步骤包括验证公开数据集、评分模型的ASR结果文件、聚合排行榜并校验清单。代码仓库的提交 ID 为 f94a679fc7fc。 论文中引用的开源项目: FunAudioLLM/FunASR 生态系统,包含: SenseVoiceSmall:开源本地语音识别器。 Paraformer-zh:开源本地语音识别器。 (论文中未给出具体链接,仅提及来自该生态系统) 标签 #语音合成 #评测基准 #数据集 #开源 主任务标签:#语音合成 主方法标签:#评测基准 补充标签:#数据集 #开源 ...

2026-06-24 · 更新于 2026-07-27 · 2 min · 399 words

ZONOS2 Technical Report

📄 ZONOS2 Technical Report #语音合成 #多语言 #自回归模型 10/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.4/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 10/10 | 前25% | #语音合成 | #多语言 | #自回归模型 | arxiv 👥 作者与机构 作者:Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge 机构:Zyphra 💡 毒舌点评 这篇技术报告读起来像一份精心包装的产品发布说明书,而非一篇严谨的学术论文。最大的槽点在于“过度声明”与“选择性对比”:摘要中声称“state-of-the-art naturalness, prosody, and voice cloning fidelity”,但结果表(IV, V)显示,在关键指标如WER和UTMOS上,ZONOS2在多个语言上显著落后于闭源模型(如Eleven Labs V3, Gemini 3.1 Flash)和部分开源模型(如Fish S2 Pro, VoxCPM 2)。其所谓“竞争力”高度依赖自家提出的ZTTS1-Eval基准,而在这个基准上,其“Quality Mode”虽提升了一些指标,但往往以牺牲说话人相似度为代价(对比表IV/ V 中“8B”与“Quality Mode”行)。此外,将80%以上的英文训练数据(图3)归因于“公开语音语料库、播客”等,却未提供这些数据集的任何链接或开源协议,使得“开源”光环下的数据透明度大打折扣,存在“数据黑箱”的嫌疑。讨论部分(VII)对MoE训练不稳定性的承认倒是挺实在的。 ...

2026-06-24 · 更新于 2026-07-27 · 7 min · 1346 words

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

📄 Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR #语音识别 #语音合成 #参数高效微调 #低资源 7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.9/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7/10 | 前50% | #语音识别 | #参数高效微调 | #语音合成 #低资源 | arxiv 👥 作者与机构 Enes Yavuz Ugan¹², Alexander Waibel¹² ¹Interactive Systems Lab, Karlsruhe Institute of Technology (KIT), Germany ²InterACT, Carnegie Mellon University (CMU), USA ...

2026-06-23 · 更新于 2026-07-27 · 2 min · 345 words

An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis

📄 An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis #语音合成 #数据集 6.9/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 6.9/10 | 前50% | #语音合成 | #数据集 | arxiv 👥 作者与机构 作者: Mateo Cámara (1), José Luis Blanco (1), Juan Ignacio Godino-Llorente (1,3), Jeung-Yoon Choi (2), Stefanie Shattuck-Hufnagel (2) 机构: Signal Processing Applications Group, Information Processing & Telecomm. Center, Universidad Politécnica de Madrid, Spain Speech Communication Group, Research Laboratory of Electronics, Massachusetts Institute of Technology, USA Bioengineering and Optoelectronics Lab., Universidad Politécnica de Madrid, Spain 邮箱: mateo.camara@upm.es, jl.blanco@upm.es, ignacio.godino@upm.es, jyechoi@mit.edu, sshuf@mit.edu 💡 毒舌点评 这篇论文就像一位严谨的工匠,用一套自己打造的精密模具(Pink Trombone)批量生产语音零件,并为每个零件贴上了绝对精准的“制造时刻”标签(地标)。它不关心这些零件组装成自然流畅的语音时是否足够逼真,只确保每个零件的诞生点都记录得清清楚楚。对于地标理论的研究者来说,这提供了一个近乎完美的“纯净沙盒”——没有自然语音中那些恼人的协同发音“噪音”和标注歧义。然而,对于追求“自然度”的主流语音合成社区,或者希望验证地标检测器在现实世界表现的学者,这盘“罐头语音”可能显得过于“人工”和“无菌”。它的价值不在于生成能以假乱真的语音,而在于为声学事件的底层规律研究提供一个绝对受控的、可重复的实验平台。作为一个资源发布工作,它扎实、规范、慷慨;但若作为一篇追求方法论突破的顶会论文,其理论深度和实验验证的全面性就显得有些单薄了。 ...

2026-06-23 · 更新于 2026-07-27 · 2 min · 360 words

An Evaluation Framework for Text-to-Speech Voice Reconstruction

📄 An Evaluation Framework for Text-to-Speech Voice Reconstruction #语音合成 #语音识别 8.8/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 🔥 8.8/10 | 前25% | #语音合成 | #语音识别 | arxiv 👥 作者与机构 Ariadna Sanchez, Christoph Minixhofer, Korin Richmond, Ondřej Klejch, Peter Bell, Simon King The Centre for Speech Technology Research, University of Edinburgh, UK 💡 毒舌点评 这篇论文解决了一个真实且重要的痛点:如何评估为语音障碍患者重建声音的TTS系统。作者没有满足于简单套用现有的MOS或WER指标,而是深刻地认识到任务的核心矛盾——提高可懂度与保持说话人身份之间的权衡。提出的框架,无论是情境化BWS的主观评估,还是双参考TTSDS Mean的客观评估,都直指这一矛盾,逻辑清晰,动机充分。然而,其“严苛”体现在何处?首先,论文的实验部分虽然规模可观(17个系统,193位说话人),但作者在分析时过于强调框架的优越性,而对观察到的现象(如零样本系统在低可懂度说话人上的普遍失败)缺乏更深入的机制探讨和假设验证。其次,提出的TTSDS Mean指标虽然有效,但其设计(简单平均)较为朴素,缺乏消融实验来证明这种平均方式是最佳选择,还是仅是一种启发式方案。最后,开源程度极低(仅提供Demo页面),对于一个旨在建立评估标准的框架而言,这大大削弱了其可复现性和社区影响力,是一个明显的短板。总体而言,这是一个扎实、有用的工作,但在方法的深度剖析和实践推广的完备性上仍有提升空间。 ...

2026-06-23 · 更新于 2026-07-27 · 2 min · 284 words