Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

📄 Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization 标签:#语音合成 #流匹配 #语音转换 #自回归模型 #零样本 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #流匹配 | #语音转换 #自回归模型 | arxiv 👥 作者与机构 团队:L-Lab Phoenix-Audio Team 机构:Didichuxing Co. Ltd 核心贡献者:Peijie Chen、Zhuanling Zha、Zhipeng Nie、Weijie Wu、Yiming Liu、Daiyu Huang、Junbo Li、Jun Fang、Naiqiang Tan、Hua Chai(均 Didichuxing Co. Ltd) 顾问:Qingyang Hong(厦门大学) 通讯作者:未说明 💡 毒舌点评 本文用 flow matching 梯度反传把语义 tokenizer 和声学解码器焊在一起,确实把 WER 压到 GT 以下、SIM 在多基准上登顶,联合训练的证据链清楚。但全篇没有任何开源迹象,mask 策略与损失权重等关键实现细节一笔带过,且“超过 GT”这类表述应更谨慎解读。推理延迟、吞吐、训练成本对比等系统级指标全缺,工业部署价值难以独立判断。 ...

2026-08-13 · 更新于 2026-08-14 · 6 min · 1095 words

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

📄 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 标签:#语音伪造检测 #基准测试 #语音合成 #语音转换 #音频理解 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.4/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音伪造检测 | #基准测试 | #语音合成 #语音转换 | arxiv 👥 作者与机构 第一作者:Aurosweta Mahapatra(Johns Hopkins University) 通讯作者:Berrak Sisman(Johns Hopkins University) 作者列表:Aurosweta Mahapatra(Johns Hopkins University)、Xiutian Zhao(Johns Hopkins University)、Shreeram Suresh Chandra(Johns Hopkins University)、Zihan Zhang(Johns Hopkins University)、Zongyang Du(Johns Hopkins University)、Ismail Rasim Ulgen(Johns Hopkins University)、Kong Aik Lee(Hong Kong Polytechnic University)、Nicholas Andrews(Johns Hopkins University)、Carlos Busso(Carnegie Mellon University)、Berrak Sisman(Johns Hopkins University) 💡 毒舌点评 AffectDF 在情感伪造攻击的覆盖广度上确实做出了有分量的贡献:21种攻击、约260小时、五种情绪、同时含表演性与自发性语音,直接填补了现有情感伪造基准规模小、攻击范式单一的空白。但训练集仅有4个说话人、LALM微调只验证了Voxtral一个模型、所有EER均为点估计且无置信区间,基准的"全面性"尚未完全转化为结论的"稳健性"。更关键的是,“情感训练无法一致提升跨域鲁棒性"这一核心反直觉发现主要建立在少数模型的行为分歧之上,论文未能说明训练数据变化为何会反转表演/自发风格的难度方向。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 805 words

Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil

📄 Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil 标签:#语音伪造检测 #领域适应 #语音转换 #语音合成 #音频理解 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音伪造检测 | #领域适应 | #语音转换 #语音合成 | arxiv 👥 作者与机构 第一作者:Lucas Rafael Stefanel Gris(论文中写作 Lucas Rafael Gris,所属机构未说明) 通讯作者:未说明 作者列表:Lucas Rafael Gris(未说明)、Daniel Casanova(未说明)、Frederico Santos De Oliveira(未说明)、Alef Iury Ferreira(未说明)、Beatriz Almeida Felício(未说明)、Raul César Reis Mata(未说明)、Anderson da Silva Soares(未说明) 💡 毒舌点评 这项工作为巴西政治语音深度伪造检测在低资源高风险的选举场景下立下了一块扎实的基准里程碑,首次系统性地将部分词级篡改和巴西境内五大区域方言差异纳入统一的评估框架,问题定义清晰,社会价值明确。但评估策略过于保守——三个检测器全为零样本推断,未做任何微调或领域适配实验,生生把“跨域泛化差”的结论限制在了现状描述层面,缺乏通向解决方案的实证路径。生成管线中的关键声学细节(如交叉淡化参数、增强器配置、压缩设置等)交代得颇为潦草,让“方法论因素主导”的结论虽直觉上成立,却少了严谨的消解和归因支撑。 ...

2026-08-03 · 更新于 2026-08-14 · 4 min · 819 words

Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion

📄 Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion 标签:#语音转换 #数据集 #基准测试 #音频生成 #音频理解 7.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音转换 | #数据集 | #基准测试 #音频生成 | arxiv 👥 作者与机构 第一作者:Seolhee Lee(NC AI Co., Ltd, Republic of Korea) 通讯作者:未说明 作者列表:Seolhee Lee(NC AI Co., Ltd)、Minsu Kang(NC AI Co., Ltd)、Yangsun Lee(NC AI Co., Ltd)、Woosun Min(Sogang University)、Choonghyeon Lee(NC AI Co., Ltd)、Namhyun Cho(NC AI Co., Ltd) 💡 毒舌点评 本文精准识别了“非人类设计声音转换”领域在公开资源和标准化评估上的空白,并为此构建了一个专业且实用的数据集与基准,其价值在于为该小众但关键的子领域奠定了可复现研究的基础。主要不足在于实验验证环节略显单薄:仅采用一个具有代表性的基线模型进行测试,未能充分展示该基准在驱动模型创新、进行更广泛方法比较上的潜力,使其更像一份“基础设施建设报告”而非深入的方法研究。此外,对于评估指标(如CER/WER在设计声音上的适用性)的讨论深度有待加强。 ...

2026-07-24 · 更新于 2026-08-14 · 2 min · 294 words

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

📄 Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture 标签:#语音转换 #大语言模型 #语音识别 #语音合成 #实时处理 6.9/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 0.7/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音转换 | #大语言模型 | #语音识别 #语音合成 | arxiv 👥 作者与机构 第一作者:Yuxuan Wu(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院) 通讯作者:Zhaojie Luo(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院) 作者列表:Yuxuan Wu(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Yifan Xu(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Junkun Wang(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Jiayong Jiang(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Xin Zhao(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Zhaojie Luo(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院) 💡 毒舌点评 本文的亮点在于将大语言模型(LLM)作为“语义纠偏器”集成到构音障碍辅助语音系统(AAC)中,并设计了异步流水线以追求实时性,这一应用场景和系统设计思路具有明确价值。然而,论文的核心缺陷在于其“创新性”高度依赖于对外部现成模型的集成,而非提出新的方法或对现有模型进行任何针对病理语音的适配。实验设计存在根本性漏洞,最关键的LLM模块的作用未能通过控制实验(如消融)进行验证,使得核心声明“LLM纠正了ASR错误”缺乏直接证据。此外,系统对重度构音障碍患者完全无效,暴露了级联架构的天然上限。加上未提供代码、模型权重或详细的工程实现,使其更像一个概念验证的演示报告,而非可复现、可深入研究的贡献。 ...

2026-07-21 · 更新于 2026-08-14 · 3 min · 462 words

Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion

📄 Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion 标签:#语音转换 #歌唱生成 #迁移学习 #领域适应 #音频理解 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音转换 | #迁移学习 | #歌唱生成 #领域适应 | arxiv 👥 作者与机构 第一作者:Ben Maman(Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS) 通讯作者:未说明 作者列表:Ben Maman(FAU 和 Fraunhofer IIS)、Frank Zalkow(FAU 和 Fraunhofer IIS)、Hans-Ulrich Berendes(FAU 和 Fraunhofer IIS)、Paolo Sani(FAU 和 Fraunhofer IIS)、Christian Dittmar(Fraunhofer IIS)、Meinard Müller(Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS) 💡 毒舌点评 这篇论文的跨领域迁移思路确实有启发性,尝试将音乐合成的条件机制应用于语音转换,展示了统一音频生成的一种潜在路径。然而,其核心贡献的论证深度严重不足:1) 实验基线选择不当,未与同类架构的扩散或流匹配模型对比,削弱了“迁移成功”的说服力;2) 对关键负面结果(如音素保真度下降)的归因分析流于表面,缺乏消融实验;3) 尽管提出了统一框架的愿景,但联合训练(T5-All)导致质量下降的矛盾未被解决,其实用价值存疑;4) 最关键的是,作为一篇方法研究,其训练代码、模型权重和关键训练配置均未开源,可复现性极差,严重削弱了其作为后续研究基石的影响力。 ...

2026-07-16 · 更新于 2026-08-14 · 3 min · 575 words

Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats

📄 Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats #语音转换 #理论分析 #基准测试 #模型比较 6.5/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 ✅ 6.5/10 | 前50% | #语音转换 | #理论分析 | #基准测试 #模型比较 | arxiv 👥 作者与机构 第一作者:Dāvis Šterns (Aalto University, Finland) 通讯作者:未说明 作者列表:Dāvis Šterns (Aalto University, Finland), Konstantinos Drossos (Nokia, Finland), Natasha Fernandes (Macquarie University, Australia), Tom Bäckström (Aalto University, Finland), Catuscia Palamidessi (Inria, France) 💡 毒舌点评 这篇论文用信息论的放大镜精准定位了语音匿名化社区长期靠EER“平均及格”的幻觉,LID指标把局部隐私塌方从全局大海绵里挤了出来,动机清晰且论据有力。但读完之后,论文的落地性被“零开源”和校准对正态假设的强依赖死死卡住,更像一份立场鲜明的审计檄文而非立即可用的攻击工具箱——社区想跟上你的旗帜,却发现连旗杆都没递出来。 ...

2026-07-08 · 更新于 2026-08-14 · 3 min · 459 words

NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

📄 NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization #语音转换 #变分自编码器 #语音合成 5.9/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.9/10 | 前50% | #语音转换 | #变分自编码器 | #语音合成 | arxiv 👥 作者与机构 第一作者:Meiying Melissa Chen(论文未提供机构信息) 通讯作者:未说明 作者列表:Meiying Melissa Chen、Anastasia Kuznetsova、Zhenyu Wang、Zhiyao Duan(均未说明机构) 💡 毒舌点评 本文的"插件式"伪说话人生成思路巧妙,通过层次化VAE实现了可调节的匿名强度,工程实用性可圈可点。然而,实验对比对象仅为简单的GMM,完全回避了VoicePrivacy Challenge中B3、B4等主流匿名化基线,且训练与推理的大量关键超参数完全缺失,让该方法在顶会级别的竞争中显得说服力不足。更致命的是,匿名化后未见任何主观听感评测(MOS),生成分布与原始分布的MMD偏差也未被正面解释为自然度损失——审稿人会追问:你生成的伪说话人真的"好听"吗? 📌 核心摘要 本文针对说话人匿名化中伪说话人身份多样性不足的问题,提出了基于层次化深度变分自编码器(NVAE)的伪说话人嵌入生成框架NouveauVoice,同时引入匿名强度可控的新维度。 方法核心是独立训练一个层次化VAE,学习说话人嵌入空间的分布。该生成器作为即插即用的插件模块,通过采样分层潜变量生成新的伪说话人嵌入,并将其注入现有语音转换(VC)系统实现匿名化,无需修改后端系统的结构或权重。 相比以往在特征空间扰动或用GMM采样的方法,NVAE通过分层条件先验提供了更丰富的说话人多样性,并且可通过渐进式替换不同数量的潜变量组来连续控制匿名化强度——这是此前工作不具备的能力。 在两个SOTA语音转换后端(FACodec与CosyVoice2)上评估,CosyVoice2-NV的EER达36.40%,WER为4.29%,UAR为42.53%;FACodec-NV的EER为38.26%,WER为7.56%,UAR为40.36%;整体上在匿名性与可懂度/情感保持间取得较优权衡。层次化控制实验表明,仅替换前2-3组潜变量即可获得大部分匿名增益,且对可懂度影响极小。 实际意义在于提供了一种轻量、可配置的隐私保护方案,能够以最小化修改将现有高质量语音合成与转换系统转化为说话人匿名化系统,降低了部署门槛。 主要局限性:缺少与VoicePrivacy Challenge强基线(如基于GAN的B3、基于码本的B4)的直接比较,且训练与推理的详细超参数几乎全部缺失,极大降低了可复现性。此外,未见对匿名化语音自然度的主观评测,生成伪说话人的感知质量存疑。 🔗 开源详情 代码:论文中未提及代码链接,仅声明"The demo will be available on GitHub page upon acceptance"。 模型权重:论文中未提及。 数据集:论文使用的数据集包括 LibriTTS(train-clean-100、train-clean-360、test-clean)、LibriSpeech(960h)、VoxCeleb、IEMOCAP,均为公开数据集,但未提供具体下载链接。 Demo:论文中未提及具体链接。 复现材料:论文中未提及。 论文中引用的开源项目: SpeechBrain ECAPA-TDNN 说话人验证模型:https://huggingface.co/speechbrain/spkrec-ecapa-voxceleb SpeechBrain wav2vec2 ASR 模型:https://huggingface.co/speechbrain/asr-wav2vec2-librispeech Facebook wav2vec2-large-960h-lv60-self 基础模型:https://huggingface.co/facebook/wav2vec2-large-960h-lv60-self SUPERB wav2vec2 情感识别模型:https://huggingface.co/superb/wav2vec2-base-superb-er scikit-learn RBF 核函数:https://scikit-learn.org/stable/modules/generated/sklearn.metrics.pairwise.rbf_kernel.html FACodec、CosyVoice2、CAM++ 等模型仅通过参考文献提及,论文未给出直接链接。 🏗️ 方法概述和架构 NouveauVoice的整体流程分为两个阶段:独立训练阶段,利用原始说话人嵌入训练层次化VAE(NVAE)以学习说话人身份分布;推理阶段,从训练好的NVAE中采样生成伪说话人嵌入,直接替换原有VC系统中的说话人嵌入,从而驱动VC系统输出匿名语音。 ...

2026-07-07 · 更新于 2026-08-14 · 1 min · 126 words

OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL

📄 OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL #自监督学习 #生成对抗网络 #语音增强 #语音分离 #语音转换 7.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1.2/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前50% | #语音识别 | #自监督学习 | #生成对抗网络 #语音增强 | arxiv 👥 作者与机构 作者:Karl El Hajal (Idiap Research Institute, Switzerland; EPFL, Switzerland), Mathew Magimai.-Doss (Idiap Research Institute, Switzerland) 机构:Idiap Research Institute(瑞士),洛桑联邦理工学院(EPFL,瑞士) ...

2026-06-30 · 更新于 2026-08-14 · 5 min · 996 words

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

📄 ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion #语音转换 #流匹配 #扩散模型 6.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.3/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 6.6/10 | 前50% | #语音转换 | #流匹配 | #扩散模型 | arxiv 👥 作者与机构 作者: Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung 机构: KAIST (韩国科学技术院), Chung-Ang University (中央大学), The Chinese University of Hong Kong (香港中文大学) ...

2026-06-23 · 更新于 2026-08-14 · 3 min · 578 words