Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion

📄 Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion 标签:#语音转换 #数据集 #基准测试 #音频生成 #音频理解 7.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音转换 | #数据集 | #基准测试 #音频生成 | arxiv 👥 作者与机构 第一作者:Seolhee Lee(NC AI Co., Ltd, Republic of Korea) 通讯作者:未说明 作者列表:Seolhee Lee(NC AI Co., Ltd)、Minsu Kang(NC AI Co., Ltd)、Yangsun Lee(NC AI Co., Ltd)、Woosun Min(Sogang University)、Choonghyeon Lee(NC AI Co., Ltd)、Namhyun Cho(NC AI Co., Ltd) 💡 毒舌点评 本文精准识别了“非人类设计声音转换”领域在公开资源和标准化评估上的空白,并为此构建了一个专业且实用的数据集与基准,其价值在于为该小众但关键的子领域奠定了可复现研究的基础。主要不足在于实验验证环节略显单薄:仅采用一个具有代表性的基线模型进行测试,未能充分展示该基准在驱动模型创新、进行更广泛方法比较上的潜力,使其更像一份“基础设施建设报告”而非深入的方法研究。此外,对于评估指标(如CER/WER在设计声音上的适用性)的讨论深度有待加强。 ...

2026-07-24 · 更新于 2026-07-24 · 2 min · 294 words

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

📄 Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture 标签:#语音转换 #大语言模型 #语音识别 #语音合成 #实时处理 6.9/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 0.7/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音转换 | #大语言模型 | #语音识别 #语音合成 | arxiv 👥 作者与机构 第一作者:Yuxuan Wu(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院) 通讯作者:Zhaojie Luo(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院) 作者列表:Yuxuan Wu(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Yifan Xu(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Junkun Wang(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Jiayong Jiang(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Xin Zhao(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院)、Zhaojie Luo(东南大学数字医学工程国家重点实验室,生物科学与医学工程学院) 💡 毒舌点评 本文的亮点在于将大语言模型(LLM)作为“语义纠偏器”集成到构音障碍辅助语音系统(AAC)中,并设计了异步流水线以追求实时性,这一应用场景和系统设计思路具有明确价值。然而,论文的核心缺陷在于其“创新性”高度依赖于对外部现成模型的集成,而非提出新的方法或对现有模型进行任何针对病理语音的适配。实验设计存在根本性漏洞,最关键的LLM模块的作用未能通过控制实验(如消融)进行验证,使得核心声明“LLM纠正了ASR错误”缺乏直接证据。此外,系统对重度构音障碍患者完全无效,暴露了级联架构的天然上限。加上未提供代码、模型权重或详细的工程实现,使其更像一个概念验证的演示报告,而非可复现、可深入研究的贡献。 ...

2026-07-21 · 更新于 2026-07-24 · 3 min · 462 words

Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion

📄 Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion 标签:#语音转换 #歌唱生成 #迁移学习 #领域适应 #音频理解 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音转换 | #迁移学习 | #歌唱生成 #领域适应 | arxiv 👥 作者与机构 第一作者:Ben Maman(Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS) 通讯作者:未说明 作者列表:Ben Maman(FAU 和 Fraunhofer IIS)、Frank Zalkow(FAU 和 Fraunhofer IIS)、Hans-Ulrich Berendes(FAU 和 Fraunhofer IIS)、Paolo Sani(FAU 和 Fraunhofer IIS)、Christian Dittmar(Fraunhofer IIS)、Meinard Müller(Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS) 💡 毒舌点评 这篇论文的跨领域迁移思路确实有启发性,尝试将音乐合成的条件机制应用于语音转换,展示了统一音频生成的一种潜在路径。然而,其核心贡献的论证深度严重不足:1) 实验基线选择不当,未与同类架构的扩散或流匹配模型对比,削弱了“迁移成功”的说服力;2) 对关键负面结果(如音素保真度下降)的归因分析流于表面,缺乏消融实验;3) 尽管提出了统一框架的愿景,但联合训练(T5-All)导致质量下降的矛盾未被解决,其实用价值存疑;4) 最关键的是,作为一篇方法研究,其训练代码、模型权重和关键训练配置均未开源,可复现性极差,严重削弱了其作为后续研究基石的影响力。 ...

2026-07-16 · 更新于 2026-07-24 · 3 min · 575 words

Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats

📄 Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats #语音转换 #理论分析 #基准测试 #模型比较 6.5/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 ✅ 6.5/10 | 前50% | #语音转换 | #理论分析 | #基准测试 #模型比较 | arxiv 👥 作者与机构 第一作者:Dāvis Šterns (Aalto University, Finland) 通讯作者:未说明 作者列表:Dāvis Šterns (Aalto University, Finland), Konstantinos Drossos (Nokia, Finland), Natasha Fernandes (Macquarie University, Australia), Tom Bäckström (Aalto University, Finland), Catuscia Palamidessi (Inria, France) 💡 毒舌点评 这篇论文用信息论的放大镜精准定位了语音匿名化社区长期靠EER“平均及格”的幻觉,LID指标把局部隐私塌方从全局大海绵里挤了出来,动机清晰且论据有力。但读完之后,论文的落地性被“零开源”和校准对正态假设的强依赖死死卡住,更像一份立场鲜明的审计檄文而非立即可用的攻击工具箱——社区想跟上你的旗帜,却发现连旗杆都没递出来。 ...

2026-07-08 · 更新于 2026-07-24 · 3 min · 459 words

NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

📄 NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization #语音转换 #变分自编码器 #语音合成 5.9/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.9/10 | 前50% | #语音转换 | #变分自编码器 | #语音合成 | arxiv 👥 作者与机构 第一作者:Meiying Melissa Chen(论文未提供机构信息) 通讯作者:未说明 作者列表:Meiying Melissa Chen、Anastasia Kuznetsova、Zhenyu Wang、Zhiyao Duan(均未说明机构) 💡 毒舌点评 本文的"插件式"伪说话人生成思路巧妙,通过层次化VAE实现了可调节的匿名强度,工程实用性可圈可点。然而,实验对比对象仅为简单的GMM,完全回避了VoicePrivacy Challenge中B3、B4等主流匿名化基线,且训练与推理的大量关键超参数完全缺失,让该方法在顶会级别的竞争中显得说服力不足。更致命的是,匿名化后未见任何主观听感评测(MOS),生成分布与原始分布的MMD偏差也未被正面解释为自然度损失——审稿人会追问:你生成的伪说话人真的"好听"吗? 📌 核心摘要 本文针对说话人匿名化中伪说话人身份多样性不足的问题,提出了基于层次化深度变分自编码器(NVAE)的伪说话人嵌入生成框架NouveauVoice,同时引入匿名强度可控的新维度。 方法核心是独立训练一个层次化VAE,学习说话人嵌入空间的分布。该生成器作为即插即用的插件模块,通过采样分层潜变量生成新的伪说话人嵌入,并将其注入现有语音转换(VC)系统实现匿名化,无需修改后端系统的结构或权重。 相比以往在特征空间扰动或用GMM采样的方法,NVAE通过分层条件先验提供了更丰富的说话人多样性,并且可通过渐进式替换不同数量的潜变量组来连续控制匿名化强度——这是此前工作不具备的能力。 在两个SOTA语音转换后端(FACodec与CosyVoice2)上评估,CosyVoice2-NV的EER达36.40%,WER为4.29%,UAR为42.53%;FACodec-NV的EER为38.26%,WER为7.56%,UAR为40.36%;整体上在匿名性与可懂度/情感保持间取得较优权衡。层次化控制实验表明,仅替换前2-3组潜变量即可获得大部分匿名增益,且对可懂度影响极小。 实际意义在于提供了一种轻量、可配置的隐私保护方案,能够以最小化修改将现有高质量语音合成与转换系统转化为说话人匿名化系统,降低了部署门槛。 主要局限性:缺少与VoicePrivacy Challenge强基线(如基于GAN的B3、基于码本的B4)的直接比较,且训练与推理的详细超参数几乎全部缺失,极大降低了可复现性。此外,未见对匿名化语音自然度的主观评测,生成伪说话人的感知质量存疑。 🔗 开源详情 代码:论文中未提及代码链接,仅声明"The demo will be available on GitHub page upon acceptance"。 模型权重:论文中未提及。 数据集:论文使用的数据集包括 LibriTTS(train-clean-100、train-clean-360、test-clean)、LibriSpeech(960h)、VoxCeleb、IEMOCAP,均为公开数据集,但未提供具体下载链接。 Demo:论文中未提及具体链接。 复现材料:论文中未提及。 论文中引用的开源项目: SpeechBrain ECAPA-TDNN 说话人验证模型:https://huggingface.co/speechbrain/spkrec-ecapa-voxceleb SpeechBrain wav2vec2 ASR 模型:https://huggingface.co/speechbrain/asr-wav2vec2-librispeech Facebook wav2vec2-large-960h-lv60-self 基础模型:https://huggingface.co/facebook/wav2vec2-large-960h-lv60-self SUPERB wav2vec2 情感识别模型:https://huggingface.co/superb/wav2vec2-base-superb-er scikit-learn RBF 核函数:https://scikit-learn.org/stable/modules/generated/sklearn.metrics.pairwise.rbf_kernel.html FACodec、CosyVoice2、CAM++ 等模型仅通过参考文献提及,论文未给出直接链接。 🏗️ 方法概述和架构 NouveauVoice的整体流程分为两个阶段:独立训练阶段,利用原始说话人嵌入训练层次化VAE(NVAE)以学习说话人身份分布;推理阶段,从训练好的NVAE中采样生成伪说话人嵌入,直接替换原有VC系统中的说话人嵌入,从而驱动VC系统输出匿名语音。 ...

2026-07-07 · 更新于 2026-07-24 · 1 min · 126 words

OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL

📄 OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL #自监督学习 #生成对抗网络 #语音增强 #语音分离 #语音转换 7.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1.2/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前50% | #语音识别 | #自监督学习 | #生成对抗网络 #语音增强 | arxiv 👥 作者与机构 作者:Karl El Hajal (Idiap Research Institute, Switzerland; EPFL, Switzerland), Mathew Magimai.-Doss (Idiap Research Institute, Switzerland) 机构:Idiap Research Institute(瑞士),洛桑联邦理工学院(EPFL,瑞士) ...

2026-06-30 · 更新于 2026-07-24 · 5 min · 996 words

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

📄 ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion #语音转换 #流匹配 #扩散模型 6.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.3/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 6.6/10 | 前50% | #语音转换 | #流匹配 | #扩散模型 | arxiv 👥 作者与机构 作者: Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung 机构: KAIST (韩国科学技术院), Chung-Ang University (中央大学), The Chinese University of Hong Kong (香港中文大学) ...

2026-06-23 · 更新于 2026-07-24 · 3 min · 578 words

RIVET: Robust Idempotent Voice Attribute Editing

📄 RIVET: Robust Idempotent Voice Attribute Editing #语音编辑 #语音转换 #低资源 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8/10 | 前50% | #语音转换 | #语音编辑 | #低资源 | arxiv 👥 作者与机构 Dareen Alharthi, Bhuvan Koduru, Rita Singh, Bhiksha Raj 卡内基梅隆大学 (Carnegie Mellon University) 💡 毒舌点评 这篇工作的出发点不错,抓住了语音编辑在大数据时代的一个真实痛点——脏标签。用“幂等性”这剂药方听起来也挺高大上,直觉上说得通。但仔细一看,这药方的“药效”和“适用症”证明得不够扎实。最大的问题是,作者自己搭了个简易擂台(去掉核心损失的自身架构),就宣布自己赢了。这就像只跟昨天的自己比赛,说服力打折扣。而且,对“年龄”这个属性,药效好像不太灵(在EARS上甚至变差了),论文却轻描淡写带过,没给出像样的病理分析。方法部分对模型“怎么做手术”的细节描述比较模糊,光给了个公式和示意图,让人不清楚这“潜在表示空间”的约束到底落在VITS的哪个部位。总之,想法有价值,但就像一篇刚完成初步临床试验的新药报告:看到了希望,但离证明其广泛有效性和弄清所有副作用,还有不少路要走。 📌 核心摘要 本文针对语音属性编辑模型因训练数据中的标签噪声而导致编辑不稳定和身份漂移的问题,提出了RIVET训练框架。其核心在于利用幂等性原理(\(f(f(x)) = f(x)\))作为正则化。具体实现上,RIVET在模型的编码潜在表示空间(同时针对说话人嵌入和语音潜在表示)施加一致性约束,通过最小化原始编码与“编辑-重建”再编码之间的差异,使模型在噪声标签下也能学习到稳定的映射。实验表明,该方法能有效提升模型在自然噪声(GLOBE)和可控合成噪声(EARS)下的编辑成功率和说话人身份保持能力,尤其是在性别编辑和对抗噪声方面效果显著。 🔗 开源详情 代码:https://github.com/DareenHarthi/rivet (提供了完整的训练和评估代码) 模型权重:论文中未提及提供预训练模型权重。 数据集:论文使用GLOBE和EARS数据集,但未提供直接获取链接,需从官方渠道获取。 Demo:论文中未提及。 复现材料:论文中包含主要的训练细节(如优化器、学习率),但未提供具体的配置文件或脚本。 🏗️ 方法概述和架构 RIVET是一个端到端训练的语音属性编辑框架,其核心组件包括三个部分:说话人编码器、属性编辑模块和语音生成器,并通过引入幂等性损失进行联合优化。 ...

2026-06-19 · 更新于 2026-07-24 · 2 min · 292 words

Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization

📄 Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization #语音转换 #流式处理 #生成对抗网络 6.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 ✅ 6.1/10 | 前50% | #语音转换 | #生成对抗网络 | #流式处理 | arxiv 👥 作者与机构 Li Yudong, Fang Zihao, Qiu Junwen, Jing Ruihai, Shen Ruixiang, Wu Zhizheng. 机构:1. 香港中文大学(深圳) 2. 深圳湾区研究院 3. 深圳传音控股股份有限公司 4. Amphion Technology Co.,Ltd. ...

2026-06-19 · 更新于 2026-07-24 · 2 min · 292 words

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

📄 DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization #语音转换 #扩散模型 #强化学习 6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 6.5/10 | 前50% | #语音转换 | #强化学习 | #扩散模型 | arxiv 👥 作者与机构 作者:Liming Wang, Cody Karjadi, Rhoda Au, James Glass 机构:MIT CSAIL;波士顿大学阿尔茨海默病中心 💡 毒舌点评 动机有点“既要又要”的浪漫主义——既要脱敏又要保真,尤其是在医疗数据上,这本身就是个两难困境。论文提出的RL方法算是条务实的路子,但离“通用解”还差得远。 实验设计还算扎实,和一堆主流方法(KNN-VC, LinearVC, TriAAN-VC, VEVO, FACodec, VALL-E)都比了,数据集也选了公认的ADReSS和FHS gold 92。但结果嘛,只能说赢了一部分,离“显著优于所有基线”还有距离,特别是在FHS gold 92的零样本设定上。 消融实验做了几项,聊胜于无。但关键的点,比如“可训练奖励教师”为什么在更嘈杂数据上会让零样本AUC下降?作者给出的解释(分布偏移)有点轻描淡写,这问题值得深挖。 自然度(UTMOS)和认知效用(AUC)经常不一致这个发现很有意思,点出了当前评估体系的盲点。但论文没进一步给出一个更好的综合评估指标,只是提了个醒。 开源态度不错,给了代码和Demo。但模型权重、训练好的教师模型、完整数据集预处理脚本都没给,想完美复现还是得自己折腾,减分。 📌 核心摘要 本文针对说话人去识别任务中隐私保护与下游任务效用(特别是认知健康评估)难以兼顾的挑战,提出了一种基于扩散模型(DDPM)与强化学习后训练(DDPO)的框架DDPO-VC。该方法无需对隐私与效用变量做解耦假设,而是通过组合来自隐私教师(说话人验证器)和效用教师(痴呆分类器)的奖励信号,直接优化扩散模型以生成既“匿名”又“保真”的语音。在ADReSS和FHS gold 92两个痴呆语音数据集上的实验表明,DDPO-VC在零样本和微调设定下的认知效用(AUC)和隐私保护(EER)上均能取得有竞争力的结果,并通过消融实验分析了教师类型、后训练技术(DDPO vs DPO)和奖励权重的影响。 ...

2026-06-16 · 更新于 2026-07-24 · 4 min · 782 words