DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

📄 DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech #语音合成 #扩散模型 #参数高效微调 #低资源 7.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | #语音合成 | #扩散模型 | #参数高效微调 #低资源 | arxiv 👥 作者与机构 第一作者:Junwon Moon(未说明) 通讯作者:未说明 作者列表:Junwon Moon、Seungbeom Kim、Yejin Lee、Hoseong Ahn、Sewoong Park、Heeseung Kim、Kyuhong Shim(七位作者均未说明所属机构,但从致谢与主观评测部分可推断其隶属韩国学术机构) 💡 毒舌点评 本文把“先做容易的”这条直觉从文本领域搬运到语音合成,工程上灵巧干净,仅用585小时数据就在WER上掀翻了自家骨干和若干数据量百倍于己的对手。但数据量的鸿沟是荣耀也是隐忧,零开源更是让所有这些漂亮数字只能停留在纸面上,社区无法验证,只能姑妄听之。 📌 核心摘要 要解决的问题:传统自回归(AR)文本转语音(TTS)模型采用严格的从左到右依次生成语音token的方式,推理速度随序列线性增长,且无法利用未来上下文信息,导致在序列起始等证据不足的位置置信度极低,容易产生幻觉和错误累积。 方法核心:提出DELTA-TTS,一个基于LoRA的轻量级适配框架。它冻结预训练的AR TTS骨干网络,通过增加双向注意力、块级LoRA适配器和Conformer风格卷积模块,将其转换为一个按置信度排序生成的离散扩散语言模型(dLLM)。 新颖性:首次将AR-to-dLLM的转换范式从文本领域迁移到语音TTS。针对语音信号强烈的局部时序相关性,引入了卷积模块来弥补全局双向注意力对局部结构建模的不足,并设计了配套的1/t加权损失和时间偏移推理调度策略,系统性地实现了“先易后难”的生成顺序。 主要实验结果:仅使用585小时的LibriTTS数据训练,在Seed-TTS test-en基准上取得了1.75%的词错误率(WER),优于其AR骨干CosyVoice3的2.02%,并超越了多个参数量和数据量远大于它的基线模型,同时推理速度提升3.3倍。 类型 模型 参数量 训练数据 (小时) Seed-TTS test-en WER (%) ↓ SIM ↑ AR CosyVoice3 0.5B 1000K Multilingual 2.02 0.692 AR Seed-TTS N/A N/A 2.25 0.762 AR VoxCPM 0.5B 1800K Multilingual 1.85 0.729 NAR MaskGCT (50 NFE) 1.1B 100K Emilia 2.62 0.714 NAR F5-TTS (32 NFE) 0.3B 100K Emilia 2.00 0.647 Ours DELTA-TTS 0.5B+94M 0.585K LibriTTS 1.75 0.688 实际意义:为工业界大规模部署的AR TTS模型提供了一条低成本(仅需15%新增参数和少量适配数据)、高效率的升级路径,能显著提升推理速度并缓解幻觉问题,尤其是在长语音合成场景下加速效果更佳(4.46倍)。 主要局限性:目标语音长度目前依赖于一个基于文本长度的启发式规则,不够鲁棒;方法目前仅在英语和CosyVoice3这一单一骨干模型上进行了验证。 🔗 开源详情 代码:否。论文中未提及代码链接。 模型权重:否。论文中未提及。 数据集: 训练数据:LibriTTS(585小时),论文中未提供下载链接。 评估数据:Seed-TTS test‑en(1088条)、LibriSpeech‑PC test‑clean Subset B(1127条),论文中未提供下载链接。 Demo:否。论文中未提及。 复现材料:否。附录A.1提供了部分实现细节(LoRA配置、卷积核大小、学习率、batch size、混合精度训练等),但未提供代码、配置文件或模型检查点。 论文引用的开源项目或资源链接: CosyVoice: https://github.com/FunAudioLLM/CosyVoice CosyVoice HuggingFace评估页: https://huggingface.co/FunAudioLLM/CosyVoice-300M Spark TTS: https://github.com/SparkAudio/Spark-TTS FireRedTTS(FireRedTTS2): https://github.com/FireRedTeam/FireRedTTS2 IndexTTS2: https://github.com/IndexTeam/IndexTTS2 Llasa: https://github.com/LlasaTeam/Llasa VoxCPM: https://github.com/VoxCMTeam/VoxCPM DiTAR: https://github.com/DiTAR-project/DiTAR MaskGCT: https://github.com/open-mmlab/Amphion/tree/main/models/tts/maskgct E2 TTS: https://github.com/SWivid/E2-TTS F5-TTS: https://github.com/SWivid/F5-TTS Whisper: https://github.com/openai/whisper faster-whisper: https://github.com/SYSTRAN/faster-whisper WavLM: https://github.com/microsoft/unilm/tree/master/wavlm SpeechMOS (UTMOS): https://github.com/tarepan/SpeechMOS LoRA (Hu et al., 2022): https://github.com/microsoft/LoRA Conformer (Gulati et al., 2020): 未提供单独开源链接(通常指ESPnet等实现) 🏗️ 方法概述和架构 DELTA-TTS的整体流程是一个将预训练AR TTS模型转换为离散扩散语言模型(dLLM)的框架。其核心思想是冻结原AR模型的主体参数,仅通过添加少量可训练模块来改变其生成范式。输入为标准零样本TTS输入(文本、提示语音等),输出为目标语音波形。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 379 words

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

📄 Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition #语音识别 #多语言 #低资源 #迁移学习 #参数高效微调 #自监督学习 6.5/10 | 创新 1/2 | 严谨 1.5/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.5/10 | 前50% | #语音识别 | #迁移学习 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Andrei Florian(Princeton University) 通讯作者:Andrei Florian(Princeton University)、Happy Buzaaba(Princeton University) 作者列表:Andrei Florian(Princeton University)、Cynthia Jayne Amol(Maseno University)、Hope Kerubo Ombaba(Maseno University)、Xiaoyu Cui(Princeton University)、Boniface Mwau(Maseno University)、Biatus Maina Kamau(Maseno University)、Lilian Diana Awuor Wanzare(Maseno University)、Christiane Fellbaum(Princeton University)、Happy Buzaaba(Princeton University) 💡 毒舌点评 这是一篇经典的"证伪"论文,作者严谨地证明了在小模型上成立的假设,在大模型上并不成立。六因素受控实验设计堪称方法论范本,但结论的毁灭性力量也扫到了论文自身的价值:如果语言相关性完全没用,那告诉社区此路不通的功劳,能换来多大影响?更致命的是,它只告诉你船漏了,却没给新船。纯负面结果的研究,在顶会博弈中注定处于弱势。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 353 words

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

📄 Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion #语音识别 #多任务学习 #多模态模型 #低资源 #自监督学习 5.8/10 | 创新 0.8/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 📝 5.8/10 | 前50% | #语音识别 | #多任务学习 | #多模态模型 #低资源 | arxiv 👥 作者与机构 第一作者:Saurabh Kumar(印度科学理工学院电气工程系) 第二作者:Amartyaveer(印度科学理工学院电气工程系) 第三作者/通讯作者:Prasanta Kumar Ghosh(印度科学理工学院电气工程系,邮箱 prasantag@gmail.com) 💡 毒舌点评 本文用“即插即用”的多模态融合模块将方言信息注入ASR,在印度多语言场景下同时刷了DID和ASR的榜。工程集成思路清晰,结果实用。但本质上仍是Conformer、RoBERTa、bottleneck等成熟组件的精巧重组,对“为什么门控融合有效”缺乏深层机理分析,且仅在单一且受限(朗读语音)的数据集上验证,模型泛化性和理论贡献薄弱。更像是一份优秀的实验报告,而非方法学上的突破。 📌 核心摘要 问题:印度语言方言差异显著,现有联合优化语音识别(ASR)与方言识别(DID)的方法存在跷跷板效应,尤其是将方言ID作为硬性文本前缀的方法,在方言预测错误时会严重损害ASR性能。 方法核心:提出多模态特征融合框架,在Conformer ASR编码器之上,以梯度阻断方式接入一个DID模块。该模块利用瓶颈编码器和RoBERTa编码器分别从语音特征和CTC软对齐输出中提取方言线索,经门控机制动态融合并由注意力编码器精炼,最终将获得的方言嵌入拼回ASR主特征流,以软特征方式增强ASR。 创新点:将方言信息从“文本硬条件”转变为“特征软注入”,通过梯度阻断(detach)策略解耦ASR与DID的优化,避免了错误方言预测带来的ASR退化;设计了语音-文本双模态门控融合,自适应挖掘不同模态的方言信息。 主要结果:在RESPIN数据集八种印度语言的33个方言上,ASR-BN-ROB模型取得了平均81.63%的DID准确率,以及4.65%的CER和17.73%的WER,均优于多个强基线。尤其对于DID预测错误的样本,ASR性能相对基线有显著提升。 实际意义:为低资源、多方言的ASR系统提供了一种有效且相对鲁棒的端到端联合优化方案。代码、模型和数据集均已公开,对印度语言语音应用的开发具有直接参考价值。 主要局限性:仅在单一数据集和一种冻结的预训练模型(IndicWav2Vec)上验证;未深入分析门控融合机制的行为和决策过程;缺乏对跨领域、噪声环境及自发性语音的泛化性评估;模型参数量增加,但未与等参模型进行严格对比;未讨论计算开销和推理延迟。 🔗 开源详情 代码:https://github.com/labspire/respin_did_interspeech25.git 模型权重:https://github.com/labspire/respin_did_interspeech25.git(与代码同一仓库) 数据集:RESPIN 数据集,获取链接:https://spiredatasets.ee.iisc.ac.in/respincorpus Demo:未提及 复现材料:论文在第3.2节提供了详细的超参数和实验设置,代码仓库中理应包含训练配置。 论文中引用的开源项目: ESPnet:https://github.com/espnet/espnet.git IndicWav2Vec:https://github.com/AI4Bharat/IndicWav2Vec 未明确列出 RoBERTa 的具体开源实现链接。 🏗️ 方法概述和架构 本文提出一种多任务学习框架,通过多模态特征融合同时优化自动语音识别(ASR)和方言识别(DID)。系统由ASR Block和DID Block两部分组成,其数据流为:输入语音 → SSL前端(IndicWav2Vec) → Conformer编码器 → ASR Block和DID Block并行处理 → DID Block产出的方言嵌入以梯度阻断方式拼回ASR Block → ASR Block内注意力编码器融合 → 混合CTC/Attention解码器输出文本。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 424 words

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

📄 Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR #语音识别 #参数高效微调 #低资源 #自监督学习 7.5/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | #语音识别 | #Adapter | #参数高效微调 #低资源 | arxiv 👥 作者与机构 第一作者:Ho Lam Chung(台湾大学,华硕) 通讯作者:Hung-yi Lee(台湾大学) 作者列表:Ho Lam Chung(台湾大学,华硕)、Yiming Chen(新加坡国立大学)、Dau-Cheng Lyu(华硕)、Hsiao-Tsung Hung(华硕)、Hung-yi Lee(台湾大学) 💡 毒舌点评 这篇论文将连续潜在测试时缩放巧妙地引入冻结ASR骨干网,稳定注入机制的设计颇具匠心,实验覆盖面广、消融充分,证明了在极小数据量下该方法明显优于传统微调。然而,WER的绝对下降幅度仅有千分之一到百分之一量级,实际收益偏薄,且所有实验都基于同一个0.6B的Qwen3-ASR模型,方法的可推广性尚存疑;此外零代码开源,令审稿人对其复现成本深感担忧。 📌 核心摘要 问题:端到端ASR模型一次前向完成转录,无法对困难输入进行额外的“思考”。本文探究能否在冻结ASR骨干网上添加连续的潜在计算环,实现输入依赖的测试时计算分配。 方法核心:LatentASR引入两个可训练模块——Latent Adapter 和 Value Head。Latent Adapter 通过有界循环更新精炼少量潜在前缀嵌入,并采用三种稳定机制(归一化、门控、固定锚点)防止冻结解码器崩溃;Value Head 预测每个话语的潜在计算效用并提前停止循环。 新颖点:不同于在全部参数上微调或修改输入分布,该方法仅训练约4M参数,保持骨干完全冻结,通过受限的、可选的残差更新在连续空间内进行迭代优化,无需中间推理文本。 主要结果:在500条话语的极小训练集下,LatentASR 是唯一不提升WER的方法,在 FLEURS (en_us) 上相对WER降低2.54% (4.900→4.776),VoxPopuli (en) 降低0.47% (9.038→8.995);口音/语码切换 (ASCEND) 上相对CER降低16.0% (57.81→48.55);在30种语言的多语言评估中WER均匀下降,无过拟合。 实际意义:提供了一种无需修改预训练ASR骨干即可为其注入自适应计算量的方法,可将固定算力转变为按需分配的软调度。 主要局限:干净语音上的绝对提升很小,方法对激活集大小和构成敏感(最优窗口仅500条),未见在更大ASR模型上的验证,零开源降低了即时工业采纳的可能性,且未探讨流式/实时场景的可行性。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及模型权重的发布链接(如 HuggingFace 或 ModelScope) 数据集:训练使用 500 条混合样本,来源于以下公开数据集: Common Voice 16.0 FLEURS VoxPopuli LibriSpeech GigaSpeech The People’s Speech ASCEND 上述数据集均为公开可获取的研究语料,但论文未给出具体下载链接或预处理脚本的仓库地址。 Demo:论文中未提及 复现材料:论文中未提及提供训练配置、检查点或补充附录等专门复现材料;训练细节(优化器、超参数、数据构造原则)在正文第 4.1 节有描述,但未指向独立的配置文件或代码仓库。 论文中引用的开源项目: Whisper (Radford et al.) —— 原始模型为 OpenAI 发布,未提供链接,通常获取方式为 GitHub: https://github.com/openai/whisper OWSM v4 —— 基于 ESPnet 的开源语音模型,通常获取方式为 GitHub: https://github.com/espnet/espnet Qwen3-ASR (0.6B) —— 论文中作为基础模型,技术报告为 arXiv:2601.21337,未给出权重链接;通常可通过 HuggingFace 或 ModelScope 获取 Coconut (Hao et al.) —— 论文 arXiv:2412.06769,未提供项目链接 Quiet-STaR (Zelikman et al.) —— 论文 arXiv:2403.09629,未提供项目链接 Pause tokens (Goyal et al.) —— 论文发表于 ICLR 2024,未提供项目链接 (注:以上仅列出在论文中被直接引用且涉及开源工具/模型的条目,无具体链接指向作者提供的仓库时,给出常见获取渠道;没有提及的项目则写“未提及”) 🏗️ 方法概述和架构 LatentASR 在完全冻结的编码器‑解码器ASR骨干上叠加两个轻量可训练模块:Latent Adapter 和 Value Head。整体流程:给定语音a,编码器输出声学状态Z并传入解码器;在解码器输入的系统提示与需转录的文本之间,插入N个隐式前缀位置(不产生任何文本token)。Latent Adapter 逐个位置对这些隐式嵌入进行迭代精炼,Value Head 监控解码器隐状态,判断是否继续或提前停止循环。若Value Head在起始锚点判定无益,则全跳过N步,直接回退到冻结基线的输出;否则逐步执行,并可在中间任意步停下。 ...

2026-07-07 · 更新于 2026-07-24 · 4 min · 756 words

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

📄 QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition #语音识别 #课程学习 #低资源 #多语言 #领域适应 6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6/10 | 前50% | #语音识别 | #课程学习 | #低资源 #多语言 | arxiv 👥 作者与机构 第一作者:Yishun Li(The University of Western Australia) 通讯作者:Ting Dang(The University of Western Australia) 作者列表:Yishun Li¹, Yang Xiao¹, Gongping Huang², Eun-Jung Holden¹, Nick Thieberger¹, Ting Dang¹ 机构标注:¹ The University of Western Australia;² 未明确标注(非UWA) 💡 毒舌点评 本文为太平洋土著语言 ASR 提供了首个系统性的数据质量诊断框架,将声学、转录与对齐三维度融合并校准样本权重,思路清晰且实验在设计上有一定洞察力。然而,所有实验固守于四个极小、封闭的 PARADISEC 语种且无一开源,使得方法的可复现性与推广性大打折扣,更像一次成功的小范围探索而非可落地的方案。更致命的是,论文完全回避了与任何已有的困难感知训练策略(如 Focal Loss、SuperLoss)的对比,方法论上的独特性存疑。 ...

2026-07-07 · 更新于 2026-07-24 · 5 min · 864 words

Reinforcement Learning for Data-Efficient Code-Switched ASR

📄 Reinforcement Learning for Data-Efficient Code-Switched ASR #语音识别 #强化学习 #语音大模型 #低资源 5.3/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.5/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.8/1.5 📝 5.3/10 | 后50% | #语音识别 | #强化学习 | #语音大模型 #低资源 | arxiv 👥 作者与机构 第一作者:Ziwei Ye(独立研究者,Independent Researcher) 第二作者:Peter Vickers(Spotify Canada) 通讯作者:未明确指定(根据作者信息,一作邮箱 zxy1677@rit.edu,二作邮箱 pvickers@spotify.com) 💡 毒舌点评 这篇论文将RLVR这个现成的优化范式移植到代码切换ASR,并搭配了两个直截了当的奖励函数和一个两步“草稿-修正”流程。效果很直观:用更少的数据,打平甚至超越了全量数据训练的SFT基线,尤其是在那些SFT极易“崩溃”为单一语言的远距离语言对上,CER和脚本污染的降低十分亮眼。然而,惊艳的数据效率背后,是方法新颖性的薄弱——这本质上是一个组合式的工作,核心组件(GRPO、两阶段解码)均非原创。更关键的是,实验设计为了追求控制变量而牺牲了外部可信度:基线单一、泛化性存疑、统计显著性缺失,让它看起来更像一份架构完善的内部技术验证报告,而非一个能被社区广泛采纳的通用方案。 📌 核心摘要 这篇论文提出了一种基于可验证奖励的强化学习微调方法,旨在实现语音大模型在代码切换自动语音识别任务上的数据高效适配。针对语音大模型在处理代码切换语音时出现的语言混淆、脚本污染和曝光偏差问题,作者将ASR任务形式化为一个可验证奖励问题,并采用组相对策略优化进行策略优化。该方法的核心在于三个组件的协同设计:1)一个组合奖励函数,同时优化字符错误率和脚本保真度,以直接提升转录准确性与书写系统正确性;2)一个训练时的“两阶段草稿与修正”流程,通过将模型的最佳初稿作为条件输入进行二次解码,鼓励模型内化自我纠错能力。 实验以 Qwen2-Audio-7B 作为受控测试平台,在 CS-FLEURS XTTS-Train 的合成语音上,选取 10 个 X-to-英语语言对进行训练。核心结论如下:仅使用 10% 的训练数据时,RLVR 在 CS-FLEURS read_test 上的微平均 CER 为 0.155,与使用全量数据训练的 LoRA SFT 的 0.159 性能相当;当使用 20% 的数据时,RLVR 的微平均 CER 达到 0.147,明显超越了全量数据的 LoRA SFT。这种性能优势还能零样本迁移到真实人类录制的 SwitchLingua 数据集上。 ...

2026-07-07 · 更新于 2026-07-24 · 3 min · 634 words

S-DiverSe: Spanish Diverse Speech

📄 S-DiverSe: Spanish Diverse Speech #语音识别 #低资源 #参数高效微调 5.8/10 | 创新 0.9/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.8/10 | 前50% | #语音识别 | #参数高效微调 | #低资源 | arxiv 👥 作者与机构 第一作者:Fernando López(Scientific Research, Telefónica Innovación Digital, Spain) 通讯作者:论文中仅给出第一作者邮箱 fernando.lopez@telefonica.com,未明确标注通讯作者,故推断 Fernando López 同为通讯作者。 作者列表:Fernando López(Scientific Research, Telefónica Innovación Digital, Spain)、Fernando Ibañez(机构未在作者列表中明确说明,根据论文开头推断可能同属 Telefónica 或 UAM)、Ana Martínez(同前)、Iván Alonso(同前)、Pablo Gómez(同前)、Santosh Kesiraju(Brno University of Technology, Czech Republic)、Jordi Luque(论文开头列有 Universidad Autónoma de Madrid, Spain 和 Telefónica Innovación Digital, Spain,具体归属未按作者逐一说明,仅在首页底部笼统标注了三个机构)。 💡 毒舌点评 这篇论文做了一件对西班牙语病理语音社区来说"有总比没有强"的工作——构建了首个多疾病、真实场景(in-the-wild)的西班牙语病理语音数据集,并发现了一个有趣的反直觉结论:简单的规则后处理比昂贵的参数微调更鲁棒。然而,这3.2小时、22个说话人的袖珍语料库,无论作者如何辩解"与其他语料库规模相当"都显得苍白。实验部分对PD/ALS/中风三种疾病的对比分析严重缺位,中风数据仅占5.8%却撑起了"多疾病"的旗帜,Whisper微调后WER飙升至125%的灾难性结果也缺乏深入诊断和解释。更关键的是,“后处理优于微调"这一核心卖点,在如此小的数据规模下更像是对过拟合的另类证明,其可推广性值得打上一个大大的问号。 ...

2026-07-07 · 更新于 2026-07-24 · 3 min · 470 words

Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

📄 Towards Digital Preservation of Efik: TTS for a Low-Resource African Language #语音合成 #低资源 #多语言 #模型比较 4/10 | 创新 0.2/2 | 严谨 0.4/1.5 | 实验 0.5/1.5 | 清晰 0.7/1 | 影响 0.7/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 📝 4/10 | 后50% | #语音合成 | #低资源 | #多语言 #模型比较 | arxiv 👥 作者与机构 第一作者:Offiong Bassey Edet(University of Cross River State, Nigeria / ML Collective) 通讯作者:未说明 作者列表:Offiong Bassey Edet(University of Cross River State, Nigeria / ML Collective)、Emmanuel Oyo-Ita(University of Cross River State, Nigeria)、Archibong Okon Archibong(University of Calabar, Nigeria)、David Effanga Bassey(University of Calabar, Nigeria)、Mbuotidem Sunday Awak(ML Collective) 💡 毒舌点评 本文为濒危语言Efik贡献了首个TTS基线数据集,由尼日利亚本土团队主导,在语言多样性保护方面值得肯定。然而,作为一篇意图冲击顶会的论文,其技术贡献约等于零:仅仅是在一种新语言上对四个开源模型跑了通标准的微调流程,然后让5个人打了个MOS分。论文没有提出任何针对声调语言的架构设计或训练范式创新,评测体系极其单薄且缺乏客观指标,对于声调语言的建模根本性问题(如无音调标注的G2P如何定义)采取了近乎回避的态度。整体而言,这项工作是一份合格的语种应用报告,但离顶会所要求的方法学深度相去甚远。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 290 words

语音/音乐/音频论文速递 2026-07-07

语音/音乐/音频论文速递 2026-07-07 共分析 58 篇论文 ⚡ 今日概览 📥 抓取 58 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 11篇 ███████████ #语音伪造检测 5篇 █████ #音频理解 4篇 ████ #语音交互 3篇 ███ #音频事件检测 3篇 ███ #语音转换 3篇 ███ #音视频理解 3篇 ███ #语音合成 3篇 ███ 📊 论文评分排行榜(58 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1分 前10% #音频检索 🥈 SPEARBench: A Benchmark for Naturalness Evaluation in S 8.9分 前25% #语音交互 🥉 Metronome: Bound the Cache, Keep the Beat for Real-Time 8.7分 前25% #语音交互 4. Auto-AEG: Scalable Data Construction for Open-Vocabular 8.3分 前25% #音频事件检测 5. RABBiT: Rapidly adaptive BOLD foundation model via brai 8.1分 前25% #音频理解 6. TRACE-EVC: Text-Guided Relative Affective Control for Z 8.0分 前25% #语音转换 7. Parallelized Autoregressive Decoding for Omni-Modal Den 8.0分 前25% #音视频理解 8. Speaker-Disentangled Chunk-Wise Regression for Syllabic 7.9分 前25% #语音编码 9. Speaker-Aware Temporal Aggregation Strategies on Segmen 7.9分 前25% #语音属性识别 10. REDDIT: Correcting Model-Generated Timestamp Drift in A 7.8分 前25% #语音识别 11. Deriving Benchmarking Datasets from Long-Form Recording 7.7分 前25% #基准测试 12. ProPS: Prompted Profile Synthesis for Natural Language- 7.6分 前25% #语音合成 13. DELTA-TTS: Adapting Autoregressive Model into Diffusion 7.5分 前25% #语音合成 14. TokAN: Accent Normalization Using Self-Supervised Speec 7.5分 前25% #语音转换 15. Listen, Think, Transcribe: Continuous Latent Test-Time 7.5分 前25% #语音识别 16. \(C^3\)ASD: Multi-Level Consistency-Driven Representation 7.5分 前25% #音视频理解 17. Training-Free Model Selection and Domain-Aware Score Ca 7.3分 前50% #音频事件检测 18. CHILDES-Aligned: A Curated Children's Speech Datase 7.2分 前50% #语音识别 19. Taste-aware music retrieval from audio embeddings 6.9分 前50% #音乐检索 20. Lights, Camera, Carbon: Architectural Scaling Laws for 6.9分 前50% #音视频生成 21. Unified Audio Intelligence Without Regressing on Text I 6.8分 前50% #音频交互 22. Ranking the Impact of Contextual Specialization in Neur 6.7分 前50% #语音增强 23. SynSFX: Multi-Model Sound Effects Synthesis Dataset for 6.5分 前50% #音频伪造检测 24. Evaluating the Effect of Linguistic Relatedness on Cros 6.5分 前50% #语音识别 25. MOSAIC: Interpretable Multi-Token Cross-Attention of Bi 6.3分 前50% #语音伪造检测 26. CARD: Cross-component Audio Representation Distillation 6.3分 前50% #音频字幕生成 27. Probing Low-Level Acoustic Attribute Encoding in CLAP A 6.2分 前50% #音频理解 28. Trajectory Variance: AnUnsupervised Measure of Developm 6.2分 前50% #音频理解 29. Adaptive Diversity-Uncertainty Active Learning with Red 6.2分 前50% #音频事件检测 30. Adaptive Loss Balancing for Multi-Task Bioacoustic Clas 6.1分 前50% #音频分类 31. An Intervention-Based Framework for Shortcut Diagnosis 6.1分 前50% #语音伪造检测 32. QuaSR: Quality-Aware Sample Reweighting for Pacific Ind 6.0分 前50% #语音识别 33. CaReCoS: A Spectrogram based Visual Benchmark for Cardi 6.0分 前50% #音频理解 34. Open-Set Source Tracing as Compositional Factors via St 6.0分 前50% #语音伪造检测 35. Context-Aware ASR for Mandarin Technical Lectures 6.0分 前50% #语音识别 36. Streaming Neural Speech Codecs through Time-Invariant R 6.0分 前50% #语音编码 37. Physiological Noise Augmentation Improves Non-Invasive 6.0分 前50% #语音识别 38. DuplexChat: Constructing Speaker-Separated Full-Duplex 5.9分 前50% #语音交互 39. Noisy Environment Adaptation of Neural Speech Codec via 5.9分 前50% #语音增强 40. NouveauVoice: Generating Novel Pseudo Speakers for Voic 5.9分 前50% #语音转换 41. OmniFocus: Query-Guided Modality-Balanced Token Compres 5.9分 前50% #音视频问答 42. Jointly Improving Dialect Identification and ASR in Ind 5.8分 前50% #语音识别 43. S-DiverSe: Spanish Diverse Speech 5.8分 前50% #语音识别 44. Towards Robust Uncertainty-Aware Speaker Modeling 5.7分 前50% #说话人验证 45. Towards Language-Agnostic Speech Inversion 5.6分 前50% #语音属性识别 46. Layer-wise Cross-Lingual Depression Detection from Spee 5.5分 前50% #语音情感识别 47. Wan-Streamer v0.2: Higher Resolution, Same Latency 5.4分 后50% #音视频交互 48. Mixture-Constrained Max Pooling Improves Separation-Bas 5.3分 后50% #音频分类 49. Reinforcement Learning for Data-Efficient Code-Switched 5.3分 后50% #语音识别 50. Physics-Informed Direction-of-Arrival Estimation Over D 5.3分 后50% #声源定位 51. Sampling Bias Compensation for Robust Evaluation of Aud 4.9分 后50% #音频分类 52. UniSkip-Mamba: A Frequency-Aware State Space Model for 4.8分 后50% #音视频理解 53. Progressive Refinement: An Iterative Pseudo-Labeling Ap 4.6分 后50% #语音识别 54. Weakly Guided and Autoregressive Beamformer Parameteriz 4.3分 后50% #语音分离 55. DETECT-3B-Omni is Agnostic of Content and Demographics 4.2分 后50% #语音伪造检测 56. Towards Digital Preservation of Efik: TTS for a Low-Res 4.0分 后50% #语音合成 57. Quantum-Inspired Harmonic Decision Models: A Computatio 2.3分 后50% #音乐生成 58. Information-Geometric Superposed Vowel Evaluation: Part 1.9分 后50% #语音伪造检测 📋 论文列表 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ...

2026-07-07 · 更新于 2026-07-24 · 47 min · 9986 words

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

📄 A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation #音频分离 #数据集 #低资源 #数据清洗 9.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 9.2/10 | 前10% | #音频分离 | #数据集 | #低资源 #数据清洗 | arxiv 👥 作者与机构 第一作者:Kai Li(清华大学计算机系 / IDG/McGovern Institute for Brain Research, 清华大学)、Jintao Cheng(清华大学计算机系)(*共同第一) 通讯作者:Xiaolin Hu(清华大学计算机系 / IDG/McGovern Institute for Brain Research / 中国脑与认知科学研究所 (CIBR)) 作者列表:Kai Li, Jintao Cheng, Chang Zeng (Shanda AI Research Tokyo), Zijun Yan (清华大学), Helin Wang (Johns Hopkins University), Zixiong Su (Shanda AI Research Tokyo), Bo Zheng (Shanda AI Research Tokyo), Xiaolin Hu (清华大学) 💡 毒舌点评 这篇论文用一个精心设计的数据清洗管道,优雅地证明了“数据纯度远比数据规模重要”这一反直觉结论——Hive 仅凭 0.2% 的训练数据量,就让模型在多项指标上媲美甚至超越百万小时级的 SAM-Audio,说服力极强。但管道核心的语义对齐和兼容性判断完全依赖 Qwen3-Omni 零样本能力,这种对单一黑盒模型的深度绑定,可能让数据集系统性地继承了该模型的偏见,而作者对这种“近亲繁殖”风险的审计仍显不足。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 735 words