语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-08-14 · 20 min · 4212 words

Speaker Role and Language Diarization for Analyzing Multilingual Interviews for Language Proficiency of Older Adults

📄 Speaker Role and Language Diarization for Analyzing Multilingual Interviews for Language Proficiency of Older Adults 标签:#说话人日志 #语音大模型 #参数高效微调 #多语言 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #说话人日志 | #语音大模型 | #参数高效微调 #多语言 | arxiv 👥 作者与机构 第一作者:Anfeng Xu(南加州大学 Viterbi 工程学院) 通讯作者:Anfeng Xu(南加州大学 Viterbi 工程学院;邮箱 anfengxu@usc.edu;主页 https://anfengxu136.github.io/) 全部作者:Anfeng Xu、Tiantian Feng、Kevin Huang、Sudarsana Kadiri、Shrikanth Narayanan(南加州大学 Viterbi 工程学院);Pranali Khobragade、Anushikha Dhankhar、Sarah Gao、Jinkook Lee(南加州大学经济与社会研究中心);Madeleine Snider、Miguel Arce Rentería(哥伦比亚大学欧文医学中心) 💡 毒舌点评 该文把说话人角色日志、语言日志和熟练度评估串成一条面向印度多语言老年访谈的自动分析流水线,数据来自真实 LASI-DAD 项目,方向务实。但语言日志的绝对性能仍然偏低,最佳自动 VAD 条件下语言混淆率约 25%,且系统只与 Whisper-Original 做内部对比,没有与 Pyannote、ariZen 等现有日志系统、也没有与已有口语熟练度评估系统进行外部比较,实验说服力受限。若能把 Telugu 标注一致性问题解决,并公开标注协议和代码,该工作的参考价值会明显提升。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 632 words

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

📄 SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages 标签:#语音识别 #语音大模型 #多语言 #低资源 #自监督学习 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:模型报告 | 评分置信度:高 | #语音识别 | #语音大模型 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Sujith Pulikodan(SPIRE Lab, Indian Institute of Science (IISc); ARTPARK@IISc) 通讯作者:未说明(论文未标注通讯作者;正文仅出现联系邮箱 sujith@artpark.in) 作者列表:Sujith Pulikodan(SPIRE Lab, IISc; ARTPARK@IISc)、Agneedh Basu(SPIRE Lab, IISc; ARTPARK@IISc)、Pavan Kumar J(SPIRE Lab, IISc; ARTPARK@IISc)、Pranav D Bhat(SPIRE Lab, IISc; ARTPARK@IISc)、Suryansh Shukla(SPIRE Lab, IISc; ARTPARK@IISc)、Nihar Desai(SPIRE Lab, IISc; ARTPARK@IISc)、Prasanta Kumar Ghosh(SPIRE Lab, IISc; ARTPARK@IISc) 💡 毒舌点评 覆盖 65 种印度语言、其中 44 种没有任何竞品支持,并公开模型权重,这确实是目前多语言印度 ASR 里少见的“广度优先”工作;但被列为核心贡献的音频–图像对齐阶段没有做任何消融,导致“该阶段提升低资源语言识别”这一声明缺乏可归因证据。另一个隐蔽问题是低资源语言的测试几乎全部来自与训练同分布的 VAANI,因此实际跨域泛化能力可能被明显高估。此外,论文对自己的最强卖点“44 种独有语言”也处理得很粗放:32 个可用测试切片中有 23 个不足 30 分钟,部分语言只有约 6 分钟测试音频,个别 WER 数字的置信区间实际上非常宽。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 1029 words

From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

📄 From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music 标签:#音乐理解 #大语言模型 #多语言 #模型评估 5.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.5/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #音乐理解 | #大语言模型 | #多语言 #模型评估 | arxiv 👥 作者与机构 第一作者:Sangheon Park(佐治亚理工学院) 通讯作者:未说明 作者列表:Sangheon Park(佐治亚理工学院)、Claire Arthur(佐治亚理工学院) 💡 毒舌点评 论文用人工构建的 taxonomy 加双语自由描述数据,把“提示词语言”和“聆听描述语言”之间的结构性差异刻画得很清楚,Genre 可传播、Story/Narrative 高密度错位的发现对 TTM 交互设计有实际参考价值。但几乎所有关键结论都建立在单一 TTM 系统 Udio 和一个被试招募渠道不一致的中英样本上,作者却把“narrative 无法被声学编码”说成了生成系统的一般性缺陷,因果断言超过数据能支撑的范围。更扎眼的是,跨文化 presence 分析报告的 OR 值全部小于 1,正文却写韩语组“more”,编码方向没有交代清楚,读者无法判断结论是否与数据一致。如果能加入多系统生成对照、同一提示词的人工重写实验,并补充人类标注一致性指标,结论会扎实很多。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 802 words

语音/音乐/音频论文速递 2026-08-10

语音/音乐/音频论文速递 2026-08-10 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 2篇 ██ #音乐理解 2篇 ██ #音频伪造检测 2篇 ██ #音频生成 2篇 ██ #多模态模型 1篇 █ #歌唱生成 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 How Much AI Is in This Track? Quantifying the Proportio 8.3分 前25% 方法研究 #音频伪造检测 🥈 Objects as Audio-Visual Modal Sound Fields 7.6分 前25% 方法研究 #音频生成 🥉 StreamArena: Toward Continuous, Interactive, and Long-H 7.6分 前25% 数据集与基准 #多模态模型 4. Frame-Level Pansori Mode Classification with Complement 7.6分 前25% 数据集与基准 #音乐理解 5. Multi Codec Discrete Diffusion Model for Text Guided Sp 7.3分 前50% 方法研究 #语音编辑 6. MI-MIDI: Mechanistic Interpretability of Text-to-MIDI G 7.1分 前50% 方法研究 #音乐生成 7. SemBridge: Semantic Token Anchoring for Continuous-Late 7.0分 前50% 方法研究 #语音合成 8. Do Audio Language Models Use Paralinguistic Evidence? C 6.9分 前50% 数据集与基准 #语音情感识别 9. Separating Decision-Rule Misalignment from Readout-Cove 6.8分 前50% 方法研究 #语音情感识别 10. MMAG: A Multi-Control Mixed Audio Generation Benchmark 6.8分 前50% 数据集与基准 #音频生成 11. Assessing AI-generated music detection in real-world br 6.8分 前50% 数据集与基准 #音频伪造检测 12. LSEAD: A Privacy-Preserving LLM-Based Speech Analysis F 6.6分 前50% 系统技术报告 #语音识别 13. Cloud-Boosted Low-Compute Multi-Channel Speech Enhancem 6.0分 前50% 方法研究 #语音增强 14. Shape Your Feed: An LLM-based Agentic System for Conver 5.7分 前50% 系统技术报告 #音视频交互 15. From Prompting to Describing: A Cross-Cultural Study of 5.5分 前50% 应用研究 #音乐理解 16. Beyond Call and Response: Modelling Reciprocal Coordina 5.5分 前50% 方法研究 #歌唱生成 📋 论文列表 🥇 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-10 · 更新于 2026-08-14 · 14 min · 2864 words

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

📄 Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors 标签:#语音质量评估 #Transformer #可解释性 #模型评估 #多语言 6.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音质量评估 | #Transformer | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Arya Labroo(未说明) 通讯作者:未说明 作者列表:Arya Labroo(未说明)、Mengjie Qian(未说明)、Kate Knill(未说明) 💡 毒舌点评 把CAV/SAE这套可解释性工具搬到L2口语自动评分偏置审计上,“概念可恢复不等于概念影响分数”与“SAE的重建目标会稀释梯度敏感性”都是很有信息量的负结果。但四个探针点全部位于两个评分器的回归头内部,并未触达BERT/Whisper主干Transformer层;核心代码、模型权重与训练超参一律未开放,SAE也只给出m/k/稀疏度这类结构配置,读者很难判断“SAE导致Bgr衰减”究竟是方法固有缺陷还是实现局限性。 ...

2026-08-07 · 更新于 2026-08-14 · 2 min · 274 words

Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI

📄 Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI 标签:#语音识别 #Transformer #低资源 #多语言 #音频理解 7.8/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前25% | 文档类型:理论研究 | 评分置信度:中 | #语音识别 | #Transformer | #低资源 #多语言 | arxiv 👥 作者与机构 第一作者:Jay L. Cunningham(DePaul University, School of Computing, RAISE Lab, USA;jcunni37@depaul.edu) 通讯作者:未标注 作者列表: Jay L. Cunningham(DePaul University, School of Computing, RAISE Lab, USA;jcunni37@depaul.edu) Mark Atta Mensah(York University, Electrical Engineering and Computer Science, Canada;mamensah@yorku.ca) Richard Martinez(Independent Researcher, USA;martinezrichardme@gmail.com) João Vieira da Silva Neto(DePaul University, School of Computing, RAISE Lab, USA;jvieirad@depaul.edu) Efi Dawodu(DePaul University, School of Computing, RAISE Lab, USA;edawodu@depaul.edu) 💡 毒舌点评 一篇题为“去殖民化”的论文,落地时却几乎全靠概念装置:七层模型、3M伤害分类、四支柱框架,术语琳琅满目,唯独缺少作者自己承认的那个东西——实验。通篇以“殖民语言等级”“结构暴力”为批判矛头,但给出的药方是一个“最低审计协议”式的未来待办清单;没有新架构、没有基准、没有代码,甚至连一个示范性审计都没有。用它自己的话说,这是“诊断地图”,可地图画得再细,不迈出一步也到不了任何地方。更讽刺的是,论文批评WER意识形态,却拿不出任何替代性的量化验证;批评北美机构特权,却由北美大学机构和独立研究员用英语发表。5.1分不算冤枉:批判性有余,而工程与验证几乎缺席。 ...

2026-08-07 · 更新于 2026-08-14 · 1 min · 183 words

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

📄 Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders 标签:#语音翻译 #语音大模型 #端到端 #课程学习 #多语言 8.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音翻译 | #语音大模型 | #端到端 #课程学习 | arxiv 👥 作者与机构 第一作者:Yexing Du(机构未说明;论文标注为 1,2) 通讯作者:论文未注明通讯作者 作者列表: Yexing Du(机构未说明;标注 1,2) Kaiyuan Liu(机构未说明;标注 1,2) Youcheng Pan(机构未说明;标注 2) Bo Yang(机构未说明;标注 2) Chengpeng Fu(机构未说明;标注 1,2) Yu Wang(机构未说明;标注 2) Ming Liu(机构未说明;标注 1,2) 说明:论文只给出作者单位编号 1 和 2,没有提供单位名称,因此无法确认具体机构。 💡 毒舌点评 用“冻结高资源专家 + 可训练中低资源专家”的方式把资源分层直接做进语音编码器,思路不算复杂,但确实直击共享编码器的容量竞争问题,45 语言全方向评测的工程量也值得肯定。不过“打破多语言诅咒”这个结论仍偏强:MoSE 本质上只是按人工资源等级把模型容量切成两半,缺少参数匹配对照、显著性检验和更精细的资源分组依据,效果有多少来自路由、多少来自直接翻倍编码器参数,论文并没有彻底说清。全方向 1,980 个翻译方向的主结果表也只给出聚合分布与代表方向,逐方向失败模式仍未充分暴露。 ...

2026-08-06 · 更新于 2026-08-14 · 8 min · 1514 words

Crowdsourced Multilingual Speech Intelligibility Testing

📄 Crowdsourced Multilingual Speech Intelligibility Testing 标签:#语音质量评估 #端到端 #多语言 #基准测试 #数据集 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音质量评估 | #端到端 | #多语言 #基准测试 | arxiv 👥 作者与机构 第一作者:Laura Lechler(所属机构未说明) 通讯作者:未说明 作者列表:Laura Lechler(未说明)、Kamil Wojcicki(未说明) 💡 毒舌点评 这篇工作把经典的 DRT 诊断押韵测试搬上众包平台,并实打实公开了五种语言的有声测试材料,弥补了多语言可懂度评测资源长期缺失的空白,工程执行力值得肯定。但实验设计整体偏“验证流程可用性”而非“建立高灵敏度评测方法”,缺少噪声条件下的系统对比和更强基线,结论的说服力仍显单薄。 📌 核心摘要 该论文提出了一种基于 DRT(诊断押韵测试)的多语言众包语音可懂度评估方法,核心贡献是公开英语、德语、西班牙语、法语和普通话五种语言的词表与 16 kHz 录音语料。方法上,作者将众包质量控制流程(预筛、听力筛查、练习轮、验证题、事后过滤)适配到可懂度测试场景,并采用文件级而非听众级计分来支持按音素/特征细粒度分析。较之以往以转写任务为主的众包可懂度测试,该方法采用封闭二选一判别任务,规避了拼写错误和记忆效应,测试时间更短、更适合大规模部署。实验一显示,西班牙语众包组在 NB PCMU 条件下比 WB 参考低 4.3 分,而内部专家组差异不显著;实验二重复测试相关系数为 0.87 与 0.86,跨人群复测无显著差异。实验三在 AMR 码本对比中复现了 ITU 实验室的下降趋势,按区别特征的相关性达到 0.86/0.94。实验四显示 PCMU 在五种语言的辅音 DRT 中普遍造成约 4-5 分的显著下降,中文声调 DRT 则无显著变化。该测试方案对语音编解码和语音增强算法的快速迭代评估具有明确实用价值,但目前仍缺少噪声提升灵敏度的系统性验证,且测试软件尚未完全开源。 ...

2026-08-06 · 更新于 2026-08-14 · 3 min · 560 words

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

📄 MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages 标签:#语音属性识别 #LoRA #多语言 #预训练 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.5/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #语音属性识别 | #LoRA | #多语言 #预训练 | arxiv 👥 作者与机构 第一作者:未说明。论文按 MERaLiON Team 字母顺序署名,无法据此认定第一作者。 通讯作者:Qiongqiong Wang(wang_qiongqiong@a-star.edu.sg) 作者列表(论文 Section 8,字母序):Aw Ai Ti、Chen Fang Yih Nancy、Chiu Ying Lay、Ding Yang、He Yingxu、Jiang Ridong、Liu Zhuohan、Lu Yanfeng、Ma Yi、Muhammad Huzaifah Bin Md Shahrin、Nabilah Binte Md Johan、Nattadaporn Lertcheva、Pham Minh Duc、Sailor Hardik Bhupendra、Siti Umairah Binte Mohammad Salleh、Sun Shuo、Tarun Kumar Vangani、Wang Qiongqiong、Wong Heng Meng Jeremy、Wu Jinyang、Zhang Longyin 机构:Institute of Advanced Intelligence and Computing (IAIC), A*STAR, Singapore 💡 毒舌点评 把 LoRA 微调的大 Conformer 与 ECAPA-TDNN 下游网络拼起来做性别识别,系统集成和评测覆盖度确实比一般任务报告完整,模型权重和 demo 也开放了。但方法本身没有提出新的学习范式或模型模块,缺少消融、缺少统计显著性检验、缺少模型规模与推理效率数据,训练数据和内部评测集也不开放。所谓“consistent surpasses SOTA”实际是 15 个测试集上 12 胜、1 平、2 负,只能算限定条件下的工程优势,不能被视为方法层面的突破。 ...

2026-08-06 · 更新于 2026-08-14 · 5 min · 933 words