研究条目

语音/音乐/音频论文速递 2026-08-11

语音/音乐/音频论文速递 2026-08-11 共分析 40 篇论文 ⚡ 今日概览 📥 抓取 40 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 4篇 ████ #音频生成 4篇 ████ #音乐生成 3篇 ███ #音频字幕生成 3篇 ███ #声源定位 2篇 ██ #语音合成 2篇 ██ #语音情感识别 2篇 ██ #语音编码 2篇 ██ 📊 论文评分排行榜(40 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detai 8.4分 前25% 方法研究 #音频字幕生成 🥈 Deferred Audio Pruning with Local Audio-Visual Dynamics 8.4分 前25% 方法研究 #模型剪枝 🥉 PACE: A Playback-Aligned Context Engine for LLM-Based F 8.0分 前25% 系统技术报告 #语音交互 4. REFRAMED: Towards Realistic Audio Description Generatio 8.0分 前25% 数据集与基准 #音频字幕生成 5. SraVaani 1.0: Scaling Inclusive Speech Recognition for 7.9分 前25% 模型报告 #语音识别 6. AudioMap: Cloze-and-Choice Reinforcement Learning for T 7.9分 前25% 方法研究 #音频字幕生成 7. SAMOT: State-Aware Step Modulation and Optimal Transpor 7.7分 前25% 方法研究 #音视频理解 8. ReLMCodec: Designing Predictable Speech Tokens from Pre 7.7分 前25% 方法研究 #语音编码 9. VoxZip: Semantic-Anchored Temporal KV Cache Compression 7.7分 前25% 方法研究 #音频理解 10. Steering dense music retrieval with open-vocabulary con 7.7分 前25% 方法研究 #音乐检索 11. VIOLET: High-Fidelity Violin Synthesis with Techniques 7.6分 前25% 方法研究 #音乐生成 12. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified 7.6分 前25% 模型报告 #音频生成 13. Beyond Reconstruction: Full-Context Generative DiT for 7.5分 前25% 系统技术报告 #音乐生成 14. From Inaudible Inputs to Model Failures: Low-Frequency 7.4分 前50% 方法研究 #音频理解 15. Beyond Piano: Cross-Instrument MIDI Velocity Estimation 7.3分 前50% 方法研究 #音乐理解 16. omni-macos: On-Device Omni-Modal Search on Apple Silico 7.2分 前50% 系统技术报告 #音频检索 17. SCoPE: Training-Free Audio-Visual Event Perception via 7.1分 前50% 方法研究 #音视频理解 18. BAMU: Bitstream-Aware Marginal-Utility Allocation for F 7.1分 前50% 方法研究 #语音编码 19. Dramarrator: Object-Based Audio Editing for Audio Drama 7.0分 前50% 系统技术报告 #音频生成 20. CuteTTS: Efficient and High-Quality Speech Synthesis vi 7.0分 前50% 系统技术报告 #语音合成 21. RAG-Audio: Retrieval-Augmented Generation for Faithful 6.9分 前50% 方法研究 #音频生成 22. Listen, See and Track: Spatio-Temporal Audio-Visual Sou 6.7分 前50% 数据集与基准 #音视频问答 23. From Speech to Interaction: Analyzing Multimodal System 6.6分 前50% 系统技术报告 #音视频语音识别 24. MADBench: A Benchmark for Modality-Aware Audio Deepfake 6.6分 前50% 数据集与基准 #音视频理解 25. A Unifying Perspective on Audio Generative Modeling: La 6.5分 前50% 理论研究 #音频生成 26. Multilingual Emotion Neurons in Large Audio-Language Mo 6.5分 前50% 方法研究 #语音情感识别 27. DAVE: A Decoupled Audio-Visual Enhancement Framework fo 6.5分 前50% 系统技术报告 #音视频语音分离 28. Structured Phonological Representations for Audio-Artic 6.5分 前50% 方法研究 #语音属性识别 29. CtrlSpeech: Coarse-to-Fine Control for Expressive Speec 6.4分 前50% 方法研究 #语音合成 30. Neural Array-Generic Direction-of-Arrival Estimation Ex 6.4分 前50% 方法研究 #声源定位 31. AI-Guided Learning: Research on Knowledge and Skill Acq 6.3分 前50% 系统技术报告 #音视频理解 32. Speaker Role and Language Diarization for Analyzing Mul 6.3分 前50% 应用研究 #说话人日志 33. MusicLayout: Explicit Structural Planning for Controlla 6.3分 前50% 系统技术报告 #音乐生成 34. Mitigating Over-Suppression in Speech Enhancement via I 6.2分 前50% 方法研究 #语音增强 35. Physics-Informed Learning for Robust Acoustic Localizat 6.2分 前50% 方法研究 #声源定位 36. EmoS: A Theory-Grounded Framework for Evaluating and Al 6.2分 前50% 数据集与基准 #语音情感识别 37. Dynamic Clustering for Cross-Segment Permutation Alignm 6.2分 前50% 方法研究 #语音分离 38. The Voiceprint Fallacy: Why Voices Are Not Unique Biome 6.0分 前50% 综述 #说话人验证 39. Investigating Multimodal Informativity under Different 5.9分 前50% 方法研究 #多模态模型 40. Machine-Learning-Based Diagnostic Framework for Passive 5.6分 前50% 应用研究 #音频分类 📋 论文列表 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward 8.4/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ...

 · 更新于 2026-09-05 · 约 33 分钟 · 6905 字 阅读 →
研究条目

A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper

📄 A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper 标签:#语音情感识别 #语音大模型 #低资源 #领域适应 #音频理解 5.7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #语音大模型 | #低资源 #领域适应 | arxiv 👥 作者与机构 第一作者:Ali Shendabadi(未提供机构) 通讯作者:未说明 作者列表:Ali Shendabadi(未提供机构)、Parnia Izadirad(未提供机构)、Mostafa Salehi(未提供机构) 💡 毒舌点评 用 PCA 替代可学习投影层是一个务实且低成本的做法,确实省掉约 19.66 万额外参数,并报告了约 30% 的每轮训练加速。但实验设计并不干净:PCA 降到 512 维,而 FC 投影层降到 256 维,维度与方法两个变量同时改变,导致“PCA 更优”这一结论无法严格归因于降维方法本身。再加上没有跨数据集验证、没有显著性检验、没有代码或权重,“一致性提升”和 SOTA 结论都明显偏强。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 639 字 阅读 →
研究条目

Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI

📄 Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI 标签:#语音识别 #Transformer #低资源 #多语言 #音频理解 7.8/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前25% | 文档类型:理论研究 | 评分置信度:中 | #语音识别 | #Transformer | #低资源 #多语言 | arxiv 👥 作者与机构 第一作者:Jay L. Cunningham(DePaul University, School of Computing, RAISE Lab, USA;jcunni37@depaul.edu) 通讯作者:未标注 作者列表: Jay L. Cunningham(DePaul University, School of Computing, RAISE Lab, USA;jcunni37@depaul.edu) Mark Atta Mensah(York University, Electrical Engineering and Computer Science, Canada;mamensah@yorku.ca) Richard Martinez(Independent Researcher, USA;martinezrichardme@gmail.com) João Vieira da Silva Neto(DePaul University, School of Computing, RAISE Lab, USA;jvieirad@depaul.edu) Efi Dawodu(DePaul University, School of Computing, RAISE Lab, USA;edawodu@depaul.edu) 💡 毒舌点评 一篇题为“去殖民化”的论文,落地时却几乎全靠概念装置:七层模型、3M伤害分类、四支柱框架,术语琳琅满目,唯独缺少作者自己承认的那个东西——实验。通篇以“殖民语言等级”“结构暴力”为批判矛头,但给出的药方是一个“最低审计协议”式的未来待办清单;没有新架构、没有基准、没有代码,甚至连一个示范性审计都没有。用它自己的话说,这是“诊断地图”,可地图画得再细,不迈出一步也到不了任何地方。更讽刺的是,论文批评WER意识形态,却拿不出任何替代性的量化验证;批评北美机构特权,却由北美大学机构和独立研究员用英语发表。5.1分不算冤枉:批判性有余,而工程与验证几乎缺席。 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 183 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-07

语音/音乐/音频论文速递 2026-08-07 共分析 21 篇论文 ⚡ 今日概览 📥 抓取 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #音频生成 2篇 ██ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AffectDF: The Most Comprehensive Benchmark for Speech D 8.4分 前25% 数据集与基准 #语音伪造检测 🥈 LILAC: An Idempotent Neural Speech Codec 8.1分 前25% 方法研究 #语音编码 🥉 KVAE: Family of Tokenizers for Multimodal Generative Mo 8.1分 前25% 模型报告 #音频编码 4. Decolonizing Linguistic Policies in Automated Speech Re 7.8分 前25% 理论研究 #语音识别 5. Audio-to-Score Transcription using Pre-trained Features 7.7分 前25% 数据集与基准 #音乐转录 6. Diff2Mix: Controllable Music Mixing via Diffusion Model 7.5分 前25% 方法研究 #音频生成 7. Vorch-Streamer: Extending Human Audio-Visual Generation 7.4分 前50% 方法研究 #音视频生成 8. EG-VAE: A Unified Framework for Electric Guitar Tone Tr 7.3分 前50% 方法研究 #音频生成 9. Explicit and Stable Pseudospectral Time-Domain Method f 7.2分 前50% 方法研究 #音频理解 10. FormBharo: Designing and Evaluating a Voice Agent for C 7.0分 前50% 系统技术报告 #语音交互 11. Whence the Voice? Self-supervised Dual-source Audio-Vis 6.8分 前50% 方法研究 #声源定位 12. Bias Analysis of L2 Speaking Assessment Systems Using C 6.7分 前50% 方法研究 #语音质量评估 13. Diff-Symbo: Text-Controlled Long-Duration Symbolic Musi 6.5分 前50% 方法研究 #音乐生成 14. Rethinking Automatic Music Mixing as Sequential Stem Bl 6.5分 前50% 方法研究 #音乐生成 15. How to Recognize New Words: A Comparison Between Contex 6.4分 前50% 方法研究 #语音识别 16. Beyond Residual Connections: Manifold-Constrained Hyper 6.0分 前50% 方法研究 #说话人验证 17. A Study of ASR Adaptation and Representation Dimensiona 5.7分 前50% 方法研究 #语音情感识别 18. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Hea 5.6分 前50% 方法研究 #音视频生成 19. The interface of intonation and lexical tone: Boundary 5.6分 前50% 综述 #语音属性识别 20. C\(^3\)PO: Evaluating Cross-Modal Composition and Counter 5.5分 前50% 数据集与基准 #音视频问答 21. ECHO: A Locally-Deployable Agentic Health Assistant wit 5.5分 前50% 系统技术报告 #语音属性识别 📋 论文列表 🥇 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

 · 更新于 2026-09-05 · 约 17 分钟 · 3544 字 阅读 →
研究条目

Transfer Learning for Avian Bioacoustics under Sparse Positive Labels

📄 Transfer Learning for Avian Bioacoustics under Sparse Positive Labels 标签:#音频分类 #迁移学习 #模型集成 #低资源 #基准测试 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #迁移学习 | #模型集成 #低资源 | arxiv 👥 作者与机构 第一作者:Dhyey Patel(未说明) 通讯作者:未说明 作者列表:Dhyey Patel(未说明)、Yunting Yin(未说明) 💡 毒舌点评 这项工作的价值在于把“未标注≠不存在”这一领域常识转成了可量化的迁移学习问题,生态先验和多源可靠性建模比粗暴数据池化更诚实;但核心声明证据不强:最强可靠性模型相对 AST+stack+graph PU 融合基线仅提升 +0.007 Macro AP,且配对置换检验 p=0.526,统计上不可区分。表 5 的fold均值与 pooled OOF 置换检验结果存在表面矛盾,论文虽在表注中解释口径不同,但正文未充分消化,读者易误读。结论方向可信,但“显著缓解负迁移”的表述过强,需要更强的统计支持和更宽的标签覆盖才能支撑。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1301 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-06

语音/音乐/音频论文速递 2026-08-06 共分析 26 篇论文 ⚡ 今日概览 📥 抓取 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 3篇 ███ #语音增强 2篇 ██ #语音质量评估 2篇 ██ #音乐理解 2篇 ██ #音视频理解 2篇 ██ #音视频生成 2篇 ██ #音频事件检测 2篇 ██ #语音属性识别 1篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Equivariant Music Transformer 8.6分 前25% 方法研究 #音乐生成 🥈 Breaking the Curse ofMultilinguality inMany-to-Many Spe 8.2分 前25% 方法研究 #语音翻译 🥉 PASE: Leveraging the Phonological Prior of WavLM for Lo 8.1分 前25% 方法研究 #语音增强 4. Towards Robust Version Identification in the Wild: A Da 8.0分 前25% 数据集与基准 #音乐检索 5. Agogic: Performance-Timed Music Tokens for LLM-Native T 7.9分 前25% 方法研究 #音频理解 6. OmniPack: Unified Token Compression for Efficient Omni- 7.7分 前25% 方法研究 #音视频理解 7. OmniVR: Joint Video-Audio Conditional Generation for Re 7.7分 前25% 方法研究 #音视频生成 8. A Dual Evaluation for Music Transcription 7.7分 前25% 方法研究 #音乐转录 9. Crowdsourced Multilingual Speech Intelligibility Testin 7.5分 前25% 数据集与基准 #语音质量评估 10. MERaLiON-GR: Speech Gender Recognition Model for Englis 7.5分 前25% 模型报告 #语音属性识别 11. HyPASE: Hyperbolic Geometry for Parameter-Efficient Spe 7.2分 前50% 方法研究 #语音情感识别 12. Transfer Learning for Avian Bioacoustics under Sparse P 7.1分 前50% 方法研究 #音频分类 13. Helping Music Co-Creation Agents ‘Listen’ Well: Hierarc 7.1分 前50% 方法研究 #音乐理解 14. EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Li 7.1分 前50% 系统技术报告 #音视频交互 15. StuPASE: Towards Low-Hallucination Studio-Quality Gener 7.0分 前50% 方法研究 #语音增强 16. Identity-Faithful Audio-Visual Target Speaker Extractio 6.8分 前50% 数据集与基准 #音视频语音分离 17. AudioScape-TTA: A Structured Soundscape Benchmark for F 6.8分 前50% 数据集与基准 #音频生成 18. Visual Representation Matters: Exploiting Temporal Diff 6.8分 前50% 方法研究 #音视频生成 19. Spoken Function Calling: A New Perspective on Spoken La 6.7分 前50% 数据集与基准 #音频理解 20. Masked diffusion enables coherent beat tracking 6.5分 前50% 方法研究 #音乐理解 21. InvFlowFD: Reference-Free and Background-Set-Free Perce 6.4分 前50% 方法研究 #音频质量评估 22. Smartphone Audio Based Distress Detection 6.3分 前50% 系统技术报告 #音频事件检测 23. Assessing speech quality metrics for evaluation of neur 6.0分 前50% 数据集与基准 #语音质量评估 24. Modality Agreement- and Conflict-Aware Prototype Hyperg 5.5分 前50% 方法研究 #音频理解 25. Deep Learning for Real-Time Sound Order Recognition in 5.2分 后50% 方法研究 #音频事件检测 26. C\(^2\)MOE: Consistency and Complementarity-guided Mixtur 4.1分 后50% 方法研究 #音视频理解 📋 论文列表 🥇 Equivariant Music Transformer 8.6/10 | 创新 1.4/2 | 严谨 1.5/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

 · 更新于 2026-09-05 · 约 23 分钟 · 4884 字 阅读 →
研究条目

An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing

📄 An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing 标签:#音频事件检测 #声源定位 #多通道 #低资源 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音频事件检测 | #声源定位 | #多通道 #低资源 | arxiv 👥 作者与机构 第一作者:Dídac Diego-Tortosa(Institut de Ciències del Mar (ICM-CSIC), Barcelona) 通讯作者:未明确标注 作者列表:Dídac Diego-Tortosa(ICM-CSIC)、Miriam Romagosa(ICM-CSIC)、Arantza Ugalde(ICM-CSIC)、Hugo Latorre(ICM-CSIC)、Sergi Ventosa(ICM-CSIC)、Jose Enrique García(IFIC, UV-CSIC)、Antonio Villaseñor(ICM-CSIC) 💡 毒舌点评 亮点是将经典信号处理方法(KVP小波检测、DBSCAN时空聚类、层次合并、双曲线拟合)巧妙组合成一套无需标注训练的生物声学监测管道,在极度稀疏、高噪声的DAS环境下实现了可用的检测精度,工程落地价值明显。短板是完全没有与任何基线方法(哪怕是最简单的能量检测器或频谱互相关)的对比,0.744的召回率缺乏参照系;定位方案承认了双曲线的左右模糊性但未提出缓解策略,整体定位精度缺乏量化指标,仅靠两个轨迹示例支撑"可推断移动方向"的结论,说服力较弱。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 323 字 阅读 →
研究条目

Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study

📄 Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study 标签:#语音合成 #基准测试 #多语言 #低资源 #音频理解 6.8/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音合成 | #基准测试 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Ali Jafar(FAST School of Computing, National University of Computer and Emerging Sciences (FAST-NUCES), Lahore, Punjab, Pakistan) 通讯作者:未说明 作者列表:Ali Jafar、Amal Sarmad、Shifa Yousaf、Maryam Bashir(均为FAST-NUCES) 贡献说明:前三作者贡献等同;Maryam Bashir为概念化、方法论、监督、审阅与编辑。 💡 毒舌点评 本文为乌尔都语TTS评估搭了一套领域分层、多指标互补的基准,动机清晰、工程完整,揭露的主客观“倒挂”现象对单指标排名的迷信是一记清醒的耳光。但主观听音仅拉来20人,每域区区10人,还把MUSHRA的连续0-100滑块砍成1-5离散量表,然后全文不给一个p值或置信区间,让人不得不怀疑那些看似漂亮的均值差异多半只是噪声——敢情这结论的稳健性全靠读者自行脑补统计检验。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 441 字 阅读 →
研究条目

Normal-Anchored First-Order Model-Agnostic Meta-Learning based Whisper Fine-Tuning for Enhancing Fairness of Cleft Lip and Palate Speech Recognition

📄 Normal-Anchored First-Order Model-Agnostic Meta-Learning based Whisper Fine-Tuning for Enhancing Fairness of Cleft Lip and Palate Speech Recognition 标签:#语音识别 #元学习 #低资源 #参数高效微调 #医疗音频 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #元学习 | #低资源 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Susmita Bhattacharjee(印度理工学院古瓦哈提分校 电子与电气工程系) 通讯作者:未说明 作者列表:Susmita Bhattacharjee(印度理工学院古瓦哈提分校 电子与电气工程系)、Jagabandhu Mishra(东芬兰大学 计算机学院)、H.S. Shekhawat(印度理工学院古瓦哈提分校 电子与电气工程系)、Ravi Jasuja(哈佛医学院 布里格姆妇女医院 / Function Promoting Therapies)、S.R. Mahadeva Prasanna(印度理工学院达瓦德分校 电气工程系) 💡 毒舌点评 用正常语音做内环锚点的设计小而巧妙,有效约束了元学习的适应方向,在 CLP 语音这个小众领域里算是扎实的探索。但公平性指标 α/β 从未赋值,整个“公平性得分”名存实亡;且实验完全回避了与 LoRA、Adapter 等主流参数高效微调方法的对比,无法判断 FOMAML 的优势究竟来自元学习还是仅仅来自更合适的正则化。严重度采样策略需为每个数据集单独选择外环组合,通用性存疑。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 857 字 阅读 →
研究条目

SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching

📄 SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching 标签:#语音分离 #CNN #多模态模型 #助听器 #低资源 7.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音分离 | #CNN | #多模态模型 #助听器 | arxiv 👥 作者与机构 第一作者:Xuefei Wang(南方科技大学电子与电气工程系) 通讯作者:Fei Chen(南方科技大学电子与电气工程系) 作者列表:Xuefei Wang(南方科技大学电子与电气工程系)、Ximin Chen(首都医科大学生物医学工程学院)、Yuting Ding(未说明机构)、Chunlin Li(未说明机构)、Fei Chen(南方科技大学电子与电气工程系) 💡 毒舌点评 这篇工作瞄准了EEG引导说话人提取中“试次内注意力切换”这个真实但棘手的动态难题,提出了一个软门控加延迟补偿的组合方案,想法是好的。但做出来的结果切换延迟2.04秒,仍停留在秒级,远谈不上“实时神经操控”,而且整套东西跑在仅18人自建数据上,代码没放、关键超参数表是空的,消融实验也缺了点统计检验。整体看着像个概念验证,离顶会solid work还差口气。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 403 字 阅读 →
研究条目

The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders

📄 The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders 标签:#语音属性识别 #自监督学习 #对比学习 #多语言 #低资源 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音属性识别 | #自监督学习 | #对比学习 #多语言 | arxiv 👥 作者与机构 第一作者:Sejin Yoo(独立研究员) 通讯作者:Sejin Yoo(独立研究员) 作者列表:Sejin Yoo(独立研究员) 💡 毒舌点评 这篇论文以干净且控制良好的实验设计,揭示了自监督语音模型中“学习目标决定跨语言音素判别方向”这一重要现象,尤其是重建目标将非母语辨别能力拉低到输入特征之下的发现令人印象深刻。然而,实验规模过小(仅11小时数据、7M参数),且完全未提供代码与模型,使得结论在大模型和真实婴儿数据上的可推广性存疑;论文自身也未能实现完整的“感知窄化”发育签名。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 383 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-04

语音/音乐/音频论文速递 2026-08-04 共分析 39 篇论文。 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 3篇 ███ #音视频生成 3篇 ███ #语音属性识别 2篇 ██ #说话人验证 2篇 ██ #音视频理解 2篇 ██ #音频分类 2篇 ██ #音频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dat 8.3分 前25% 数据集与基准 #语音识别 🥈 FATE: Frame-Level Audio-Visual Temporal Embedding 8.3分 前25% 方法研究 #音视频理解 🥉 Allocation Before Ranking: Decoupled Token Compression 8.1分 前25% 方法研究 #音视频理解 4. Embodied Passive Aeroacoustic Perception Enables Relati 7.9分 前25% 系统技术报告 #声源定位 5. Interpretable MEG Decoding of Perceived Speech: Cortica 7.9分 前25% 方法研究 #音频检索 6. Beyond Prompt Adherence: Auditing Attribute-Level Voice 7.8分 前25% 方法研究 #语音合成 7. Hidden-Domain Routing for All-Type Audio Deepfake Detec 7.6分 前25% 系统技术报告 #领域适应 8. An End-to-End Workflow for Fin Whale Song Detection, No 7.5分 前25% 系统技术报告 #音频事件检测 9. SAGE: Switch-Aware EEG-Guided Soft Gating for Target Sp 7.3分 前50% 方法研究 #语音分离 10. Experience-Calibrated Contrastive Decoding for Mitigati 7.2分 前50% 方法研究 #语音合成 11. DRONEAUDIONET: Noise Suppression for Drone Audition-bas 7.2分 前50% 方法研究 #音频分离 12. Multi-Backbone Self-Supervised Ensembles for Audio Deep 7.2分 前50% 系统技术报告 #音频伪造检测 13. Hear, Invoke, and Understand: A Skill-Calling Multimoda 7.2分 前50% 方法研究 #音频理解 14. CultureVidBench: Benchmarking Cultural Understanding in 7.2分 前50% 数据集与基准 #音视频生成 15. SwanTale: Unified Multi-Speaker Speech and Audio Genera 7.1分 前50% 系统技术报告 #音频生成 16. Scene2Sound: Auditory-Grounded Soundscape Generation fo 7.0分 前50% 方法研究 #音频生成 17. The Learning Objective Governs Perceptual Narrowing: A 7.0分 前50% 方法研究 #语音属性识别 18. Discriminative Axis, Not Data Volume: What a Contrastiv 6.9分 前50% 方法研究 #语音属性识别 19. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrume 6.9分 前50% 系统技术报告 #音频理解 20. AcoustiTrace: When Plausible Sound Violates Physics 6.9分 前50% 数据集与基准 #音视频生成 21. Gecko: Fast Private Inference via Secure Public Encoder 6.9分 前50% 系统技术报告 #迁移学习 22. LeapTalk: Breaking the Latency-Quality Trade-off in Tal 6.8分 前50% 方法研究 #音视频生成 23. Separate-and-Detect: Unified Drum Transcription and Ste 6.8分 前50% 方法研究 #音乐转录 24. Domain-Specific Evaluation of Text-to-Speech Systems: A 6.8分 前50% 数据集与基准 #语音合成 25. JoyAI-Talker: Full-Duplex Speech Interactive Large Mode 6.5分 前50% 系统技术报告 #语音合成 26. REIMU: Efficient Heterogeneous Hierarchical Reasoning f 6.4分 前50% 方法研究 #语音伪造检测 27. The Role of Disfluencies in Speech Translation 6.4分 前50% 数据集与基准 #语音翻译 28. SCOPE: Entanglement Frontier Escape for Source-Free Cla 6.3分 前50% 方法研究 #说话人验证 29. Uncertainty-Aware Crossmodal Fusion for Classification 6.3分 前50% 方法研究 #音频分类 30. Can Foundation Models Hear What Made That Sound? A Tier 6.3分 前50% 数据集与基准 #音频分类 31. QR-Erase: Efficient Subspace-Based Machine Unlearning w 6.0分 前50% 方法研究 #说话人验证 32. SGAD: A State-Guided Adaptive Decision Framework for Ro 6.0分 前50% 方法研究 #Transformer 33. Normal-Anchored First-Order Model-Agnostic Meta-Learnin 5.9分 前50% 方法研究 #语音识别 34. AnyBand: Unified Multi-Bandwidth Speech Extension via F 5.9分 前50% 方法研究 #语音超分 35. Sounding Canvas: Embedding Algorithms in Networked, Sen 5.7分 前50% 系统技术报告 #RNN 36. UOT-IR: Structured Routing of High-Polyphony Symbolic M 5.5分 前50% 方法研究 #音乐理解 37. Embodied Empathy: A Multimodal AR and LLM-Powered Syste 5.4分 后50% 应用研究 #音频交互 38. Analyzing Speech Condition Effects in Dysarthric ASR: A 5.0分 后50% 方法研究 #语音识别 39. Homebot: A Personal AI Agent for Conversational Home As 3.8分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

 · 更新于 2026-09-05 · 约 28 分钟 · 5820 字 阅读 →
研究条目

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

📄 Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription 标签:#音乐转录 #自回归模型 #低资源 #模型评估 #音频理解 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自回归模型 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Ting-Kai Hsu(国立台湾大学通信工程研究所) 通讯作者:未说明 作者列表:Ting-Kai Hsu(国立台湾大学通信工程研究所)、Wei-Chin Wang(国立台湾大学电机工程学系)、Kai-Xi Hong(国立台湾大学电机工程学系)、Yu-Hua Chen(国立台湾大学网络与多媒体研究所) 💡 毒舌点评 这篇论文在解码器目标端显式加入NOTE_ON/OFF事件,让transformer直接建模音符边界,这一设计直观有效,尤其在小样本Leduc数据集上避免了灾难性过拟合,97.57个百分点的提升确实亮眼。但文章仅与一个重训的Fretting Transformer比较,既没有和MIDI-to-Tab等近期序列标注方法交手,也缺少对NOTE_ON、NOTE_OFF、正则化等组件各自的消融实验,实验说服力大打折扣。承诺开源但代码未落地,优化器、学习率、batch size等核心训练配置全部缺失,复现基本靠猜。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 369 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-07-30

语音/音乐/音频论文速递 2026-07-30 共分析 19 篇论文 ⚡ 今日概览 📥 抓取 19 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #音频伪造检测 2篇 ██ #CNN 1篇 █ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(19 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework 8.3分 前25% 方法研究 #音频伪造检测 🥈 A large-scale corpus of religious radio broadcast trans 8.2分 前25% 数据集与基准 #说话人日志 🥉 Voice Memory for Agentic Speech Recognition 8.2分 前25% 方法研究 #语音识别 4. Less is More: Modality-Decoupling for General AIGC Audi 7.5分 前25% 方法研究 #音频伪造检测 5. MPEcho: A Melody and Phoneme-Aware Generative Framework 7.4分 前50% 方法研究 #音乐生成 6. Prosody-driven Jailbreaks in Audio LLMs: A Controlled S 7.0分 前50% 方法研究 #音频交互 7. Few-Shot Open-Set Audio Classification via Transductive 6.8分 前50% 方法研究 #音频分类 8. TaoMate: Anchor-Guided Memory Bridging Evolving and Ref 6.7分 前50% 方法研究 #音视频生成 9. Symphony of Bias: Exploring Gender Associations with Mu 6.6分 前50% 数据集与基准 #音乐理解 10. Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction 6.6分 前50% 方法研究 #语音伪造检测 11. DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking D 6.5分 前50% 方法研究 #语音交互 12. Dissecting Sensitivity to Training Language in Self-Sup 6.3分 前50% 方法研究 #语音识别 13. Detection of AI-generated stems within hybrid human-AI 6.3分 前50% 方法研究 #CNN 14. MMAC: A Massive Multi-dimensional Benchmark for Audio C 6.3分 前50% 数据集与基准 #音频字幕生成 15. Explicit Note-Event Tokenization and Pitch-Validity Con 6.1分 前50% 方法研究 #音乐转录 16. Zero-Shot Face-to-Speech Synthesis via Latent Space Ada 6.0分 前50% 方法研究 #语音合成 17. A Study on Online Mask-based Beamforming Using Per-chan 5.7分 前50% 方法研究 #语音增强 18. Qwen-Audio-3.0-Gen-Preview Technical Report 5.6分 前50% 模型报告 #音频生成 19. Unfolded Recursive Expectation-Maximization Neural Netw 5.4分 后50% 方法研究 #声源定位 📋 论文列表 🥇 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization 8.3/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

 · 更新于 2026-09-05 · 约 15 分钟 · 3188 字 阅读 →
研究条目

Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception

📄 Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception 标签:#语音交互 #对比学习 #低资源 #音频理解 #Transformer 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音交互 | #对比学习 | #低资源 #音频理解 | arxiv 👥 作者与机构 第一作者:Tian Zheng(中国科学院大学;中国科学院软件研究所) 通讯作者:未说明 作者列表:Tian Zheng(中国科学院大学,中国科学院软件研究所)、Xurong Xie(中国科学院软件研究所)、Xinxin Zhu(北京语言大学)、Xiaolan Peng(中国科学院软件研究所)、Feng Tian(中国科学院软件研究所) 💡 毒舌点评 本文在中文脑电到文本解码这一艰难赛道上首次将文本语义与音频声学双对齐引入CTC框架,在封闭句集分类上取得了大幅超越基线的数字,思路清晰、消融扎实。然而,完全不开源、不提供任何模型或代码,且仅在小规模单数据集上验证,使得其“首次大词汇连续解码”的声称在当前阶段更像概念验证而非可复现的社区资产。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 488 字 阅读 →
研究条目

Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction

📄 Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction 标签:#语音属性识别 #图神经网络 #自监督学习 #低资源 #音频理解 5.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音属性识别 | #图神经网络 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Behrad TaghiBeyglou(多伦多大学电气与计算机工程系) 通讯作者:未说明 作者列表:Behrad TaghiBeyglou(多伦多大学电气与计算机工程系)、Fatemeh Bagheri(多伦多大学电气与计算机工程系)、Ervin Sejdic(多伦多大学电气与计算机工程系 / North York General Hospital) 💡 毒舌点评 文章用"SSL特征+GNN图分类"的思路为ALS语音评估提供了一种简洁的多段录音融合方案,在挑战赛验证集上确实压过了官方基线。然而全部实验仅在一个单中心意大利语数据集上完成,且关键设计(kNN图与固定时长拼接)缺乏消融证明,使得"图方法优于简单池化"这一核心主张仍停留在相关性而非因果层面。更麻烦的是,10折CV在全部受试者上进行,随后再在官方训练/验证集划分上重训练,超参选择阶段已间接看到验证集数据,存在信息泄露风险。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 601 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-07-29

语音/音乐/音频论文速递 2026-07-29 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 2篇 ██ #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #音频理解 2篇 ██ #Transformer 1篇 █ #声源定位 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 faster-enhancer.c: A Dependency-Free int8 Runtime for S 8.7分 前25% 系统技术报告 #语音增强 🥈 OmniScope: Modality-Decoupled Token Compression for Omn 8.3分 前25% 方法研究 #音视频问答 🥉 AVE-Compass: Towards Holistic Evaluation for Audio-Vide 8.3分 前25% 数据集与基准 #多模态模型 4. Extracting Voice Styles from Frozen TTS Models via Grad 7.9分 前25% 方法研究 #语音克隆 5. CARE: A Multimodal Corpus for Studying Speech and Non-V 7.9分 前25% 数据集与基准 #音视频理解 6. GraphIDyOM: A graph-native Python reimplementation of I 7.8分 前25% 系统技术报告 #音乐理解 7. VAD to the Bone: Ultra-Tiny Speech Activity Detection f 7.4分 前50% 系统技术报告 #语音活动检测 8. Unlocking Spatial Grounding in Large Audio-Visual Retri 7.2分 前50% 方法研究 #声源定位 9. SpeechLLM Meets Federated Learning for End-to-End ASR: 7.1分 前50% 方法研究 #语音识别 10. Joint Text-Audio Alignment for EEG-to-Text Decoding in 7.0分 前50% 方法研究 #语音交互 11. OmniDelta: Skill-Driven Budget Allocation for Token Com 7.0分 前50% 方法研究 #音视频问答 12. Text-Prompted CLAP: Learning Query-Conditioned Audio Re 6.6分 前50% 方法研究 #音频理解 13. Towards Operational Conversational Intelligence: A Spee 6.4分 前50% 系统技术报告 #说话人日志 14. Parallel Decoding Distillation for Fast Image and Video 6.2分 前50% 方法研究 #音视频生成 15. Spacing Out: On the Reliability of Binaural Music Sourc 6.1分 前50% 方法研究 #音乐源分离 16. MyMentorLLM: A psychotherapy GenAI environment with mul 5.9分 前50% 系统技术报告 #语音交互 17. MusiChat: Vibe Composing for Music Creation 5.8分 前50% 系统技术报告 #音乐生成 18. AMRD: Adaptive Multi-Teacher Relational Distillation fo 5.6分 前50% 方法研究 #语音情感识别 19. Multi-Phonation Graph Learning with Self-Supervised Spe 5.5分 前50% 方法研究 #语音属性识别 20. Evaluation of forced alignment of code-mixed speech: th 5.4分 后50% 方法研究 #语音识别 21. A Cross-lingual Comparison of Human and Classification 5.1分 后50% 方法研究 #Transformer 22. From Semantics to Readout: Mechanistic Understanding of 5.1分 后50% 方法研究 #音频理解 23. Finding the noise: Zero-shot AI Music Detection 5.1分 后50% 方法研究 #无监督学习 24. Depression Markers in Speech: An Approach based on Trac 5.1分 后50% 应用研究 #语音属性识别 25. Self-Supervised Audio Representation Learning for Pedia 5.0分 后50% 应用研究 #音频分类 26. DynaBridge: Dynamic Summary-Guided Cross-Task Multimoda 4.9分 后50% 方法研究 #音视频理解 27. Device Invariance using Domain Adaptation on Acoustic S 4.2分 后50% 方法研究 #领域适应 📋 论文列表 🥇 faster-enhancer.c: A Dependency-Free int8 Runtime for Streaming Speech Enhancement on Commodity CPUs 8.7/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 ...

 · 更新于 2026-09-05 · 约 20 分钟 · 4243 字 阅读 →
研究条目

Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability

📄 Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability 标签:#语音情感识别 #迁移学习 #多模态模型 #低资源 #音频理解 5.3/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.3/10 | 后50% | 文档类型:应用研究 | 评分置信度:中 | #语音情感识别 | #迁移学习 | #多模态模型 #低资源 | arxiv 👥 作者与机构 第一作者:Kalle Lahtinen (Tampere University, Signal Processing Research Centre) 通讯作者:未说明 作者列表:Kalle Lahtinen (Tampere University, Signal Processing Research Centre), Liisa Mustanoja (Tampere University, Research Centre Plural), Okko Räsänen (Tampere University, Signal Processing Research Centre) 💡 毒舌点评 论文用MLP加特征拼接的经典配方,在芬兰语上复现了“文本主效价、音频主唤醒”的已知范式。穷举127种组合的实验设计看得出作者的耐心,但方法学上毫无冒险精神,整体强度只够支撑一篇扎实的数据点报告。标题里的“语言可解释性”在糟糕的显式特征性能面前,只剩一声空响。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 320 字 阅读 →
研究条目

Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English

📄 Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English 标签:#语音合成 #领域适应 #低资源 #音频理解 #Transformer 6.3/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音合成 | #领域适应 | #低资源 #音频理解 | arxiv 👥 作者与机构 第一作者:Ivan Kukanov(未说明机构) 通讯作者:未说明 作者列表:Ivan Kukanov(未说明机构)、Zheng Xin Chai(未说明机构) 💡 毒舌点评 本文首次将零样本 TTS 微调应用于 Singlish 这一长期被忽略的低资源英语变体,adaptation-vs-consistency 的评估拆分做出了清晰的概念贡献。然而,实验仅涉及两个预训练模型的简单全参微调,方法层面几无新意,且完全没有系统的主观听力测试,在感知说服力上明显不足。对 RADAR 2026 深伪检测挑战的数据贡献有一定实际价值,但不能弥补学术创新性的缺乏。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 889 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-07-28

语音/音乐/音频论文速递 2026-07-28 共分析 31 篇论文 ⚡ 今日概览 📥 抓取 31 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 5篇 █████ #语音交互 3篇 ███ #语音属性识别 3篇 ███ #声源定位 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #对比学习 1篇 █ 📊 论文评分排行榜(31 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 StanceBench: A Benchmark for Audio LLM-Based Interperso 8.6分 前25% 数据集与基准 #语音属性识别 🥈 Expose Your Disguise: Recovering Source Speaker Identit 7.5分 前25% 方法研究 #对比学习 🥉 Leveraging Gradient Reversal Loss and Multitask Learnin 7.3分 前50% 方法研究 #语音伪造检测 4. PathRIR: Physics-Guided Acoustic Path Selection and Lat 7.2分 前50% 方法研究 #空间音频 5. Indic DiarBench: A Multilingual Joint Diarization and A 7.1分 前50% 数据集与基准 #说话人日志 6. Earnings25: A Comprehensive 500-Hour Speech Benchmark f 7.1分 前50% 数据集与基准 #语音识别 7. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment 7.1分 前50% 方法研究 #音视频生成 8. Revisiting Vocos: That Phasiness Business in Time-Frequ 7.1分 前50% 方法研究 #语音合成 9. Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robu 7.0分 前50% 系统技术报告 #语音合成 10. Towards High-Level Semantic Intelligence 7.0分 前50% 综述 #音视频理解 11. Speech Signals Complement LLMs for Predicting Interpers 6.9分 前50% 应用研究 #语音交互 12. Let Me Look at You: Advanced Facial Expression Modeling 6.9分 前50% 模型报告 #语音合成 13. Simple Language Normalization Wins: Cross-Lingual Speak 6.8分 前50% 系统技术报告 #说话人验证 14. Memory Efficient Audio Synthesis with Decoupled Tempora 6.8分 前50% 系统技术报告 #语音合成 15. Explainable AI through the Lens of Material Agency: Ena 6.7分 前50% 应用研究 #音乐生成 16. MoLGE: Mixture of Language Group Experts for Efficient 6.7分 前50% 方法研究 #语音识别 17. Mind the Microphone Gap: Benchmarking Array Upsampling 6.6分 前50% 方法研究 #声源定位 18. Multimodal Domain Generalization for Depression Detecti 6.4分 前50% 方法研究 #音频分类 19. Infinite Canons: Maximally Self-Similar Melodic Lines a 6.4分 前50% 理论研究 #音乐生成 20. Singlish, Can or Not? Fine-Tuning and Evaluating Zero-S 6.3分 前50% 应用研究 #语音合成 21. JarvisHub: An Open Harness for Canvas-Native Multimodal 6.2分 前50% 系统技术报告 #音视频生成 22. Low-Latency Turn-Taking via Context-Aware Preface Gener 6.1分 前50% 系统技术报告 #语音交互 23. Do Visual Features Improve Other-Initiated Repair Detec 5.9分 前50% 方法研究 #音视频交互 24. Automatic Audio Equalization with Semantic Embeddings 5.8分 前50% 方法研究 #语音增强 25. Music-Source-Separation-Training (MSST): A Unified Fram 5.7分 前50% 系统技术报告 #音乐源分离 26. Disentangling Acoustic Cues in Alzheimer’s Pathology an 5.4分 后50% 应用研究 #语音属性识别 27. Speech Entrainment in Multi-Party Conversations with a 5.3分 后50% 应用研究 #语音交互 28. Improving Zero-Shot Phonetic Classification through Lan 5.3分 后50% 方法研究 #语音属性识别 29. Looking for Affect in Spontaneous Finnish Speech throug 5.3分 后50% 应用研究 #语音情感识别 30. Modeling Stylistic Co-evolution in Symbolic Music Herit 4.9分 后50% 方法研究 #音乐理解 31. Resource-Aware Topology Management for ISAC-Enabled TDO 4.1分 后50% 方法研究 #声源定位 📋 论文列表 🥇 StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech 8.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

 · 更新于 2026-09-05 · 约 26 分钟 · 5365 字 阅读 →