An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing

📄 An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing 标签:#音频事件检测 #声源定位 #多通道 #低资源 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音频事件检测 | #声源定位 | #多通道 #低资源 | arxiv 👥 作者与机构 第一作者:Dídac Diego-Tortosa(Institut de Ciències del Mar (ICM-CSIC), Barcelona) 通讯作者:未明确标注 作者列表:Dídac Diego-Tortosa(ICM-CSIC)、Miriam Romagosa(ICM-CSIC)、Arantza Ugalde(ICM-CSIC)、Hugo Latorre(ICM-CSIC)、Sergi Ventosa(ICM-CSIC)、Jose Enrique García(IFIC, UV-CSIC)、Antonio Villaseñor(ICM-CSIC) 💡 毒舌点评 亮点是将经典信号处理方法(KVP小波检测、DBSCAN时空聚类、层次合并、双曲线拟合)巧妙组合成一套无需标注训练的生物声学监测管道,在极度稀疏、高噪声的DAS环境下实现了可用的检测精度,工程落地价值明显。短板是完全没有与任何基线方法(哪怕是最简单的能量检测器或频谱互相关)的对比,0.744的召回率缺乏参照系;定位方案承认了双曲线的左右模糊性但未提出缓解策略,整体定位精度缺乏量化指标,仅靠两个轨迹示例支撑"可推断移动方向"的结论,说服力较弱。 ...

2026-08-04 · 更新于 2026-08-14 · 2 min · 323 words

Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study

📄 Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study 标签:#语音合成 #基准测试 #多语言 #低资源 #音频理解 6.8/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音合成 | #基准测试 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Ali Jafar(FAST School of Computing, National University of Computer and Emerging Sciences (FAST-NUCES), Lahore, Punjab, Pakistan) 通讯作者:未说明 作者列表:Ali Jafar、Amal Sarmad、Shifa Yousaf、Maryam Bashir(均为FAST-NUCES) 贡献说明:前三作者贡献等同;Maryam Bashir为概念化、方法论、监督、审阅与编辑。 💡 毒舌点评 本文为乌尔都语TTS评估搭了一套领域分层、多指标互补的基准,动机清晰、工程完整,揭露的主客观“倒挂”现象对单指标排名的迷信是一记清醒的耳光。但主观听音仅拉来20人,每域区区10人,还把MUSHRA的连续0-100滑块砍成1-5离散量表,然后全文不给一个p值或置信区间,让人不得不怀疑那些看似漂亮的均值差异多半只是噪声——敢情这结论的稳健性全靠读者自行脑补统计检验。 ...

2026-08-04 · 更新于 2026-08-14 · 3 min · 441 words

Normal-Anchored First-Order Model-Agnostic Meta-Learning based Whisper Fine-Tuning for Enhancing Fairness of Cleft Lip and Palate Speech Recognition

📄 Normal-Anchored First-Order Model-Agnostic Meta-Learning based Whisper Fine-Tuning for Enhancing Fairness of Cleft Lip and Palate Speech Recognition 标签:#语音识别 #元学习 #低资源 #参数高效微调 #医疗音频 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #元学习 | #低资源 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Susmita Bhattacharjee(印度理工学院古瓦哈提分校 电子与电气工程系) 通讯作者:未说明 作者列表:Susmita Bhattacharjee(印度理工学院古瓦哈提分校 电子与电气工程系)、Jagabandhu Mishra(东芬兰大学 计算机学院)、H.S. Shekhawat(印度理工学院古瓦哈提分校 电子与电气工程系)、Ravi Jasuja(哈佛医学院 布里格姆妇女医院 / Function Promoting Therapies)、S.R. Mahadeva Prasanna(印度理工学院达瓦德分校 电气工程系) 💡 毒舌点评 用正常语音做内环锚点的设计小而巧妙,有效约束了元学习的适应方向,在 CLP 语音这个小众领域里算是扎实的探索。但公平性指标 α/β 从未赋值,整个“公平性得分”名存实亡;且实验完全回避了与 LoRA、Adapter 等主流参数高效微调方法的对比,无法判断 FOMAML 的优势究竟来自元学习还是仅仅来自更合适的正则化。严重度采样策略需为每个数据集单独选择外环组合,通用性存疑。 ...

2026-08-04 · 更新于 2026-08-14 · 5 min · 857 words

SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching

📄 SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching 标签:#语音分离 #CNN #多模态模型 #助听器 #低资源 7.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音分离 | #CNN | #多模态模型 #助听器 | arxiv 👥 作者与机构 第一作者:Xuefei Wang(南方科技大学电子与电气工程系) 通讯作者:Fei Chen(南方科技大学电子与电气工程系) 作者列表:Xuefei Wang(南方科技大学电子与电气工程系)、Ximin Chen(首都医科大学生物医学工程学院)、Yuting Ding(未说明机构)、Chunlin Li(未说明机构)、Fei Chen(南方科技大学电子与电气工程系) 💡 毒舌点评 这篇工作瞄准了EEG引导说话人提取中“试次内注意力切换”这个真实但棘手的动态难题,提出了一个软门控加延迟补偿的组合方案,想法是好的。但做出来的结果切换延迟2.04秒,仍停留在秒级,远谈不上“实时神经操控”,而且整套东西跑在仅18人自建数据上,代码没放、关键超参数表是空的,消融实验也缺了点统计检验。整体看着像个概念验证,离顶会solid work还差口气。 ...

2026-08-04 · 更新于 2026-08-14 · 2 min · 403 words

The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders

📄 The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders 标签:#语音属性识别 #自监督学习 #对比学习 #多语言 #低资源 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音属性识别 | #自监督学习 | #对比学习 #多语言 | arxiv 👥 作者与机构 第一作者:Sejin Yoo(独立研究员) 通讯作者:Sejin Yoo(独立研究员) 作者列表:Sejin Yoo(独立研究员) 💡 毒舌点评 这篇论文以干净且控制良好的实验设计,揭示了自监督语音模型中“学习目标决定跨语言音素判别方向”这一重要现象,尤其是重建目标将非母语辨别能力拉低到输入特征之下的发现令人印象深刻。然而,实验规模过小(仅11小时数据、7M参数),且完全未提供代码与模型,使得结论在大模型和真实婴儿数据上的可推广性存疑;论文自身也未能实现完整的“感知窄化”发育签名。 ...

2026-08-04 · 更新于 2026-08-14 · 2 min · 383 words

语音/音乐/音频论文速递 2026-08-04

语音/音乐/音频论文速递 2026-08-04 共分析 39 篇论文。 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 3篇 ███ #音视频生成 3篇 ███ #语音属性识别 2篇 ██ #说话人验证 2篇 ██ #音视频理解 2篇 ██ #音频分类 2篇 ██ #音频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dat 8.3分 前25% 数据集与基准 #语音识别 🥈 FATE: Frame-Level Audio-Visual Temporal Embedding 8.3分 前25% 方法研究 #音视频理解 🥉 Allocation Before Ranking: Decoupled Token Compression 8.1分 前25% 方法研究 #音视频理解 4. Embodied Passive Aeroacoustic Perception Enables Relati 7.9分 前25% 系统技术报告 #声源定位 5. Interpretable MEG Decoding of Perceived Speech: Cortica 7.9分 前25% 方法研究 #音频检索 6. Beyond Prompt Adherence: Auditing Attribute-Level Voice 7.8分 前25% 方法研究 #语音合成 7. Hidden-Domain Routing for All-Type Audio Deepfake Detec 7.6分 前25% 系统技术报告 #领域适应 8. An End-to-End Workflow for Fin Whale Song Detection, No 7.5分 前25% 系统技术报告 #音频事件检测 9. SAGE: Switch-Aware EEG-Guided Soft Gating for Target Sp 7.3分 前50% 方法研究 #语音分离 10. Experience-Calibrated Contrastive Decoding for Mitigati 7.2分 前50% 方法研究 #语音合成 11. DRONEAUDIONET: Noise Suppression for Drone Audition-bas 7.2分 前50% 方法研究 #音频分离 12. Multi-Backbone Self-Supervised Ensembles for Audio Deep 7.2分 前50% 系统技术报告 #音频伪造检测 13. Hear, Invoke, and Understand: A Skill-Calling Multimoda 7.2分 前50% 方法研究 #音频理解 14. CultureVidBench: Benchmarking Cultural Understanding in 7.2分 前50% 数据集与基准 #音视频生成 15. SwanTale: Unified Multi-Speaker Speech and Audio Genera 7.1分 前50% 系统技术报告 #音频生成 16. Scene2Sound: Auditory-Grounded Soundscape Generation fo 7.0分 前50% 方法研究 #音频生成 17. The Learning Objective Governs Perceptual Narrowing: A 7.0分 前50% 方法研究 #语音属性识别 18. Discriminative Axis, Not Data Volume: What a Contrastiv 6.9分 前50% 方法研究 #语音属性识别 19. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrume 6.9分 前50% 系统技术报告 #音频理解 20. AcoustiTrace: When Plausible Sound Violates Physics 6.9分 前50% 数据集与基准 #音视频生成 21. Gecko: Fast Private Inference via Secure Public Encoder 6.9分 前50% 系统技术报告 #迁移学习 22. LeapTalk: Breaking the Latency-Quality Trade-off in Tal 6.8分 前50% 方法研究 #音视频生成 23. Separate-and-Detect: Unified Drum Transcription and Ste 6.8分 前50% 方法研究 #音乐转录 24. Domain-Specific Evaluation of Text-to-Speech Systems: A 6.8分 前50% 数据集与基准 #语音合成 25. JoyAI-Talker: Full-Duplex Speech Interactive Large Mode 6.5分 前50% 系统技术报告 #语音合成 26. REIMU: Efficient Heterogeneous Hierarchical Reasoning f 6.4分 前50% 方法研究 #语音伪造检测 27. The Role of Disfluencies in Speech Translation 6.4分 前50% 数据集与基准 #语音翻译 28. SCOPE: Entanglement Frontier Escape for Source-Free Cla 6.3分 前50% 方法研究 #说话人验证 29. Uncertainty-Aware Crossmodal Fusion for Classification 6.3分 前50% 方法研究 #音频分类 30. Can Foundation Models Hear What Made That Sound? A Tier 6.3分 前50% 数据集与基准 #音频分类 31. QR-Erase: Efficient Subspace-Based Machine Unlearning w 6.0分 前50% 方法研究 #说话人验证 32. SGAD: A State-Guided Adaptive Decision Framework for Ro 6.0分 前50% 方法研究 #Transformer 33. Normal-Anchored First-Order Model-Agnostic Meta-Learnin 5.9分 前50% 方法研究 #语音识别 34. AnyBand: Unified Multi-Bandwidth Speech Extension via F 5.9分 前50% 方法研究 #语音超分 35. Sounding Canvas: Embedding Algorithms in Networked, Sen 5.7分 前50% 系统技术报告 #RNN 36. UOT-IR: Structured Routing of High-Polyphony Symbolic M 5.5分 前50% 方法研究 #音乐理解 37. Embodied Empathy: A Multimodal AR and LLM-Powered Syste 5.4分 后50% 应用研究 #音频交互 38. Analyzing Speech Condition Effects in Dysarthric ASR: A 5.0分 后50% 方法研究 #语音识别 39. Homebot: A Personal AI Agent for Conversational Home As 3.8分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-08-04 · 更新于 2026-08-14 · 28 min · 5820 words

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

📄 Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription 标签:#音乐转录 #自回归模型 #低资源 #模型评估 #音频理解 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自回归模型 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Ting-Kai Hsu(国立台湾大学通信工程研究所) 通讯作者:未说明 作者列表:Ting-Kai Hsu(国立台湾大学通信工程研究所)、Wei-Chin Wang(国立台湾大学电机工程学系)、Kai-Xi Hong(国立台湾大学电机工程学系)、Yu-Hua Chen(国立台湾大学网络与多媒体研究所) 💡 毒舌点评 这篇论文在解码器目标端显式加入NOTE_ON/OFF事件,让transformer直接建模音符边界,这一设计直观有效,尤其在小样本Leduc数据集上避免了灾难性过拟合,97.57个百分点的提升确实亮眼。但文章仅与一个重训的Fretting Transformer比较,既没有和MIDI-to-Tab等近期序列标注方法交手,也缺少对NOTE_ON、NOTE_OFF、正则化等组件各自的消融实验,实验说服力大打折扣。承诺开源但代码未落地,优化器、学习率、batch size等核心训练配置全部缺失,复现基本靠猜。 ...

2026-07-30 · 更新于 2026-08-14 · 2 min · 369 words

语音/音乐/音频论文速递 2026-07-30

语音/音乐/音频论文速递 2026-07-30 共分析 19 篇论文 ⚡ 今日概览 📥 抓取 19 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #音频伪造检测 2篇 ██ #CNN 1篇 █ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(19 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework 8.3分 前25% 方法研究 #音频伪造检测 🥈 A large-scale corpus of religious radio broadcast trans 8.2分 前25% 数据集与基准 #说话人日志 🥉 Voice Memory for Agentic Speech Recognition 8.2分 前25% 方法研究 #语音识别 4. Less is More: Modality-Decoupling for General AIGC Audi 7.5分 前25% 方法研究 #音频伪造检测 5. MPEcho: A Melody and Phoneme-Aware Generative Framework 7.4分 前50% 方法研究 #音乐生成 6. Prosody-driven Jailbreaks in Audio LLMs: A Controlled S 7.0分 前50% 方法研究 #音频交互 7. Few-Shot Open-Set Audio Classification via Transductive 6.8分 前50% 方法研究 #音频分类 8. TaoMate: Anchor-Guided Memory Bridging Evolving and Ref 6.7分 前50% 方法研究 #音视频生成 9. Symphony of Bias: Exploring Gender Associations with Mu 6.6分 前50% 数据集与基准 #音乐理解 10. Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction 6.6分 前50% 方法研究 #语音伪造检测 11. DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking D 6.5分 前50% 方法研究 #语音交互 12. Dissecting Sensitivity to Training Language in Self-Sup 6.3分 前50% 方法研究 #语音识别 13. Detection of AI-generated stems within hybrid human-AI 6.3分 前50% 方法研究 #CNN 14. MMAC: A Massive Multi-dimensional Benchmark for Audio C 6.3分 前50% 数据集与基准 #音频字幕生成 15. Explicit Note-Event Tokenization and Pitch-Validity Con 6.1分 前50% 方法研究 #音乐转录 16. Zero-Shot Face-to-Speech Synthesis via Latent Space Ada 6.0分 前50% 方法研究 #语音合成 17. A Study on Online Mask-based Beamforming Using Per-chan 5.7分 前50% 方法研究 #语音增强 18. Qwen-Audio-3.0-Gen-Preview Technical Report 5.6分 前50% 模型报告 #音频生成 19. Unfolded Recursive Expectation-Maximization Neural Netw 5.4分 后50% 方法研究 #声源定位 📋 论文列表 🥇 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization 8.3/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-07-30 · 更新于 2026-08-14 · 15 min · 3188 words

Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception

📄 Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception 标签:#语音交互 #对比学习 #低资源 #音频理解 #Transformer 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音交互 | #对比学习 | #低资源 #音频理解 | arxiv 👥 作者与机构 第一作者:Tian Zheng(中国科学院大学;中国科学院软件研究所) 通讯作者:未说明 作者列表:Tian Zheng(中国科学院大学,中国科学院软件研究所)、Xurong Xie(中国科学院软件研究所)、Xinxin Zhu(北京语言大学)、Xiaolan Peng(中国科学院软件研究所)、Feng Tian(中国科学院软件研究所) 💡 毒舌点评 本文在中文脑电到文本解码这一艰难赛道上首次将文本语义与音频声学双对齐引入CTC框架,在封闭句集分类上取得了大幅超越基线的数字,思路清晰、消融扎实。然而,完全不开源、不提供任何模型或代码,且仅在小规模单数据集上验证,使得其“首次大词汇连续解码”的声称在当前阶段更像概念验证而非可复现的社区资产。 ...

2026-07-29 · 更新于 2026-08-14 · 3 min · 488 words

Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction

📄 Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction 标签:#语音属性识别 #图神经网络 #自监督学习 #低资源 #音频理解 5.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音属性识别 | #图神经网络 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Behrad TaghiBeyglou(多伦多大学电气与计算机工程系) 通讯作者:未说明 作者列表:Behrad TaghiBeyglou(多伦多大学电气与计算机工程系)、Fatemeh Bagheri(多伦多大学电气与计算机工程系)、Ervin Sejdic(多伦多大学电气与计算机工程系 / North York General Hospital) 💡 毒舌点评 文章用"SSL特征+GNN图分类"的思路为ALS语音评估提供了一种简洁的多段录音融合方案,在挑战赛验证集上确实压过了官方基线。然而全部实验仅在一个单中心意大利语数据集上完成,且关键设计(kNN图与固定时长拼接)缺乏消融证明,使得"图方法优于简单池化"这一核心主张仍停留在相关性而非因果层面。更麻烦的是,10折CV在全部受试者上进行,随后再在官方训练/验证集划分上重训练,超参选择阶段已间接看到验证集数据,存在信息泄露风险。 ...

2026-07-29 · 更新于 2026-08-14 · 3 min · 601 words