The Role of Disfluencies in Speech Translation

📄 The Role of Disfluencies in Speech Translation 标签:#语音翻译 #基准测试 #音频理解 #Transformer #模型评估 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.4/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音翻译 | #Transformer | #基准测试 #音频理解 | arxiv 👥 作者与机构 第一作者:Maike Züfle(卡尔斯鲁厄理工学院) 通讯作者:未说明 作者列表:Maike Züfle(卡尔斯鲁厄理工学院)、Maria Teleki(德克萨斯农工大学)、Fabian Retkowski(卡尔斯鲁厄理工学院)、Vilém Zouhar(苏黎世联邦理工学院)、Oliver Grabner(德克萨斯农工大学)、Alexander Waibel(卡尔斯鲁厄理工学院、卡内基梅隆大学)、James Caverlee(德克萨斯农工大学)、Jan Niehues(卡尔斯鲁厄理工学院) 💡 毒舌点评 这篇论文为语音翻译中的不流畅现象做了一次扎实的"验尸报告":通过人类情感标注和基准构建,首次量化了去除不流畅对情绪感知的扭曲,问题定义清晰且有现实意义。然而,该工作本质上是对现有模型盲点的系统诊断,其贡献边界应更清晰地界定。方法层面的创新有限,推理时策略的改进幅度微小且未解决根本问题——如果加两个上下文示例就能提升5个chrF点,那只能说明当前模型离解决此问题只差一点点提示工程,所谓的"盲点"可能更多是训练数据分布偏差,而非真正的认知缺陷。 ...

2026-08-04 · 更新于 2026-08-14 · 3 min · 557 words

UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations

📄 UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations 标签:#音乐理解 #无监督学习 #测试时自适应 #基准测试 #模型评估 5.5/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #无监督学习 | #测试时自适应 #基准测试 | arxiv 👥 作者与机构 第一作者:Ziyue Kang(论文中未在作者列表处标注机构,但致谢部分提及 XJTU Research Fund for AI Science,推断来自西安交通大学) 通讯作者:论文中未明确标注 作者列表:Ziyue Kang、Nan Nan、Chenhao Lin、Xiaohong Guan(均推断来自西安交通大学,论文首页未列出机构归属,仅致谢中体现 XJTU 资助信息) 💡 毒舌点评 本文把高复调符号音乐压缩形式化为结构化路由问题,并引入训练无关的 UOT 框架,是一个优雅且具有洞察力的建模。然而,整项工作只在一个数据集上评估,且 Orch2Vec 先验的构建细节(树一致边权重拟合、PPMI 稳定化的支持门控与裁剪)被含糊带过,实际复现时将面临诸多暗坑;论文也完全未提代码或模型开源,对社区的直接帮助极为有限。 ...

2026-08-04 · 更新于 2026-08-14 · 5 min · 921 words

语音/音乐/音频论文速递 2026-08-04

语音/音乐/音频论文速递 2026-08-04 共分析 39 篇论文。 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 3篇 ███ #音视频生成 3篇 ███ #语音属性识别 2篇 ██ #说话人验证 2篇 ██ #音视频理解 2篇 ██ #音频分类 2篇 ██ #音频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dat 8.3分 前25% 数据集与基准 #语音识别 🥈 FATE: Frame-Level Audio-Visual Temporal Embedding 8.3分 前25% 方法研究 #音视频理解 🥉 Allocation Before Ranking: Decoupled Token Compression 8.1分 前25% 方法研究 #音视频理解 4. Embodied Passive Aeroacoustic Perception Enables Relati 7.9分 前25% 系统技术报告 #声源定位 5. Interpretable MEG Decoding of Perceived Speech: Cortica 7.9分 前25% 方法研究 #音频检索 6. Beyond Prompt Adherence: Auditing Attribute-Level Voice 7.8分 前25% 方法研究 #语音合成 7. Hidden-Domain Routing for All-Type Audio Deepfake Detec 7.6分 前25% 系统技术报告 #领域适应 8. An End-to-End Workflow for Fin Whale Song Detection, No 7.5分 前25% 系统技术报告 #音频事件检测 9. SAGE: Switch-Aware EEG-Guided Soft Gating for Target Sp 7.3分 前50% 方法研究 #语音分离 10. Experience-Calibrated Contrastive Decoding for Mitigati 7.2分 前50% 方法研究 #语音合成 11. DRONEAUDIONET: Noise Suppression for Drone Audition-bas 7.2分 前50% 方法研究 #音频分离 12. Multi-Backbone Self-Supervised Ensembles for Audio Deep 7.2分 前50% 系统技术报告 #音频伪造检测 13. Hear, Invoke, and Understand: A Skill-Calling Multimoda 7.2分 前50% 方法研究 #音频理解 14. CultureVidBench: Benchmarking Cultural Understanding in 7.2分 前50% 数据集与基准 #音视频生成 15. SwanTale: Unified Multi-Speaker Speech and Audio Genera 7.1分 前50% 系统技术报告 #音频生成 16. Scene2Sound: Auditory-Grounded Soundscape Generation fo 7.0分 前50% 方法研究 #音频生成 17. The Learning Objective Governs Perceptual Narrowing: A 7.0分 前50% 方法研究 #语音属性识别 18. Discriminative Axis, Not Data Volume: What a Contrastiv 6.9分 前50% 方法研究 #语音属性识别 19. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrume 6.9分 前50% 系统技术报告 #音频理解 20. AcoustiTrace: When Plausible Sound Violates Physics 6.9分 前50% 数据集与基准 #音视频生成 21. Gecko: Fast Private Inference via Secure Public Encoder 6.9分 前50% 系统技术报告 #迁移学习 22. LeapTalk: Breaking the Latency-Quality Trade-off in Tal 6.8分 前50% 方法研究 #音视频生成 23. Separate-and-Detect: Unified Drum Transcription and Ste 6.8分 前50% 方法研究 #音乐转录 24. Domain-Specific Evaluation of Text-to-Speech Systems: A 6.8分 前50% 数据集与基准 #语音合成 25. JoyAI-Talker: Full-Duplex Speech Interactive Large Mode 6.5分 前50% 系统技术报告 #语音合成 26. REIMU: Efficient Heterogeneous Hierarchical Reasoning f 6.4分 前50% 方法研究 #语音伪造检测 27. The Role of Disfluencies in Speech Translation 6.4分 前50% 数据集与基准 #语音翻译 28. SCOPE: Entanglement Frontier Escape for Source-Free Cla 6.3分 前50% 方法研究 #说话人验证 29. Uncertainty-Aware Crossmodal Fusion for Classification 6.3分 前50% 方法研究 #音频分类 30. Can Foundation Models Hear What Made That Sound? A Tier 6.3分 前50% 数据集与基准 #音频分类 31. QR-Erase: Efficient Subspace-Based Machine Unlearning w 6.0分 前50% 方法研究 #说话人验证 32. SGAD: A State-Guided Adaptive Decision Framework for Ro 6.0分 前50% 方法研究 #Transformer 33. Normal-Anchored First-Order Model-Agnostic Meta-Learnin 5.9分 前50% 方法研究 #语音识别 34. AnyBand: Unified Multi-Bandwidth Speech Extension via F 5.9分 前50% 方法研究 #语音超分 35. Sounding Canvas: Embedding Algorithms in Networked, Sen 5.7分 前50% 系统技术报告 #RNN 36. UOT-IR: Structured Routing of High-Polyphony Symbolic M 5.5分 前50% 方法研究 #音乐理解 37. Embodied Empathy: A Multimodal AR and LLM-Powered Syste 5.4分 后50% 应用研究 #音频交互 38. Analyzing Speech Condition Effects in Dysarthric ASR: A 5.0分 后50% 方法研究 #语音识别 39. Homebot: A Personal AI Agent for Conversational Home As 3.8分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-08-04 · 更新于 2026-08-14 · 28 min · 5820 words

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

📄 ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine 标签:#音视频理解 #多模态模型 #数据集 #基准测试 #音频理解 8.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 8.3/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Yukang Cao (S-Lab, Nanyang Technological University)、Haozhe Xie (S-Lab, Nanyang Technological University)、Beichen Wen (ACE Robotics) 通讯作者:Dacheng Tao (ACE Robotics)、Xiaogang Wang (ACE Robotics)、Liang Pan (ACE Robotics)、Ziwei Liu (S-Lab, Nanyang Technological University) 作者列表:Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu 💡 毒舌点评 本工作搭建了首个在真实家居中同步捕获视觉、全身运动、物体6D轨迹、触觉与音频的大规模数据集,传感器同步与标定硬核,双尺度设计巧妙,彻底告别了具身数据碎片化。然而音频部分彻底沦为花瓶,基准评测仅涉及视觉、触觉和运动,多通道音频信号未被任何下游任务利用,对语音/音频领域而言几乎只是硬件陈列。触觉手套和全身标记的侵入性也可能让“自然行为”打了折扣,数据集的价值能否泛化到无穿戴场景存疑。 ...

2026-07-31 · 更新于 2026-08-14 · 5 min · 853 words

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

📄 AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach 标签:#语音识别 #大语言模型 #基准测试 #音频理解 #Transformer 6.8/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音识别 | #大语言模型 | #基准测试 #音频理解 | arxiv 👥 作者与机构 第一作者:Zixuan Jiang(论文中未说明具体机构,仅署名标注1,2,3) 通讯作者:Xie Chen(论文中未列出机构,但从上下文推断为上海交通大学) 作者列表:Zixuan Jiang、Binghao Qiang、Jiaying Chi、Yanqiao Zhu、Kai Yu、Xie Chen(论文未提供任何机构全称,仅以数字上标区分署名) 💡 毒舌点评 这篇论文把口语转书面语包装成一个新任务AgenticSR,并搭了一套从数据合成到在线修订的完整系统,实用野心一目了然。AgenticASR的滑动窗口修订机制确实让流式场景下的后编辑成为可能,比传统“等话说完再清洁”的思路更接地气。但问题在于,任务定义把所有后处理操作一锅烩,四个评测维度看似精细,实则把需要不同容错策略的场景用同一把尺子量,未免粗暴。AASR-Bench的合成语音占比超八成,真实录音的泛化性几乎无凭据,而Refiner对上游ASR的强依赖让整个系统在噪声场景下像纸牌屋——ASR一塌,后段再洗也白搭。此外,在线延迟虽然控制得不错,但论文始终回避端到端全链路延迟分析,实际部署时的体感延迟可能远高于报告的12秒。 ...

2026-07-31 · 更新于 2026-08-14 · 2 min · 418 words

CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation

📄 CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation 标签:#音乐源分离 #数据集 #基准测试 #多通道 #音频理解 7.3/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐源分离 | #数据集 | #基准测试 #多通道 | arxiv 👥 作者与机构 第一作者:Enric Gusó(Eurecat, Centre Tecnològic de Catalunya,未注明具体学院/系) 通讯作者:未明确说明 其他作者:Xavier Serra(Universitat Pompeu Fabra,根据过往信息应隶属其 Music Technology Group,但论文未明确说明机构) 💡 毒舌点评 一篇被“工程落地”掩盖了“学术灵气”的工作。作者把语音增强的“脏化-清洗”老方子,一丝不苟地糊在了音乐源分离这面新墙上:现场噪声音源库(CrowdioSet)和场馆冲激响应库(PaRIRset)填补了数据空白,但方法本身是 WHAM!/WHAMR! 的复刻,毫无架构或理论惊喜。合成跟唱的 pipeline 更是提着木偶线模仿真人,音色转换模型一通操作,结果依然与主唱高度相关,不仅没做成加分项,反而在消融实验里“查无此人”,贡献纯粹停留在“生成了这个数据但效果未知”的水平。最终的分离结果依然在极低 SDR 区间挣扎(人声最高仅 3.26 dB),离“可用”还有十万八千里,更像是一份扎实的数据集论文而非方法突破。 ...

2026-07-31 · 更新于 2026-08-14 · 4 min · 644 words

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

📄 Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding 标签:#语音识别 #迁移学习 #基准测试 #模型比较 #音频理解 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音识别 | #迁移学习 | #基准测试 #模型比较 | arxiv 👥 作者与机构 第一作者:Owais Mujtaba Khanday(格拉纳达大学信号理论、通信与电信系、CITIC-UGR) 通讯作者:Jose A. Gonzalez-Lopez(格拉纳达大学信号理论系、CIMCYC) 作者列表:Owais Mujtaba Khanday(格拉纳达大学信号理论、通信与电信系、CITIC-UGR)、Mohamed Baha Ben Ticha(格拉纳达大学信号理论系、CIMCYC & Chouaib Doukkali 大学信息科技实验室)、Sanae Belfrouh(Chouaib Doukkali 大学信息科技实验室)、Marc Ouellet(格拉纳达大学 CIMCYC)、Jose A. Gonzalez-Lopez(格拉纳达大学信号理论系、CIMCYC) 💡 毒舌点评 这篇论文首次以严格对照的方式回答了 EEG 基础模型能否迁移到语音解码这一关键问题,给出了清晰的否定结论,实验设计扎实,泄漏控制到位。然而,结论本身更像是一份“打脸”报告而非建设性方案,对为何不迁移的深层机理(如预训练数据分布、语音特异性神经动力学)缺乏分析和假说验证;零开源让他人既无法验证也难以在其基础上继续推进,使得这项工作止步于一次昂贵的负面报告。 ...

2026-07-31 · 更新于 2026-08-14 · 4 min · 689 words

Teffic-Audio: Tell Fact from Fiction

📄 Teffic-Audio: Tell Fact from Fiction 标签:#语音伪造检测 #对抗训练 #鲁棒性 #基准测试 #模型比较 6.8/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音伪造检测 | #对抗训练 | #鲁棒性 #基准测试 | arxiv 👥 作者与机构 第一作者:Wan Lin(未说明)— 根据原文,作者列表为“Amphion Team”,具体为:Wan Lin, Li Wang, Jindong Wang, Kunyu Feng, Zhizheng Wu。机构均未明确说明。 通讯作者:未说明 💡 毒舌点评 这篇报告用一个"朴素"的Conformer架构,靠着一套精心设计的"数据食谱"(多源数据整合、攻击源平衡采样、多样音频增强),在Speech-DF-Arena排行榜上拿下了第一。它有力地证明了在语音伪造检测中,好的训练数据分布有时比花哨的模型架构更重要。然而,短板同样致命:系统完全闭源,代码和模型权重一概欠奉,仅有一个demo页面供人"瞻仰",这让1.454%的EER看起来更像是一个诱人但无法检验的广告。训练超参数等关键细节的大量留白,使得独立复现几乎成了"不可能完成的任务",削弱了其作为公共基线的价值。 ...

2026-07-31 · 更新于 2026-08-14 · 7 min · 1458 words

语音/音乐/音频论文速递 2026-07-31

语音/音乐/音频论文速递 2026-07-31 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 3篇 ███ #语音交互 2篇 ██ #音频理解 2篇 ██ #医疗音频 1篇 █ #歌唱生成 1篇 █ #语音伪造检测 1篇 █ #语音分离 1篇 █ #语音属性识别 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SKY-Piano: A Multimodal Piano Performance Dataset 8.3分 前25% 数据集与基准 #音频理解 🥈 ACE-Data-0: Human-Centric Ambient Capture as Embodied D 8.3分 前25% 数据集与基准 #音视频理解 🥉 Improved Robustness in AI-Generated Music Detection 8.0分 前25% 方法研究 #音频伪造检测 4. Integrating Contextual Embeddings into Evaluation of Ex 7.7分 前25% 方法研究 #音乐理解 5. VocalRender: Score-Native Singing Voice Synthesis for R 7.5分 前25% 模型报告 #歌唱生成 6. WeSep: A Modular and Cue-Composable Framework for Targe 7.4分 前50% 系统技术报告 #语音分离 7. CrowdioSet and PaRIRset: Two Datasets Towards Live Musi 7.3分 前50% 数据集与基准 #音乐源分离 8. Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy 7.2分 前50% 系统技术报告 #语音交互 9. RIPPLE: Generating Multi-Channel Phase, Not Recovering 7.1分 前50% 方法研究 #音频理解 10. AgenticASR: Refining Speech Recognition in Real-World S 6.8分 前50% 系统技术报告 #语音识别 11. Teffic-Audio: Tell Fact from Fiction 6.8分 前50% 系统技术报告 #语音伪造检测 12. Does EEG Foundation Models Transfer to Speech? A Benchm 6.5分 前50% 数据集与基准 #语音识别 13. The MADRS Pipeline: Supporting Depression Assessment in 5.8分 前50% 系统技术报告 #医疗音频 14. Digital Harf: A Clinically Integrated Multimodal AI Sys 5.6分 前50% 系统技术报告 #语音交互 15. Enhancing Law-Enforcement Audio Transcription: A LoRA-B 4.8分 后50% 应用研究 #语音识别 16. Correlation between prosody and pragmatics: A case stud 4.4分 后50% 应用研究 #语音属性识别 📋 论文列表 🥇 SKY-Piano: A Multimodal Piano Performance Dataset 8.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-31 · 更新于 2026-08-14 · 13 min · 2588 words

CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions

📄 CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions 标签:#音视频理解 #多模态模型 #数据集 #医疗音频 #基准测试 7.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.7/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #数据集 #医疗音频 | arxiv 👥 作者与机构 第一作者:David Gimeno-Gómez(PRHLT, Universitat Politècnica de València, Spain; 与 Catarina Botelho 共同第一作者) 通讯作者:未说明 作者列表:David Gimeno-Gómez(PRHLT, Universitat Politècnica de València, Spain)、Catarina Botelho(Sword Health, Portugal; INESC-ID, Portugal)、Carlos-D. Martínez-Hinarejos(PRHLT, Universitat Politècnica de València, Spain)、Isabel Trancoso(INESC-ID, Portugal; Instituto Superior Técnico, Universidade de Lisboa, Portugal)、Alberto Abad(INESC-ID, Portugal; Instituto Superior Técnico, Universidade de Lisboa, Portugal) 💡 毒舌点评 这是一个野心勃勃、工程扎实的多模态医疗数据集,覆盖12种疾病和多维行为特征,其规模和结构化的元数据弥足珍贵。然而,数据集本质上仍是二手数据再加工,缺乏原生的临床验证和标准化录制协议;控制组的构成也使得疾病 vs 健康的对比难以做到纯粹,基于文本叙事推断的情绪和症状元数据更需谨慎使用,否则可能沦为大规模噪声源。 ...

2026-07-29 · 更新于 2026-08-14 · 6 min · 1119 words