VibeVoice-ASR-Streaming Technical Report

📄 边听边分清谁在说:把长历史留下来做说话人归属 英文题目:VibeVoice-ASR-Streaming Technical Report 一句话:针对流式会议转录要同时低延迟输出文字与说话人标签的难题,论文把固定块加前视与历史交错放入单一自回归上下文,用 7B 模型在五集合均值与 12 个归属设置上取得最优,代价是 8 分钟上限与首包更慢。 标签:#语音识别 | #语音大模型 | #说话人日志 | #流式处理 | #会议转录 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yujie Tu:University of Chinese Academy of Sciences Zhiliang Peng:Microsoft Research Jianwei Yu:Microsoft Research Li Dong:Microsoft Research Songchen Xu:Shanghai Jiao Tong University Yaoyao Chang:Microsoft Research Wenhui Wang:Microsoft Research Zilong Wang:Microsoft Research Zehua Wang:Microsoft Research Yan Xia:Microsoft Research Jiajun Zhang:University of Chinese Academy of Sciences Xie Chen:Shanghai Jiao Tong University Furu Wei:Microsoft Research 💬 毒舌点评 把长历史保留在自回归上下文里来固定说话人身份是漂亮而务实的选择,云端对比的延迟与代价测量也难得诚实。但序列化单流输出对长时重叠的妥协、八分钟上限与首包延迟问题让实时声称打了折,技术报告仍更像强工程而非范式突破。 ...

2026-09-03 · 更新于 2026-09-04 · 2 min · 294 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

📄 Don’t Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding 标签:#音频理解 #长音频处理 #图神经网络 #音频检索 #会议转录 7.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.7/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #图神经网络 | #长音频处理 #音频检索 | arxiv 👥 作者与机构 第一作者:Quanwei Tang(School of Computer Science & Technology, NLP Lab, Soochow University, China) 通讯作者:Dong Zhang 作者列表:Quanwei Tang、Dong Zhang、Shoushan Li、Guodong Zhou(机构:School of Computer Science & Technology, NLP Lab, Soochow University, China;Jiangsu Key Lab of Language Computing, Suzhou) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 770 words

语音/音乐/音频论文速递 2026-08-26

语音/音乐/音频论文速递 2026-08-26 共分析 26 篇论文 ⚡ 今日概览 ✅ 筛选入选 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 7 篇 ███████ #空间音频 3 篇 ███ #语音交互 2 篇 ██ #语音合成 2 篇 ██ #音乐生成 2 篇 ██ #音视频理解 2 篇 ██ #声源定位 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions… 9.6 前10% 方法研究 #语音合成 🥈 LAION-BVD: A 10-Million-Hour Open Video Dataset for… 9.4 前10% 数据集与基准 #音视频理解 🥉 The ISCSLP 2026 Real-World Audio-Visual Speech… 8.8 前25% 数据集与基准 #音视频语音分离 4. EM-KalmanNet: Learned Expectation-Maximization for… 8.8 前25% 方法研究 #声源定位 5. EXAM\(^2\): \(\underline{Ex}tending\) \(\underline{A}udio\)… 8.7 前25% 数据集与基准 #音频理解 6. FireRedAudio: A General-Purpose Audio Language Model… 8.7 前25% 模型报告 #音频理解 7. Arbitrary Polygon Oscillator: Generalizing Polygonal… 8.7 前25% 方法研究 #音乐生成 8. Relative Time Intervals Representation for Word-level… 8.6 前25% 方法研究 #语音识别 9. REDnet: Recursive Encoder and Decoder for Speech… 8.2 前25% 方法研究 #语音分离 10. From local kernels to global form: modeling the… 8.2 前25% 理论研究 #音乐理解 11. Lost in Speech: Trilingual Spoken Hallucination… 8.2 前25% 数据集与基准 #音频理解 12. Weakly Supervised Seafloor Segmentation for Seagrass… 8.1 前25% 方法研究 #音频理解 13. SonarLLM: A Native Sonar–Optical Multimodal Large… 8.0 前25% 方法研究 #音频理解 14. CoSTALA: Compositional Spatio-Temporal Audio-Language… 7.9 前25% 方法研究 #空间音频 15. Don’t Just Listen, Try Planning: Graph-based Retrieval… 7.8 前25% 方法研究 #音频理解 16. On the Robustness of Audio Deepfake Detection under… 7.7 前25% 方法研究 #音频伪造检测 17. Speech-to-SOAP: End-to-End Summarization of Medical… 7.7 前25% 系统技术报告 #音频理解 18. Array-Agnostic Ambisonics Encoding via Diffusion… 7.5 前25% 方法研究 #空间音频 19. OmniJudge or OmniBias? Diagnosing Multimodal Judges… 7.4 前50% 数据集与基准 #音频质量评估 20. Task-disentangled Low-Rank Adaptation for Versatile… 7.4 前50% 方法研究 #音视频理解 21. Anatomy of a Scam Call: What 10,000 real scam and spam… 7.3 前50% 应用研究 #语音交互 22. Preference Optimization for Non-Verbal Vocalization… 7.1 前50% 方法研究 #语音合成 23. One Timeline, Many Renderings: A Wolfram Language… 7.0 前50% 系统技术报告 #音乐生成 24. Visually-Guided Spatial Audio Generation for… 6.9 前50% 方法研究 #空间音频 25. Benchmarking LLM Judges for Voice-Agent Evaluation… 6.6 前50% 数据集与基准 #语音交互 26. Investigating voiced and unvoiced regions of speech… 6.4 前50% 方法研究 #语音伪造检测 📋 论文列表 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ...

2026-08-26 · 更新于 2026-09-04 · 22 min · 4543 words

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

📄 Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction 标签:#语音识别 #模型融合 #语音分离 #说话人日志 #会议转录 7.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #模型融合 | #语音分离 #说话人日志 | arxiv 👥 作者与机构 第一作者:Hermann Yepdjio Nkouanga(Portland State University, USA) 通讯作者:正文未明确标注 作者列表:Hermann Yepdjio Nkouanga、Minwei Luo、Maggie Wigness、Suresh Singh(机构:Portland State University, USA;US Army Research Laboratory, USA) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 541 words

语音/音乐/音频论文速递 2026-08-25

语音/音乐/音频论文速递 2026-08-25 共分析 46 篇论文 ⚡ 今日概览 ✅ 筛选入选 46 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 7 篇 ███████ #音视频理解 4 篇 ████ #语音交互 3 篇 ███ #语音增强 3 篇 ███ #语音情感识别 3 篇 ███ #音频事件检测 3 篇 ███ #音频理解 3 篇 ███ #语音合成 2 篇 ██ 📊 论文评分排行榜(46 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 TLive-Omni: An Omni-Modal Understanding Model for E… 10.0 前10% 系统技术报告 #音视频理解 🥈 sanoTTS: The Smallest Real-Time Neural TTS on a… 10.0 前10% 系统技术报告 #语音合成 🥉 Do Spoken Language Models Hear Speech as They Read… 10.0 前10% 方法研究 #语音交互 4. LipsAM: Lipschitz-continuous Neural Networks for… 10.0 前10% 理论研究 #音频修复 5. PolyChirp: Multi-Species Birdsong Classification Using… 10.0 前10% 系统技术报告 #音频分类 6. EchoWM: Open and Enterable Omnimodal World Models 10.0 前10% 系统技术报告 #音视频生成 7. Simulation-to-Real First-Break Segmentation for… 9.8 前10% 应用研究 #音频事件检测 8. A Computationally Efficient Likelihood Approximation… 9.8 前10% 方法研究 #声源定位 9. A Factorial Ablation of a Speech-to-SFT Pipeline… 9.7 前10% 应用研究 #语音交互 10. Self-Supervised Speech Representations Track Spoken… 9.7 前10% 应用研究 #语音属性识别 11. AudioWorldSim: Realistic Binaural Audio Datasets For… 9.7 前10% 系统技术报告 #空间音频 12. AT-ADD: A Benchmark and Challenge for Robust and All… 9.6 前10% 数据集与基准 #音频伪造检测 13. WnW: Waxing-and-Waning KV Cache for Long-Form Speech… 9.4 前10% 方法研究 #语音交互 14. Better Retrieval, Worse Robustness: How Multi-hop RAG… 9.1 前10% 应用研究 #音频理解 15. Training DeepFilterNet with Accurate Room Acoustic… 9.0 前10% 应用研究 #语音增强 16. TurboBias 2.0: Streaming Context-Biasing for… 9.0 前10% 系统技术报告 #语音识别 17. FlowSep 2: Self-Supervised Flow Matching for Language… 9.0 前10% 方法研究 #音频分离 18. Pre-Decoding Acoustic Triage for Budgeted Vision… 9.0 前10% 方法研究 #音视频理解 19. Do SpeechLMs Hear Their Own Opinions? Diagnosing and… 8.9 前25% 方法研究 #语音情感识别 20. MRMAD: A Multi-Round Multi-Audio Benchmark for… 8.9 前25% 数据集与基准 #音频质量评估 21. Unsupervised Speech Recognition at the Syllable Level 8.9 前25% 方法研究 #语音识别 22. Towards Actionable Surgical Team Dynamics: from… 8.9 前25% 数据集与基准 #音视频理解 23. Long-Horizon Audio-Visual Generation for Persistent… 8.9 前25% 系统技术报告 #音视频生成 24. Do Time-Series Foundation Models Pay Off for… 8.8 前25% 应用研究 #音频事件检测 25. MusPyExpress: Extending MusPy with Enhanced Expression… 8.7 前25% 系统技术报告 #音乐理解 26. Adaptive Hierarchical Representation Alliance for… 8.6 前25% 方法研究 #语音情感识别 27. Vibrato Matching for Modulation Control and Blending… 8.5 前25% 方法研究 #音频生成 28. Spiking Neural Networks for Energy-Efficient Object… 8.5 前25% 应用研究 #音频事件检测 29. Development and Feasibility Evaluation of an Edge AI… 8.4 前25% 应用研究 #语音识别 30. Dual-Scale State-Space Modeling with Speaker-Wise… 8.4 前25% 方法研究 #语音情感识别 31. μNet: Ultra-Low-Memory and Low-Complexity Speech… 8.3 前25% 方法研究 #语音增强 32. Cross-Subject Generalization in Decoding Perceived… 8.3 前25% 方法研究 #语音识别 33. Reasoning-Oriented Post-Training and Inference-Time… 8.3 前25% 应用研究 #音频理解 34. Multi-Modal Semantic Expansion with Constrained LLM… 8.3 前25% 系统技术报告 #音乐推荐 35. DAMOS: Learning Distortion-Aware Speech Quality… 8.2 前25% 方法研究 #语音质量评估 36. Multi-Task Learning for Non-Canonical Phoneme… 8.2 前25% 方法研究 #语音识别 37. MetaSICL: Globalizing Auditory LLMs for Underserved… 8.0 前25% 方法研究 #音频理解 38. AudioNoisePrints: Model-free audio watermarking using… 7.9 前25% 方法研究 #音频水印 39. Building and Evaluating a Synthetic Bengali Speech… 7.6 前25% 数据集与基准 #语音合成 40. SlimDiffuSE: Towards Efficient Diffusion-Based Speech… 7.6 前25% 方法研究 #语音增强 41. DiaScriber: A Speech LLM for Joint Diarization and… 7.3 前50% 方法研究 #语音识别 42. A Regularized Block Diagonal RLS Algorithm for… 7.2 前50% 方法研究 #回声消除 43. Separating Voice from Age in COPD Screening 7.2 前50% 应用研究 #语音属性识别 44. Mitigating Speaker Leakage in Cascaded Multi-talker… 7.1 前50% 方法研究 #语音识别 45. Motion-Aware Reasoning from Speech to Mask Tracks… 7.1 前50% 系统技术报告 #音视频理解 46. Humanoid Musical Robots as Experimental Interfaces for… 5.9 前50% 应用研究 #音视频交互 📋 论文列表 🥇 TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming 10.0/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ...

2026-08-25 · 更新于 2026-09-04 · 34 min · 7173 words

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

📄 From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios 标签:#音视频语音识别 #多模态模型 #大语言模型 #模型比较 #会议转录 6.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频语音识别 | #多模态模型 | #大语言模型 #模型比较 | arxiv 👥 作者与机构 第一作者:Thai-Binh Nguyen(Karlsruhe Institute of Technology) 通讯作者:未说明 作者列表:Thai-Binh Nguyen(Karlsruhe Institute of Technology)、Zhaolin Li(Karlsruhe Institute of Technology)、Jan Niehues(Karlsruhe Institute of Technology)、Alexander Waibel(Carnegie Mellon University;论文中 Waibel 的邮箱显示为 zhaolin.li@kit.edu,与第二作者重复,疑似论文排版错误) 💡 毒舌点评 这篇 CHiME-9 MCoRec 系统分析把"鸡尾酒会"问题拆成目标说话人转录与对话聚类两条设计轴,给出"重叠率不能单独解释性能差异"这一反直觉结论,并指出 LLM 语义聚类在高 WER 下仍保持高 F1,对后续系统设计有实际参考价值。 但所有参赛系统都以匿名编号出现且 system paper 尚未发布;各系统在 ASD、AVTSE、AVSR、聚类多个维度上同时变化,文中对"什么策略最有效"的归因停留在相关性层面,无受控消融、无统计显著性检验,session 案例分析样本量也很小。作为挑战赛技术分析报告,定位合格,但难以支撑强因果结论。 ...

2026-08-11 · 更新于 2026-09-04 · 5 min · 895 words

语音/音乐/音频论文速递 2026-08-11

语音/音乐/音频论文速递 2026-08-11 共分析 40 篇论文 ⚡ 今日概览 📥 抓取 40 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 4篇 ████ #音频生成 4篇 ████ #音乐生成 3篇 ███ #音频字幕生成 3篇 ███ #声源定位 2篇 ██ #语音合成 2篇 ██ #语音情感识别 2篇 ██ #语音编码 2篇 ██ 📊 论文评分排行榜(40 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detai 8.4分 前25% 方法研究 #音频字幕生成 🥈 Deferred Audio Pruning with Local Audio-Visual Dynamics 8.4分 前25% 方法研究 #模型剪枝 🥉 PACE: A Playback-Aligned Context Engine for LLM-Based F 8.0分 前25% 系统技术报告 #语音交互 4. REFRAMED: Towards Realistic Audio Description Generatio 8.0分 前25% 数据集与基准 #音频字幕生成 5. SraVaani 1.0: Scaling Inclusive Speech Recognition for 7.9分 前25% 模型报告 #语音识别 6. AudioMap: Cloze-and-Choice Reinforcement Learning for T 7.9分 前25% 方法研究 #音频字幕生成 7. SAMOT: State-Aware Step Modulation and Optimal Transpor 7.7分 前25% 方法研究 #音视频理解 8. ReLMCodec: Designing Predictable Speech Tokens from Pre 7.7分 前25% 方法研究 #语音编码 9. VoxZip: Semantic-Anchored Temporal KV Cache Compression 7.7分 前25% 方法研究 #音频理解 10. Steering dense music retrieval with open-vocabulary con 7.7分 前25% 方法研究 #音乐检索 11. VIOLET: High-Fidelity Violin Synthesis with Techniques 7.6分 前25% 方法研究 #音乐生成 12. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified 7.6分 前25% 模型报告 #音频生成 13. Beyond Reconstruction: Full-Context Generative DiT for 7.5分 前25% 系统技术报告 #音乐生成 14. From Inaudible Inputs to Model Failures: Low-Frequency 7.4分 前50% 方法研究 #音频理解 15. Beyond Piano: Cross-Instrument MIDI Velocity Estimation 7.3分 前50% 方法研究 #音乐理解 16. omni-macos: On-Device Omni-Modal Search on Apple Silico 7.2分 前50% 系统技术报告 #音频检索 17. SCoPE: Training-Free Audio-Visual Event Perception via 7.1分 前50% 方法研究 #音视频理解 18. BAMU: Bitstream-Aware Marginal-Utility Allocation for F 7.1分 前50% 方法研究 #语音编码 19. Dramarrator: Object-Based Audio Editing for Audio Drama 7.0分 前50% 系统技术报告 #音频生成 20. CuteTTS: Efficient and High-Quality Speech Synthesis vi 7.0分 前50% 系统技术报告 #语音合成 21. RAG-Audio: Retrieval-Augmented Generation for Faithful 6.9分 前50% 方法研究 #音频生成 22. Listen, See and Track: Spatio-Temporal Audio-Visual Sou 6.7分 前50% 数据集与基准 #音视频问答 23. From Speech to Interaction: Analyzing Multimodal System 6.6分 前50% 系统技术报告 #音视频语音识别 24. MADBench: A Benchmark for Modality-Aware Audio Deepfake 6.6分 前50% 数据集与基准 #音视频理解 25. A Unifying Perspective on Audio Generative Modeling: La 6.5分 前50% 理论研究 #音频生成 26. Multilingual Emotion Neurons in Large Audio-Language Mo 6.5分 前50% 方法研究 #语音情感识别 27. DAVE: A Decoupled Audio-Visual Enhancement Framework fo 6.5分 前50% 系统技术报告 #音视频语音分离 28. Structured Phonological Representations for Audio-Artic 6.5分 前50% 方法研究 #语音属性识别 29. CtrlSpeech: Coarse-to-Fine Control for Expressive Speec 6.4分 前50% 方法研究 #语音合成 30. Neural Array-Generic Direction-of-Arrival Estimation Ex 6.4分 前50% 方法研究 #声源定位 31. AI-Guided Learning: Research on Knowledge and Skill Acq 6.3分 前50% 系统技术报告 #音视频理解 32. Speaker Role and Language Diarization for Analyzing Mul 6.3分 前50% 应用研究 #说话人日志 33. MusicLayout: Explicit Structural Planning for Controlla 6.3分 前50% 系统技术报告 #音乐生成 34. Mitigating Over-Suppression in Speech Enhancement via I 6.2分 前50% 方法研究 #语音增强 35. Physics-Informed Learning for Robust Acoustic Localizat 6.2分 前50% 方法研究 #声源定位 36. EmoS: A Theory-Grounded Framework for Evaluating and Al 6.2分 前50% 数据集与基准 #语音情感识别 37. Dynamic Clustering for Cross-Segment Permutation Alignm 6.2分 前50% 方法研究 #语音分离 38. The Voiceprint Fallacy: Why Voices Are Not Unique Biome 6.0分 前50% 综述 #说话人验证 39. Investigating Multimodal Informativity under Different 5.9分 前50% 方法研究 #多模态模型 40. Machine-Learning-Based Diagnostic Framework for Passive 5.6分 前50% 应用研究 #音频分类 📋 论文列表 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward 8.4/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ...

2026-08-11 · 更新于 2026-09-04 · 33 min · 6905 words

What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio

📄 What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio 标签:#会议转录 #端到端 #语音识别 #说话人日志 #音频理解 4.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 📝 4.8/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #端到端 | #会议转录 #说话人日志 | arxiv 👥 作者与机构 第一作者:Cheng Siong Chin 通讯作者:Cheng Siong Chin 作者列表:Cheng Siong Chin(纽卡斯尔大学新加坡分校,科学、农业与工程学院)、Jianhua Zhang(青岛理工大学,信息与控制工程学院)、Mohan Venkateshkumar(Amrita Vishwa Vidyapeetham,Amrita工程技术学院,电气与电子工程系) 💡 毒舌点评 论文提出了一个具有实用价值的“透明第一”设计框架,并在工程上集成了一个完整的语音音频分析原型。然而,作为一篇顶会水平的研究论文,它最致命的缺陷在于几乎没有提供任何支撑其系统能力声明的实验验证。它更像一份详尽的产品设计文档或系统说明书,而非一篇经过严格实验检验的研究工作。审稿人无法评估其转录质量、日志准确性或任何声称功能的实际效果,这极大地削弱了其作为学术论文的可信度和影响力。 ...

2026-07-22 · 更新于 2026-09-04 · 2 min · 237 words

语音/音乐/音频论文速递 2026-07-22

语音/音乐/音频论文速递 2026-07-22 共分析 20 篇论文 ⚡ 今日概览 📥 抓取 20 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 5篇 █████ #语音合成 3篇 ███ #音频分类 2篇 ██ #基准测试 1篇 █ #语音交互 1篇 █ #语音分离 1篇 █ #语音增强 1篇 █ #语音情感识别 1篇 █ 📊 论文评分排行榜(20 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Content is What Remains: Invariant Speech Tokenization 9.2分 前10% 方法研究 #语音编码 🥈 Fusion Embedding: A Unified Embedding Space for Text, I 8.6分 前25% 系统技术报告 #音频检索 🥉 End-to-End Markov State Sequence Learning for Auditory 8.3分 前25% 方法研究 #语音交互 4. Staged Depth-Pruning Distillation of a Flow-Matching Te 7.9分 前25% 系统技术报告 #语音合成 5. Constrained CTC Decoding for Efficient Diacritic Restor 7.7分 前25% 方法研究 #语音识别 6. Fretiq: Browser-Native Electric Guitar String Classific 7.5分 前25% 系统技术报告 #音频分类 7. MeetingToM: Evaluating Multimodal LLMs on Theory-of-Min 7.2分 前50% 数据集与基准 #基准测试 8. Transcription Policy as a Latent Variable: Activating C 7.1分 前50% 方法研究 #语音识别 9. Benchmarking Human and Automatic Speech Recognition of 7.0分 前50% 系统技术报告 #语音识别 10. A Situational Speech Synthesizer for Yoruba: System Des 6.7分 前50% 系统技术报告 #语音合成 11. From a Multilingual Streaming ASR Backbone to Kenyan-La 6.5分 前50% 系统技术报告 #语音识别 12. Towards Array-Invariant Speech Enhancement via Geometry 6.3分 前50% 方法研究 #语音增强 13. Comparing Spectrogram Front-Ends for Abnormal Heart-Sou 5.7分 前50% 方法研究 #音频分类 14. EmoEUS: Uncertainty Supervision for Multimodal Emotion 5.6分 前50% 方法研究 #语音情感识别 15. Summary of DCASE 2026 Task 5: Audio-Dependent Question 5.4分 后50% 数据集与基准 #音频理解 16. Towards a reproducible cross-venue method for quantifyi 5.4分 后50% 方法研究 #音频质量评估 17. CS-ETS: Chaos-Inspired Samba-Based EMG-To-Speech Synthe 5.3分 后50% 方法研究 #语音合成 18. Addressing Limited Data in Auditory Attention Decoding 5.1分 后50% 应用研究 #语音分离 19. What the Waveform Knows: Transparent-first Speech and A 4.8分 后50% 系统技术报告 #语音识别 20. Teleportation Game: Quantum Teleportation in Multi-Agen 4.4分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 Content is What Remains: Invariant Speech Tokenization from Parallel Utterances 9.2/10 | 创新 1.5/2 | 严谨 1.5/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-07-22 · 更新于 2026-09-04 · 17 min · 3461 words