语音/音乐/音频论文速递 2026-08-06

语音/音乐/音频论文速递 2026-08-06 共分析 26 篇论文 ⚡ 今日概览 📥 抓取 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 3篇 ███ #语音增强 2篇 ██ #语音质量评估 2篇 ██ #音乐理解 2篇 ██ #音视频理解 2篇 ██ #音视频生成 2篇 ██ #音频事件检测 2篇 ██ #语音属性识别 1篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Equivariant Music Transformer 8.6分 前25% 方法研究 #音乐生成 🥈 Breaking the Curse ofMultilinguality inMany-to-Many Spe 8.2分 前25% 方法研究 #语音翻译 🥉 PASE: Leveraging the Phonological Prior of WavLM for Lo 8.1分 前25% 方法研究 #语音增强 4. Towards Robust Version Identification in the Wild: A Da 8.0分 前25% 数据集与基准 #音乐检索 5. Agogic: Performance-Timed Music Tokens for LLM-Native T 7.9分 前25% 方法研究 #音频理解 6. OmniPack: Unified Token Compression for Efficient Omni- 7.7分 前25% 方法研究 #音视频理解 7. OmniVR: Joint Video-Audio Conditional Generation for Re 7.7分 前25% 方法研究 #音视频生成 8. A Dual Evaluation for Music Transcription 7.7分 前25% 方法研究 #音乐转录 9. Crowdsourced Multilingual Speech Intelligibility Testin 7.5分 前25% 数据集与基准 #语音质量评估 10. MERaLiON-GR: Speech Gender Recognition Model for Englis 7.5分 前25% 模型报告 #语音属性识别 11. HyPASE: Hyperbolic Geometry for Parameter-Efficient Spe 7.2分 前50% 方法研究 #语音情感识别 12. Transfer Learning for Avian Bioacoustics under Sparse P 7.1分 前50% 方法研究 #音频分类 13. Helping Music Co-Creation Agents ‘Listen’ Well: Hierarc 7.1分 前50% 方法研究 #音乐理解 14. EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Li 7.1分 前50% 系统技术报告 #音视频交互 15. StuPASE: Towards Low-Hallucination Studio-Quality Gener 7.0分 前50% 方法研究 #语音增强 16. Identity-Faithful Audio-Visual Target Speaker Extractio 6.8分 前50% 数据集与基准 #音视频语音分离 17. AudioScape-TTA: A Structured Soundscape Benchmark for F 6.8分 前50% 数据集与基准 #音频生成 18. Visual Representation Matters: Exploiting Temporal Diff 6.8分 前50% 方法研究 #音视频生成 19. Spoken Function Calling: A New Perspective on Spoken La 6.7分 前50% 数据集与基准 #音频理解 20. Masked diffusion enables coherent beat tracking 6.5分 前50% 方法研究 #音乐理解 21. InvFlowFD: Reference-Free and Background-Set-Free Perce 6.4分 前50% 方法研究 #音频质量评估 22. Smartphone Audio Based Distress Detection 6.3分 前50% 系统技术报告 #音频事件检测 23. Assessing speech quality metrics for evaluation of neur 6.0分 前50% 数据集与基准 #语音质量评估 24. Modality Agreement- and Conflict-Aware Prototype Hyperg 5.5分 前50% 方法研究 #音频理解 25. Deep Learning for Real-Time Sound Order Recognition in 5.2分 后50% 方法研究 #音频事件检测 26. C\(^2\)MOE: Consistency and Complementarity-guided Mixtur 4.1分 后50% 方法研究 #音视频理解 📋 论文列表 🥇 Equivariant Music Transformer 8.6/10 | 创新 1.4/2 | 严谨 1.5/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-06 · 更新于 2026-09-04 · 23 min · 4884 words

语音/音乐/音频论文速递 2026-08-05

语音/音乐/音频论文速递 2026-08-05 共分析 32 篇论文 ⚡ 今日概览 📥 抓取 32 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 6篇 ██████ #语音合成 3篇 ███ #音频生成 3篇 ███ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #多任务学习 1篇 █ 📊 论文评分排行榜(32 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8分 前25% 系统技术报告 #音乐转录 🥈 Efficient Audio Enhancement with a Differentiable Psych 8.2分 前25% 系统技术报告 #音频超分辨 🥉 GROW: Group-Relative Advantage-Weighted On-Policy Reinf 8.0分 前25% 方法研究 #语音合成 4. Reinforcement Learning with Evolving Rubrics as Rewards 7.6分 前25% 方法研究 #音频理解 5. Cross-cultural evaluation of taste-sound correspondence 7.5分 前25% 应用研究 #音乐理解 6. dots.tts.edit: Precisely Controlled Speech Editing with 7.4分 前50% 模型报告 #语音编辑 7. Anomalous Sound Detection Meets Noise-Aware Self-Superv 7.2分 前50% 方法研究 #音频事件检测 8. Towards More Expressive Spoken LLMs: Fine-Grained Inten 7.2分 前50% 方法研究 #语音交互 9. CLASVS: Continuous-Latent Autoregression for Melody-Pre 7.1分 前50% 方法研究 #自回归模型 10. Music Restoration via Latent Operator Optimization and 7.0分 前50% 方法研究 #音频修复 11. DDSynth-RL: Audio Synthesizer Inversion via Discrete Di 7.0分 前50% 方法研究 #音频生成 12. Language-Specialized Multi-Teacher On-Policy Distillati 6.9分 前50% 方法研究 #语音识别 13. AI-Based Sound Effect Generation: A Narrative Review of 6.9分 前50% 综述 #音频生成 14. Hear to See: Discerning Stateful Listening for Audio-Vi 6.8分 前50% 方法研究 #音频理解 15. On the Geometry of Music Bandwidth Extension in Latent 6.7分 前50% 方法研究 #音频理解 16. Learning Music Style for Piano Arrangement Through Cros 6.6分 前50% 方法研究 #音乐生成 17. Adaptive Modality Reliability Diagnosis and Restoration 6.4分 前50% 方法研究 #音视频理解 18. Latent Softmax for Data-Efficient Phoneme-Based Multili 6.3分 前50% 方法研究 #语音识别 19. Echo-Aware Modulation for Compact-Latent Frequency-Time 6.3分 前50% 方法研究 #语音增强 20. Geometric Cross-Modal Token Selection for Latency-Const 6.2分 前50% 方法研究 #音视频问答 21. Rethinking Modality Reliability in Multimodal Sentiment 6.2分 前50% 方法研究 #音视频理解 22. Towards Real-world Environment-aware Zero-shot Text-to- 6.1分 前50% 方法研究 #语音合成 23. MeloCodec: Harnessing Melodic Priors for High-Fidelity 6.1分 前50% 方法研究 #歌唱生成 24. Speaker Verification Under Real Classroom Conditions fo 5.7分 前50% 应用研究 #说话人验证 25. Band-Count Dense Modal Estimation with Fixed-Frequency 5.6分 前50% 方法研究 #音频理解 26. Simulation-Based Plate-Reverb Parameter Estimation from 5.5分 前50% 方法研究 #音频理解 27. MEMS Microphones as Ultrasonic Transducers: Nonlinear E 5.5分 前50% 系统技术报告 #音频生成 28. Beyond One-Size-Fits-All: Personalized and Culturally A 5.2分 后50% 方法研究 #语音合成 29. Deep Learning-Based Active Trim Panels for Enhanced Air 5.0分 后50% 方法研究 #多任务学习 30. Calliphony: A Calligraphy-Driven Interface for Real-Tim 5.0分 后50% 系统技术报告 #音乐生成 31. Evidence-Grounded Multimodal Knowledge Graph Constructi 4.7分 后50% 系统技术报告 #音视频问答 32. What Is Sonification? Toward a Philosophy of Sonificati 3.8分 后50% 理论研究 #音频理解 📋 论文列表 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-05 · 更新于 2026-09-04 · 24 min · 4991 words

语音/音乐/音频论文速递 2026-08-04

语音/音乐/音频论文速递 2026-08-04 共分析 39 篇论文。 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 3篇 ███ #音视频生成 3篇 ███ #语音属性识别 2篇 ██ #说话人验证 2篇 ██ #音视频理解 2篇 ██ #音频分类 2篇 ██ #音频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dat 8.3分 前25% 数据集与基准 #语音识别 🥈 FATE: Frame-Level Audio-Visual Temporal Embedding 8.3分 前25% 方法研究 #音视频理解 🥉 Allocation Before Ranking: Decoupled Token Compression 8.1分 前25% 方法研究 #音视频理解 4. Embodied Passive Aeroacoustic Perception Enables Relati 7.9分 前25% 系统技术报告 #声源定位 5. Interpretable MEG Decoding of Perceived Speech: Cortica 7.9分 前25% 方法研究 #音频检索 6. Beyond Prompt Adherence: Auditing Attribute-Level Voice 7.8分 前25% 方法研究 #语音合成 7. Hidden-Domain Routing for All-Type Audio Deepfake Detec 7.6分 前25% 系统技术报告 #领域适应 8. An End-to-End Workflow for Fin Whale Song Detection, No 7.5分 前25% 系统技术报告 #音频事件检测 9. SAGE: Switch-Aware EEG-Guided Soft Gating for Target Sp 7.3分 前50% 方法研究 #语音分离 10. Experience-Calibrated Contrastive Decoding for Mitigati 7.2分 前50% 方法研究 #语音合成 11. DRONEAUDIONET: Noise Suppression for Drone Audition-bas 7.2分 前50% 方法研究 #音频分离 12. Multi-Backbone Self-Supervised Ensembles for Audio Deep 7.2分 前50% 系统技术报告 #音频伪造检测 13. Hear, Invoke, and Understand: A Skill-Calling Multimoda 7.2分 前50% 方法研究 #音频理解 14. CultureVidBench: Benchmarking Cultural Understanding in 7.2分 前50% 数据集与基准 #音视频生成 15. SwanTale: Unified Multi-Speaker Speech and Audio Genera 7.1分 前50% 系统技术报告 #音频生成 16. Scene2Sound: Auditory-Grounded Soundscape Generation fo 7.0分 前50% 方法研究 #音频生成 17. The Learning Objective Governs Perceptual Narrowing: A 7.0分 前50% 方法研究 #语音属性识别 18. Discriminative Axis, Not Data Volume: What a Contrastiv 6.9分 前50% 方法研究 #语音属性识别 19. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrume 6.9分 前50% 系统技术报告 #音频理解 20. AcoustiTrace: When Plausible Sound Violates Physics 6.9分 前50% 数据集与基准 #音视频生成 21. Gecko: Fast Private Inference via Secure Public Encoder 6.9分 前50% 系统技术报告 #迁移学习 22. LeapTalk: Breaking the Latency-Quality Trade-off in Tal 6.8分 前50% 方法研究 #音视频生成 23. Separate-and-Detect: Unified Drum Transcription and Ste 6.8分 前50% 方法研究 #音乐转录 24. Domain-Specific Evaluation of Text-to-Speech Systems: A 6.8分 前50% 数据集与基准 #语音合成 25. JoyAI-Talker: Full-Duplex Speech Interactive Large Mode 6.5分 前50% 系统技术报告 #语音合成 26. REIMU: Efficient Heterogeneous Hierarchical Reasoning f 6.4分 前50% 方法研究 #语音伪造检测 27. The Role of Disfluencies in Speech Translation 6.4分 前50% 数据集与基准 #语音翻译 28. SCOPE: Entanglement Frontier Escape for Source-Free Cla 6.3分 前50% 方法研究 #说话人验证 29. Uncertainty-Aware Crossmodal Fusion for Classification 6.3分 前50% 方法研究 #音频分类 30. Can Foundation Models Hear What Made That Sound? A Tier 6.3分 前50% 数据集与基准 #音频分类 31. QR-Erase: Efficient Subspace-Based Machine Unlearning w 6.0分 前50% 方法研究 #说话人验证 32. SGAD: A State-Guided Adaptive Decision Framework for Ro 6.0分 前50% 方法研究 #Transformer 33. Normal-Anchored First-Order Model-Agnostic Meta-Learnin 5.9分 前50% 方法研究 #语音识别 34. AnyBand: Unified Multi-Bandwidth Speech Extension via F 5.9分 前50% 方法研究 #语音超分 35. Sounding Canvas: Embedding Algorithms in Networked, Sen 5.7分 前50% 系统技术报告 #RNN 36. UOT-IR: Structured Routing of High-Polyphony Symbolic M 5.5分 前50% 方法研究 #音乐理解 37. Embodied Empathy: A Multimodal AR and LLM-Powered Syste 5.4分 后50% 应用研究 #音频交互 38. Analyzing Speech Condition Effects in Dysarthric ASR: A 5.0分 后50% 方法研究 #语音识别 39. Homebot: A Personal AI Agent for Conversational Home As 3.8分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-08-04 · 更新于 2026-09-04 · 28 min · 5820 words

语音/音乐/音频论文速递 2026-08-03

语音/音乐/音频论文速递 2026-08-03 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #音频理解 2篇 ██ #主动降噪 1篇 █ #元学习 1篇 █ #医疗音频 1篇 █ #声源定位 1篇 █ #数据集 1篇 █ #语音交互 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Do Music Foundation Models Embed Pitch in Helical Struc 8.1分 前25% 方法研究 #音乐理解 🥈 Versatile On-device Adaptation at the Edge by Unifying 8.1分 前25% 系统技术报告 #元学习 🥉 FriendBench: Benchmarking Dyadic Familiarity Inference 7.9分 前25% 数据集与基准 #音视频理解 4. Cloned Voices, Real Consequences: Evaluating Bias in Po 7.7分 前25% 数据集与基准 #语音伪造检测 5. A Neurosymbolic Approach for Explainable Early Diagnosi 7.7分 前25% 系统技术报告 #音频理解 6. DoubleHelix: Structured Cross-Modal Fusion for Audio-Vi 7.4分 前50% 方法研究 #音视频语音识别 7. Tensor-Based Joint Pitch and DOA Estimation 6.9分 前50% 方法研究 #声源定位 8. ParaASR: Multi-Token Prediction for Fast and Long-Conte 6.7分 前50% 系统技术报告 #语音识别 9. Exploring Efficient Waveform Diffusion Models for Foley 6.5分 前50% 方法研究 #音频生成 10. Leveraging Beam Search Information for Confidence Estim 6.3分 前50% 方法研究 #语音识别 11. TORUS: A Test of Rendering-Understanding Self-Coherence 6.1分 前50% 数据集与基准 #音频理解 12. M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain 6.1分 前50% 数据集与基准 #语音交互 13. Stable Autoregressive Speech Generation with Low-Frame- 5.8分 前50% 方法研究 #语音合成 14. Learning to Predict Performance-induced Emotion Differe 5.6分 前50% 方法研究 #数据集 15. Model-Agnostic Meta-Learning Initialization for Distrib 5.1分 后50% 方法研究 #主动降噪 16. Technological Advances in Detecting and Managing Cognit 4.0分 后50% 综述 #医疗音频 📋 论文列表 🥇 Do Music Foundation Models Embed Pitch in Helical Structure? 8.1/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ...

2026-08-03 · 更新于 2026-09-04 · 14 min · 2783 words

语音/音乐/音频论文速递 2026-07-31

语音/音乐/音频论文速递 2026-07-31 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 3篇 ███ #语音交互 2篇 ██ #音频理解 2篇 ██ #医疗音频 1篇 █ #歌唱生成 1篇 █ #语音伪造检测 1篇 █ #语音分离 1篇 █ #语音属性识别 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SKY-Piano: A Multimodal Piano Performance Dataset 8.3分 前25% 数据集与基准 #音频理解 🥈 ACE-Data-0: Human-Centric Ambient Capture as Embodied D 8.3分 前25% 数据集与基准 #音视频理解 🥉 Improved Robustness in AI-Generated Music Detection 8.0分 前25% 方法研究 #音频伪造检测 4. Integrating Contextual Embeddings into Evaluation of Ex 7.7分 前25% 方法研究 #音乐理解 5. VocalRender: Score-Native Singing Voice Synthesis for R 7.5分 前25% 模型报告 #歌唱生成 6. WeSep: A Modular and Cue-Composable Framework for Targe 7.4分 前50% 系统技术报告 #语音分离 7. CrowdioSet and PaRIRset: Two Datasets Towards Live Musi 7.3分 前50% 数据集与基准 #音乐源分离 8. Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy 7.2分 前50% 系统技术报告 #语音交互 9. RIPPLE: Generating Multi-Channel Phase, Not Recovering 7.1分 前50% 方法研究 #音频理解 10. AgenticASR: Refining Speech Recognition in Real-World S 6.8分 前50% 系统技术报告 #语音识别 11. Teffic-Audio: Tell Fact from Fiction 6.8分 前50% 系统技术报告 #语音伪造检测 12. Does EEG Foundation Models Transfer to Speech? A Benchm 6.5分 前50% 数据集与基准 #语音识别 13. The MADRS Pipeline: Supporting Depression Assessment in 5.8分 前50% 系统技术报告 #医疗音频 14. Digital Harf: A Clinically Integrated Multimodal AI Sys 5.6分 前50% 系统技术报告 #语音交互 15. Enhancing Law-Enforcement Audio Transcription: A LoRA-B 4.8分 后50% 应用研究 #语音识别 16. Correlation between prosody and pragmatics: A case stud 4.4分 后50% 应用研究 #语音属性识别 📋 论文列表 🥇 SKY-Piano: A Multimodal Piano Performance Dataset 8.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-31 · 更新于 2026-09-04 · 13 min · 2588 words

语音/音乐/音频论文速递 2026-07-30

语音/音乐/音频论文速递 2026-07-30 共分析 19 篇论文 ⚡ 今日概览 📥 抓取 19 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #音频伪造检测 2篇 ██ #CNN 1篇 █ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(19 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework 8.3分 前25% 方法研究 #音频伪造检测 🥈 A large-scale corpus of religious radio broadcast trans 8.2分 前25% 数据集与基准 #说话人日志 🥉 Voice Memory for Agentic Speech Recognition 8.2分 前25% 方法研究 #语音识别 4. Less is More: Modality-Decoupling for General AIGC Audi 7.5分 前25% 方法研究 #音频伪造检测 5. MPEcho: A Melody and Phoneme-Aware Generative Framework 7.4分 前50% 方法研究 #音乐生成 6. Prosody-driven Jailbreaks in Audio LLMs: A Controlled S 7.0分 前50% 方法研究 #音频交互 7. Few-Shot Open-Set Audio Classification via Transductive 6.8分 前50% 方法研究 #音频分类 8. TaoMate: Anchor-Guided Memory Bridging Evolving and Ref 6.7分 前50% 方法研究 #音视频生成 9. Symphony of Bias: Exploring Gender Associations with Mu 6.6分 前50% 数据集与基准 #音乐理解 10. Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction 6.6分 前50% 方法研究 #语音伪造检测 11. DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking D 6.5分 前50% 方法研究 #语音交互 12. Dissecting Sensitivity to Training Language in Self-Sup 6.3分 前50% 方法研究 #语音识别 13. Detection of AI-generated stems within hybrid human-AI 6.3分 前50% 方法研究 #CNN 14. MMAC: A Massive Multi-dimensional Benchmark for Audio C 6.3分 前50% 数据集与基准 #音频字幕生成 15. Explicit Note-Event Tokenization and Pitch-Validity Con 6.1分 前50% 方法研究 #音乐转录 16. Zero-Shot Face-to-Speech Synthesis via Latent Space Ada 6.0分 前50% 方法研究 #语音合成 17. A Study on Online Mask-based Beamforming Using Per-chan 5.7分 前50% 方法研究 #语音增强 18. Qwen-Audio-3.0-Gen-Preview Technical Report 5.6分 前50% 模型报告 #音频生成 19. Unfolded Recursive Expectation-Maximization Neural Netw 5.4分 后50% 方法研究 #声源定位 📋 论文列表 🥇 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization 8.3/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-07-30 · 更新于 2026-09-04 · 15 min · 3188 words

语音/音乐/音频论文速递 2026-07-29

语音/音乐/音频论文速递 2026-07-29 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 2篇 ██ #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #音频理解 2篇 ██ #Transformer 1篇 █ #声源定位 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 faster-enhancer.c: A Dependency-Free int8 Runtime for S 8.7分 前25% 系统技术报告 #语音增强 🥈 OmniScope: Modality-Decoupled Token Compression for Omn 8.3分 前25% 方法研究 #音视频问答 🥉 AVE-Compass: Towards Holistic Evaluation for Audio-Vide 8.3分 前25% 数据集与基准 #多模态模型 4. Extracting Voice Styles from Frozen TTS Models via Grad 7.9分 前25% 方法研究 #语音克隆 5. CARE: A Multimodal Corpus for Studying Speech and Non-V 7.9分 前25% 数据集与基准 #音视频理解 6. GraphIDyOM: A graph-native Python reimplementation of I 7.8分 前25% 系统技术报告 #音乐理解 7. VAD to the Bone: Ultra-Tiny Speech Activity Detection f 7.4分 前50% 系统技术报告 #语音活动检测 8. Unlocking Spatial Grounding in Large Audio-Visual Retri 7.2分 前50% 方法研究 #声源定位 9. SpeechLLM Meets Federated Learning for End-to-End ASR: 7.1分 前50% 方法研究 #语音识别 10. Joint Text-Audio Alignment for EEG-to-Text Decoding in 7.0分 前50% 方法研究 #语音交互 11. OmniDelta: Skill-Driven Budget Allocation for Token Com 7.0分 前50% 方法研究 #音视频问答 12. Text-Prompted CLAP: Learning Query-Conditioned Audio Re 6.6分 前50% 方法研究 #音频理解 13. Towards Operational Conversational Intelligence: A Spee 6.4分 前50% 系统技术报告 #说话人日志 14. Parallel Decoding Distillation for Fast Image and Video 6.2分 前50% 方法研究 #音视频生成 15. Spacing Out: On the Reliability of Binaural Music Sourc 6.1分 前50% 方法研究 #音乐源分离 16. MyMentorLLM: A psychotherapy GenAI environment with mul 5.9分 前50% 系统技术报告 #语音交互 17. MusiChat: Vibe Composing for Music Creation 5.8分 前50% 系统技术报告 #音乐生成 18. AMRD: Adaptive Multi-Teacher Relational Distillation fo 5.6分 前50% 方法研究 #语音情感识别 19. Multi-Phonation Graph Learning with Self-Supervised Spe 5.5分 前50% 方法研究 #语音属性识别 20. Evaluation of forced alignment of code-mixed speech: th 5.4分 后50% 方法研究 #语音识别 21. A Cross-lingual Comparison of Human and Classification 5.1分 后50% 方法研究 #Transformer 22. From Semantics to Readout: Mechanistic Understanding of 5.1分 后50% 方法研究 #音频理解 23. Finding the noise: Zero-shot AI Music Detection 5.1分 后50% 方法研究 #无监督学习 24. Depression Markers in Speech: An Approach based on Trac 5.1分 后50% 应用研究 #语音属性识别 25. Self-Supervised Audio Representation Learning for Pedia 5.0分 后50% 应用研究 #音频分类 26. DynaBridge: Dynamic Summary-Guided Cross-Task Multimoda 4.9分 后50% 方法研究 #音视频理解 27. Device Invariance using Domain Adaptation on Acoustic S 4.2分 后50% 方法研究 #领域适应 📋 论文列表 🥇 faster-enhancer.c: A Dependency-Free int8 Runtime for Streaming Speech Enhancement on Commodity CPUs 8.7/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 ...

2026-07-29 · 更新于 2026-09-04 · 20 min · 4243 words

语音/音乐/音频论文速递 2026-07-28

语音/音乐/音频论文速递 2026-07-28 共分析 31 篇论文 ⚡ 今日概览 📥 抓取 31 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 5篇 █████ #语音交互 3篇 ███ #语音属性识别 3篇 ███ #声源定位 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #对比学习 1篇 █ 📊 论文评分排行榜(31 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 StanceBench: A Benchmark for Audio LLM-Based Interperso 8.6分 前25% 数据集与基准 #语音属性识别 🥈 Expose Your Disguise: Recovering Source Speaker Identit 7.5分 前25% 方法研究 #对比学习 🥉 Leveraging Gradient Reversal Loss and Multitask Learnin 7.3分 前50% 方法研究 #语音伪造检测 4. PathRIR: Physics-Guided Acoustic Path Selection and Lat 7.2分 前50% 方法研究 #空间音频 5. Indic DiarBench: A Multilingual Joint Diarization and A 7.1分 前50% 数据集与基准 #说话人日志 6. Earnings25: A Comprehensive 500-Hour Speech Benchmark f 7.1分 前50% 数据集与基准 #语音识别 7. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment 7.1分 前50% 方法研究 #音视频生成 8. Revisiting Vocos: That Phasiness Business in Time-Frequ 7.1分 前50% 方法研究 #语音合成 9. Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robu 7.0分 前50% 系统技术报告 #语音合成 10. Towards High-Level Semantic Intelligence 7.0分 前50% 综述 #音视频理解 11. Speech Signals Complement LLMs for Predicting Interpers 6.9分 前50% 应用研究 #语音交互 12. Let Me Look at You: Advanced Facial Expression Modeling 6.9分 前50% 模型报告 #语音合成 13. Simple Language Normalization Wins: Cross-Lingual Speak 6.8分 前50% 系统技术报告 #说话人验证 14. Memory Efficient Audio Synthesis with Decoupled Tempora 6.8分 前50% 系统技术报告 #语音合成 15. Explainable AI through the Lens of Material Agency: Ena 6.7分 前50% 应用研究 #音乐生成 16. MoLGE: Mixture of Language Group Experts for Efficient 6.7分 前50% 方法研究 #语音识别 17. Mind the Microphone Gap: Benchmarking Array Upsampling 6.6分 前50% 方法研究 #声源定位 18. Multimodal Domain Generalization for Depression Detecti 6.4分 前50% 方法研究 #音频分类 19. Infinite Canons: Maximally Self-Similar Melodic Lines a 6.4分 前50% 理论研究 #音乐生成 20. Singlish, Can or Not? Fine-Tuning and Evaluating Zero-S 6.3分 前50% 应用研究 #语音合成 21. JarvisHub: An Open Harness for Canvas-Native Multimodal 6.2分 前50% 系统技术报告 #音视频生成 22. Low-Latency Turn-Taking via Context-Aware Preface Gener 6.1分 前50% 系统技术报告 #语音交互 23. Do Visual Features Improve Other-Initiated Repair Detec 5.9分 前50% 方法研究 #音视频交互 24. Automatic Audio Equalization with Semantic Embeddings 5.8分 前50% 方法研究 #语音增强 25. Music-Source-Separation-Training (MSST): A Unified Fram 5.7分 前50% 系统技术报告 #音乐源分离 26. Disentangling Acoustic Cues in Alzheimer’s Pathology an 5.4分 后50% 应用研究 #语音属性识别 27. Speech Entrainment in Multi-Party Conversations with a 5.3分 后50% 应用研究 #语音交互 28. Improving Zero-Shot Phonetic Classification through Lan 5.3分 后50% 方法研究 #语音属性识别 29. Looking for Affect in Spontaneous Finnish Speech throug 5.3分 后50% 应用研究 #语音情感识别 30. Modeling Stylistic Co-evolution in Symbolic Music Herit 4.9分 后50% 方法研究 #音乐理解 31. Resource-Aware Topology Management for ISAC-Enabled TDO 4.1分 后50% 方法研究 #声源定位 📋 论文列表 🥇 StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech 8.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-07-28 · 更新于 2026-09-04 · 26 min · 5365 words

语音/音乐/音频论文速递 2026-07-27

语音/音乐/音频论文速递 2026-07-27 共分析 13 篇论文 ⚡ 今日概览 📥 抓取 13 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音伪造检测 2篇 ██ #语音识别 2篇 ██ #音频理解 2篇 ██ #大语言模型 1篇 █ #语音交互 1篇 █ #语音情感识别 1篇 █ #语音活动检测 1篇 █ #音乐检索 1篇 █ 📊 论文评分排行榜(13 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MEUSLI: a Multilingual Projector for LLM-based ASR and 8.2分 前25% 方法研究 #语音识别 🥈 CODA: Cascaded Online Discontinuity-Aware Alignment for 8.1分 前25% 方法研究 #音频理解 🥉 SoundscapeAgent: Agentic Soundscape Construction for Co 8.0分 前25% 系统技术报告 #大语言模型 4. Reflector: Arrangement-Aware Harmonic Retrieval for Sam 7.7分 前25% 系统技术报告 #音乐检索 5. Phylogenetic signal in marine mammal and bird vocalizat 7.7分 前25% 应用研究 #音频理解 6. Listen, Do Not Copy: Internalizing Audio-Grounded Scaff 6.6分 前50% 方法研究 #语音识别 7. Probing Speaker Identity Sensitivity in Audio Deepfake 6.5分 前50% 方法研究 #语音伪造检测 8. Transforming Keystroke Noise to Text: Self-Supervised A 6.5分 前50% 方法研究 #语音活动检测 9. Music-JEPA: Learning a World Model of Sound from Action 6.2分 前50% 方法研究 #音乐转录 10. Synthetic Speech, Real Signal: Paralinguistic Preservat 6.2分 前50% 应用研究 #语音情感识别 11. Kutti AI: A Voice-First, Offline-Capable Learning Compa 5.5分 前50% 系统技术报告 #语音交互 12. MemNMF: Memory-Augmented NMF on LPC Spectra for Anomalo 5.3分 后50% 方法研究 #音频事件检测 13. How Meta-Learning Shapes LoRA Adapter Geometry in Speec 5.2分 后50% 方法研究 #语音伪造检测 📋 论文列表 🥇 MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond 8.2/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ...

2026-07-27 · 更新于 2026-09-04 · 10 min · 2119 words

语音/音乐/音频论文速递 2026-07-24

语音/音乐/音频论文速递 2026-07-24 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 4篇 ████ #语音交互 2篇 ██ #语音情感识别 2篇 ██ #多模态模型 1篇 █ #数据集 1篇 █ #语音伪造检测 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DONDO: Open w2v-BERT Speech-Recognition Base Models for 8.1分 前25% 系统技术报告 #语音识别 🥈 Designed Vocalizations Dataset: Sound-Designed Human an 7.9分 前25% 数据集与基准 #语音转换 🥉 VibeVoice-ASR-BitNet Technical Report 7.8分 前25% 系统技术报告 #语音识别 4. Faster IndexTTS-2: Accelerating and Streaming Autoregre 7.6分 前25% 系统技术报告 #语音合成 5. From Read Speech to Spoken Digits: A Task-Specific Eval 7.5分 前25% 应用研究 #语音识别 6. Instruct-FD: Can Your Full-Duplex Speech System Follow 7.2分 前50% 数据集与基准 #语音交互 7. OPOD: On-Policy Omni Distillation 7.1分 前50% 方法研究 #多模态模型 8. X\(^3\)-OPD: Distilling Reasoning into Large Audio-Langua 7.1分 前50% 方法研究 #音频理解 9. Toward Interpretable Speech Deepfake Detection using Ar 7.0分 前50% 方法研究 #语音伪造检测 10. Toward Generalizable Cognitive Impairment Detection wit 7.0分 前50% 方法研究 #语音情感识别 11. Safeguards for Speech2Speech LLM-Assistants: A Case Stu 6.5分 前50% 系统技术报告 #语音交互 12. Investigating Codec-Internal Latent Audio Watermarking 6.4分 前50% 系统技术报告 #音频水印 13. TF-MossFormer: Integrating Convolution Gated Local-Glob 6.3分 前50% 模型报告 #语音分离 14. Phonetic forced alignment for low-resource language var 6.2分 前50% 方法研究 #语音识别 15. SCoPE: Shift-Aware Speaker-Conditioned Priors for Emoti 6.0分 前50% 方法研究 #语音情感识别 16. Word meaning co-determines vowel-inherent spectral chan 5.9分 前50% 方法研究 #语音属性识别 17. An Evaluation Framework for Structured Audio Captions V 5.3分 后50% 数据集与基准 #数据集 18. Improving the performance of an ASV system using hybrid 5.0分 后50% 方法研究 #说话人验证 📋 论文列表 🥇 DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages 8.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-07-24 · 更新于 2026-09-04 · 14 min · 2973 words