论文解读

What You Train Is What You Get: Gender Bias, Training Composition, and Post-Hoc Mitigation in Audio Deepfake Detection

语音伪造检测 | 6.6/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9677 字 阅读 →
论文解读

Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis

语音识别 | 6.7/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9645 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-14

共分析 53 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 186 分钟 · 92760 字 阅读 →
论文解读

Clean2FX: Label-conditioned modeling for clean-to-effect guitar audio transformations

音频理解 | 7.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7034 字 阅读 →
论文解读

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

多模态模型 | 7.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7057 字 阅读 →
论文解读

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

音乐生成 | 7.2/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8543 字 阅读 →
论文解读

FreyaTTS Technical Report

语音合成 | 7.7/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8785 字 阅读 →
论文解读

Immersive Social Interaction with VR and LLM-Assisted Humanoids

语音交互 | 4.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5532 字 阅读 →
论文解读

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5818 字 阅读 →
论文解读

Technical Report for MERL's Real-TSE Challenge Submission

语音分离 | 6.6/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8552 字 阅读 →
论文解读

Tonnetz-Driven Graph Wedgelet for Harmonic Complexity Reduction in Music Scores

音乐理解 | 5.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5870 字 阅读 →
论文解读

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9038 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 51 分钟 · 25294 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 8.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7893 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7616 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7365 字 阅读 →
论文解读

Inverse-designed meta processing units for multi-task near-field photonic computing

音频理解 | 6.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6789 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9170 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

多模态模型 | 5.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8394 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6518 字 阅读 →