论文解读

The SMC Blind Spot: A Failure Mode Analysis of State-of-the-Art Beat Tracking

节拍跟踪 | 7.4/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6909 字 阅读 →
论文解读

Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement

语音增强 | 6.6/10

 · 更新于 2026-09-10 · 约 21 分钟 · 10496 字 阅读 →
论文解读

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

 · 更新于 2026-09-10 · 约 18 分钟 · 8956 字 阅读 →
论文解读

UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning

多模态推理 | 7.3/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7164 字 阅读 →
论文解读

What makes a word hard to learn? Modeling L1 influence on English vocabulary difficulty

词汇难度预测 | 5.0/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9671 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-13

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 81 分钟 · 40414 字 阅读 →
论文解读

A Cold Diffusion Approach for Percussive Dereverberation

音频修复 | 6.2/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9177 字 阅读 →
论文解读

AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State

音乐视频生成 | 4.8/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8053 字 阅读 →
论文解读

APEX: Audio Prototype EXplanations for Classification Tasks

音频分类 | 6.2/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9804 字 阅读 →
论文解读

Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

语音识别 说话人日志 | 5.5/10

 · 更新于 2026-09-10 · 约 21 分钟 · 10162 字 阅读 →
论文解读

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

音频生成 | 6.0/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8585 字 阅读 →
论文解读

CORTEG: Foundation Models Enable Cross-Modality Representation Transfer from Scalp to Intracranial Brain Recordings

脑机接口 | 6.5/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9166 字 阅读 →
论文解读

DiffVQE: Hybrid Diffusion Voice Quality Enhancement Under Acoustic Echo and Noise

语音增强 | 6.2/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8037 字 阅读 →
论文解读

Dolphin-CN-Dialect: Where Chinese Dialects Matter

语音识别 | 5.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8629 字 阅读 →
论文解读

Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs

音乐生成 | 4.0/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9279 字 阅读 →
论文解读

EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

音频事件检测 | 5.8/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9380 字 阅读 →
论文解读

Encoding and Decoding Temporal Signals with Spiking Bandpass Wavelets

音频编码 | 7.0/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8486 字 阅读 →
论文解读

Evaluating the Expressive Appropriateness of Speech in Rich Contexts

语音质量评估 | 7.2/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9625 字 阅读 →
论文解读

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

音频检索 | 6.0/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9517 字 阅读 →
论文解读

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

语音对话系统 | 6.0/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8653 字 阅读 →