论文解读

Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8776 字 阅读 →
论文解读

WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

语音识别 | 7.0/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7464 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-14

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 62 分钟 · 30769 字 阅读 →
论文解读

A Semi-Supervised Framework for Speech Confidence Detection using Whisper

语音自信度检测 | 6.5/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9646 字 阅读 →
论文解读

Adaptive Diagonal Loading using Krylov Subspaces for Robust Beamforming

声源定位 | 7.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8591 字 阅读 →
论文解读

AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling

音频编码 | 7.0/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8374 字 阅读 →
论文解读

AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling

音频生成 | 6.0/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8049 字 阅读 →
论文解读

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

多模态模型评估 | 5.5/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9061 字 阅读 →
论文解读

Chunkwise Aligners for Streaming Speech Recognition

语音识别 | 6.3/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9896 字 阅读 →
论文解读

Exploring Token-Space Manipulation in Latent Audio Tokenizers

音频编码 | 6.5/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9238 字 阅读 →
论文解读

jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition

多模态检索 | 7.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8909 字 阅读 →
论文解读

Mechanistic Interpretability of ASR models using Sparse Autoencoders

语音识别 | 5.5/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8102 字 阅读 →
论文解读

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

语音编辑 | 6.5/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5409 字 阅读 →
论文解读

MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

基准测试 | 60/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9917 字 阅读 →
论文解读

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8863 字 阅读 →
论文解读

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

音视频 | 7.0/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8379 字 阅读 →
论文解读

Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling

歌唱语音转换 | 5.5/10

 · 更新于 2026-09-10 · 约 28 分钟 · 13767 字 阅读 →
论文解读

Spatial Power Estimation via Riemannian Covariance Matching

声源定位 | 6.5/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7380 字 阅读 →
论文解读

STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts

音乐转录 | 5.5/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8145 字 阅读 →
论文解读

The Deepfakes We Missed: We Built Detectors for a Threat That Didn't Arrive

深度伪造检测 | 6.5/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7431 字 阅读 →