论文解读

Exploring Token-Space Manipulation in Latent Audio Tokenizers

音频编码 | 6.5/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9238 字 阅读 →
论文解读

jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition

多模态检索 | 7.5/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8909 字 阅读 →
论文解读

Mechanistic Interpretability of ASR models using Sparse Autoencoders

语音识别 | 5.5/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8102 字 阅读 →
论文解读

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

语音编辑 | 6.5/10

 · 更新于 2026-10-01 · 约 11 分钟 · 5409 字 阅读 →
论文解读

MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

基准测试 | 60/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9917 字 阅读 →
论文解读

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8863 字 阅读 →
论文解读

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

音视频 | 7.0/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8379 字 阅读 →
论文解读

Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling

歌唱语音转换 | 5.5/10

 · 更新于 2026-10-01 · 约 28 分钟 · 13767 字 阅读 →
论文解读

Spatial Power Estimation via Riemannian Covariance Matching

声源定位 | 6.5/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7380 字 阅读 →
论文解读

STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts

音乐转录 | 5.5/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8145 字 阅读 →
论文解读

The Deepfakes We Missed: We Built Detectors for a Threat That Didn't Arrive

深度伪造检测 | 6.5/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7431 字 阅读 →
论文解读

The SMC Blind Spot: A Failure Mode Analysis of State-of-the-Art Beat Tracking

节拍跟踪 | 7.4/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6909 字 阅读 →
论文解读

Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement

语音增强 | 6.6/10

 · 更新于 2026-10-01 · 约 21 分钟 · 10496 字 阅读 →
论文解读

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

 · 更新于 2026-10-01 · 约 18 分钟 · 8956 字 阅读 →
论文解读

UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning

多模态推理 | 7.3/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7164 字 阅读 →
论文解读

What makes a word hard to learn? Modeling L1 influence on English vocabulary difficulty

词汇难度预测 | 5.0/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9671 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-13

共分析 22 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 81 分钟 · 40414 字 阅读 →
论文解读

A Cold Diffusion Approach for Percussive Dereverberation

音频修复 | 6.2/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9177 字 阅读 →
论文解读

AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State

音乐视频生成 | 4.8/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8053 字 阅读 →
论文解读

APEX: Audio Prototype EXplanations for Classification Tasks

音频分类 | 6.2/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9804 字 阅读 →