论文解读

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

音频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7745 字 阅读 →
论文解读

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

音频理解 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6569 字 阅读 →
论文解读

Taste-aware music retrieval from audio embeddings

音乐检索 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6947 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 176 分钟 · 87928 字 阅读 →
论文解读

ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9724 字 阅读 →
论文解读

AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7803 字 阅读 →
论文解读

FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content

可解释性 | 6.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4956 字 阅读 →
论文解读

Multimodal Fact-Level Attribution for Verifiable Reasoning

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11220 字 阅读 →
论文解读

Probing Cross-modal Information Hubs in Audio-Visual LLMs

音视频理解 | 7.2/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2684 字 阅读 →
论文解读

Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech

语音合成 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6988 字 阅读 →
论文解读

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

模型剪枝 | 5.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5098 字 阅读 →
论文解读

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

音视频理解 | 5.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6064 字 阅读 →
论文解读

Decomposer: Learning to Decompile Symbolic Music to Programs

音乐理解 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5948 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-03

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 101 分钟 · 50504 字 阅读 →
论文解读

Automatic Detection of Stress from Speech in the Trier Social Stress Test

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7439 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24050 字 阅读 →
论文解读

Profiling the Voice: Speaker-Specific Phoneme Fingerprinting for Speech Deepfake Detection

语音伪造检测 | 7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7180 字 阅读 →
论文解读

Preliminary Insights in Chronos Frequency Data Understanding and Reconstruction

模型评估 | 6.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7215 字 阅读 →
论文解读

Discovering and Steering Interpretable Concepts in Large Generative Music Models

音乐生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4454 字 阅读 →
论文解读

Steering Autoregressive Music Generation with Recursive Feature Machines

音乐生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4217 字 阅读 →