论文解读

SmartDJ: Declarative Audio Editing with Audio Language Model

音频编辑 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6024 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4606 字 阅读 →
论文解读

Steering Autoregressive Music Generation with Recursive Feature Machines

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4895 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6983 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

模型评估 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4581 字 阅读 →
论文解读

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

面部动画生成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4542 字 阅读 →
论文解读

Discovering and Steering Interpretable Concepts in Large Generative Music Models

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4300 字 阅读 →
论文解读

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4396 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3963 字 阅读 →
论文解读

OWL : Geometry-Aware Spatial Reasoning for Audio Large Language Models

空间音频 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5296 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4835 字 阅读 →
论文解读

A Generative-First Neural Audio Autoencoder

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5163 字 阅读 →
论文解读

AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMs

音频大模型 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4439 字 阅读 →
论文解读

Auditory Illusion Benchmark for Large Audio Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3529 字 阅读 →
论文解读

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4576 字 阅读 →
论文解读

Deepaq: A Perceptual Audio Quality Metric Based on Foundational Models and Weakly Supervised Learning

音频质量评估 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4761 字 阅读 →
论文解读

DisContSE: Single-Step Diffusion Speech Enhancement based on Joint Discrete and Continuous Embeddings

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5379 字 阅读 →
论文解读

DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4732 字 阅读 →