论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

音频分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4519 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7563 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4141 字 阅读 →
论文解读

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4850 字 阅读 →
论文解读

AVEX: What Matters for Animal Vocalization Encoding

生物声学 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5485 字 阅读 →
论文解读

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
论文解读

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

多模态推理 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4438 字 阅读 →
论文解读

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4230 字 阅读 →
论文解读

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4360 字 阅读 →
论文解读

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4836 字 阅读 →
论文解读

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

音乐理解 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3318 字 阅读 →
论文解读

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4701 字 阅读 →
会议任务专题

ICLR 2026 - 基准测试

共 9 篇 ICLR 2026 基准测试 方向论文

 · 更新于 2026-09-25 · 约 31 分钟 · 15370 字 阅读 →
论文解读

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

音频安全 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4556 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5220 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

音视频联合推理 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4251 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4323 字 阅读 →
论文解读

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3678 字 阅读 →
论文解读

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

音频场景理解 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

基准测试 数据集 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4749 字 阅读 →