论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4010 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

生成模型 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3762 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

模型评估 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4581 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

AVEX: What Matters for Animal Vocalization Encoding

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4577 字 阅读 →
论文解读

Deep Learning with Learnable Product-Structured Activations

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5033 字 阅读 →
论文解读

Discovering and Steering Interpretable Concepts in Large Generative Music Models

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4300 字 阅读 →
论文解读

DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick

语音编码 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6275 字 阅读 →
论文解读

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5102 字 阅读 →
论文解读

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

音视频 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4449 字 阅读 →
论文解读

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

语音合成 | 8.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6115 字 阅读 →
论文解读

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6079 字 阅读 →
论文解读

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

语音对话系统 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4643 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4979 字 阅读 →
论文解读

MAPSS: Manifold-based Assessment of Perceptual Source Separation

语音分离 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4535 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3963 字 阅读 →
论文解读

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

语音问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4249 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4700 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 7.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3836 字 阅读 →