论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

图像生成 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4164 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7563 字 阅读 →
论文解读

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4999 字 阅读 →
论文解读

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4360 字 阅读 →
论文解读

Human Behavior Atlas: Benchmarking Unified Psychological And Social Behavior Understanding

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5063 字 阅读 →
论文解读

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4701 字 阅读 →
会议任务专题

ICLR 2026 - 模型评估

共 2 篇 ICLR 2026 模型评估 方向论文

 · 更新于 2026-09-25 · 约 7 分钟 · 3282 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

音视频联合推理 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4251 字 阅读 →
论文解读

Learning multimodal dictionary decompositions with group-sparse autoencoders

跨模态检索 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3971 字 阅读 →
论文解读

MAPSS: Manifold-based Assessment of Perceptual Source Separation

模型评估 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4083 字 阅读 →
论文解读

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

多模态模型 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5387 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4370 字 阅读 →
论文解读

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

模型比较 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4240 字 阅读 →
论文解读

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6035 字 阅读 →
论文解读

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4490 字 阅读 →
论文解读

Timing is Everything: Temporal Scaffolding of Semantic Surprise in Humor

音频事件检测 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5042 字 阅读 →
论文解读

TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems

语音合成评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4384 字 阅读 →
论文解读

Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5053 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

模型评估 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5353 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3728 字 阅读 →