论文解读

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

视频生成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4843 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4979 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 7.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3836 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6263 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5369 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5245 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3720 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4207 字 阅读 →
论文解读

Audio Video Verbal Analysis (AVVA) for Capturing Classroom Dialogues

音频问答 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4011 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5319 字 阅读 →
论文解读

AISHELL6-Whisper: A Chinese Mandarin Audio-Visual Whisper Speech Dataset with Speech Recognition Baselines

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4735 字 阅读 →
论文解读

An Audio-Visual Speech Separation Network with Joint Cross-Attention and Iterative Modeling

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4638 字 阅读 →
论文解读

Assessing Identity Leakage in Talking Face Generation: Metrics and Evaluation Framework

说话人脸生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3595 字 阅读 →
论文解读

Asynchrony-Aware Decoupled Multimodal Control for Cued Speech Video Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4846 字 阅读 →
论文解读

Attentive AV-Fusionnet: Audio-Visual Quality Prediction with Hybrid Attention

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4767 字 阅读 →
论文解读

Audio-Visual Feature Fusion for Calibrating Relevance Scores of Video Moment Retrieval

视频片段检索 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5439 字 阅读 →
论文解读

AVO-65: A Large-Scale Hierarchical Audio-Visual Object Dataset

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4186 字 阅读 →
论文解读

Bimodal Fusion Framework for Dynamic Facial Expression Recognition In-The-Wild

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3875 字 阅读 →
论文解读

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

模型评估 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4504 字 阅读 →