论文解读

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

多模态模型 | 7.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5649 字 阅读 →
论文解读

TuneJury: An Open Metric for Improving Music Generation Preference Alignment

多模态模型 | 9.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6483 字 阅读 →
论文解读

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

多模态模型 | 6.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6481 字 阅读 →
论文解读

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

多模态模型 | 8.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5565 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-16

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 168 分钟 · 83790 字 阅读 →
论文解读

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators

多模态模型 | 7.4/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9515 字 阅读 →
论文解读

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

语音合成 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6238 字 阅读 →
论文解读

Multimodal Speaker Identification in Classroom Environments

说话人识别 | 6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5508 字 阅读 →
论文解读

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

数据增强 | 8.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6462 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

语音翻译 | 8.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6061 字 阅读 →
论文解读

M*: A Modular, Extensible, Serving System for Multimodal Models

多模态模型 | 8.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6159 字 阅读 →
论文解读

MiniMax Sparse Attention

高效推理 | 7.7/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11126 字 阅读 →
论文解读

Missing-Token Prompted Reliability-Aware Fusion for Robust Polyglot Speaker Identification

说话人识别 | 8.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5723 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 77 分钟 · 38140 字 阅读 →
论文解读

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

语音合成 | 5.2/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4836 字 阅读 →
论文解读

Context-Aware Multimodal Claim Verification in Spoken Dialogues

多模态模型 | 7.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6922 字 阅读 →
论文解读

Frozen Multimodal Embeddings for Personality and Cognitive Ability Assessment in Asynchronous Video Interviews

语音情感识别 | 6.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6098 字 阅读 →
论文解读

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

音频问答 | 9.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6896 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-11

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 99 分钟 · 49581 字 阅读 →