每日研究速递

语音/音乐/音频论文速递 2026-06-17

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 94 分钟 · 46631 字 阅读 →
论文解读

Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models

音频分类 | 8.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5504 字 阅读 →
论文解读

Bridging the SEA Gap: An Initial Benchmark for Neural Audio Codec-Synthesized Speech Deepfakes in South-East Asian Languages

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5381 字 阅读 →
论文解读

EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

音频问答 | 6.1/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10753 字 阅读 →
论文解读

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

多模态模型 | 5.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6343 字 阅读 →
论文解读

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

语音生成 | 6.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5373 字 阅读 →
论文解读

MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

语音对话系统 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6606 字 阅读 →
论文解读

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

多模态模型 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5649 字 阅读 →
论文解读

TuneJury: An Open Metric for Improving Music Generation Preference Alignment

多模态模型 | 9.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6483 字 阅读 →
论文解读

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

多模态模型 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6481 字 阅读 →
论文解读

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

多模态模型 | 8.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5565 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-16

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 168 分钟 · 83790 字 阅读 →
论文解读

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators

多模态模型 | 7.4/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9515 字 阅读 →
论文解读

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

语音合成 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6238 字 阅读 →
论文解读

Multimodal Speaker Identification in Classroom Environments

说话人识别 | 6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5508 字 阅读 →
论文解读

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

数据增强 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6462 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

语音翻译 | 8.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6061 字 阅读 →
论文解读

M*: A Modular, Extensible, Serving System for Multimodal Models

多模态模型 | 8.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6159 字 阅读 →
论文解读

MiniMax Sparse Attention

高效推理 | 7.7/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11126 字 阅读 →