每日研究速递

语音/音乐/音频论文速递 2026-06-22

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 4 分钟 · 1684 字 阅读 →
论文解读

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

Transformer | 7.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
论文解读

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5988 字 阅读 →
论文解读

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

语音合成 | 5.7/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

多模态模型 | 8.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5119 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-19

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 110 分钟 · 54842 字 阅读 →
论文解读

Constraining to Generalize: Subspace Tuning for Few-shot Generalization of Audio-Language Models

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7536 字 阅读 →
论文解读

Fair Cognitive Impairment Detection Through Unlearning

多模态模型 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5572 字 阅读 →
论文解读

GRIDEX: Grid-Grounded Forensic Explanations for Deepfake Spectrogram Analysis

语音合成 | 8.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7676 字 阅读 →
论文解读

Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6808 字 阅读 →
论文解读

Mitigating Scoring Errors and Compensating for Nonverbal Subtests in Speech-Based Dementia Assessment

多模态模型 | 8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6686 字 阅读 →
论文解读

Native Active Perception as Reasoning for Omni-Modal Understanding

语音识别 | 9.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6616 字 阅读 →
论文解读

Risk Stratification for ICU Delirium using Pervasive Ambient Sensing Information

多模态模型 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4563 字 阅读 →
论文解读

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

强化学习 | 6.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4793 字 阅读 →
论文解读

Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

多模态模型 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5845 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 105 分钟 · 52107 字 阅读 →
论文解读

A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models

多模态模型 | 6.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5184 字 阅读 →
论文解读

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5868 字 阅读 →
论文解读

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4464 字 阅读 →
论文解读

OlfactProfile: Profile-Conditioned Odor Prediction from Audiovisual Content

多模态模型 | 5.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5084 字 阅读 →