每日研究速递

语音/音乐/音频论文速递 2026-06-24

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 98 分钟 · 48791 字 阅读 →
论文解读

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

音频问答 | 7.9/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4940 字 阅读 →
论文解读

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

语音伪造检测 | 8.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5580 字 阅读 →
论文解读

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5368 字 阅读 →
论文解读

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

多模态模型 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5674 字 阅读 →
论文解读

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

语音识别 | 7.7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4555 字 阅读 →
论文解读

Interleaved Speech Language Models Latently Work In Text

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5690 字 阅读 →
论文解读

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

语音合成 | 6.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4805 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3142 字 阅读 →
论文解读

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

多模态模型 | 7.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5459 字 阅读 →
论文解读

Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi

语音识别 | 6.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5011 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-23

共分析 83 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 224 分钟 · 112108 字 阅读 →
论文解读

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

音乐生成 | 8.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6648 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-22

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 4 分钟 · 1684 字 阅读 →
论文解读

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

Transformer | 7.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5452 字 阅读 →
论文解读

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

语音对话系统 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5988 字 阅读 →
论文解读

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

语音合成 | 5.7/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3893 字 阅读 →
论文解读

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

多模态模型 | 8.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5119 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-19

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 110 分钟 · 54842 字 阅读 →
论文解读

Constraining to Generalize: Subspace Tuning for Few-shot Generalization of Audio-Language Models

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7536 字 阅读 →