论文解读

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1135 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-25

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38268 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4879 字 阅读 →
论文解读

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

多模态模型 | 8.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6088 字 阅读 →
论文解读

NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction

语音生成 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6037 字 阅读 →
论文解读

video-SALMONN-R\(^3\): Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

多模态模型 | 8.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5751 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-24

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 98 分钟 · 48791 字 阅读 →
论文解读

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

音频问答 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4940 字 阅读 →
论文解读

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

语音伪造检测 | 8.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5580 字 阅读 →
论文解读

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5368 字 阅读 →
论文解读

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

多模态模型 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5674 字 阅读 →
论文解读

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

Interleaved Speech Language Models Latently Work In Text

语音识别 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5690 字 阅读 →
论文解读

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

语音合成 | 6.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4805 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3142 字 阅读 →
论文解读

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

多模态模型 | 7.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5459 字 阅读 →
论文解读

Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5011 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-23

共分析 83 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 224 分钟 · 112108 字 阅读 →
论文解读

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6648 字 阅读 →