论文解读

有害不在一处:当声音与画面由多模态共同拼出

音视频生成 | 7.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7570 字 阅读 →
论文解读

不只用文字指挥检索:当嵌入器学会看区域、听时段

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9187 字 阅读 →
论文解读

说出来就变了味:当语音不再是文本的透明通道

音视频问答 | 8.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7692 字 阅读 →
论文解读

听错一个字就全盘皆输:SpeechGym 把语音智能体的失败变成可训练的梯度

语音交互 | 7.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8505 字 阅读 →
论文解读

边播边改:当音视频生成从片段走向持续世界

音频生成 | 8.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8087 字 阅读 →
论文解读

当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意

语音交互 | 6.6/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10404 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 87 分钟 · 43538 字 阅读 →
论文解读

ASR 评测别急着换大模型:先分清向量度量、候选裁判与错误解释

语音质量评估 | 6.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5237 字 阅读 →
论文解读

把 100 小时 MEG 拆成两种稀缺资源,才看得见神经语音解码该怎样扩展

基准测试 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5035 字 阅读 →
论文解读

把“该不该开口”拆成可追责时间表:TurnBench 逼出的轮次交接难题

语音交互 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4976 字 阅读 →
论文解读

别再把同步分数当裁判:先问它量的是偏移、内容,还是感知代理

音视频理解 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5899 字 阅读 →
论文解读

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

语音交互 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6124 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

音频理解 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6093 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6318 字 阅读 →
论文解读

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

音视频语音分离 | 8.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6292 字 阅读 →
论文解读

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

音频伪造检测 | 9.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

音频质量评估 | 8.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6001 字 阅读 →
论文解读

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

语音交互 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5667 字 阅读 →
论文解读

Towards Quantifying Benchmark Optimization in ASR Models

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6239 字 阅读 →