论文解读

一条咳嗽模型的跨国体检:高分为何更像设备在说话

音频分类 | 8.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5492 字 阅读 →
论文解读

让同一组录音按用户视角重新分组:AudioLens 如何把语音聚类变成集合推理

把“按什么视角聚类”交给自然语言指令,并让音频语言模型直接输出完整分区。

 · 更新于 2026-09-25 · 约 10 分钟 · 4545 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 54 分钟 · 26637 字 阅读 →
论文解读

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

语音交互 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6264 字 阅读 →
论文解读

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

音乐生成 | 8.7/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1221 字 阅读 →
论文解读

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

语音交互 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6124 字 阅读 →
论文解读

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

空间音频 | 7.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

音频理解 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6380 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5988 字 阅读 →
论文解读

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

语音合成 | 9.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5401 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
论文解读

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6164 字 阅读 →
论文解读

From local kernels to global form: modeling the emergence of musical content

音乐理解 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5260 字 阅读 →
论文解读

Investigating voiced and unvoiced regions of speech for audio deepfake detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6842 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6559 字 阅读 →
论文解读

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

音频理解 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6093 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6318 字 阅读 →
论文解读

On the Robustness of Audio Deepfake Detection under Audio Watermarking

音频伪造检测 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5950 字 阅读 →
论文解读

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7660 字 阅读 →