论文解读

让每个频率格为自己的关系负责:DS 接入音乐模型

音乐理解 | 7.2/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4422 字 阅读 →
论文解读

ASR 评测别急着换大模型:先分清向量度量、候选裁判与错误解释

语音质量评估 | 6.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5237 字 阅读 →
论文解读

把 100 小时 MEG 拆成两种稀缺资源,才看得见神经语音解码该怎样扩展

基准测试 | 8.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5035 字 阅读 →
论文解读

忘掉不等于擦除:语音网络把关键期痕迹压在了最底层

语音识别 | 8.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4703 字 阅读 →
论文解读

谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车

语音识别 | 5.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4240 字 阅读 →
论文解读

把“该不该开口”拆成可追责时间表:TurnBench 逼出的轮次交接难题

语音交互 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4976 字 阅读 →
论文解读

别再把同步分数当裁判:先问它量的是偏移、内容,还是感知代理

音视频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5899 字 阅读 →
论文解读

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

语音交互 | 7.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6264 字 阅读 →
论文解读

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

语音交互 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6124 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Investigating voiced and unvoiced regions of speech for audio deepfake detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6842 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6318 字 阅读 →
论文解读

On the Robustness of Audio Deepfake Detection under Audio Watermarking

音频伪造检测 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5950 字 阅读 →
论文解读

Preference Optimization for Non-Verbal Vocalization Synthesis

语音合成 | 7.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6013 字 阅读 →
论文解读

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

音频伪造检测 | 9.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5822 字 阅读 →
论文解读

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

语音质量评估 | 8.2/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4504 字 阅读 →
论文解读

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

音频质量评估 | 8.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6001 字 阅读 →
论文解读

Separating Voice from Age in COPD Screening

语音属性识别 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5333 字 阅读 →
论文解读

Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations?

音频理解 | 5.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5749 字 阅读 →
论文解读

TCP_α: Margin-Controlled Confidence estimation for reliable Music Information Retrieval

音乐理解 | 8.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5890 字 阅读 →