论文解读

Optimal Transport Audio Distance with Learned Riemannian Ground Metrics

音频质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8844 字 阅读 →
论文解读

Preliminary Insights in Chronos Frequency Data Understanding and Reconstruction

模型评估 | 6.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7215 字 阅读 →
论文解读

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9319 字 阅读 →
论文解读

Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2190 字 阅读 →
论文解读

Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4636 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4621 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4807 字 阅读 →
论文解读

A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2387 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5431 字 阅读 →
论文解读

Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4862 字 阅读 →
论文解读

ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Toward Structural Multimodal Representations: Specialization, Selection, and Sparsification via Mixture-of-Experts

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6070 字 阅读 →
论文解读

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3895 字 阅读 →
论文解读

Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4665 字 阅读 →
论文解读

Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5630 字 阅读 →
论文解读

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

多模态幻觉缓解 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5400 字 阅读 →
论文解读

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5294 字 阅读 →
论文解读

NH-CROP: Robust Pricing for Governed Language Data Assets under Cost Uncertainty

强化学习 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5190 字 阅读 →
论文解读

Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1964 字 阅读 →