论文解读

Does language matter for spoken word classification? A multilingual generative meta-learning approach

音频分类 | 6.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7080 字 阅读 →
论文解读

Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8776 字 阅读 →
论文解读

Mechanistic Interpretability of ASR models using Sparse Autoencoders

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8102 字 阅读 →
论文解读

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

语音编辑 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5409 字 阅读 →
论文解读

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

 · 更新于 2026-09-25 · 约 18 分钟 · 8956 字 阅读 →
论文解读

What makes a word hard to learn? Modeling L1 influence on English vocabulary difficulty

词汇难度预测 | 5.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9671 字 阅读 →
论文解读

Dolphin-CN-Dialect: Where Chinese Dialects Matter

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8629 字 阅读 →
论文解读

RADAR Challenge 2026: Robust Audio Deepfake Recognition under Media Transformations

音频深度伪造检测 | 6.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7522 字 阅读 →
论文解读

Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9094 字 阅读 →
论文解读

Linear Semantic Segmentation for Low-Resource Spoken Dialects

语义分割 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7887 字 阅读 →
论文解读

MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method

音频事件检测 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6396 字 阅读 →
论文解读

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

语音克隆 | 8.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8272 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7885 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6296 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-07

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 79 分钟 · 39450 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4807 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5431 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6496 字 阅读 →
论文解读

Artificial intelligence language technologies in multilingual healthcare: Grand challenges ahead

多语言健康沟通 | 6.5/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2457 字 阅读 →
论文解读

Spoken Language Identification with Pre-trained Models and Margin Loss

说话人识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3725 字 阅读 →