论文解读

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1272 字 阅读 →
论文解读

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6454 字 阅读 →
论文解读

The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6823 字 阅读 →
论文解读

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7179 字 阅读 →
论文解读

Benchmarking AI for low-resource contexts: Thinking beyond leaderboards

语音识别 | 5.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6151 字 阅读 →
论文解读

Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6823 字 阅读 →
论文解读

Building Community-Centred NLP Resources for Puno Quechua

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5330 字 阅读 →
论文解读

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

语音情感识别 | 6.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5387 字 阅读 →
论文解读

When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6313 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7769 字 阅读 →
论文解读

FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5287 字 阅读 →
论文解读

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8339 字 阅读 →
论文解读

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6086 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5492 字 阅读 →
论文解读

Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6387 字 阅读 →
论文解读

Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1800 字 阅读 →
论文解读

Multilingual Phonological Feature Recognition with Self-Supervised Speech Models

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5589 字 阅读 →
论文解读

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

语音识别 | 9.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8124 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4440 字 阅读 →