论文解读

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

语音识别 | 5.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8468 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-15

共分析 25 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 88 分钟 · 43611 字 阅读 →
论文解读

Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

语音分离 | 6.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7612 字 阅读 →
论文解读

Efficiently Adapting Spoken Language Models for the Singaporean Context

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8212 字 阅读 →
论文解读

Teaching Speech Enhancement Models to Sing: Domain Adaptation from Speech Enhancement to Singing Voice Separation

音乐源分离 | 6.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9285 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-14

共分析 53 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 186 分钟 · 92760 字 阅读 →
论文解读

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

多模态模型 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7057 字 阅读 →
论文解读

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

音视频语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7585 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25294 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10711 字 阅读 →
论文解读

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6706 字 阅读 →
论文解读

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9228 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 5.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6538 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7440 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8468 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8582 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 64 分钟 · 31889 字 阅读 →
论文解读

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6017 字 阅读 →
论文解读

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5163 字 阅读 →
论文解读

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

语音翻译 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5932 字 阅读 →