论文解读

Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8091 字 阅读 →
论文解读

TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios

音频分类 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6741 字 阅读 →
论文解读

Umm... With Transformers? Insights from Filled Pause Use across Four Slavic Parliaments

语音属性识别 | 4.8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8229 字 阅读 →
论文解读

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

音视频理解 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6394 字 阅读 →
论文解读

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7351 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 84 分钟 · 41962 字 阅读 →
论文解读

Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification

音频事件检测 | 6.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5162 字 阅读 →
论文解读

Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types

音频分类 | 6.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7376 字 阅读 →
论文解读

An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures

语音伪造检测 | 6.1/10

 · 更新于 2026-09-06 · 约 22 分钟 · 10952 字 阅读 →
论文解读

\(C^3\)ASD: Multi-Level Consistency-Driven Representation Learning

音视频理解 | 7.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7018 字 阅读 →
论文解读

Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

音频事件检测 | 8.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8342 字 阅读 →
论文解读

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

音频字幕生成 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7179 字 阅读 →
论文解读

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

音频理解 | 6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7796 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6524 字 阅读 →
论文解读

Context-Aware ASR for Mandarin Technical Lectures

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5475 字 阅读 →
论文解读

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7847 字 阅读 →
论文解读

Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

基准测试 | 7.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6409 字 阅读 →
论文解读

DETECT-3B-Omni is Agnostic of Content and Demographics

语音伪造检测 | 4.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5688 字 阅读 →
论文解读

Doppelganger: Sound Effects and Their Synthetic Twins

音频检索 | 9.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6213 字 阅读 →
论文解读

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

语音交互 | 5.9/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8798 字 阅读 →