论文解读

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

语音翻译 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5932 字 阅读 →
论文解读

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

音视频生成 | 7.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7295 字 阅读 →
论文解读

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

音频事件检测 | 8.2/10

 · 更新于 2026-09-06 · 约 26 分钟 · 12620 字 阅读 →
论文解读

Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8091 字 阅读 →
论文解读

TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios

音频分类 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6741 字 阅读 →
论文解读

Umm... With Transformers? Insights from Filled Pause Use across Four Slavic Parliaments

语音属性识别 | 4.8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8229 字 阅读 →
论文解读

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

音视频理解 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6394 字 阅读 →
论文解读

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7351 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 84 分钟 · 41962 字 阅读 →
论文解读

Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification

音频事件检测 | 6.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5162 字 阅读 →
论文解读

Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types

音频分类 | 6.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7376 字 阅读 →
论文解读

An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures

语音伪造检测 | 6.1/10

 · 更新于 2026-09-06 · 约 22 分钟 · 10952 字 阅读 →
论文解读

\(C^3\)ASD: Multi-Level Consistency-Driven Representation Learning

音视频理解 | 7.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7018 字 阅读 →
论文解读

Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

音频事件检测 | 8.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8342 字 阅读 →
论文解读

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

音频字幕生成 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7179 字 阅读 →
论文解读

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

音频理解 | 6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7796 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6524 字 阅读 →
论文解读

Context-Aware ASR for Mandarin Technical Lectures

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5475 字 阅读 →
论文解读

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7847 字 阅读 →
论文解读

Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

基准测试 | 7.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6409 字 阅读 →