论文解读

Snapping Matters: Context-Aware Onset Refinement for Automatic Music Transcription

音乐信息检索 | 7.1/10

 · 更新于 2026-09-08 · 约 12 分钟 · 5577 字 阅读 →
论文解读

SpAArSIST: Sparsified AASIST for Efficient and Reliable Anti-Spoofing

模型压缩 | 7.7/10

 · 更新于 2026-09-08 · 约 11 分钟 · 5272 字 阅读 →
论文解读

Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

 · 更新于 2026-09-08 · 约 12 分钟 · 5795 字 阅读 →
论文解读

The Dynamics of Human and AI-Generated Language: How Semantics Fluctuates across Different Timescales

语音合成 | 8.1/10

 · 更新于 2026-09-08 · 约 12 分钟 · 5915 字 阅读 →
论文解读

The Hidden Cost of Pairwise Verification in Synthetic Speech Source Tracing

语音合成 | 7.5/10

 · 更新于 2026-09-08 · 约 13 分钟 · 6167 字 阅读 →
论文解读

Tight Boundary Prediction in Speaker Diarization Using Causal-Anticausal Consistency

低资源 | 9.6/10

 · 更新于 2026-09-08 · 约 9 分钟 · 4149 字 阅读 →
论文解读

Towards Data-free and Training-free Compression for Speech Foundation Models Using Parameter Clustering

语音识别 | 6.4/10

 · 更新于 2026-09-08 · 约 11 分钟 · 5326 字 阅读 →
论文解读

UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction

语音合成 | 8.1/10

 · 更新于 2026-09-08 · 约 13 分钟 · 6102 字 阅读 →
论文解读

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

语音识别 | 7.5/10

 · 更新于 2026-09-08 · 约 14 分钟 · 6593 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-11

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-08 · 约 99 分钟 · 49581 字 阅读 →
论文解读

A Lightweight Dual-Factor Acoustic Authentication System via Cascaded GMM-DTW Architecture for Edge Computing

说话人验证 | 6/10

 · 更新于 2026-09-08 · 约 13 分钟 · 6198 字 阅读 →
论文解读

ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling

语音质量评估 | 8/10

 · 更新于 2026-09-08 · 约 10 分钟 · 4995 字 阅读 →
论文解读

Anchoring the Unknown: Open-Set Model Attribution via Proxy-Anchor Learning

多语言 | 8/10

 · 更新于 2026-09-08 · 约 11 分钟 · 5426 字 阅读 →
论文解读

AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

 · 更新于 2026-09-08 · 约 11 分钟 · 5467 字 阅读 →
论文解读

AuRA: Internalizing Audio Understanding into LLMs as LoRA

语音问答 | 7.5/10

 · 更新于 2026-09-08 · 约 7 分钟 · 3100 字 阅读 →
论文解读

Automated Pronunciation Evaluation for Korean Toddler Speech using Speech Diarization and Self-Supervised Learning

说话人日志 | 6/10

 · 更新于 2026-09-08 · 约 14 分钟 · 6726 字 阅读 →
论文解读

ContextCodec: Content-Focused Context Guidance for Ultra-Low Bitrate Speech Coding

语音编码 | 7.9/10

 · 更新于 2026-09-08 · 约 4 分钟 · 1629 字 阅读 →
论文解读

Cross-Modal Knowledge Distillation without Paired Data: Theoretical Foundation and Algorithm

语音识别 | 7.5/10

 · 更新于 2026-09-08 · 约 21 分钟 · 10471 字 阅读 →
论文解读

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

 · 更新于 2026-09-08 · 约 13 分钟 · 6279 字 阅读 →
论文解读

Deploying Speech-Driven 3D Facial Animation in Unreal Engine for Production-Ready Digital Humans

语音合成 | 6.6/10

 · 更新于 2026-09-08 · 约 24 分钟 · 11714 字 阅读 →