论文解读

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

扩散模型 | 8.9/10

 · 更新于 2026-09-07 · 约 15 分钟 · 7367 字 阅读 →
论文解读

VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation

语音合成 | 7.6/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5290 字 阅读 →
论文解读

voxmap-studio: An open-source speaker diarization annotation tool with built-in cost instrumentation

说话人日志 | 6.5/10

 · 更新于 2026-09-07 · 约 18 分钟 · 8922 字 阅读 →
论文解读

wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

语音检索 | 6.4/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5876 字 阅读 →
论文解读

What We are Missing in Multimodal LLM Evaluation?

What We are Missing in Multimodal LLM Evaluation?

 · 更新于 2026-09-07 · 约 1 分钟 · 229 字 阅读 →
论文解读

When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence

语音情感识别 | 6.6/10

 · 更新于 2026-09-07 · 约 21 分钟 · 10419 字 阅读 →
论文解读

WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

音频分类 | 6.7/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4761 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-07 · 约 55 分钟 · 27448 字 阅读 →
论文解读

Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS

语音合成 | 7/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5086 字 阅读 →
论文解读

Attractive and Repulsive Pattern Control in Sequence Generation

音乐生成 | 8.1/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6487 字 阅读 →
论文解读

BCoughBench: Benchmarking Respiratory Acoustic Foundation Models Under Body-Coupled Wearable Sensor Conditions

基准测试 | 6.7/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6270 字 阅读 →
论文解读

CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations

语音合成 | 5.5/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5965 字 阅读 →
论文解读

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

语音识别 | 7.1/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5097 字 阅读 →
论文解读

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

语音情感识别 | 6.9/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5369 字 阅读 →
论文解读

End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users

端到端 | 7/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6231 字 阅读 →
论文解读

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

语音识别 | 6.1/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4514 字 阅读 →
论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4856 字 阅读 →
论文解读

FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset

音频分类 | 7/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6748 字 阅读 →
论文解读

Frequency-Aware Self-Supervised Music Representation Learning

音乐信息检索 | 6.8/10

 · 更新于 2026-09-07 · 约 19 分钟 · 9505 字 阅读 →
论文解读

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5630 字 阅读 →