每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 84 分钟 · 41962 字 阅读 →
论文解读

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

音频字幕生成 | 6.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7179 字 阅读 →
论文解读

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7847 字 阅读 →
论文解读

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 7010 字 阅读 →
论文解读

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6575 字 阅读 →
论文解读

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

语音识别 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6159 字 阅读 →
论文解读

S-DiverSe: Spanish Diverse Speech

语音识别 | 5.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7968 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 176 分钟 · 87928 字 阅读 →
论文解读

CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

音乐生成 | 6.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4833 字 阅读 →
论文解读

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

音视频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8159 字 阅读 →
论文解读

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

声源定位 | 8.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8152 字 阅读 →
论文解读

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

空间音频 | 8.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8299 字 阅读 →
论文解读

Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

语音交互 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7653 字 阅读 →
论文解读

V-LynX: Token Interface Alignment for Video+X LLMs

音视频问答 | 7.8/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5123 字 阅读 →
论文解读

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

语音翻译 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7251 字 阅读 →
论文解读

SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings

语音合成 | 5.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5960 字 阅读 →
论文解读

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

语音交互 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5306 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-03

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 101 分钟 · 50504 字 阅读 →
论文解读

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5802 字 阅读 →
论文解读

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

音频检索 | 7.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5356 字 阅读 →