论文解读

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

语音识别 | 7.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4845 字 阅读 →
论文解读

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

音频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5275 字 阅读 →
论文解读

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

音视频理解 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4537 字 阅读 →
论文解读

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

音视频生成 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5274 字 阅读 →
论文解读

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

音视频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3309 字 阅读 →
论文解读

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

音频字幕生成 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8571 字 阅读 →
论文解读

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

音频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7525 字 阅读 →
论文解读

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6649 字 阅读 →
论文解读

Luna-TTS Family Technical Report

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7839 字 阅读 →
论文解读

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

音频质量评估 | 6.5/10

 · 更新于 2026-09-24 · 约 6 分钟 · 3001 字 阅读 →
论文解读

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

音频字幕生成 | 7.9/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2475 字 阅读 →
论文解读

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

音频字幕生成 | 8.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11629 字 阅读 →
论文解读

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

语音情感识别 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5637 字 阅读 →
论文解读

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

音视频问答 | 6.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5213 字 阅读 →
论文解读

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6266 字 阅读 →
论文解读

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
论文解读

Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR

语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6440 字 阅读 →
论文解读

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

音频理解 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6060 字 阅读 →
论文解读

Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

语音交互 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6106 字 阅读 →
论文解读

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

音频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6085 字 阅读 →