论文解读

直接学对话会失语:用课程学习与说话轮次嵌入让流匹配学会双人对话

针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9541 字 阅读 →
论文解读

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

音视频语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6606 字 阅读 →
论文解读

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

音频字幕生成 | 7.9/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2475 字 阅读 →
论文解读

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

语音翻译 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7762 字 阅读 →
论文解读

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9417 字 阅读 →
论文解读

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

音频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7166 字 阅读 →
论文解读

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

语音交互 | 7.6/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8635 字 阅读 →
论文解读

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

音视频理解 | 6.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7850 字 阅读 →
论文解读

ITGPT: A Transformer Based Architecture for the Generation of Dance Dance Revolution and In the Groove Charts

音乐生成 | 6.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7824 字 阅读 →
论文解读

Technical Report for MERL's Real-TSE Challenge Submission

语音分离 | 6.6/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6411 字 阅读 →
论文解读

Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition

语音识别 | 7.3/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5903 字 阅读 →
论文解读

Position-Aware Target Speaker Extraction for Long-Form Multi-Party Conversations: A Diarization-Free Framework for ASR

语音识别 | 8.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6087 字 阅读 →
论文解读

Learning from Annotation Uncertainty: Entropy-Aware Curriculum for Speech Emotion Recognition

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5469 字 阅读 →
论文解读

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

强化学习 | 6.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4793 字 阅读 →
论文解读

Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6027 字 阅读 →
论文解读

Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection

课程学习 | 7.2/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13307 字 阅读 →
论文解读

Scaling Human and G2P Supervision for Robust Phonetic Transcription

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4873 字 阅读 →
论文解读

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

音频生成 | 7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6522 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2097 字 阅读 →