论文解读

Towards True Speech-to-Speech Models Without Text Guidance

语音对话系统 | 9.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4831 字 阅读 →
论文解读

TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction

脑编码 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5372 字 阅读 →
论文解读

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

语音翻译 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5273 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5344 字 阅读 →
论文解读

BUT System Description for CHiME-9 MCoRec Challenge

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5308 字 阅读 →
论文解读

Diffusion Reconstruction towards Generalizable Audio Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4407 字 阅读 →
论文解读

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

说话人验证 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6131 字 阅读 →
论文解读

Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

语音分类 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5063 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4318 字 阅读 →
论文解读

A Study of Data Selection Strategies for Pre-Training Self-Supervised Speech Models

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4254 字 阅读 →
论文解读

A Task-Aware Dual-Level Self-Supervised Learning Method for Effective Sound Event Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4113 字 阅读 →
论文解读

ACAVCaps: Enabling Large-Scale Training for Fine-Grained and Diverse Audio Understanding

音频分类 | 8.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3768 字 阅读 →
论文解读

Advancing LLM-Based Multi-Channel Multi-Speaker Speech Recognition with Global Cross-Channel Attention and Sentence-Ordered First-In First-Out Serialized Output Training

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5058 字 阅读 →
论文解读

Adversarial Fine-Tuning on Speech Foundation Model with Vulnerable Attention Consistency Regularization for Robust Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4509 字 阅读 →
论文解读

An Event-Based Sequence Modeling Approach to Recognizing Non-Triad Chords with Oversegmentation Minimization

音乐信息检索 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4973 字 阅读 →
论文解读

An Unsupervised Alignment Feature Fusion System for Spoken Language-Based Dementia Detection

语音生物标志物 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4201 字 阅读 →
论文解读

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4086 字 阅读 →
论文解读

Audio-Guided Multimodal Approach for Fine-Grained Alignment and Boundary Modeling in Active Speaker Detection

说话人检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4161 字 阅读 →
论文解读

Benchmarking Music Autotagging with MGPHot Expert Annotations vs. Generic Tag Datasets

音乐信息检索 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4442 字 阅读 →
论文解读

Bimodal Fusion Framework for Dynamic Facial Expression Recognition In-The-Wild

语音情感识别 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3875 字 阅读 →