论文解读

Attention2Probability: Attention-Driven Terminology Probability Estimation for Robust Speech-to-text System

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5189 字 阅读 →
论文解读

Audio-Visual Deepfake Generation and Detection: An Exploratory Survey

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3233 字 阅读 →
论文解读

AUDIOCARDS: Structured Metadata Improves Audio Language Models for Sound Design

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5242 字 阅读 →
论文解读

AVO-65: A Large-Scale Hierarchical Audio-Visual Object Dataset

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4186 字 阅读 →
论文解读

BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on POP and Classical Music

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4376 字 阅读 →
论文解读

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

音频深度伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Beyond Global Emotion: Fine-Grained Emotional Speech Synthesis with Dynamic Word-Level Modulation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

BioSEN: A Bio-Acoustic Signal Enhancement Network for Animal Vocalizations

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5221 字 阅读 →
论文解读

Bleed No More: Generative Interference Reduction for Musical Recordings

音乐源分离 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4891 字 阅读 →
论文解读

CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries

音频检索 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3821 字 阅读 →
论文解读

Clue2Emo: A Brain-Inspired Framework for Open-Vocabulary Multimodal Emotion Recognition

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6003 字 阅读 →
论文解读

CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-Spoofing Countermeasures

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5184 字 阅读 →
论文解读

Confidence-Based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4790 字 阅读 →
论文解读

Content Leakage in Librispeech and its Impact on the Privacy Evaluation of Speaker Anonymization

语音匿名化 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3586 字 阅读 →
论文解读

CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content

跨模态检索 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4170 字 阅读 →
论文解读

Cross-Lingual Interleaving for Speech Language Models

语音大模型 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5122 字 阅读 →
论文解读

Denoising Of Stochastic Ray Tracing Room Impulse Responses

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4886 字 阅读 →
论文解读

Detecting and Attributing Synthetic Spanish Speech: The HISPASpoof Dataset

语音伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4286 字 阅读 →
论文解读

Do Bias Benchmarks Generalise? Evidence from Voice-Based Evaluation of Gender Bias in Speechllms

模型评估 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4695 字 阅读 →
论文解读

Do You Hear What I Mean? Quantifying the Instruction-Perception GAP in Instruction-Guided Expressive Text-to-Speech Systems

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4453 字 阅读 →