论文解读

VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion

语音伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6950 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-14

共分析 53 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 186 分钟 · 92760 字 阅读 →
论文解读

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

音乐生成 | 7.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8543 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 51 分钟 · 25294 字 阅读 →
论文解读

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

语音质量评估 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7643 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9056 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

语音属性识别 | 5.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8539 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6518 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5232 字 阅读 →
论文解读

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

音乐转录 | 7.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6381 字 阅读 →
论文解读

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

音乐转录 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7041 字 阅读 →
论文解读

MuScriptor: An Open Model for Multi-Instrument Music Transcription

音乐转录 | 8.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6987 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7527 字 阅读 →
论文解读

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

语音分离 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 64 分钟 · 31889 字 阅读 →
论文解读

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

音乐理解 | 8.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12029 字 阅读 →
论文解读

MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres

基准测试 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6401 字 阅读 →
论文解读

Text-Independent Speaker Verification Using Discrete Audio Tokens

说话人验证 | 5.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7091 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23491 字 阅读 →
论文解读

Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats

语音转换 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6152 字 阅读 →