论文解读

Leveraging Large Speech Language Models as Evaluators for Expressive Speech

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3233 字 阅读 →
论文解读

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

基准测试 | 7.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3975 字 阅读 →
论文解读

LOTUSDIS: A Thai Far-Field Meeting Corpus for Robust Conversational ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3735 字 阅读 →
论文解读

Marco-Voice: A Unified Framework for Expressive Speech Synthesis with Voice Cloning

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

MCF: Text LLMS for Multimodal Emotional Causality

情感分析 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4895 字 阅读 →
论文解读

MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3597 字 阅读 →
论文解读

Multimodal LLMs as Expert Speech Annotators: Acoustic Macro-Descriptors for Parkinson's Detection

语音生物标志物 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4079 字 阅读 →
论文解读

Multimodal Transformer with Multiperspective Training for Predicting Self-Expression Skills from Video Interview

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4288 字 阅读 →
论文解读

MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5119 字 阅读 →
论文解读

No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4301 字 阅读 →
论文解读

OV-INSTRUCTTTS: Towards Open-Vocabulary Instruct Text-to-Speech

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5743 字 阅读 →
论文解读

Perceptual Quality Assessment for Stylized Talking Heads

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4192 字 阅读 →
论文解读

Pianoroll-Event: A Novel Score Representation for Symbolic Music

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4100 字 阅读 →
论文解读

Random Matrix-Driven Graph Representation Learning For Bioacoustic Recognition

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4382 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4136 字 阅读 →
论文解读

Reliable AI via Age-Balanced Validation: Fair Model Selection for Parkinson’s Detection from Voice

语音生物标志物 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4513 字 阅读 →
论文解读

Representation-Based Data Quality Audits for Audio

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4054 字 阅读 →
论文解读

Rethinking Entity Disambiguation in Complex Modalities

实体消歧 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4884 字 阅读 →
论文解读

Rethinking Music Captioning with Music Metadata LLMS

音乐理解 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5562 字 阅读 →
论文解读

RFM-Editing: Rectified Flow Matching for Text-Guided Audio Editing

音频编辑 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4151 字 阅读 →