论文解读

Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues

音频分类 | 6.5/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7338 字 阅读 →
论文解读

Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction

语音生物标志物 | 6/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8390 字 阅读 →
论文解读

Can We Trust AI-Inferred User States. A Psychometric Framework for Validating the Reliability of Users States Classification by LLMs in Operational Environments

模型评估 | 6/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7392 字 阅读 →
论文解读

From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation

语音翻译 | 6.9/10

 · 更新于 2026-10-01 · 约 36 分钟 · 17909 字 阅读 →
论文解读

Improving Automatic Speech Recognition for Speakers Treated for Oral Cancer using Data Augmentation and LLM Error Correction

语音识别 | 6/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8703 字 阅读 →
论文解读

Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization

语音识别 说话人分离 | 7.2/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8034 字 阅读 →
论文解读

Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation

音乐生成 | 8.1/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8739 字 阅读 →
论文解读

Perforated Neural Networks for Keyword Spotting

关键词检测 | 5/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7432 字 阅读 →
论文解读

Real-time Speech Restoration using Data Prediction Mean Flows

音频修复 | 7.5/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7597 字 阅读 →
论文解读

Scalable neuromorphic computing from autonomous spiking dynamics in a clockless reconfigurable chip

音频分类 | 7.8/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8807 字 阅读 →
论文解读

Sound Sparks Motion: Audio and Text Tuning for Video Editing

视频编辑 | 5.5/10

 · 更新于 2026-10-01 · 约 12 分钟 · 5597 字 阅读 →
论文解读

Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics

生理信号预测 | 6/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8109 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-18

共分析 13 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 48 分钟 · 23894 字 阅读 →
论文解读

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

音视频分割 | 7.2/10

 · 更新于 2026-10-01 · 约 23 分钟 · 11356 字 阅读 →
论文解读

ViMU: Benchmarking Video Metaphorical Understanding

基准测试 | 8.1/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7731 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-17

共分析 2 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 9 分钟 · 4469 字 阅读 →
论文解读

A Benchmark for Early-stage Parkinson's Disease Detection from Speech

语音生物标志物 | 7.2/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7457 字 阅读 →
论文解读

A Calculus-Based Framework for Determining Vocabulary Size in End-to-End ASR

语音识别 | 3.9/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8601 字 阅读 →
论文解读

AudioMosaic: Contrastive Masked Audio Representation Learning

音频分类 | 7.3/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7392 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis

音频生成 | 6.8/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8349 字 阅读 →