论文解读

PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention

多模态讽刺检测 | 8.0/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6125 字 阅读 →
论文解读

Period-conscious Time-series Reconstruction under Local Differential Privacy

时间序列重构 | 7.0/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4076 字 阅读 →
论文解读

Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation

音频分类 | 6.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5535 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.5/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5190 字 阅读 →
论文解读

Spoken Language Identification with Pre-trained Models and Margin Loss

说话人识别 | 7.5/10

 · 更新于 2026-10-02 · 约 8 分钟 · 3725 字 阅读 →
论文解读

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

语音情感识别 | 7.0/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5598 字 阅读 →
论文解读

The AECM Algorithm for Deterministic Maximum Likelihood Direction Finding in the Presence of Gaussian Mixture Noise

声源定位 | 7.0/10

 · 更新于 2026-10-02 · 约 7 分钟 · 3375 字 阅读 →
论文解读

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

语音合成 | 7.0/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4081 字 阅读 →
论文解读

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

音乐生成 | 7.5/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5102 字 阅读 →
论文解读

Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI

模型评估 | 7.5/10

 · 更新于 2026-10-02 · 约 4 分钟 · 1964 字 阅读 →
论文解读

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

音频深度伪造检测 | 7.5/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5251 字 阅读 →
论文解读

Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy

语音治疗系统 | 7.5/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4453 字 阅读 →
论文解读

When Attention Collapses: Residual Evidence Modeling for Compositional Inference

音频分离 | 7.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5820 字 阅读 →
论文解读

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-10-02 · 约 6 分钟 · 2617 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-05

共分析 33 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 104 分钟 · 51662 字 阅读 →
论文解读

Alethia: A Foundational Encoder for Voice Deepfakes

音频深度伪造检测 | 8.0/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4189 字 阅读 →
论文解读

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

模型评估 | 7.5/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4999 字 阅读 →
论文解读

CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval

音频检索 音乐理解 | 6.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5689 字 阅读 →
论文解读

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

音频生成 | 7.5/10

 · 更新于 2026-10-02 · 约 14 分钟 · 6971 字 阅读 →
论文解读

From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings

音频分类 | 6.5/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6394 字 阅读 →