论文解读

Proteus: Automated Adversarial Robustness Testing for Audio Deepfake Detectors

数据增强 | 5.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4768 字 阅读 →
论文解读

MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

多模态模型 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5909 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-29

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 46 分钟 · 22697 字 阅读 →
论文解读

VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5290 字 阅读 →
论文解读

Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

音乐情感识别 | 4.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10281 字 阅读 →
论文解读

video-SALMONN-R\(^3\): Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

多模态模型 | 8.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5751 字 阅读 →
论文解读

Imitation Learning for Elder-Facing Speech Synthesis

语音合成 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5760 字 阅读 →
论文解读

GRIDEX: Grid-Grounded Forensic Explanations for Deepfake Spectrogram Analysis

语音合成 | 8.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7676 字 阅读 →
论文解读

Native Active Perception as Reasoning for Omni-Modal Understanding

语音识别 | 9.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6616 字 阅读 →
论文解读

Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs

语音合成 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7228 字 阅读 →
论文解读

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

强化学习 | 6.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4793 字 阅读 →
论文解读

Decision-Driven Geosteering Under Uncertainty: A Unified Framework for Sequential Decision Optimization

强化学习 | 7.8/10

 · 更新于 2026-09-25 · 约 40 分钟 · 19751 字 阅读 →
论文解读

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4464 字 阅读 →
论文解读

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6856 字 阅读 →
论文解读

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

语音转换 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9064 字 阅读 →
论文解读

Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors

语音情感识别 | 7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5825 字 阅读 →
论文解读

Orchestra-o1: Omnimodal Agent Orchestration

强化学习 | 8.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6192 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

语音对话系统 | 9.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8738 字 阅读 →
论文解读

End-to-End Training for Discrete Token LLM based TTS System

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6973 字 阅读 →