论文解读

Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study

语音合成 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6254 字 阅读 →
论文解读

DRONEAUDIONET: Noise Suppression for Drone Audition-based Search and Rescue

音频分离 | 7.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Embodied Empathy: A Multimodal AR and LLM-Powered System for Self-Attachment Psychotherapy with Self-Initiated Humour

音频交互 | 5.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Embodied Passive Aeroacoustic Perception Enables Relative Sensing and Pursuit Between Aerial Robots

声源定位 | 7.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8298 字 阅读 →
论文解读

Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5978 字 阅读 →
论文解读

FATE: Frame-Level Audio-Visual Temporal Embedding

音视频理解 | 8.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6937 字 阅读 →
论文解读

Gecko: Fast Private Inference via Secure Public Encoder Offloading

迁移学习 | 6.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7533 字 阅读 →
论文解读

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

音频理解 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6085 字 阅读 →
论文解读

Hidden-Domain Routing for All-Type Audio Deepfake Detection

领域适应 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6135 字 阅读 →
论文解读

Homebot: A Personal AI Agent for Conversational Home Assistance and Automation

语音交互 | 3.8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4457 字 阅读 →
论文解读

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8227 字 阅读 →
论文解读

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5563 字 阅读 →
论文解读

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8468 字 阅读 →
论文解读

Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

音频伪造检测 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6916 字 阅读 →
论文解读

Normal-Anchored First-Order Model-Agnostic Meta-Learning based Whisper Fine-Tuning for Enhancing Fairness of Cleft Lip and Palate Speech Recognition

语音识别 | 5.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6336 字 阅读 →
论文解读

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

音频理解 | 6.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5961 字 阅读 →
论文解读

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

说话人验证 | 6.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5438 字 阅读 →
论文解读

REIMU: Efficient Heterogeneous Hierarchical Reasoning for SSL-Based Speech Deepfake Detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5558 字 阅读 →
论文解读

SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching

语音分离 | 7.3/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4976 字 阅读 →
论文解读

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8583 字 阅读 →