论文解读

Evidence Subspace Projection: Measuring How Much Evidence Explains Deepfake Detection in Self-Supervised Speech Models

语音伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
论文解读

GigaChat Audio: Time-aware Large Audio Language Model

音频理解 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6899 字 阅读 →
论文解读

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

多模态模型 | 6.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12190 字 阅读 →
论文解读

LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

多模态模型 | 6.1/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10138 字 阅读 →
论文解读

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

音频理解 | 5.9/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7666 字 阅读 →
论文解读

PC-Mix: Partial-Component Audio Spoofing Detection under Mixed Speech and Environmental Sound Conditions

音频伪造检测 | 8.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5825 字 阅读 →
论文解读

Perceived Annoyance in Multi-source Electric Vehicle AVAS Environments

音频质量评估 | 3.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9113 字 阅读 →
论文解读

Semantic Sampling via Learnable Observation Front Ends

音频理解 | 5.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8112 字 阅读 →
论文解读

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

模型集成 | 9.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6811 字 阅读 →
论文解读

TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings

音频分类 | 7.9/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9587 字 阅读 →
论文解读

The SonicAGI System for the REAL-TSE Challenge

语音分离 | 6.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8024 字 阅读 →
论文解读

Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation

音乐生成 | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6192 字 阅读 →
论文解读

VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion

语音伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6950 字 阅读 →
论文解读

What You Train Is What You Get: Gender Bias, Training Composition, and Post-Hoc Mitigation in Audio Deepfake Detection

语音伪造检测 | 6.6/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9677 字 阅读 →
论文解读

Clean2FX: Label-conditioned modeling for clean-to-effect guitar audio transformations

音频理解 | 7.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7034 字 阅读 →
论文解读

Immersive Social Interaction with VR and LLM-Assisted Humanoids

语音交互 | 4.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5532 字 阅读 →
论文解读

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5818 字 阅读 →
论文解读

Tonnetz-Driven Graph Wedgelet for Harmonic Complexity Reduction in Music Scores

音乐理解 | 5.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5870 字 阅读 →
论文解读

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9038 字 阅读 →
论文解读

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

语音质量评估 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7643 字 阅读 →