论文解读

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

多模态模型 | 7.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7057 字 阅读 →
论文解读

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

音乐生成 | 7.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8543 字 阅读 →
论文解读

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5818 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 51 分钟 · 25294 字 阅读 →
论文解读

HeadRoom: Lightweight, Edge-deployable Pipeline for Adaptive Notification Routing

音频事件检测 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6561 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-11

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 4 分钟 · 1819 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

多模态模型 | 5.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8394 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

语音属性识别 | 5.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8539 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6518 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5232 字 阅读 →
论文解读

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

语音情感识别 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5806 字 阅读 →
论文解读

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

多模态模型 | 4.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9967 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频交互 | 5.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6461 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 64 分钟 · 31889 字 阅读 →
论文解读

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

语音情感识别 | 6.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8349 字 阅读 →
论文解读

Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning

语音交互 | 8.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7653 字 阅读 →
论文解读

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

音乐理解 | 8.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12029 字 阅读 →
论文解读

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

语音活动检测 | 6.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9878 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23491 字 阅读 →
论文解读

Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

语音属性识别 | 7.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3485 字 阅读 →