论文解读

FreyaTTS Technical Report

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8785 字 阅读 →
论文解读

Immersive Social Interaction with VR and LLM-Assisted Humanoids

语音交互 | 4.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5532 字 阅读 →
论文解读

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5818 字 阅读 →
论文解读

Technical Report for MERL's Real-TSE Challenge Submission

语音分离 | 6.6/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8552 字 阅读 →
论文解读

Tonnetz-Driven Graph Wedgelet for Harmonic Complexity Reduction in Music Scores

音乐理解 | 5.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5870 字 阅读 →
论文解读

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9038 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 51 分钟 · 25294 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7893 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7616 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7365 字 阅读 →
论文解读

Inverse-designed meta processing units for multi-task near-field photonic computing

音频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6789 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9170 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

多模态模型 | 5.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8394 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6518 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6828 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 64 分钟 · 31889 字 阅读 →
论文解读

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

语音分离 | 4.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8227 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 41962 字 阅读 →
论文解读

BAT: Better Audio Transformer Guided by Convex Gated Probing

音频分类 | 8.6/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9139 字 阅读 →
论文解读

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

空间音频 | 8.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8299 字 阅读 →