论文解读

韵律能猜出多少句法?把停顿与时长放进互信息的秤上称重

Transformer | 7.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11855 字 阅读 →
论文解读

当一句“右转航向 150”必须找到那架飞机:语音与轨迹如何在同一个地图上相遇

对比学习 | 7.5/10

 · 更新于 2026-09-24 · 约 32 分钟 · 15572 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 151 分钟 · 75584 字 阅读 →
论文解读

效果是效果,声音是声音:当表征必须同时记住与忘记内容

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 9008 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 66 分钟 · 32614 字 阅读 →
论文解读

先分清状态,再决定能不能说话:Anian 如何把生成关进安全笼子

语音交互 | 5.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8236 字 阅读 →
论文解读

别只听响度:为什么 AI 炸点声会在“尾巴”里露馅

音频伪造检测 | 5.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8682 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 87 分钟 · 43538 字 阅读 →
论文解读

忘掉不等于擦除:语音网络把关键期痕迹压在了最底层

语音识别 | 8.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4703 字 阅读 →
论文解读

别等整句说完:把数字人的手势变成一条受因果约束的数据流

音视频交互 | 6.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4260 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26637 字 阅读 →
论文解读

Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

音频理解 | 8.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6292 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 68 分钟 · 33830 字 阅读 →
论文解读

MusPyExpress: Extending MusPy with Enhanced Expression Text Support

音乐理解 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5294 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-25

共分析 46 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 101 分钟 · 50381 字 阅读 →
论文解读

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

音频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5976 字 阅读 →
论文解读

Tracking the Trend in How Speech Synthesizers Deceive People

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4931 字 阅读 →
论文解读

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

音视频生成 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5274 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-21

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 60 分钟 · 29950 字 阅读 →
论文解读

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

音视频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8197 字 阅读 →