论文解读

Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery

这篇论文提出了一个名为 **Geo2Sound** 的新任务和框架,旨在从卫星图像生成地理上一致且逼真的声音景观。**要解决的问题**是现有图像到音频模型在处理自上而下的卫星视图时面临三大挑战:缺乏结

 · 更新于 2026-09-25 · 约 13 分钟 · 6095 字 阅读 →
论文解读

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

本文首次提出了“聆听深度伪造检测”这一新任务,旨在识别视频中人物在倾听状态下(非说话时)的伪造反应,弥补了现有研究主要集中于“说话”场景的不足。为解决此任务数据稀缺的问题,作者构建了首个专门数据集Li

 · 更新于 2026-09-25 · 约 9 分钟 · 4253 字 阅读 →
论文解读

VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark

本文旨在解决语音处理中一个基础但被忽视的问题:如何系统化地识别语音音频所经过的后期处理效果及其参数。现实中,语音几乎都经过了降噪、压缩等效果处理,但现有数据集缺乏此类精确标注,阻碍了相关研究。为此,作

 · 更新于 2026-09-25 · 约 10 分钟 · 4743 字 阅读 →