每日研究速递

语音/音乐/音频论文速递 2026-04-20

共分析 24 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 50 分钟 · 24566 字 阅读 →
论文解读

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

这篇论文旨在解决当前全模态大模型在音视频不一致性理解能力上缺乏系统性评估的问题。现有基准要么只关注音视频对齐事件,要么局限于检测深度伪造中的低级伪影,无法评估模型对长视频中语义级矛盾的理解。为此,作者

 · 更新于 2026-09-25 · 约 12 分钟 · 5790 字 阅读 →
论文解读

Classical Machine Learning Baselines for Deepfake Audio Detection on the Fake-or-Real Dataset

本文旨在解决深度伪造音频检测领域缺乏透明、可解释基线的问题。研究团队采用经典机器学习方法,在Fake-or-Real (FoR) 数据集上构建了一个完整的检测流程。他们从高保真(44.1 kHz)和电

 · 更新于 2026-09-25 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Comparison of window shapes and lengths in short-time feature extraction for classification of heart sound signals

本文针对心音信号(PCG)分类任务中,因信号非-stationarity而采用滑动窗口分段提取特征时,窗函数形状和长度选择缺乏系统性研究的问题,进行了一项实验性评估。作者使用双向长短期记忆网络(biL

 · 更新于 2026-09-25 · 约 7 分钟 · 3490 字 阅读 →
论文解读

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

本文提出了ControlFoley,一个统一且可控的视频到音频生成框架,旨在解决现有方法在跨模态冲突下文本控制力弱、以及参考音频控制中音色与时间信息纠缠的问题。其核心贡献包括:1)提出联合视觉编码范式

 · 更新于 2026-09-25 · 约 13 分钟 · 6198 字 阅读 →
论文解读

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

本文旨在解决当前语音代理评估中过度关注被动响应,而忽视其主动交互能力的问题。为此,作者提出了首个专门评估主动语音代理的基准测试框架 **ProVoice-Bench**。该框架包含四个新颖的任务,用以

 · 更新于 2026-09-25 · 约 8 分钟 · 3948 字 阅读 →
论文解读

Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery

这篇论文提出了一个名为 **Geo2Sound** 的新任务和框架,旨在从卫星图像生成地理上一致且逼真的声音景观。**要解决的问题**是现有图像到音频模型在处理自上而下的卫星视图时面临三大挑战:缺乏结

 · 更新于 2026-09-25 · 约 13 分钟 · 6095 字 阅读 →
论文解读

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

本文旨在解决大型音频语言模型在**细粒度音频事件时间定位**上的不足。现有模型因训练数据缺乏精确时间戳、基准测试过于简单,导致在长音频中定位短暂事件(“大海捞针”)时表现不可靠。为此,作者提出了**S

 · 更新于 2026-09-25 · 约 11 分钟 · 5348 字 阅读 →
论文解读

VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark

本文旨在解决语音处理中一个基础但被忽视的问题:如何系统化地识别语音音频所经过的后期处理效果及其参数。现实中,语音几乎都经过了降噪、压缩等效果处理,但现有数据集缺乏此类精确标注,阻碍了相关研究。为此,作

 · 更新于 2026-09-25 · 约 10 分钟 · 4743 字 阅读 →
论文解读

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

这篇论文旨在解决一个关键问题:当语音大模型(SLM)进入多用户共享环境时,仅基于文本内容的安全对齐策略是不足的,说话人身份、副语言特征和声学场景等音频上下文信息会根本性地改变请求的性质。为此,作者提出

 · 更新于 2026-09-25 · 约 10 分钟 · 4584 字 阅读 →
论文解读

Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection

这篇论文的核心贡献在于系统性地揭示并量化了语音抑郁症检测模型中普遍存在的“说话人身份泄露”问题。作者指出,当前许多报告高准确率的模型,其性能可能严重依赖于对说话人身份(声纹)的记忆,而非对抑郁相关声学

 · 更新于 2026-09-25 · 约 11 分钟 · 5416 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-19

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 94 分钟 · 46668 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 276 分钟 · 137848 字 阅读 →