论文解读

先按人找声音,再按位置修声音:用空间相关增强 HRTF 个性化

针对未见被试在稀疏测量下难以个性化 HRTF 的问题,该工作用图网络分别做基于被试检索的个性化和基于位置检索的上采样,再用前者输出微调后者,报告在 SONICOM 上 3 个方向时把 LSD 从 4.33 dB 降到 3.60 dB,代价是需要先测少量方向并做两阶段预训练加微调。

 · 更新于 2026-09-24 · 约 23 分钟 · 11100 字 阅读 →
论文解读

从短行为模拟内部认知:用个性化权重图回归真实人格

针对直接从外部行为回归真实人格偏向观察者印象的问题,该文用 10 秒音视频生成密钥修正通用面部反应生成器得到个性化认知权重,再编码为矩阵图用二维图网络回归自陈大五特质,在 NoXI 与 UDIVA 上报告了误差与相关提升,代价是仍需扩散预训练与双损失联合训练且细粒度言语未建模。

 · 更新于 2026-09-24 · 约 15 分钟 · 7429 字 阅读 →
论文解读

结构保真与语义对齐如何同时做:SSU 用句法图、文本引导图与语义锚统一多模态情感

针对文本、音频、视频情感分析中模态内结构丢失与跨模态语义错位问题,SSU 用句法与文本引导的模态图加全局语义锚与多视角对比学习统一融合,在 CMU-MOSI/MOSEI 上报告最高精度并以 0.3B 参数、0.015s 构图保持轻量,代价是依赖文本质量与句法解析条件。

 · 更新于 2026-09-24 · 约 23 分钟 · 11284 字 阅读 →
论文解读

从直接配音到导演-演员磨合:用检索增强补情感功课的配音模型

针对仅对目标语句做跨模态建模导致情感表达不足的问题,论文用多模态参考片段库加情感相似检索与渐进图融合来模拟导演给素材、演员逐步内化的流程,在 V2C-Animation 上把情感准确率做到 47.21%,代价是需要维护检索库并做三阶段图编码。

 · 更新于 2026-09-24 · 约 19 分钟 · 9141 字 阅读 →
论文解读

墙体遮挡下的分布式声学叙事:用拓扑图与几何提示补全多房间声场景

针对多房间中墙体遮挡导致单点麦克风观测碎片化的问题,论文用分布式麦克风的拓扑感知图融合与几何约束的冻结大语言模型推理将声学证据补全为物理一致的叙事,并在受控仿真中以三元组与空间一致性等指标验证其相对集中式基线的优势与代价。

 · 更新于 2026-09-24 · 约 22 分钟 · 11004 字 阅读 →
论文解读

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

音频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6380 字 阅读 →
论文解读

Investigating voiced and unvoiced regions of speech for audio deepfake detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6842 字 阅读 →
论文解读

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

音视频理解 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4656 字 阅读 →
论文解读

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

语音属性识别 | 5.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7091 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-07

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28125 字 阅读 →
论文解读

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

音频理解 | 5.5/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2267 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-06

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 73 分钟 · 36201 字 阅读 →
论文解读

Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction

语音属性识别 | 5.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6989 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-29

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 83 分钟 · 41435 字 阅读 →
论文解读

Modeling Stylistic Co-evolution in Symbolic Music Heritage Collections

音乐理解 | 4.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8057 字 阅读 →
论文解读

Resource-Aware Topology Management for ISAC-Enabled TDOA Localization in IoUT Networks

声源定位 | 4.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5538 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-28

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 103 分钟 · 51404 字 阅读 →
论文解读

From Prediction to Collaboration: Interactive Symbolic Music Analysis

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6028 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-16

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 63 分钟 · 31364 字 阅读 →
论文解读

HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection

音频伪造检测 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5063 字 阅读 →