论文解读

从一个人跳到一屋人跳:Encypher 把集体律动写成音乐提示

Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。

 · 更新于 2026-09-24 · 约 18 分钟 · 8986 字 阅读 →
论文解读

用稀疏局部图约束跨模态对齐,再让 Mamba 管长时序的轻量音视增强

针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。

 · 更新于 2026-09-24 · 约 18 分钟 · 8523 字 阅读 →
论文解读

声音没有空间位置时,如何让三维人脸知道嘴该动哪里

针对语音特征缺少显式人脸空间结构导致口唇与表情不准的问题,该文用音频预测的 68 点地标做局部空间增强与全局补偿来修正三维高斯属性偏移,并在自驱动与跨驱动条件下验证同步与重建,同时以阈值与几何正则的取舍为代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9332 字 阅读 →
论文解读

看不清就撞一下再改路:TDGP 用令牌融合定方向、用碰撞删边改路径

针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8733 字 阅读 →
论文解读

秒级对齐加软标签:AVNet 如何让声音与画面在缺模态时仍能互补

针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。

 · 更新于 2026-09-24 · 约 18 分钟 · 8553 字 阅读 →
论文解读

不看画质看物理:PIVOT 用可测量的声视约束验算生成视频

针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。

 · 更新于 2026-09-24 · 约 25 分钟 · 12250 字 阅读 →
论文解读

边说边想边办事:Realtime-Venus 如何把全双工对话与异步委派放在同一时间线上

Realtime-Venus 用两个 9B 前端分别处理音视频与纯音频全双工对话,用双环运行时把即时说话与后台推理工具执行解耦,最强证据是 Omni 在六项视频基准领先与 Audio 在 MMAU 等四项音频问答领先,代价是打断响应与参数准确率仍落后及委派判断存在漏委派与过度委派的权衡。

 · 更新于 2026-09-24 · 约 24 分钟 · 11780 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

先看到的不等于已证实:用未来可验声明管住流式音视记忆

针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。

 · 更新于 2026-09-24 · 约 24 分钟 · 11690 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

“You Good?”靠什么区分陈述与疑问:F0 峰位置与眉毛峰时序的协同证据

该研究以非裔美国英语使用者产出的多义短语 you good 及单义对照句为材料,用 Praat 标 F0 峰位置与 OpenFace 加 findgest 标眉毛运动,检验句类与多义性对峰位、眉毛活动频率、抬眉分布与声手峰时序的影响,最强证据是句类显著决定 F0 峰落在第二词与眉峰相对更早,而疑问句并未带来更多眉毛活动或抬眉。

 · 更新于 2026-09-24 · 约 18 分钟 · 8866 字 阅读 →
论文解读

整句里的手势为何不再决定重音:西班牙语节拍手势效应的整句检验

该研究把西班牙语最小重音对嵌入完整句子并用 5 级声音连续体加 2 种节拍对齐做二选一判断,结果显示声音步骤主导判断而手势对齐无可靠影响,反应时同样无可靠加速,代价是更自然的语速与手势变异可能稀释了视觉线索的权重。

 · 更新于 2026-09-24 · 约 20 分钟 · 9995 字 阅读 →
论文解读

重叠喀哒声串归谁:三水听器加视频如何拆解抹香鲸近场混叠

针对两头同龄雄性幼鲸近距离身体接触时连续重叠喀哒声串难以归属的问题,论文用单通道恒 Q 变换谱加步间间隔节律做声学解交织,再用三元紧凑阵列到达时差定位投影到视频验证,在简单场景聚类误差为 0.0%、最难场景达 25.79%,并以 10 度容限实现主要发射者最高 100% 水平视觉一致,代价是垂直方向系统性偏差与近平面阵列几何盲区导致两个场景无法最终归属。

 · 更新于 2026-09-24 · 约 20 分钟 · 9640 字 阅读 →
论文解读

当脸和声音吵架时,人工耳蜗学龄前儿童为什么更信脸

该研究用 48 段高兴与生气冲突或一致的动态视听短片加眼动追踪,检验 27 名人工耳蜗学龄前儿童与 25 名健听同龄人的线索权重与注视分配,发现人工耳蜗组在冲突时显著偏向面孔且眼口注视更均衡,代价是听觉线索利用不足与注视表现关联缺失。

 · 更新于 2026-09-24 · 约 17 分钟 · 8194 字 阅读 →
论文解读

拍手何以助听词:安静与噪声下节拍手势加速词汇通达却不依赖重音对齐

该研究用荷兰语预测性句尾词汇判断任务检验节拍手势是否加速词汇通达,最强证据是噪声下真词反应时加快约 122 毫秒和 124 毫秒并使正确率提升约 4 个百分点,代价是手势与词重音是否对齐始终未产生可靠的交互作用。

 · 更新于 2026-09-24 · 约 23 分钟 · 11295 字 阅读 →
论文解读

重叠对话先听清谁再分清哪一桌:长时视听目标说话人识别加语义聚类

针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7990 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

稀疏舞蹈线索到稠密音乐之间:用分层专家监督补上中间表示

针对舞蹈线索稀疏而作曲需要稠密结构的问题,CMA-OT 用 Jukebox 多尺度专家对 DiT 隐表示做由粗到细的课程对齐与尺度自适应 FGW 软对齐,并以流匹配生成损失联合训练,在 AIST++ 与 TikTok 上报告了节奏与质量提升,代价是训练侧引入多尺度 OT 与课程调度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10119 字 阅读 →
论文解读

重叠语音下先看眼神再听声音:互视聚类与双模型输出融合的 MCoRec 系统

针对多人同时交谈且严重重叠的 MCoRec 任务,该工作用互视分数加语音重叠分数做会话聚类,并用 CTC/attention 与 Whisper 双模型输出融合做识别,在评测集上聚类 F1 达到 0.910,词错误率降到 48.67%,联合误差降到 0.289,代价是依赖几何假设、边界框与抽帧处理。

 · 更新于 2026-09-24 · 约 18 分钟 · 9005 字 阅读 →