论文解读

在嘴型与动作抢注意力时,如何让化身在正确时间做正确动作

ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10172 字 阅读 →
论文解读

只用朗读时的停顿和用词,能反推中风病灶在哪、有多大吗

该研究用图片描述语音的声学流畅性与文本流畅性双路特征加注意力多示例学习,在 742 人 SONIVA 语料上不依赖影像预测中风状态、偏侧、体积三分级和 12 个半球脑叶受累,并报告左半球偏文本、右半球偏声学的特征依赖梯度与定位性能差距。

 · 更新于 2026-09-24 · 约 18 分钟 · 8882 字 阅读 →
论文解读

自回归交叉注意力丢了时间因果:用质心右移把对齐拉回来

针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。

 · 更新于 2026-09-24 · 约 18 分钟 · 8609 字 阅读 →
论文解读

先估计各模态可不可信,再决定听谁的:CICA 的感知与决策耦合

针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。

 · 更新于 2026-09-24 · 约 24 分钟 · 11594 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

当画面给不出声音线索时,导演脚本如何逐秒指挥视频生音频

针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9521 字 阅读 →
论文解读

只重建正常包络:用 LPC 谱加 NMF 记忆约束异常声音检测的重建

针对仅用正常录音训练时自编码器会重建异常输入的问题,该研究把每段音频压缩为一条 LPC 谱包络并只用正常字典的记忆加权来重建,在 MIMII 上以 90.6% 平均 AUC 超过 GRLNet 的 77.2%,代价是 Toy-conveyor 这类依赖细粒度时频线索的机器类型上 LPC 平滑可能削弱区分性。

 · 更新于 2026-09-24 · 约 15 分钟 · 7474 字 阅读 →
论文解读

不用重建声音:用两层可训练多分辨率网络直接在特征空间圈住正常机器声

针对只有正常机声可训练的异常声音检测,该文用两层 MuReNN 加注意力与可训练幂变换提取谱时调制并以 Deep SVDD 把正常样本压向超球面中心,在 MIMII 上平均 AUC 达 90.3%,代价是在 -6 dB 强噪声下落后于带去噪重建的 DeSpaWN。

 · 更新于 2026-09-24 · 约 19 分钟 · 9304 字 阅读 →
论文解读

带底噪也要无缝改口:先分离再压残留噪声的语音编辑

针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。

 · 更新于 2026-09-24 · 约 17 分钟 · 8091 字 阅读 →
论文解读

不重建整张网格:用分支-主干算子在连续房间空间中查询声场幅值

该文把声场重建写成从稀疏测点集合到任意查询点幅值的算子学习,用分支网编码麦克风坐标与幅值、主干网编码查询坐标并以交叉注意力聚合,在 32×32 训练网格上训练后可直接查询 64×64 细网格,并在 64 或 128 个测点时报告优于扩散基线,代价是 256 个测点时基线反超且本文只重建幅值不重建相位。

 · 更新于 2026-09-24 · 约 16 分钟 · 7766 字 阅读 →
论文解读

切分学习传不动 ViT:用注意力先并批再剪令牌的双重压缩

针对切分学习中 ViT 中间激活传输开销大的问题,论文提出先按 CLS 注意力聚类合并样本再按簇质心保留 Top-k 令牌的 ADC,在固定通信预算下用更少样本和更短序列完成前后向,并在 DeiT-T/S 上以更低压缩比保持精度,代价是客户端约 5.1% 的 K-means 聚类开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8315 字 阅读 →
论文解读

从一路混合音频生成面对面双人 3D 对话:空间、注视与轮流如何被建模

该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。

 · 更新于 2026-09-24 · 约 21 分钟 · 10319 字 阅读 →
论文解读

二分容器装不下成对线索:用三子空间为模态对单独留位置

针对只有全局共有与单模态私有两类表示会漏掉仅在两个模态之间成立的情感协同的问题,论文把表示分成公共、两两共享、私有三路并用子空间感知交叉注意力融合,在对齐与非对齐条件下报告了更低的平均绝对误差与更高的细粒度准确率,代价是更多分支与正则项需要逐项验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9615 字 阅读 →
论文解读

不只看脸像不像:用生成器内部的声音嘴型对齐信号抓伪造

针对跨生成器泛化难的问题,论文用音频条件扩散模型的 DDIM 反演重建差异与音频视觉交叉注意力做双路检测,在 MMDF 未见生成器与外部基准上取得领先,但单次反演约一分钟的计算开销是主要代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9407 字 阅读 →
论文解读

把离线 Canary 搬进同传:AlignAtt 截断如何换来口袋模型的低延迟

该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。

 · 更新于 2026-09-24 · 约 17 分钟 · 8024 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

没有交叉注意力时如何做 AlignAtt:把源文钉在提示词里再重算对齐块

论文把英语语音同传拆成 Qwen3 语音识别加强制对齐与 Gemma-4 解码器翻译的同步级联,用显式源文区间加离线挑选的 8 个对齐头加 qk-fast 重算实现解码器侧 AlignAtt,在英德和英意低延迟约 2 秒与高延迟 4 秒内超过主办方基线,代价是中文方向不稳定且全头重算会明显抬高计算感知延迟。

 · 更新于 2026-09-24 · 约 20 分钟 · 9819 字 阅读 →
论文解读

补上时间细节:让多模态大模型重新看清唇动的前后变化

针对多模态大模型做音视频语音识别时视觉时间建模粗糙且深层解码逐渐丢失时序的问题,论文用编码端时间感知注意力和解码端分层时间 token 堆叠来补时间信息,在 LRS2 与 LRS3 上把纯视觉识别词错率做到更低,代价是只在英语离线句子级条件下验证且增加了投影与注意力模块的开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8351 字 阅读 →