在嘴型与动作抢注意力时,如何让化身在正确时间做正确动作
ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。
ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。
该研究用图片描述语音的声学流畅性与文本流畅性双路特征加注意力多示例学习,在 742 人 SONIVA 语料上不依赖影像预测中风状态、偏侧、体积三分级和 12 个半球脑叶受累,并报告左半球偏文本、右半球偏声学的特征依赖梯度与定位性能差距。
针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。
针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。
针对仅用正常录音训练时自编码器会重建异常输入的问题,该研究把每段音频压缩为一条 LPC 谱包络并只用正常字典的记忆加权来重建,在 MIMII 上以 90.6% 平均 AUC 超过 GRLNet 的 77.2%,代价是 Toy-conveyor 这类依赖细粒度时频线索的机器类型上 LPC 平滑可能削弱区分性。
针对只有正常机声可训练的异常声音检测,该文用两层 MuReNN 加注意力与可训练幂变换提取谱时调制并以 Deep SVDD 把正常样本压向超球面中心,在 MIMII 上平均 AUC 达 90.3%,代价是在 -6 dB 强噪声下落后于带去噪重建的 DeSpaWN。
针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。
该文把声场重建写成从稀疏测点集合到任意查询点幅值的算子学习,用分支网编码麦克风坐标与幅值、主干网编码查询坐标并以交叉注意力聚合,在 32×32 训练网格上训练后可直接查询 64×64 细网格,并在 64 或 128 个测点时报告优于扩散基线,代价是 256 个测点时基线反超且本文只重建幅值不重建相位。
针对切分学习中 ViT 中间激活传输开销大的问题,论文提出先按 CLS 注意力聚类合并样本再按簇质心保留 Top-k 令牌的 ADC,在固定通信预算下用更少样本和更短序列完成前后向,并在 DeiT-T/S 上以更低压缩比保持精度,代价是客户端约 5.1% 的 K-means 聚类开销。
该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。
针对只有全局共有与单模态私有两类表示会漏掉仅在两个模态之间成立的情感协同的问题,论文把表示分成公共、两两共享、私有三路并用子空间感知交叉注意力融合,在对齐与非对齐条件下报告了更低的平均绝对误差与更高的细粒度准确率,代价是更多分支与正则项需要逐项验证。
针对跨生成器泛化难的问题,论文用音频条件扩散模型的 DDIM 反演重建差异与音频视觉交叉注意力做双路检测,在 MMDF 未见生成器与外部基准上取得领先,但单次反演约一分钟的计算开销是主要代价。
该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把英语语音同传拆成 Qwen3 语音识别加强制对齐与 Gemma-4 解码器翻译的同步级联,用显式源文区间加离线挑选的 8 个对齐头加 qk-fast 重算实现解码器侧 AlignAtt,在英德和英意低延迟约 2 秒与高延迟 4 秒内超过主办方基线,代价是中文方向不稳定且全头重算会明显抬高计算感知延迟。
针对多模态大模型做音视频语音识别时视觉时间建模粗糙且深层解码逐渐丢失时序的问题,论文用编码端时间感知注意力和解码端分层时间 token 堆叠来补时间信息,在 LRS2 与 LRS3 上把纯视觉识别词错率做到更低,代价是只在英语离线句子级条件下验证且增加了投影与注意力模块的开销。