论文解读

跳过转写直接做摘要:用句子向量把多语言语音送进法语摘要器

该研究把长语音切成片段并编码为与法语句向量对齐的语音片段向量,直接送入改造后的法语编码器解码器生成法语摘要,在呼叫中心对话和小规模跨语言合成语音上报告了与级联和音频大模型对照的可核对结果,但大模型对照为零样本且跨语言语音为合成。

 · 更新于 2026-09-24 · 约 19 分钟 · 9459 字 阅读 →
论文解读

重叠越密越要看嘴型:NJU-AALAB 用数据清洗与模板混合加持视听识别

针对多人同时说话造成的严重重叠与多会话分组难题,该工作保留基线说话人检测不变,主攻视听语音识别的数据清洗与模板化混合仿真并用大语言模型做会话聚类,开发集最好结果为词错误率 42.81% 与聚类分数 97.77%,代价是强单说话人骨干仍易误转干扰人且文本纠错收益有限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9320 字 阅读 →
论文解读

八人四会话强重叠下先用视觉定界再抽取转写的级联路线

针对室内社交中最多八人四会话并行且重叠率超 90% 的问题,采用每人视觉流做说话人检测分段、音频视觉目标语音抽取去干扰、音频视觉识别转写再做大模型会话聚类的级联路线,最强可复现证据是原始开发集上提交三的 32.03/16.02 到 31.39/15.70 与聚类满分,代价是多前端多后端融合与大模型多次投票的系统复杂度。

 · 更新于 2026-09-24 · 约 20 分钟 · 9719 字 阅读 →
论文解读

把七种模态塞进一个自回归模型:Archon 用语义视频与模态链思考做整人生成

Archon 针对文本音频动作视觉碎片化问题,用统一离散词表加自回归语言模型统一七种模态,以语义视频实现约 4 倍 token 压缩并用语义驱动扩散恢复高清视频,最强证据是语音驱动视频与图条件语音任务上与专用模型相当或更优,代价是两阶段训练与推理链更长且本次未能确认代码模型公开。

 · 更新于 2026-09-24 · 约 24 分钟 · 11704 字 阅读 →
论文解读

只用朗读时的停顿和用词,能反推中风病灶在哪、有多大吗

该研究用图片描述语音的声学流畅性与文本流畅性双路特征加注意力多示例学习,在 742 人 SONIVA 语料上不依赖影像预测中风状态、偏侧、体积三分级和 12 个半球脑叶受累,并报告左半球偏文本、右半球偏声学的特征依赖梯度与定位性能差距。

 · 更新于 2026-09-24 · 约 18 分钟 · 8882 字 阅读 →
论文解读

不靠听觉合奏:把振动、触摸和视觉当作音乐材料的即兴装置

Audionce 针对聋人与听人共同即兴时听觉门槛过高的问题,选择把物理扬声器阵列与点云虚拟镜面放在同一交互场中,用身体移动与触摸扬声器驱动声音与视觉,最强证据是聋人设计者与听人可协同完成结构化即兴而不被察觉听力差异,主要代价是振动难以分辨音高与音量等细粒度差异且依赖持续学习与视觉补偿。

 · 更新于 2026-09-24 · 约 24 分钟 · 11966 字 阅读 →
论文解读

简单输入画不准、精细能量难手绘:AudioSketch 如何调制出有语义的时间能量

针对单张图像对应多种合理声音的一对多图像到音频生成问题,AudioSketch 用轻量图像到音频映射复用预训练文本到音频扩散模型并以 ControlNet 注入能量轨迹,再用语义条件能量调制器把简单时间戳转换为精炼能量,在 VisualSound 上无控制时以 16.21 的 FD 与 12.41 的 IS 领先同类,而代价是对平滑归一化选择敏感且客观起振对 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8996 字 阅读 →
论文解读

把选片、排序、写稿、配乐装进同一个离散词表:AutoCut 如何做可控的广告剪辑

AutoCut 针对广告视频制作中多模态松散耦合与剪辑不可控问题,用残差向量量化把视频与音频变成与文本共享的离散词元并经两阶段训练统一推理,在 364 个样本的同一评测上取得排序准确率 0.10714 与脚本质量 84.6255 等最佳结果,代价是依赖已有素材库检索而不能从零生成像素。

 · 更新于 2026-09-24 · 约 20 分钟 · 9532 字 阅读 →
论文解读

缺模态下先补语义再算不确定性:超图引导扩散与双通道证据融合

针对对话情感识别中随机缺失模态导致语义不一致与模态冲突,论文用掩码超图注意力为扩散恢复提供条件并用特征源与判别双通道估计不确定性做证据融合,在缺失率 0.0 至 0.7 下保持最高准确率,代价是两阶段训练与 300 步扩散采样开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9807 字 阅读 →
论文解读

把叫声、照片和学名对齐到同一空间:BioVITA 的三模态生物表征路线

BioVITA 针对图像与分类文本已对齐但音频缺位的问题,用 130 万音频与 230 万图像的两阶段对比学习把音频接入 BioCLIP 2,并在六方向检索上报告平均 Top-1 为 71.7% 的结果,代价是科层级检索与哺乳类音频仍明显更难且项目页链接当前不可用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10701 字 阅读 →
论文解读

先估计各模态可不可信,再决定听谁的:CICA 的感知与决策耦合

针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。

 · 更新于 2026-09-24 · 约 24 分钟 · 11594 字 阅读 →
论文解读

看不见脸时说话人是谁:CineSRD 用视觉锚点加语音语义补齐影视对白

针对影视长视频、多说话人和音画不同步问题,CineSRD 先用视觉锚点聚类注册说话人再用音频语言模型做轮次检测与幕后补充,在 SubtitleSD 上报告更低的 DER 与 JER,代价是多阶段集成而非端到端且依赖人脸与字幕时间轴。

 · 更新于 2026-09-24 · 约 17 分钟 · 8047 字 阅读 →
论文解读

字幕能帮耳朵分轨吗:CineSubNet 用文本先验做电影对白音乐音效分离

针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。

 · 更新于 2026-09-24 · 约 15 分钟 · 7049 字 阅读 →
论文解读

把命名识别改成音频文本配对:CLAP 如何绕开失语症转写的脆弱环节

针对卒中后失语命名中发音变异和多重尝试导致转写不可靠的问题,论文把判断改成音频与提示文本在共享空间的配对,用两组法语命名数据在留一说话人评估下报告最高 0.90 准确率,代价是仍需在失语数据上微调且重度损伤集上降到 0.85。

 · 更新于 2026-09-24 · 约 17 分钟 · 8130 字 阅读 →
论文解读

模态吵架时别硬拉齐:冲突加权交叉重构的共享语义对齐

针对同一视频中语言、视觉、音频情感极性不一致时相似性对齐会扭曲共享语义的问题,论文提出冲突感知自适应交叉重构 CACR,用共享空间冲突分数加权交叉重构实现隐式对齐并以视听线索精炼文本,在 MOSI 上报告 ACC7 为 48.69、ACC2 为 87.04,代价是需要多组重构解码器与多项正则损失协同训练。

 · 更新于 2026-09-24 · 约 18 分钟 · 8759 字 阅读 →
论文解读

混响一重噪声一来就失准:用场景嵌入去拨动音频与运动的融合闸门

针对可穿戴 6 自由度声音事件定位与检测中混响和噪声破坏声学空间线索的问题,该文用信噪比与混响时间辅助监督学场景嵌入并以此控制音频-运动融合门,在 6DoF SELD 数据集上把聚合误差降到 0.265、相对静态融合降低 5.69%,代价是增加 18.6K 参数和 37.4M 计算量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

用手势字幕补上语义:CoordSpeaker 如何让说话人边说边做指定动作

针对手势数据缺描述文本导致的语义先验缺口与音频加描述难以协调控制的问题,CoordSpeaker 先用动作语言模型离线生成多粒度手势字幕,再用统一表示的潜在扩散加分层去噪器实现语音节奏与字幕语义的联合生成,最强证据是推理耗时大幅下降与文本对齐指标领先,代价是部分重建指标未占优且长序列时序感知仍有限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9508 字 阅读 →
论文解读

不用表情图片,只用情感语音的差向量去改脸:C-MET 的跨模态情绪编辑

针对说话人视频中情绪编辑受限于离散标签和参考图像的问题,C-MET 用语音与表情空间的情绪语义向量差做跨模态回归,在 MEAD 上把情绪准确率做到最高,同时保留唇动与身份,且能处理训练未见的扩展情绪。

 · 更新于 2026-09-24 · 约 22 分钟 · 10870 字 阅读 →
论文解读

不追求更像人脸,而是生成对判别更有用的视觉特征:跨模态引导的抑郁识别训练框架

针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10499 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →