词级对齐何时盖过手工声学特征:自发语音同时做淀粉样预测与失语分型的对照
该工作用自发语音同时检验阿尔茨海默病淀粉样蛋白阳性预测与原发性进行性失语三分类,对比拼接加注意力池化的 DMHAM 与词级对齐加门控交叉注意力的 CogniAlign,最强证据是西班牙语 SPIN 队列上 CogniAlign 加手工声学特征达到淀粉样预测准确率 83.86%,代价是 PPA 小样本三分类不稳定且手工特征在不同任务上时而冗余时而互补。
该工作用自发语音同时检验阿尔茨海默病淀粉样蛋白阳性预测与原发性进行性失语三分类,对比拼接加注意力池化的 DMHAM 与词级对齐加门控交叉注意力的 CogniAlign,最强证据是西班牙语 SPIN 队列上 CogniAlign 加手工声学特征达到淀粉样预测准确率 83.86%,代价是 PPA 小样本三分类不稳定且手工特征在不同任务上时而冗余时而互补。
针对文本与音频信息量不等且离散分类忽略情绪远近的问题,EMART 以文本为主做音频参照融合,并用情绪轮角度约束对比学习,在 IEMOCAP 和 MELD 上报告了可复核的准确率与 F1 提升,但未引入视觉且依赖音频编码器选择。
针对多模态情感回归在测试时分布偏移下的适配问题,GMEL 用 vMF 混合建模潜在情感分组提供自监督,并用多尺度重 dropout 保持模态完整性,在三数据集五种跨域设置上报告平均 ACC 提升 2.53 个百分点、F1 提升 3.70 个百分点、MAE 降低 0.05,代价是需离线访问全部目标数据并估计分组数。
论文用语音大模型提示打分与 COMET 加音频回归两条路线检验源语音是否有用,在 IWSLT 2026 开发集上报告音频未稳定超过纯文本,而错配音频不掉点与技术内容占比高揭示了数据与建模代价。
针对带背景声的语音合成中可懂度与场景一致性难兼顾的问题,ImmersiveTTS 用双流扩散 Transformer 做联合注意力交互并以语音与音频双教师做表示对齐,在 25 步采样下取得更低词错率与更好音频保真度,代价是对双重引导强度敏感且训练依赖人工混合数据。
针对神经音频编解码器重合成的印度语伪造语音检测难泛化问题,论文构建多语言多编解码器基准并提出双阶段双曲对齐的检测框架,在域内与跨库迁移上报告更低等错误率,但以双编码器与大语言模型解码器开销为代价。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
论文用同一轻量三流分类器穷举声学、韵律、文本七种组合,发现声学加韵律在相同训练下取得最平衡的准确与延迟,而加入文本只增加抢话误报且不能提升性能。
针对噪声导致语言结构坍塌与语义模糊,论文提出 Speech-MLM 用频谱视觉结构、复述文本语义与门控跨模态融合做重建,在多噪声集上报告词错误率与语义相似度同步提升,但多分支带来推理开销与复述质量依赖。
针对看图说话中词汇语义与发音 timing 互补但贡献不均的问题,LAPE 以大语言模型文本表示为锚,把停顿与拖长写进转写并做事件保持组块与门控融合,在 ADReSS 与 ADReSSo 的五折与留一被试评估中均取得最高准确率,代价是依赖词时间戳与多路语音特征的完整流水线。
针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。
针对语音、音乐、环境声混在一起导致共享适配器梯度互相打架的问题,论文用稀疏混合专家适配器把音频令牌分流到不同专家,在总参数约 94.4M、激活约 70.8M 的受控预算下把 MMSU 音频准确率从 35.03% 提升到 38.19%、OBQA 从 50.10% 提升到 53.85%、MMAU 从 59.79% 提升到 61.50%,代价是需要负载均衡约束来维 …
论文研究语音大模型能否用音频加文本示范现学未见濒危语言,报告多模态示范降低困惑度且跨语言微调接近目标语言微调,并提出用声学模型产生候选再由语音大模型重排来改善词错误率,但直接生成转写仍很弱且重排带来显存与耗时开销。
该研究把三人对话的群体情绪定义为每秒的唤醒与效价连续估计,用混合状态平行标记成员分歧,以冻结编码器加时序 Transformer 的因果滑动窗口建模,最强证据是音视频融合在一致性与误差上超过单模态,而高混合区间更大的误差揭示了单值表示的边界。
针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对附和预测中缺视频、模态时间不对齐和只盯触发点的问题,论文用多层跨模态对齐加两阶段课程学习,在韩语 KC-Dialog 上宏 F1 达到 58.53,代价是视频推理耗时从 18.868 毫秒增至 20.083 毫秒。
针对文本、音频、视觉在噪声与缺失连续变化时情感分析退化的问题,论文用连续可靠度谱统一三种退化协议并提出以偶然不确定性驱动路由的 QA-MoE,在 CMU-MOSI 等基准上保持领先,代价是需要谱感知的数据增强与双分支不确定性建模。
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
该文以聚合 10.7M 字幕的 CaptionStew 为试验床,在冻结编码器条件下比较对比学习与字幕生成两种目标,发现在判别任务上对比更数据高效而生成式随规模追赶更快,但有监督初始化的增益随规模衰减且声音事件检测出现反向扩展。