论文解读

把打断、等待与做任务放进同一个流:Gander 如何用块展平与小脑-大脑分工实现可打断的全双工 Omni 智能体

针对语音视觉文本连续输入下既要低延迟可打断对话又要长程工具执行的问题,Gander 用小脑负责流式交互与块级控制、大脑免训练负责长程推理并通过编排运行时协同,在 Full-Duplex-Bench 上以 100% 合时接管与 8.0 抢话率取得交互最优,同时在 SpokenQA 上保持 75.60 与 59.30 的流式问答能力,代价是 WorldSense …

 · 更新于 2026-09-25 · 约 29 分钟 · 14523 字 阅读 →
论文解读

把波形峰值关进语义空间:MAPS 如何在非线性功放下同时做对齐与 PAPR 抑制

针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。

 · 更新于 2026-09-25 · 约 22 分钟 · 10894 字 阅读 →
论文解读

不对称残差融合能否替代双向跨模态 Transformer:RAFM-SER++ 的轻量化权衡

RAFM-SER++ 以文本为查询、语音为键值的单向残差注意力替代双向跨模态 Transformer,结合 BYOL 式对齐与注意力池化,在 IEMOCAP 上达到 81.10% BACC、ESD 上 95.39% BACC,同时将可训练参数从 8.9M 降至 3.6M 并提升推理吞吐。

 · 更新于 2026-09-25 · 约 20 分钟 · 9994 字 阅读 →
论文解读

序列不等长就保不住语义:TASTE2 用一词一隐变量走向可打断对话

TASTE2 把每个文本词元配一个连续音频隐变量使序列长度严格等于文本,用 56.3% 对 57.3% 保留 98.2% 文本问答能力并以 0.060 秒停下响应用户打断,代价是流畅接话需 1.207 秒、部署首音频 2701 毫秒且显式副语言控制不稳定。

 · 更新于 2026-09-25 · 约 19 分钟 · 9448 字 阅读 →
论文解读

Tri-PvP:用感知与命题的正交冲突把模态偏置从证据形式偏置中剥离

为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。

 · 更新于 2026-09-25 · 约 25 分钟 · 12503 字 阅读 →
论文解读

打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。

 · 更新于 2026-09-25 · 约 24 分钟 · 11696 字 阅读 →
论文解读

声音去哪了:末层仍可线性读出却在选项字母上失准的读出瓶颈

论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。

 · 更新于 2026-09-25 · 约 24 分钟 · 11701 字 阅读 →
论文解读

线性拼接已够好时,注意力还能补什么:BioSync 的宽深融合与合成验证

BioSync 用多头自注意力建模模态间交互并并联线性拼接分支,在两个合成队列上以认知队列 AUC 0.928 和代谢队列准确率 0.764 为最强证据,代价是干净数据优势微弱且临床推断仍待真实队列验证。

 · 更新于 2026-09-25 · 约 17 分钟 · 8124 字 阅读 →
论文解读

低码率语音编解码装不下时:用语义与唇动补上高层信息

针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。

 · 更新于 2026-09-25 · 约 22 分钟 · 10955 字 阅读 →
论文解读

声调与词义打架时,语音情感识别为何崩溃:TWIN-SER 基准与 DAS 解耦融合

论文针对语调情感与字面语义冲突时主流语音情感识别显著退化的问题,提出解耦声学与语义双通路并做高能量筛选与查询融合的 DAS 框架,在 378 条高冲突 TWIN-SER 上取得 59.38% 加权准确率的最好结果,代价是零样本通用集上不及大预训练模型且小样本恐惧与厌恶类仍难分。

 · 更新于 2026-09-25 · 约 20 分钟 · 9838 字 阅读 →
论文解读

几何主导下如何减出材料:GaMi 的跨模态相减式解耦

针对几何变化压制材料特征的问题,GaMi 用共位毫米波与声学的共享几何一致性做对齐-校准-相减解耦,并以样本间对比抑制残差,在 20 类材料上以 95.2% 的总体准确率显著优于单模态基线,代价是需双模态同步采集与多目标联合训练。

 · 更新于 2026-09-25 · 约 23 分钟 · 11269 字 阅读 →
论文解读

MOTOR: A Multimodal Dataset for Two-Wheeler Rider Behavior Understanding

视频行为识别 | 5.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5468 字 阅读 →
论文解读

Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7101 字 阅读 →
论文解读

Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation

关键词检测 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6327 字 阅读 →
论文解读

MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

跨模态 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6048 字 阅读 →
论文解读

缺失与偏置并存时如何做鲁棒的多模态情感分析:门控序列修复与平衡跨模态注意的协同

📄 缺失与偏置并存时如何做鲁棒的多模态情感分析:门控序列修复与平衡跨模态注意的协同 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460389

 · 更新于 2026-09-25 · 约 16 分钟 · 7690 字 阅读 →
会议任务专题

ICASSP 2026 - 多模态学习

共 1 篇 ICASSP 2026 多模态学习 方向论文

 · 更新于 2026-09-25 · 约 3 分钟 · 1126 字 阅读 →
论文解读

Multimodal Co-Training with Subtractive Unlabeled-Benefit Bounds

多模态学习 | 6.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3241 字 阅读 →
论文解读

Multimodal Transformer with Multiperspective Training for Predicting Self-Expression Skills from Video Interview

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4288 字 阅读 →