论文解读

先对齐再分家:PLUM-Net 用原型标签拆开共有与私有表征

针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。

 · 更新于 2026-09-24 · 约 22 分钟 · 10952 字 阅读 →
论文解读

先对齐个性再逐层融合:PSA-MF 如何处理情感表达的个体差异与模态异构

针对多模态情感分析中忽视个性差异与浅层融合的问题,PSA-MF 用个性-情感对齐提取个性化文本情感再做多级融合,在 MOSI 和 MOSEI 上取得报告的最优结果,代价是依赖双 BERT 文本编码与多阶段融合结构。

 · 更新于 2026-09-24 · 约 19 分钟 · 9277 字 阅读 →
论文解读

先对齐再推理:ConLLM 用两阶段解决模态割裂与浅层融合

针对多模态伪造中模态割裂与跨模态语义推理不足的问题,ConLLM 采用预训练模型分模态抽取加对比对齐与类 GPT 变换器精炼的两阶段结构,在音频、视频与音视频六个基准上报告了更低的等错误率与更高的准确率,但其增益依赖预训练权重与训练数据覆盖且推理代价仍需权衡。

 · 更新于 2026-09-24 · 约 18 分钟 · 8868 字 阅读 →
论文解读

结构保真与语义对齐如何同时做:SSU 用句法图、文本引导图与语义锚统一多模态情感

针对文本、音频、视频情感分析中模态内结构丢失与跨模态语义错位问题,SSU 用句法与文本引导的模态图加全局语义锚与多视角对比学习统一融合,在 CMU-MOSI/MOSEI 上报告最高精度并以 0.3B 参数、0.015s 构图保持轻量,代价是依赖文本质量与句法解析条件。

 · 更新于 2026-09-24 · 约 23 分钟 · 11284 字 阅读 →
论文解读

把波形峰值关进语义空间:MAPS 如何在非线性功放下同时做对齐与 PAPR 抑制

针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。

 · 更新于 2026-09-24 · 约 22 分钟 · 10894 字 阅读 →
论文解读

冻结表征上分离对比损失与正确配对的语义精炼

在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →
论文解读

音频幻觉为何总说“有”:用静默对照与首步门控校正肯定偏差的 TAD

针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9866 字 阅读 →
论文解读

百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11347 字 阅读 →
论文解读

一条声音,二十四种说法:SonicCaps 把听觉歧义变成检索的养分

音频检索 | 7.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10292 字 阅读 →
论文解读

当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环

说话人验证 | 7.8/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11936 字 阅读 →
论文解读

把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉

音乐检索 | 7.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12385 字 阅读 →
论文解读

从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间

音频分离 | 5.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5061 字 阅读 →
论文解读

没有配对报告时,如何让呼吸声自己找到临床语义?

音频分类 | 7.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11049 字 阅读 →
论文解读

用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10477 字 阅读 →
论文解读

当文字当指挥:MAESTRO 如何让声画专家按序就位

音视频理解 | 6.0/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10691 字 阅读 →
论文解读

在只有 204 个婴儿的世界里,为什么 97.9% 的准确率不值得庆祝

音频分类 | 8.1/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10819 字 阅读 →
论文解读

当一句“右转航向 150”必须找到那架飞机:语音与轨迹如何在同一个地图上相遇

对比学习 | 7.5/10

 · 更新于 2026-09-24 · 约 32 分钟 · 15572 字 阅读 →
论文解读

歌声里藏着母语的口型:当音素的物理约束在旋律中留下指纹

音乐理解 | 8.0/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12286 字 阅读 →
论文解读

效果是效果,声音是声音:当表征必须同时记住与忘记内容

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 9008 字 阅读 →
论文解读

泛化失效有两种:能用标注买回的,和换什么表征也买不回的

音频理解 | 8.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9839 字 阅读 →