MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis

📄 MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis 标签:#多模态模型 #对比学习 #鲁棒性 #音频理解 #Transformer 5.9/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #多模态模型 | #Transformer | #对比学习 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Haoran Ma(新疆大学计算机科学与技术学院;丝绸之路多语言认知计算国际联合实验室;新疆多模态智能处理与信息安全工程技术研究中心;鹏城实验室新疆网络节点;具身智能联合实验室) 通讯作者:Yinfeng Yu(新疆大学计算机科学与技术学院;丝绸之路多语言认知计算国际联合实验室;新疆多模态智能处理与信息安全工程技术研究中心;鹏城实验室新疆网络节点;具身智能联合实验室) 作者列表:Haoran Ma(新疆大学计算机科学与技术学院;丝绸之路多语言认知计算国际联合实验室;新疆多模态智能处理与信息安全工程技术研究中心;鹏城实验室新疆网络节点;具身智能联合实验室)、Yinfeng Yu(新疆大学计算机科学与技术学院;丝绸之路多语言认知计算国际联合实验室;新疆多模态智能处理与信息安全工程技术研究中心;鹏城实验室新疆网络节点;具身智能联合实验室)、Liejun Wang(新疆大学计算机科学与技术学院;丝绸之路多语言认知计算国际联合实验室;新疆多模态智能处理与信息安全工程技术研究中心;鹏城实验室新疆网络节点;具身智能联合实验室) 💡 毒舌点评 一篇结构完整、实验扎实的增量式改进工作。论文敏锐地指出了现有解耦-蒸馏骨干DMD在最终融合阶段仍可能被退化模态误导的缺陷,并提出了“任务感知路由监督”与“不确定性校准”相结合的方案,思想清晰,消融实验和机制分析做得细致。然而,其核心创新是在强基线DMD之上的模块化增强,属于典型的“搭积木”式改进,缺乏范式性突破。更关键的是,论文仅在两个紧密相关的英文视频情感数据集上验证,未触及任何语音或音频领域的核心挑战(如信噪比、说话人干扰、音频主导任务),对于该领域的研究者而言,其直接实用价值和启发性大打折扣。提升幅度温和,更适合作为方法论文献在“多模态融合”这一小圈子里流传。 ...

2026-07-14 · 更新于 2026-07-24 · 4 min · 750 words

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

📄 Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition 标签:#音视频语音识别 #对比学习 #语音识别 #参数高效微调 #音频理解 6.9/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频语音识别 | #对比学习 | #语音识别 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Xugang Lu(日本产业技术综合研究所,AIST) 通讯作者:未说明 作者列表:Xugang Lu(AIST)、Peng Shen(AIST)、Yu Tsao(AIST)、Hisashi Kawai(AIST) 💡 毒舌点评 本文将最优传输(OT)引入LLM-AVSR进行语义对齐,思路有一定新意,并在LRS3-TED上取得了SOTA成绩,证明了其有效性。然而,该方法将成熟的OT数学工具迁移到特定任务中,创新程度属于中上。其最大硬伤在于多个核心超参数(如虚拟桶相似度边距、OT正则化系数、对齐损失权重、温度)的选择完全依赖经验网格搜索,缺乏系统的敏感性分析或理论指导,暴露了方法对调参的敏感性和工程上的粗糙,也使得论文的“可复现性”和“技术严谨性”大打折扣。 📌 核心摘要 本文解决基于大语言模型(LLM)的音视频语音识别(LLM-AVSR)中,音频、视觉模态与LLM语言嵌入空间存在表示差异,导致跨模态融合效果受限的问题。论文提出了一种基于最优传输(OT)的语义对齐框架,在多模态融合前,通过OT将音频和视觉编码器的输出与LLM的文本嵌入进行对齐。与直接融合投影特征的方法相比,其创新在于使用OT耦合矩阵作为软伪标签来监督对比学习,显式地桥接模态差距。主要实验结果表明,在LRS3-TED基准上,该方法在多种信噪比(SNR)下均优于LLaMA-AVSR、MMS-LLaMA等基线,取得了SOTA性能。实际意义在于为提升LLM-AVSR的鲁棒性提供了一个有效的特征对齐框架。主要局限性在于所涉及的多个超参数的选择完全依赖经验,缺乏系统的消融和理论分析,且实验仅在单一数据集上进行。 ...

2026-07-13 · 更新于 2026-07-24 · 3 min · 469 words

语音/音乐/音频论文速递 2026-07-13

语音/音乐/音频论文速递 2026-07-13 共分析 14 篇论文 ⚡ 今日概览 📥 抓取 14 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #语音合成 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音频理解 1篇 █ #多模态模型 1篇 █ #音视频语音识别 1篇 █ #语音分离 1篇 █ 📊 论文评分排行榜(14 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Tokenizer Transplantation: Mitigating Autoregressive Co 8.8分 前25% 方法研究 #语音识别 🥈 Phone Segmentation and Recognition through Phonological 7.7分 前25% 方法研究 #语音识别 🥉 FreyaTTS Technical Report 7.7分 前25% 系统技术报告 #语音合成 4. ReGen: Hierarchical Multi-Prompt Representation Generat 7.5分 前25% 方法研究 #语音合成 5. Clean2FX: Label-conditioned modeling for clean-to-effec 7.3分 前50% 系统技术报告 #音频理解 6. Event-Based Token Sequences for Audio-Conditioned Music 7.2分 前50% 方法研究 #音乐生成 7. Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception 7.1分 前50% 方法研究 #多模态模型 8. Optimal Transport-based Semantic Alignment for LLM-base 6.9分 前50% 方法研究 #音视频语音识别 9. Technical Report for MERL’s Real-TSE Challenge Submissi 6.6分 前50% 系统技术报告 #语音分离 10. SVF-CR: Synchronized Visual-Facial Cross-Refinement for 6.4分 前50% 方法研究 #音视频理解 11. Beyond Time Shifts: Adapting Omni-LLM as a Reference-Fr 6.0分 前50% 方法研究 #音视频理解 12. Wan-Dancer: A Hierarchical Framework for Minute-scale C 5.6分 前50% 方法研究 #音乐生成 13. Tonnetz-Driven Graph Wedgelet for Harmonic Complexity R 5.3分 后50% 方法研究 #音乐理解 14. Immersive Social Interaction with VR and LLM-Assisted H 4.7分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-13 · 更新于 2026-07-24 · 12 min · 2359 words

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

📄 COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation 标签:#语音识别 #对比学习 #参数高效微调 #鲁棒性 #音频理解 8.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #对比学习 | #参数高效微调 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Jhih-Rong Guo(台湾师范大学) 通讯作者:未说明(论文中所有作者邮箱均列出,未明确标注通讯作者) 作者列表:Jhih-Rong Guo(台湾师范大学)、Bi-Cheng Yan(台湾师范大学)、Tien-Hong Lo(台湾师范大学)、Berlin Chen(台湾师范大学) 💡 毒舌点评 论文的核心卖点在于识别了SLM在多实体上下文偏置场景下的“训练崩溃”问题,并通过将优化目标解耦为点式二分类(DPD-Loss)提供了一个逻辑自洽的解决方案,在可控的实验设置下效果显著。然而,其光芒被几个关键短板所掩盖:所有验证均在“干净”的朗读语音(LibriSpeech)上进行,对真实嘈杂、口语化环境下的鲁棒性存疑;偏置列表的构建方式过于理想化(仅含罕见词),与工业场景中可能包含大量无关文本或实体变体的复杂列表相去甚远;部分关键超参数(如LoRA秩、投影器维度)和训练细节缺失,损害了可复现性。这项工作更像是一篇在干净沙盒中完成的、概念验证式的“方法研究”,其宣称的“鲁棒性”和实际应用潜力需要更严苛、更多样化的实验来检验。 ...

2026-07-10 · 更新于 2026-07-24 · 2 min · 360 words

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

📄 COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation 标签:#语音识别 #对比学习 #参数高效微调 #语音大模型 7.5/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #对比学习 | #参数高效微调 #语音大模型 | arxiv 👥 作者与机构 第一作者:Jhih-Rong Guo(国立台湾师范大学) 通讯作者:未说明 作者列表:Jhih-Rong Guo(国立台湾师范大学)、Bi-Cheng Yan(国立台湾师范大学)、Tien-Hong Lo(国立台湾师范大学)、Berlin Chen(国立台湾师范大学) 💡 毒舌点评 论文针对语音增强语言模型(SLM)在多实体上下文偏置场景下的梯度冲突问题,提出了MPD-Loss和DPD-Loss两种损失函数,将偏置评分重构为点对点二分类问题,在大规模偏置列表下实现了高召回率和低B-WER。然而,“零偏置"场景下的基础ASR性能(B-WER 23.39/39.49)远逊于所有对比基线(如RNN-T+IB的12.96/28.09),论文仅承认差距而未深入分析原因;所有实验仅在相对规整的LibriSpeech上进行,缺乏噪声、口音等真实场景验证;未经BTI过滤直接输入偏置列表(N=500/1000)时B-WER(20.38/35.01)劣于无偏置条件,暗示方法高度依赖阈值筛选机制,评分器本身的区分能力不足以直接支撑上下文偏置。 ...

2026-07-10 · 更新于 2026-07-24 · 3 min · 469 words

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

📄 MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations #音乐理解 #数据集 #基准测试 #对比学习 #多模态模型 8.1/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #音乐理解 | #对比学习 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Sirui Zhang(中央音乐学院、北京通用人工智能研究院) 通讯作者:Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院) 作者列表:Sirui Zhang(中央音乐学院、北京通用人工智能研究院)、Tianle Wang(中央音乐学院、北京通用人工智能研究院)、Xinyi Tong(中央音乐学院、北京通用人工智能研究院)、Peiyang Yu(中央音乐学院、北京通用人工智能研究院)、Jishang Chen(中央音乐学院、北京通用人工智能研究院)、Liangke Zhao(中央音乐学院、北京通用人工智能研究院)、Haoxin Zhang(中央音乐学院、北京通用人工智能研究院)、Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院) 💡 毒舌点评 该工作为音乐美学评估贡献了目前最大规模、最细粒度的专业标注基准,多维度框架与多标注者设计很有诚意,显著超越了现有MusicEval/SongEval等数据集。然而,基准实验仅停在轻量回归和零样本LLM预测,缺乏精心设计的专用美学模型对比,且训练超参数几乎完全不公开,削弱了其作为“benchmark”的深度说服力。CLAP的语义适应增益微弱,暴露了当前音文对齐模型在捕捉细粒度美学信号上的根本性局限,而论文对此并未提出有效的解决方案。 ...

2026-07-09 · 更新于 2026-07-24 · 6 min · 1075 words

语音/音乐/音频论文速递 2026-07-09

语音/音乐/音频论文速递 2026-07-09 共分析 13 篇论文 ⚡ 今日概览 📥 抓取 13 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 4篇 ████ #音乐理解 2篇 ██ #基准测试 1篇 █ #语音交互 1篇 █ #语音情感识别 1篇 █ #语音活动检测 1篇 █ #音乐生成 1篇 █ #说话人验证 1篇 █ 📊 论文评分排行榜(13 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 MMGenre: Benchmarking Singing Voice Synthesis across Mu 8.3分 前25% #基准测试 🥈 Decoupling Conversational Dynamics in Full-Duplex Spoke 8.2分 前25% #语音交互 🥉 MADB: A Large-Scale Music Aesthetics Dataset with Profe 8.1分 前25% #音乐理解 4. Gradient-Based Speech-to-Text Alignment for Any ASR Mod 7.3分 前50% #语音识别 5. UBG-Net: An Uncertainty-aware Bayesian Gating Network f 7.1分 前50% #语音识别 6. Compress the Cache, Not the Speech Embedding: KV Compre 7.0分 前50% #语音识别 7. Audio Sentiment Analysis via Distillation and Cross-Mod 6.9分 前50% #语音情感识别 8. Multimodal Voice Activity Projection for Turn-Taking in 6.7分 前50% #语音活动检测 9. Extending Xenakis: From Architectural Geometry to Sonif 5.6分 前50% #音乐生成 10. Text-Independent Speaker Verification Using Discrete Au 5.2分 后50% #说话人验证 11. Transformer-based segmentation of prosodic boundaries i 4.0分 后50% #语音识别 12. Rag Classification of Tagore Songs using Symbolic Music 3.0分 后50% #音乐理解 13. EscFOA: Enhancing Spatial Learning for Visually Impaire 2.8分 后50% #教育 📋 论文列表 🥇 MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.2/0.5 | 工程 1/1.5 ...

2026-07-09 · 更新于 2026-07-24 · 13 min · 2708 words

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

📄 Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking #音乐检索 #多模态模型 #对比学习 5.4/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0/0.5 | 工程 1.2/1.5 📝 5.4/10 | 后50% | #音乐检索 | #对比学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Seungheon Doh(未说明) 通讯作者:未说明 作者列表:Seungheon Doh(未说明)、Minhee Lee(未说明)、Sangmoon Lee(未说明)、Ben Sangbae Chon(未说明)、Juhan Nam(未说明) 💡 毒舌点评 本文构建了一个“检索+重排序”的两阶段视频音乐推荐框架,把多模态语义检索和时序交叉编码器拼成了一个完整系统,在评测基准上超越了通用跨模态模型,人类评估也显示音乐质量能吊打生成式方案。然而,实验部分缺少消融实验、关键训练细节几乎全部缺失、代码和模型都未开源,这些硬伤使得方法的有效部件无法区分,整个工作的学术可验证性约等于零。两阶段的独立贡献说不清楚,创新点看起来更像是工程拼装而非方法突破。 📌 核心摘要 论文针对视频配乐推荐任务,提出 VTMR 两阶段框架:第一阶段利用视频的RGB帧、非音乐音频和LLM生成的场景描述,与音乐音频及其LLM生成字幕和视频元数据,在共享嵌入空间中进行多模态语义检索,得到全局语义兼容的 top-N 候选音乐;第二阶段通过交叉编码器对视频的视听序列与候选音乐的声学序列进行时序交叉注意力打分,实现细粒度时间对齐重排序。相比以往仅依赖单模态全局嵌入的方法,VTMR 同时建模了全局语义兼容与局部时序对应。在 VidMuse 基准上,语义检索阶段将 R@10 从最强基线 ImageBind 的 14.2 提升至 15.9,MedR 从 75 降至 58;加入时序重排序后 R@10 进一步提升至 18.3,MedR 降至 46。人工 A-vs-B 测试中,VTMR 在与 Adobe Firefly 商用工具的总体偏好对比中具有竞争力(77% win+tie),且音乐质量远胜生成式基线 VidMuse(96% win+tie)。实际意义在于为视频创作者提供可检索高质量版权音乐的自动化工具,但主要局限在于缺少消融实验、训练超参数缺失且未开源,方法贡献的归因存疑。 ...

2026-07-08 · 更新于 2026-07-24 · 4 min · 644 words

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

📄 Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking #音视频理解 #对比学习 #医疗音频 #多模态模型 7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 7/10 | 前50% | #音视频理解 | #对比学习 | #医疗音频 #多模态模型 | arxiv 👥 作者与机构 第一作者:Manning Gao(华南师范大学) 通讯作者:未明确标注(推测为 Sijie Mai,华南师范大学,根据常见通讯作者惯例) 作者列表:Manning Gao(华南师范大学)、Tingyi Liu(华南师范大学)、Leheng Zhang(华南师范大学)、Haifeng Hu(中山大学)、Yuncheng Jiang(华南师范大学)、Sijie Mai(华南师范大学) 💡 毒舌点评 该工作抓住了二元抑郁检测中粗粒度标签丢失连续严重度信息的痛点,将排序学习引入基于音视频的自动抑郁检测,idea 有洞察力。BAR Loss 通过动态优势加权聚焦难样本,实验设计也较为扎实。但核心方法始终在成对损失框架内修修补补,学理深度有限,且作者完全不提供代码、模型或数据集链接,在严重依赖开源和快速复现的顶会语境下,这种封闭姿态会极大削弱社区信任与实际影响力。 ...

2026-07-08 · 更新于 2026-07-24 · 5 min · 884 words

ASD: Multi-Level Consistency-Driven Representation Learning

📄 \(C^3\)ASD: Multi-Level Consistency-Driven Representation Learning #音视频理解 #对比学习 #知识蒸馏 #鲁棒性 7.5/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前25% | #音视频理解 | #对比学习 | #知识蒸馏 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Jin Hong (Chung-Ang University, Seoul, Republic of Korea),与 Jisoo Park 为共同第一作者(*Equal contribution) 通讯作者:未说明(论文未明确标注通讯作者,第三作者 Junseok Kwon 可能为通讯作者,但文中未标注) 作者列表:Jin Hong (Chung-Ang University)、Jisoo Park (Chung-Ang University)、Junseok Kwon (Chung-Ang University) 💡 毒舌点评 亮点在于将一致性正则化系统拆解为嵌入级、序列级、预测级三个互补层次,附录中梯度旋转性质、Fisher判别等价性和MSE梯度有界性分析为方法提供了超出一般应用论文的理论深度。短板同样刺眼:完全无开源代码或模型权重,干净数据上mAP增益仅0.2个百分点,LR-ASD以更少参数(0.84M)取得更高mAP(94.5%),方法的绝对性能并非SOTA;腐败场景下1-2%的绝对提升虽具统计意义但实际价值存疑,且所有腐败均为合成注入,缺乏真实恶劣录制环境验证。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 426 words