Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

📄 Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow #Transformer #流匹配 #多模态模型 #模型压缩 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前50% | #Transformer | #Transformer | #流匹配 #多模态模型 | arxiv 👥 作者与机构 Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang* ...

2026-06-19 · 更新于 2026-07-27 · 4 min · 658 words

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

📄 IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows #语音对话系统 #多模态模型 #基准测试 7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前25% | #语音对话系统 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 Ahmad Salimi, Wentao Ma, Yuzhi Tang (Boson AI, Toronto, ON, Canada); Dongming Shen, Mu Li, Alex Smola (Boson AI, Santa Clara, CA, USA) ...

2026-06-19 · 更新于 2026-07-27 · 3 min · 441 words

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

📄 MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model #语音合成 #自监督学习 #多模态模型 #流式处理 5.7/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.7/10 | 前50% | #语音合成 | #自监督学习 | #多模态模型 #流式处理 | arxiv 👥 作者与机构 未提及 💡 毒舌点评 这篇论文试图为“社交世界”下一个定义并打造第一个模型,野心不小。技术上,把22B参数的怪兽塞进单GPU跑到47.5 FPS,听起来像在炫耀工程肌肉。然而,审稿人的嗅觉告诉我,“社交交互优化”这个标签贴得有点急——你的benchmark里有“社交”吗?还是说只要能实时出视频就算社交了?那抖音特效是不是早就达标了?技术细节像走马观花,Self-resampling,ROPD,听着很酷,但具体怎么干的、干得有多好,全靠读者脑补。最要命的是,连代码、权重、数据都不开源,这“可复现性”基本是零分预定。这篇论文更像一个声势浩大的“我们开始了”的宣言,而非一个论证扎实、可供他人跟进的完整研究。 📌 核心摘要 该工作首次定义了“社交世界模型”这一研究方向,旨在生成以人类社交动态为中心的交互式音视频内容,区别于专注于物理环境或游戏世界探索的先前世界模型。为探索该方向,作者构建了MaineCoon原型,这是一个具有22B参数的首个实时音视频自回归模型。它支持实时流式生成和亚秒级交互,在单GPU上实现了高达47.5 FPS的帧率。论文声称,这是首个针对社交交互应用优化的实时音视频生成模型。为实现高效稳定的训练与推理,论文引入了多项新技术:Self-resampling、跨模态表征对齐、领域感知偏好优化以及强化在线策略蒸馏(ROPD)。同时,设计了首个智能体流式推理框架,通过智能体缓存管理和提示规划,支持千秒级甚至更长的生成并缓解漂移问题。这些创新加速了训练并优化了实时推理性能。作者认为该工作不仅为高质量、低延迟、长时域音视频自回归模型设立了新的性能基准,也指出了下一代AI原生社交平台所需的范式转变。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及模型权重获取链接。 数据集:论文中未提及。 Demo:论文中未提及。 复现材料:论文中未提及。 论文中引用的开源项目:未提及。 🏗️ 方法概述和架构 MaineCoon是一个端到端的自回归音视频生成模型,旨在实现实时交互式社交世界生成。其核心架构与训练流程可概括如下: ...

2026-06-19 · 更新于 2026-07-27 · 1 min · 137 words

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

📄 PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models #多模态模型 #扩散模型 #数据集 8.1/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.1/10 | 前25% | #多模态模型 | #扩散模型 | #数据集 | arxiv 👥 作者与机构 Peking University MSALab, ByteDance 💡 毒舌点评 一篇扎实且工程量巨大的工作,将扩散语言模型应用于多区域感知这一细分场景。优点是问题定义清晰(AR效率瓶颈),解决方案有设计感(区域提示+结构化掩码),实验全面且开源相对及时。但“并行”的叙事在单张图片、少量区域时优势有限,真正的杀手级应用场景(如机器人实时交互、大规模图像分析)需要更强的推理能力而非仅仅是描述,而这正是扩散模型目前的短板。数据依赖GAR生成,上限受限;评估高度依赖GPT-5.2,其偏好可能塑造了“正确”的描述标准。整体是多模态领域一次有价值的“效率优化”探索,但离改变范式尚有距离。 📌 核心摘要 本文针对MLLMs在处理多区域感知任务时,因自回归(AR)顺序生成导致的效率瓶颈,提出了PerceptionDLM框架。工作分为两部分:首先,训练了PerceptionDLM-Base,这是一个基于离散扩散语言模型(DLM)的多模态基线,在多个开源扩散VLM中达到了最佳性能。其次,在此基线上构建了并行区域感知模型,通过引入区域提示(可学习的嵌入)、RoI对齐特征回放和结构化注意力掩码,使模型能够在单次去噪过程中同时为图像中的多个掩码区域生成文本描述。为评估此能力,作者构建了新基准ParaDLC-Bench。实验表明,该模型在保持有竞争力的描述质量的同时,显著提升了多区域任务的推理效率(吞吐量提升最高达3.44倍),为利用扩散模型进行高效细粒度视觉理解提供了新思路。 🔗 开源详情 代码:https://github.com/MSALab-PKU/PerceptionDLM 模型权重:https://huggingface.co/collections/MSALab/perceptiondlm-model-zoo 数据集: 训练数据:ParaCaption-5.7M。论文说明其“released”,由SA-1B (SAM)和COCONut数据集经处理生成,但未提供独立下载链接。 评估基准:ParaDLC-Bench。论文说明其“released”,但未提供独立下载链接。 Demo:论文未提及。 复现材料: 模型检查点:通过上述HuggingFace链接获取。 训练配置与细节:论文表3及附录8提供了详细的四阶段训练参数(数据集、轮次、学习率、批量大小等)和并行模型训练细节。 附录:提供了完整的消融实验、可视化结果、失败案例分析等(附录8-12)。 🏗️ 方法概述和架构 PerceptionDLM框架由两个核心部分构成:基础模型PerceptionDLM-Base和并行区域感知模型。 ...

2026-06-19 · 更新于 2026-07-27 · 1 min · 197 words

语音/音乐/音频论文速递 2026-06-19

语音/音乐/音频论文速递 2026-06-19 共分析 40 篇论文 ⚡ 今日概览 📥 抓取 40 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 10篇 ██████████ #语音识别 8篇 ████████ #语音转换 2篇 ██ #语音增强 2篇 ██ #自监督学习 2篇 ██ #说话人验证 1篇 █ #模型压缩 1篇 █ #多模态模型 1篇 █ 📊 论文评分排行榜(40 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 FlowEdit: Associative Memory for Lifelong Pronunciation 10.0分 前25% #语音合成 🥈 Low-Burden Data Augmentation for Dysarthric ASR via Zer 8.7分 前25% #语音识别 🥉 S-JEPA : Soft Clustering Anchors for Self-Supervised Sp 8.7分 前25% #语音识别 4. Personalized Keyword Spotting for User-Defined Keywords 8.6分 前25% #说话人验证 5. FlowFake: Liquid Networks for Audio Deepfake Detection 8.5分 前25% #模型压缩 6. Systematic Study of Dysarthric Speech Recognition: Spec 8.3分 前50% #语音识别 7. PerceptionDLM: Parallel Region Perception with Multimod 8.1分 前25% #多模态模型 8. RIVET: Robust Idempotent Voice Attribute Editing 8.0分 前50% #语音转换 9. Repurposing a Speech Classifier for Guided Diffusion-Ba 7.9分 前50% #语音合成 10. Exploring Feature Extraction Technique Parameters for A 7.9分 前50% #音频事件检测 11. Transcript-Free Flow-Matching Text-to-Speech via Speech 7.7分 前25% #语音合成 12. How Do Instructions Shape Speech? Cross-Attention Attri 7.7分 前50% #语音合成 13. Hybrid Diffusion Transformer for Instruction-Guided Aud 7.6分 前50% #Transformer 14. Improving Code-Switching ASR with Code-Mixing Guided Sy 7.6分 前25% #语音识别 15. PolSeT: Polish Semantics of Timbre Dataset 7.5分 后50% - 16. IHBench: Evaluating Post-Interruption Recovery in Voice 7.5分 前25% #语音对话系统 17. A Survey of Full-Duplex Spoken Dialogue Systems: Archit 7.4分 前50% #语音合成 18. PhysDrift: Bridging the Embodiment Gap in Humanoid Co-S 7.4分 前50% #语音合成 19. PrefSQA: Pairwise Preference Prediction for Speech Qual 7.3分 前50% #语音质量评估 20. Latency-Configurable Streaming Speech Enhancement via A 7.2分 前50% #语音增强 21. A Comparative Study of Pretrained Transformer Models fo 7.2分 前50% #语音识别 22. Pitch Spelling Jazz Lead Sheets, Solo Transcriptions, C 7.2分 前50% - 23. Stuttering Classification and Segmentation with Attenti 7.0分 前50% - 24. Time-Unconditional Generative Speech Enhancement via Au 7.0分 前25% #语音增强 25. Investigating Human-Model Discrepancies in Speech Quali 6.9分 前25% #语音合成 26. Prismriver: Formalization of Music Theory and Algorithm 6.9分 前50% - 27. NEST: Narrative Event Structures in Time for Long Video 6.8分 前50% - 28. Cross-Dataset, Age, and Gender Generalization: A Compre 6.7分 前50% #语音识别 29. Exploring Pre-training Benefits on Phoneme Addition thr 6.7分 前50% - 30. Analyzing Language and Geographical Variation in Speech 6.5分 前50% #语音识别 31. Improving End-to-End Speech Recognition for Dysarthric 6.5分 前50% #语音识别 32. Segment-Level Mandarin Chinese Speech-Based Cognitive I 6.5分 前50% #对比学习 33. Light-weight Pronunciation Assessment via Discrete Spee 6.4分 前50% #自监督学习 34. ReNikud: Audio-Supervised Hebrew Grapheme-to-Phoneme Co 6.2分 前50% #语音合成 35. Zero-VC: Zero-Lookahead Streaming Voice Conversion via 6.1分 前50% #语音转换 36. MixProLAP: Mixture-Induced Uncertainty Modeling for Pro 5.7分 前50% #音频检索 37. MaineCoon: Pursuing A Real-Time Audio-Visual Social Wor 5.7分 前50% #语音合成 38. Leveraging systems' non-linearity to tackle the sca 5.5分 后50% #数据增强 39. Interpreting Content and Speaker Characteristics in Fac 5.0分 后50% #语音合成 40. Beyond Speaker Independence: Evaluating Cross-Lingual A 4.9分 后50% #自监督学习 📋 论文列表 🥇 FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS 10.0/10 | 创新 2/2 | 严谨 1.5/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 ...

2026-06-19 · 更新于 2026-07-27 · 23 min · 4844 words

Constraining to Generalize: Subspace Tuning for Few-shot Generalization of Audio-Language Models

📄 Constraining to Generalize: Subspace Tuning for Few-shot Generalization of Audio-Language Models #多模态模型 #参数高效微调 7.5/10 | 清晰 是/1 | 复现 是,论文提供了详细的实验设置和超参数。/0.5 ✅ 7.5/10 | 前25% | #音频分类 | #参数高效微调 | #多模态模型 | arxiv 👥 作者与机构 作者:Jaehyuk Jang, Kangwook Ko, Wonjun Lee, Changick Kim 机构:韩国科学技术院(KAIST) 邮箱:{jhyuk, kw.ko, dpenguin, changick}@kaist.ac.kr 💡 毒舌点评 论文的核心矛盾在于:声称是为音频语言模型设计的通用方法,但最大短板却是对预训练音频-文本对齐质量的绝对依赖。如果上游预训练模型本身就是个“瘸子”,你这个精妙的几何约束无异于在沙子上雕刻。 参数量随类别数线性增长的问题被轻描淡写地用“在窄标签任务中高效”带过。这本质上是将方法的应用场景做了硬约束,而非解决了可扩展性问题。当面对真实世界可能出现的成千上万音频类别时,这个方法恐怕会先把自己“参数死”。 跨数据集迁移结果(表2)堪称“不稳定之王”。在Emotion Recognition和Sound Event Classification上,改进忽高忽低,甚至部分低于零样本。这强烈暗示,所谓的“共享基变换”在跨域时可能转移的不是“知识”,而是“偏见”。附录B.6的分析虽然坦诚,但也坐实了该方法在域差异较大时的脆弱性。 在ImageNet(表5)上略逊于CoOp,以及在跨数据集迁移上的挣扎,共同勾勒出SubT的“舒适区”:任务相对简单、类别空间窄小且同质、预训练模型在该领域已有良好表征。这是一种精准的“降维打击”,但也暴露了其普适性的天花板。 📌 核心摘要 本文深入分析了在音频语言模型(ALM)小样本适应中普遍存在的基类-新类性能权衡问题,并将其根源归结为文本嵌入空间的“零样本漂移”,即适应过程破坏了预训练的类间结构(Gram漂移)并使嵌入偏离了零样本锚点(大小漂移)。为解决此问题,作者提出了子空间调谐(SubT),一个几何约束的适应框架。SubT包含两个互补机制:1)结构化子空间参数化,通过对基类文本嵌入矩阵进行SVD分解并冻结类别相关坐标,仅学习共享的语义基变换,从而限制类间关系的任意变形;2)残差锚定,将适应后的嵌入与原始零样本嵌入进行残差连接,以稳定适应过程并限制漂移幅度。在推理时,学习到的基变换被全局转移到新类的零样本嵌入上,并通过子空间感知门控机制,根据新类与基子空间的对齐程度(β分数)来抑制负迁移。在11个音频基准测试上的实验表明,SubT在保持参数高效和无需文本编码器反向传播的同时,显著优于现有方法,取得了最佳的平均调和平均精度,并提供了关于漂移控制、组件贡献和跨域迁移失败案例的深入分析。 🔗 开源详情 代码:论文未提供自身代码的开源链接。但详细引用了所有基线方法的代码仓库,链接见论文原文。 模型权重:论文未提供预训练模型(Pengi, CLAP, CLIP)或适应后模型权重的具体下载链接。 数据集:论文详细列出了11个音频数据集及ImageNet的来源、许可协议。具体信息如下: Beijing-Opera: MIT 许可,托管于 Hugging Face。 NS-Instruments: CC BY 4.0 许可,托管于 Hugging Face。 ESC50: CC BY-NC 3.0 许可,托管于 GitHub。 ESC50-Actions: CC BY-NC 3.0 许可,托管于 GitHub。 UrbanSound8K: CC BY-NC 4.0 许可,托管于 UrbanSound8K 网站。 CREMA-D: ODbL 1.0 许可,托管于 GitHub。 RAVDESS: CC BY-SA 4.0 许可,托管于 Zenodo。 SESA: CC BY 4.0 许可,托管于 Zenodo。 GT-Music-Genre: MIT 许可,托管于 Hugging Face。 VocalSound: CC BY-SA 4.0 许可,托管于 GitHub。 TUT2017: Non-commercial 许可,托管于 Zenodo。 ImageNet: Non-commercial 许可,托管于 ImageNet 网站。 Demo:论文中未提及。 复现材料:论文提供了详细的复现信息,包括数据集划分、提示模板(表6)、实现细节(附录A.2, A.3)、训练超参数(附录A.3)以及评估协议。这些信息分散在正文和附录中,可用于复现实验。 论文中引用的开源项目: Pengi: MIT 许可,链接:https://github.com/microsoft/Pengi CLAP: MIT 许可,链接:https://github.com/LAION-AI/CLAP CLIP: MIT 许可,链接:https://github.com/openai/CLIP CoOp: MIT 许可,链接:https://github.com/KaiyangZhou/CoOp CoCoOp: MIT 许可,链接:https://github.com/KaiyangZhou/CoCoOp KgCoOp: 许可未知,链接:https://github.com/y0ug/KgCoOp DePT: GPL-2.0 许可,链接:https://github.com/taozhiyu/DePT SEPT: 许可未知,链接:https://github.com/wonjunlee/SEPT CLIP-Adapter: 许可未知,链接:https://github.com/raoyongming/CLIP-Adapter 🏗️ 方法概述和架构 SubT是一个在预训练ALM的冻结文本嵌入空间中进行的小样本适应框架,其核心思想是通过几何约束来控制适应过程中的漂移,从而提升对新类的泛化能力。整个方法分为训练阶段和推理阶段,包含以下核心组件: ...

2026-06-18 · 更新于 2026-07-27 · 4 min · 800 words

Fair Cognitive Impairment Detection Through Unlearning

📄 Fair Cognitive Impairment Detection Through Unlearning #多模态模型 7.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.7/10 | 前25% | #多模态模型 | #多模态模型 | arxiv 👥 作者与机构 William Nguyen, Jiali Cheng, Hadi Amiri University of Massachusetts Lowell, USA 💡 毒舌点评 这篇论文解决了一个重要且及时的问题——医疗AI中的公平性,尤其是在数据不平衡的临床语音场景中。方法设计上,将跨模态注意力融合与梯度反转“遗忘”机制结合,逻辑自洽,有一定创新性。实验结果在TAUKADIAL数据集上看起来相当亮眼。然而,仔细审视后,一些问题浮出水面。首先,主要验证集TAUKADIAL只有387个样本,对于一个声称能解决公平性问题的方法来说,这个数据基础稍显薄弱。其次,对于核心的“遗忘”机制,作者用辅助分类器准确率下降来证明,但该准确率(61.7%, 62.3%)远未达到随机猜测的50%,作者对此“残留泄露”仅一笔带过,缺乏深入分析,这削弱了其公平性主张的强度。此外,消融研究不够彻底,对关键超参数调度策略和融合方式选择的探讨不足。论文在可解释性方面也欠缺,声称模型能关注跨模态线索却缺乏可视化支撑。总体而言,这是一份扎实的工作,但离顶会的严苛标准,尤其是在方法验证的深度和机制分析的透彻性上,还有一步之遥。 📌 核心摘要 本文针对轻度认知障碍(MCI)检测中模型可能学习人口统计学虚假关联而导致性能偏差的问题,提出了一个名为FMD的公平多模态框架。该框架包含两个核心组件:1)基于交叉注意力的多模态融合模块,用于更精细地对齐和融合语音、文本(及可选的图像)模态信息,以捕捉互补的认知障碍线索;2)基于梯度反转的表示遗忘模块,通过一个辅助的人口统计学分类器,在训练中反向传播其梯度,从而在共享表示中抑制与任务无关的人口统计学信息,鼓励模型专注于疾病特征。在TAUKADIAL(387样本)和PREPARE(1644样本)两个多语言基准上的实验表明,FMD在整体F1分数、最差组F1分数以及跨人口统计学组别的性能差距指标上均优于包括CogniVoice、DFR在内的基线模型。跨数据集的零样本迁移实验也表明,FMD学习的表征更鲁棒。然而,探针实验显示表征中仍残留一定的人口统计学信息。 🔗 开源详情 代码:论文在摘要中声明 “Our code is here.”,但未提供具体的URL链接地址。论文中未提供可访问的代码仓库链接。 模型权重:论文中未提及模型权重的发布信息(如HuggingFace或ModelScope链接)。 ...

2026-06-18 · 更新于 2026-07-27 · 3 min · 600 words

GRIDEX: Grid-Grounded Forensic Explanations for Deepfake Spectrogram Analysis

📄 GRIDEX: Grid-Grounded Forensic Explanations for Deepfake Spectrogram Analysis #多模态模型 #语音合成 #强化学习 8.6/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.6/10 | 前50% | #语音合成 | #强化学习 | #多模态模型 | arxiv 👥 作者与机构 Thi Ngan Ha Do, Tingmin Wu, Alsharif Abuadbba, Kristen Moore 澳大利亚联邦科学与工业研究组织(CSIRO, Australia) 作者邮箱:do.nganha11@gmail.com, Tina.Wu@data61.csiro.au, Sharif.Abuadbba@data61.csiro.au, Kristen.Moore@data61.csiro.au 💡 毒舌点评 论文抓住了一个真实且重要的法医取证痛点:从“是/否伪造”的黑盒判断,转向提供“哪里伪造”及“为什么是伪造”的可审计证据链。GRIDEX的结构化输出设计(区域ID+类别字段+证据陈述)是方法论上的亮点,试图让解释模仿标准的证据记录,这比生成一堆漂亮的但无法验证的热力图或自由文本要实用得多。数据构建流程(利用VLM生成初稿,LLM验证,人工校正)思路清晰且有一定自动化规模。然而,这篇论文的“科学严谨性”与其“工程实现”的野心之间存在一道明显的鸿沟。最大的槽点在于其“取证”之名下的评估体系完全依赖于自我构建的“伪地面真值”。差异图作为监督信号的假设(仅适用于声码器伪造且需要完美的真伪配对)过于理想化,这严重削弱了结论在真实、未知伪造类型上的说服力。其次,解释的“深度”令人失望,其字段(T, F, P)的定义过于粗粒度(例如音素只分三类),生成的证据陈述(En)与训练数据的ROUGE-L分数低得可怜(0.084),这更像是一个“结构化填充”任务,而非真正的、有洞察力的法医分析。所谓的“错误传播”和“热点偏差”问题,在作者自己的实验中已经暴露无遗(Query 2端到端性能骤降),但论文的应对方案(课程学习)显然治标不治本。最后,缺乏任何人类专家评估,直接宣称其对“法医取证”有用,这种结论下得过于武断。总体而言,这是一个有趣的原型系统,展示了VLM在结构化输出任务上的潜力,但距离一个可靠、通用、深入的取证分析工具还有很长的路要走。 📌 核心摘要 本文提出GRIDEX,一个用于深度伪造语音频谱图取证分析的两阶段视觉语言模型(VLM)流水线。针对现有深度伪造检测模型仅提供全局判断而缺乏可验证、定位化解释的缺陷,以及现有可解释方法(如显著性图或自由文本)在法医鉴证中可审计性差的问题,GRIDEX旨在为频谱图中的伪像区域生成结构化的取证解释。该框架包含两个顺序执行的查询任务:Query 1通过在频谱图上应用固定网格并进行Top-3选择,定位最可疑的伪像区域;Query 2针对每个选定的区域,生成一个包含区域标识符(Cn)、时间上下文(T,语音/非语音)、频带(F,低/中/高)、音素类别(P,元音/辅音/清音)以及证据陈述(En,描述伪像及其听觉影响)的结构化解释元组。为训练该模型,作者基于VocV4语料库构建了首个区域接地的解释数据集,包含20,512个频谱图样本和61,536条解释,其中伪像监督信号源自成对的真伪音频差异图,而自由文本解释(En)则通过一个两步流程(VLM解释器生成初稿,LLM验证器润色与验证)自动生成。训练策略采用监督微调(SFT)与分组相对策略优化(GRPO)相结合的两阶段方式,并使用分阶段的低秩适配器(LoRA)分别处理Query 1和Query 2,以缓解任务间的干扰。在自建数据集上的实验表明,GRIDEX在区域定位任务上(\(R@3\):0.386, \(nDCG\):0.411, \(mAP\):0.333)显著优于多个强大的开源VLM基线(如Qwen3-VL-8B, InternVL3-78B),其端到端生成的解释在覆盖度(\(CovAvg\):0.884)和语义相似度(\(BERTF1\):0.413)上也优于基线。消融研究证实了网格粒度选择、GRPO-1中的命中奖励以及分阶段优化策略的有效性。论文坦诚讨论了系统的主要局限,包括流水线中的错误传播(Query 1的定位错误会严重损害Query 2的解释质量)和GRPO训练可能引发的热点偏差(模型倾向于反复预测少数固定区域ID)。结论指出,GRIDEX在实现基于区域接地的结构化取证解释上迈出了第一步,但提升定位精度和多样性、增强模型对错误传播的鲁棒性以及扩展至跨数据集泛化是未来关键方向。 ...

2026-06-18 · 更新于 2026-07-27 · 3 min · 446 words

Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction

📄 Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction #多模态模型 #对比学习 #对抗训练 7.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前50% | #多模态模型 | #对比学习 | #对抗训练 | arxiv 👥 作者与机构 作者:Zhuangzhuang Pan (Universiti Malaya), Ning Dong (Suqian University), Yingna Su (Suqian University), Yan Xia (Suzhou University of Technology)。 机构:Universiti Malaya, Suqian University, Suzhou University of Technology。 ...

2026-06-18 · 更新于 2026-07-27 · 3 min · 433 words

Mitigating Scoring Errors and Compensating for Nonverbal Subtests in Speech-Based Dementia Assessment

📄 Mitigating Scoring Errors and Compensating for Nonverbal Subtests in Speech-Based Dementia Assessment #多模态模型 8/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 0.7/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.6/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 8/10 | 前25% | #多模态模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Franziska Braun (Technische Hochschule Nürnberg) 通讯作者:Franziska Braun (franziska.braun@th-nuernberg.de) 作者列表:Franziska Braun, Christopher Witzl, Andreas Erzigkeit, Hartmut Lehfeld, Thomas Hillemacher, Tobias Bocklet, Korbinian Riedhammer 机构:1 Technische Hochschule Nürnberg, 2 Geromed GmbH, 3 PMU Klinikum Nürnberg, Germany ...

2026-06-18 · 更新于 2026-07-27 · 2 min · 222 words