ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

📄 先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放 英文题目:PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment 一句话:针对视频面试评分不透明、通用大模型系统性跑偏的问题,PhoenixNest-Video 用语义视频图加检索校验与双奖励强化学习把每个分数锚定到可回放证据,在自采面试集上以 8B 模型达到 91.50% 等级准确率,代价是核心数据不公开且证据判断仍依赖大模型自身。 标签:#音视频理解 | #强化学习 | #多模态模型 | #可解释性 评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fan Yuxuan:The Hong Kong University of Science and Technology (Guangzhou) Huang Miaojun:The Hong Kong University of Science and Technology (Guangzhou) Zhang Haimei:The Hong Kong University of Science and Technology (Guangzhou) Wu Jingshen:The Hong Kong University of Science and Technology (Guangzhou) Liu Hao:The Hong Kong University of Science and Technology (Guangzhou) 💬 毒舌点评 亮点在于把评分锚定到可回放的证据链而非直接输出分数,并用双奖励把机构分级校准显式写入优化目标,思路贴合高风险评审的审计需求。短板在于核心数据集不公开且关键证据多依赖大模型自判自证,证据可追溯性与评分客观性都仍系于未经验证的模型判断。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 964 words

Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis

📄 当文字当指挥:MAESTRO 如何让声画专家按序就位 英文题目:Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis 一句话:针对静态融合难以处理讽刺等语义冲突与情感强度有序性被忽略的问题,MAESTRO 以文本为指挥动态调度声画专家并用序数原型对比塑造有序隐空间,在 CMU-MOSI 上取得 Acc-7 49.42% 与 MAE 0.689 的领先,同时引入稀疏路由与额外对比开销。 标签:#音视频理解 #对比学习 #多模态模型 评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Xiaode Chen:Jianghan University, Wuhan, China Jiakang Yu:Jianghan University, Wuhan, China Hongtao Deng:Jianghan University, Wuhan, China Huina Qu:Jianghan University, Wuhan, China Xun Zhu:Jianghan University, Wuhan, China Yinxia Lou:Jianghan University, Wuhan, China 💬 毒舌点评 用文本当指挥棒来调度音视频专家的比喻很形象,序数原型对比对回归误差的针对性也到位,在 MOSI 上把 7 分类从 47.08 拉到 49.42、MAE 压到 0.689 算是硬提升。但原型靠批次内现算、类别缺失就跳过,小批量下估计方差必然抖;全程只在两个英语视频数据集上刷分,没给方差、显著性检验,也没测文本噪声或缺失时指挥失灵的后果,且零代码零权重,复现只能靠猜。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1175 words

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

📄 对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化 英文题目:Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict 一句话:论文把语义矛盾的音视频配对当作组合推理探针,用三级时序对齐与对数透镜审计检验 VideoLLaMA 2-7B-AV,发现时序对齐只会搬运答案偏置而无法把准确率抬离随机线,承诺层稳定在 25.5±1 层的晚期固化覆盖了 15 至 18 层已出现的冲突检测信号。 标签:#音视频理解 #多模态模型 #参数高效微调 #可解释性 评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Adarsh Sudheer:Independent Researcher David Li:Independent Researcher Omar Elbanna:Independent Researcher Ishaan Kodarapu:Independent Researcher Arjun Bahuguna:Independent Researcher Vasu Sharma:Independent Researcher 💬 毒舌点评 把音视频矛盾包装为组合泛化探针并用对数透镜定位到 25.5±1 层的晚期固化,为先验主导提供了可复现的机制叙事;代价是行为评估依赖精确字符串匹配的 Yes/No 子集且机制审计仅在 100 样本上以未校准阈值完成,对齐流水线又未做序列长度等混淆因素对照,结论更多是相关性描述而非因果验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 969 words

SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching

📄 把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分 英文题目:SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching 一句话:面对多语言、码混、角色敏感的销售话术辅导,SETU 选择把视觉、语音、文本与相关性拆成可替换智能体并用信任加权编排做可追溯聚合,在 18 条内部视频上取得教练一致性 0.78 与可解释性 4.3/5 的试点效果,代价是小样本、闭源与未校准阈值带来的外推局限。 标签:#音视频理解 #多模态模型 #语音质量评估 #大语言模型 评分:5.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jonnalagadda Maruthi Tejas:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Uponika Barman Roy:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Tilottama Goswami:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Samir Goswami:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Mousita Dhar:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com 💬 毒舌点评 把销售话术辅导拆成可审计的多智能体流水线并显式引入买家角色与信任加权,对多语言码混的工程痛点有针对性;但仅用 18 条内部视频就敢报 0.78 相关性与 40.9% 提效,形式化公式与阈值多为描述性定义而无标定与统计支撑,可复现性与外推性均不足。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 833 words

Emotion Understanding in Streaming Video with Trajectory-Aware Reliability

📄 别只看那一刻有多自信,要看一路有多摇晃:TRACE 用轨迹来判断情感是否可信 英文题目:Emotion Understanding in Streaming Video with Trajectory-Aware Reliability 一句话:面对流式视频中证据不断到来的情感判断,TRACE 选择让低延迟的音频前缀先形成信念轨迹,再用轨迹的稳定性来决定是否值得花代价调用多模态重解释,在 StreamMER 上以 55.58% 的重解释调用保留了接近全量多模态 70.18% 中的 69.47% 准确率,但代价是重解释仍有延迟且可靠性估计依赖训练域的轨迹分布。 标签:#音视频理解 #多模态模型 #流式处理 #语音情感识别 评分:7.7/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Qingsong Wang:Zhejiang University;Ant Group Qigong Lei:Zhejiang University Zitong Wang:Ant Group Bohan Yu:Ant Group Zhiang Dong:Zhejiang University Jian liu:Ant Group Weiqiang Wang:Ant Group Chang Yao:Zhejiang University Jingyuan Chen:Zhejiang University 💬 毒舌点评 亮点在于把流式情感识别从单点置信度判断拉回到轨迹稳定性判断,并用音频前缀驱动低延迟路径、视觉文本上下文做选择性重解释,准确率-代价权衡做得干净。短板是轨迹可靠性仍靠手工特征加小MLP拟合、StreamMER完全基于Friends剧本情景且标注依赖Gemini-3.1-Pro初标,泛化与标注偏差风险未被充分证伪,所谓流式更多是截断式前缀模拟而非真实在线部署验证。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 776 words

How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space

📄 当 AI 自己给艺术分类:28 个簇与 6 个人类标签的错位 英文题目:How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space 一句话:论文在无配对、无标签条件下用冻结骨干加 HDBSCAN 伪标签与监督对比损失的迭代闭环,让四模态在 256 维球面上自组织出 28 个美学概念,并以 NMI 0.40、ARI 0.15、纯度 0.70 揭示其与人类六类情感寄存器的部分重叠与系统性分歧,代价是弱标签噪声、单模态主导与缺失基线验证。 标签:#音视频理解 #自监督学习 #对比学习 #多模态模型 评分:4.0/10 | 创新 1.1/2 | 技术严谨 0.9/1.5 | 实验充分 0.4/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Corey D.C. Heath:Independent Researcher, Phoenix, AZ, USA 💬 毒舌点评 用无配对迭代聚类挑战 ImageBind 式显式对齐的想法有勇气,28 个 AI 概念对 6 个弱标签人类寄存器的拓扑分歧分析也算提供了新视角;但全程冻结骨干仅训轻量投影、12,010 样本的采集级弱标签噪声被直接当成分歧证据,却无任何外部基线、消融或检索验证,结论远超证据,工程与复现细节大量缺失。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 949 words

Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding

📄 不训练模型,只靠对齐:用图像把英文单词钉到印地语语音里 英文题目:Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding 一句话:面对无转写的印地语图像描述语音,论文用英文图像描述器做弱标签、HuBERT 特征做语音对齐、再用正负区间堆叠定位,在视觉监督下把关键词定位 P@10 从 10.4% 拉到 49.9%,代价是性能仍被跨文化描述不一致牢牢卡住。 标签:#音频检索 #自监督学习 #音视频理解 #低资源 评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Gabriel Pirlogeanu:机构信息未在 arXiv HTML 中可靠披露 Dan Oneata:机构信息未在 arXiv HTML 中可靠披露 Horia Cucu:机构信息未在 arXiv HTML 中可靠披露 Herman Kamper:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用无训练的对齐流水线替代端到端多模态网络,在 Hindi 真实跨语言场景下把视觉弱监督的词定位从神经注意力范式拉回可解释的检索范式,且负样本相减的区间堆叠设计简单有效。短板是方法本质为单篇会议工作的跨语言扩展,核心依赖现成的 HuBERT 与英文图像描述器,对视觉与语音描述不一致的文化鸿沟仅做事后分析而未提出实质性缓解,且评测词汇仅 100 个高频可视化名词。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 1018 words

Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models

📄 Omni 不等于会选:当模型被要求用对的模态回答 英文题目:Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models 一句话:针对前沿模型自称全模态却只会用文字回答的落差,论文用 893 条自包含跨模态提示与双层评分证明最强模型的模态召回也不过三成,且音频输出至今无人能回。 标签:#音视频理解 #多模态模型 #音频理解 #基准测试 评分:7.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Rohit Patel:Meta Superintelligence Labs Dieuwke Hupkes:Meta Superintelligence Labs Sloan Strader:Meta Superintelligence Labs 💬 毒舌点评 首次把输出模态选择本身作为考核目标,893 条跨 5 模态自包含提示与按模态隔离判定的 rubric 设计精准刺破 omni 营销与裸 API 能力的落差;短板是主指标 MMI Value 因模型几乎不产出非文本资产而无法在主评测中验证,70.8% 人机一致性与 0.41 的 Scott’s π 仅勉强可用,且用 Gemini 家族同时做生成后端与判别器的验证实验存在自偏好风险,宽松口径把链接计为成功也高估了真实生成能力。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 942 words

Omni-Interactive Universal Embedder

📄 不只用文字指挥检索:当嵌入器学会看区域、听时段 英文题目:Omni-Interactive Universal Embedder 一句话:为解决文本指令无法精确定位重叠声源与画外音的问题,OmniUE 以全模态大语言模型为骨干、用分段器把视觉掩码与音频时段编码为交互嵌入并做跨层聚合,在视频、音频与交互检索上均超越同规模基线,代价是依赖现成大模型与掩码推理的高开销。 标签:#音频检索 #多模态模型 #音视频理解 #对比学习 #基准测试 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5 👥 作者与机构 Wei-Yao Wang:Sony Group Corporation Kazuya Tateishi:Sony Group Corporation Shuyang Cui:Sony Group Corporation Christian Simon:Sony Group Corporation Takashi Shibuya:Sony AI Shusuke Takahashi:Sony Group Corporation Yuki Mitsufuji:Sony Group Corporation;Sony AI 💬 毒舌点评 首次把交互从文本扩展到视觉掩码与音频时序片段,并用分段器与跨层聚合把 omni-modal 输入真正做成了可条件化的统一嵌入,在 4 个系列基准上都拉开差距。短板是核心依赖 Qwen2.5-Omni 与 SAM-Audio / SAM-3 的现成能力且未开源任何产物,OmniCHOIR 仅 479 样本且合成流程重度依赖大模型生成,泛化与可复现性存疑。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 1040 words