研究条目

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

📄 Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue 标签:#多模态模型 #端到端 #模型评估 5.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #多模态模型 | #端到端 | #模型评估 | arxiv 👥 作者与机构 共同第一作者:Esam Ghaleb(Max Planck Institute for Psycholinguistics)、Hugh Mee Wong(Utrecht University)。论文脚注标注"Equal contribution",因此按共同第一作者处理。 通讯作者:Esam Ghaleb(Max Planck Institute for Psycholinguistics,邮箱 esam.ghaleb@mpi.nl)。 作者列表:Esam Ghaleb(Max Planck Institute for Psycholinguistics)、Hugh Mee Wong(Utrecht University)、Kristina Kobrock(Osnabrück University)。 💡 毒舌点评 “这篇工作把’手势是否真的在对话中指称信息’从口号变成可计算的模型问题,并且用’语音不确定时手势增益最大’这一发现给出了有洞察的答案。但整个结论被封闭的Fribble指称游戏、标注的手势区间以及完全缺失的代码/模型发布所限制,开放性和可复现性明显拖了后腿。” ...

 · 更新于 2026-09-05 · 约 2 分钟 · 399 字 阅读 →
研究条目

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

📄 Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models 标签:#音视频问答 #多模态模型 #空间音频 #强化学习 6.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #空间音频 #强化学习 | arxiv 👥 作者与机构 第一作者:Zhi Zeng(标注为共同一作,机构编号 1;机构名称未在正文中说明) 共同一作:Cheng Zhang、Zesheng Yang(机构编号 1)、Rendong Pi(机构编号 2) 作者列表:Zhi Zeng¹、Cheng Zhang¹、Zesheng Yang¹、Rendong Pi²、Jiaying Wu³、Di Zhang¹、Zihan Ma¹、Guodong Li⁴、Zhou Yang¹、Yu Xiang²、Yifei Zheng⁵、Minnan Luo¹(前四位标注 equal contribution;通讯作者未说明;1–5 为机构编号,机构名称未在论文中给出) 💡 毒舌点评 亮点:把"移动声源的时空跟踪与视觉绑定"正式定义为四级 QA 任务,并用模态必要性约束从构造上堵死单模态捷径,定位精准;ST-Omni-R1 平均 77.83% 领先最强闭源基线 Gemini-2.5-Pro(37.28%)达 40.55 个百分点,差距显著。 短板:核心产物(ST-OmniQA 数据、STA-encoder 代码、模型权重)完全未开源,一个基准论文拿不出基准本身,是最大的硬伤;全部数据来自 Matterport3D+SoundSpaces 2.0 单一仿真管线,真实场景只有音频模态的部分迁移证据;高度相关的近作 ST-AudioLM 在正文中被点名却未入表对比;且所有通用基线均为零样本,与经过同分布 SFT 的本文方法并不对等,“碾压式"领先需要打折解读。 📌 核心摘要 要解决的问题:现有音频语言模型(LALM)多以全局事件语义表示整段音频,视觉语言模型缺乏空间音频线索,SELD 则受限于固定词表与结构化输出,三者均无法对移动声源执行"定位—跟踪—跨模态绑定"的联合开放推理。 方法核心:构建 ST-OmniQA 基准(40K 全景视频 + 400K QA,四级能力 A/B/C/D,式 (2) 模态必要性约束),提出 ST-Omni-R1 模型,由 STA-encoder(1 个语义 token + 40 个时序轨迹 token)、Qwen2.5-VL-7B-Instruct 视频分支、两层 MLP 音频连接器组成,经 Stage A→D 渐进课程学习与推理树强化学习(RT-GRPO)训练。 新在哪里:基准层面要求答案仅在联合视听证据下唯一可解(\(|\mathcal{C}_A|>1, |\mathcal{C}_V|>1, |\mathcal{C}_{AV}|=1\));表示层面将 FOA 的时变声强向量转为有序轨迹 tokens,并与全景视觉实例绑定。 主要实验结果:ST-OmniQA 上 ST-Omni-R1(SFT+RT-RL)平均语义准确率 77.83%,最强闭源基线 Gemini-2.5-Pro 为 37.28%;TAU-NIGENS/L3DAS22/STARSS23 三个公开空间音频基准上总体均优于 BAT(注意 TAU-NIGENS 的 Elevation 子项上 BAT 50.00 略高于本文 49.50)。 实际意义:为"空间音频+全景视频"的动态声源推理提供了基准与基线系统,可能推动音视频问答、具身智能中声源跟踪与视觉绑定方向的研究。 主要局限:训练与评测均来自 Matterport3D+SoundSpaces 2.0 同一仿真引擎,真实场景仅有音频/音视频迁移的部分证据;模型、数据、代码均未开源;RT-GRPO 奖励权重与树节点打分细则未披露;Level C 仅 55.70% 且无失败模式分析。 下图展示了ST-OmniQA基准中的一个单源音频-视觉接地任务示例。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 493 字 阅读 →
研究条目

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

📄 MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection 标签:#音视频理解 #多模态模型 #基准测试 #语音合成 #音频生成 6.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.5/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频理解 | #多模态模型 | #基准测试 #语音合成 | arxiv 👥 作者与机构 作者列表:Yanqiu Li、Yang Xiao、Jisheng Bai、Bin Chen、Hong Jia、Ting Dang。 机构编号为 1、2、3;具体机构名称在提供的论文原文片段中未披露。 通信作者信息未披露。 💡 毒舌点评 论文把“环境音频”从被长期忽视的背景音升级成了独立伪造组件,但复现所需的代码、数据和模型权重却被藏成了未披露的第三个组件。行文与表格中存在大量排版损坏字符,读起来像从 PDF 里抢救出来的半成品;实验设计值得肯定,工程开源程度却让“rigorous foundation”显得有点嘴硬。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 561 字 阅读 →
研究条目

Multilingual Emotion Neurons in Large Audio-Language Models

📄 Multilingual Emotion Neurons in Large Audio-Language Models 标签:#语音情感识别 #多模态模型 #可解释性 #低资源 6.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #多模态模型 | #可解释性 #低资源 | arxiv 👥 作者与机构 第一作者:Xiutian Zhao(Center for Language and Speech Processing, Johns Hopkins University, USA) 通讯作者:未说明 作者机构归属: Johns Hopkins University: Xiutian Zhao、Philipp Koehn、Berrak Sisman Imperial College London: Björn Schuller 论文标题页脚注明确给出了作者编号与机构对应关系:编号 1 对应 CLSP, Johns Hopkins University;编号 2 对应 GLAM, Imperial College London。因此可将姓名与机构直接对应,不需要写“未说明”。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 765 字 阅读 →
研究条目

omni-macos: On-Device Omni-Modal Search on Apple Silicon

📄 omni-macos: On-Device Omni-Modal Search on Apple Silicon 标签:#音频检索 #多模态模型 #高效推理 #开源工具 #模型压缩 7.2/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频检索 | #多模态模型 | #高效推理 #开源工具 | arxiv 👥 作者与机构 第一作者:Han Xiao(Jina AI by Elastic,来自论文署名行) 通讯作者:未说明(论文未明确标注通讯作者) 作者列表:Han Xiao(Jina AI by Elastic) 💡 毒舌点评 工程完成度确实高,把“隐私、持续索引、交互延迟、统一内存预算”做成一个可运行的原生 macOS 系统,并且每个机制都给了跨五台机器的测量。但论文始终没有与任何既有检索系统做端到端质量对比,检索质量只靠“与自身 bf16 扫描的一致性”来间接说明,更像一份优秀的系统报告而非完整的检索研究。作为审稿人,我愿意接收为系统展示/工程论文,但不会把它当作检索质量或 SOTA 的证据。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 948 字 阅读 →
研究条目

RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

📄 RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction 标签:#音频生成 #扩散模型 #音乐生成 #多模态模型 #对比学习 6.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #扩散模型 | #音乐生成 #多模态模型 | arxiv 👥 作者与机构 第一作者:Ambuj Mehrish(CVML Lab, Ca’ Foscari University of Venice) 通讯作者:未说明 作者列表:Ambuj Mehrish(CVML Lab, Ca’ Foscari University of Venice)、Sebastiano Vascon(CVML Lab, Ca’ Foscari University of Venice) 💡 毒舌点评 把 SDEdit / rectified-flow 中间初始化搬到脑到音频生成,用检索 exemplar 锚定采样轨迹而不是把它当条件或直接输出,确实是处理 prior domination 的务实思路;用 MusicGen 做负对照把“轨迹初始化”从“检索本身”中分离出来,也比一般脑解码文章的实验设计更用心。但全篇只在 Brain2Music 一个数据集、5 个受试者、300 个 pooled 样本上验证,代码链接还是 TBA;FAD 从 13.49 降到 1.25 主要是靠贴近检索真音频,而不是生成器本身的音频质量变强,所以作者没有 claim 超过 retrieval-only 是对的——RAG 相对纯检索的增量其实只有 novelty 从 0.06 提到 0.18,FAD 反而从 0.89 涨到 1.25,这个 trade-off 值不值取决于具体应用。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 1065 字 阅读 →
研究条目

REFRAMED: Towards Realistic Audio Description Generation for Movies

📄 REFRAMED: Towards Realistic Audio Description Generation for Movies 标签:#音频字幕生成 #多模态模型 #大语言模型 8.0/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音频字幕生成 | #多模态模型 | #大语言模型 | arxiv 👥 作者与机构 第一作者:Igor Sterner(爱丁堡大学信息学院) 通讯作者:未说明(论文未明确标注通讯作者) 作者列表:Igor Sterner(爱丁堡大学信息学院)、Mirella Lapata(爱丁堡大学信息学院)、Alex Lascarides(爱丁堡大学信息学院)、Frank Keller(爱丁堡大学信息学院) 发表信息:COLM 2026 会议论文 💡 毒舌点评 一个真正把"何时描述"和"描述什么"统一进任务定义的 AD 数据集/基准工作,数据构建的验证密度很高,摆脱了以往"clip-level captioning"的简化设定。短板也很明显:挑战集只有 10 部电影、LLM 在 full-movie 输入下生成质量远低于人类,且评估指标仍依赖 METEOR/CIDEr 这类早期 n-gram 度量,对新任务的表征力可能有限。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 877 字 阅读 →
研究条目

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

📄 SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation 标签:#音视频理解 #多模态模型 #模型评估 7.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #模型评估 | arxiv 👥 作者与机构 彭凯(Kai Peng):大连理工大学,happypk@mail.dlut.edu.cn 申云哲(Yunzhe Shen):大连理工大学 张淼(Miao Zhang):大连理工大学 刘雷野(Leiye Liu):大连理工大学 纪伟(Wei Ji):耶鲁大学 李晶晶(Jingjing Li):卡内基梅隆大学 朴永日(Yongri Piao):大连理工大学 卢湖川(Huchuan Lu):大连理工大学 注:论文模板中包含对应作者标记,但正文未将标记映射到具体姓名,按“未明确标注”处理。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 929 字 阅读 →
研究条目

Steering dense music retrieval with open-vocabulary concept discovery

📄 Steering dense music retrieval with open-vocabulary concept discovery 标签:#音乐检索 #无监督学习 #多模态模型 #零样本 #可解释性 7.7/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐检索 | #无监督学习 | #多模态模型 #零样本 | arxiv 👥 作者与机构 作者列表与机构信息在原文中未以常规作者块形式提供,仅有致谢提及 EPSRC UKRI Centre for Doctoral Training in Artificial Intelligence and Music (EP/S022694/1) 与 Universal Music Group 资助。作者身份与完整机构列表未披露。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 700 字 阅读 →
研究条目

Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification

📄 Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification 标签:#语音属性识别 #多模态模型 #对比学习 #自监督学习 #可解释性 6.5/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音属性识别 | #多模态模型 | #对比学习 #自监督学习 | arxiv 👥 作者与机构 作者列表按原文顺序为:Abner Hernandez、Tomás Arias-Vergara、Daiqi Liu、Andreas Maier、Paula Andrea Pérez-Toro。 论文未标注通讯作者。 机构栏仅为 Anonymous Institution,未提供具体单位、实验室或国家/地区信息。 参考文献与文中致谢未透露作者所属机构。 💡 毒舌点评 把 PhonoQ 的结构化音系表征引入 rtMRI 轮廓分类,语音学直觉是清晰的,后验分析也确实给出 flapping、/t/-/r/ 塞擦化/后移和鼻音同化等可解释线索。但整个验证只建立在 12 个说话人、2 个测试说话人的小子集上,未提供代码、模型权重或可复现材料;而且 PhonoQ 的增益可能部分来自 XLSR 多语言预训练本身,论文没有用同骨干无音系头的对照来排除这个混淆。结果再正面,也难以支撑“结构化音系表征广泛有效”的强结论。更像一篇有潜力但尚未打磨到顶会标准的方法报告。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 810 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-11

语音/音乐/音频论文速递 2026-08-11 共分析 40 篇论文 ⚡ 今日概览 📥 抓取 40 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 4篇 ████ #音频生成 4篇 ████ #音乐生成 3篇 ███ #音频字幕生成 3篇 ███ #声源定位 2篇 ██ #语音合成 2篇 ██ #语音情感识别 2篇 ██ #语音编码 2篇 ██ 📊 论文评分排行榜(40 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detai 8.4分 前25% 方法研究 #音频字幕生成 🥈 Deferred Audio Pruning with Local Audio-Visual Dynamics 8.4分 前25% 方法研究 #模型剪枝 🥉 PACE: A Playback-Aligned Context Engine for LLM-Based F 8.0分 前25% 系统技术报告 #语音交互 4. REFRAMED: Towards Realistic Audio Description Generatio 8.0分 前25% 数据集与基准 #音频字幕生成 5. SraVaani 1.0: Scaling Inclusive Speech Recognition for 7.9分 前25% 模型报告 #语音识别 6. AudioMap: Cloze-and-Choice Reinforcement Learning for T 7.9分 前25% 方法研究 #音频字幕生成 7. SAMOT: State-Aware Step Modulation and Optimal Transpor 7.7分 前25% 方法研究 #音视频理解 8. ReLMCodec: Designing Predictable Speech Tokens from Pre 7.7分 前25% 方法研究 #语音编码 9. VoxZip: Semantic-Anchored Temporal KV Cache Compression 7.7分 前25% 方法研究 #音频理解 10. Steering dense music retrieval with open-vocabulary con 7.7分 前25% 方法研究 #音乐检索 11. VIOLET: High-Fidelity Violin Synthesis with Techniques 7.6分 前25% 方法研究 #音乐生成 12. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified 7.6分 前25% 模型报告 #音频生成 13. Beyond Reconstruction: Full-Context Generative DiT for 7.5分 前25% 系统技术报告 #音乐生成 14. From Inaudible Inputs to Model Failures: Low-Frequency 7.4分 前50% 方法研究 #音频理解 15. Beyond Piano: Cross-Instrument MIDI Velocity Estimation 7.3分 前50% 方法研究 #音乐理解 16. omni-macos: On-Device Omni-Modal Search on Apple Silico 7.2分 前50% 系统技术报告 #音频检索 17. SCoPE: Training-Free Audio-Visual Event Perception via 7.1分 前50% 方法研究 #音视频理解 18. BAMU: Bitstream-Aware Marginal-Utility Allocation for F 7.1分 前50% 方法研究 #语音编码 19. Dramarrator: Object-Based Audio Editing for Audio Drama 7.0分 前50% 系统技术报告 #音频生成 20. CuteTTS: Efficient and High-Quality Speech Synthesis vi 7.0分 前50% 系统技术报告 #语音合成 21. RAG-Audio: Retrieval-Augmented Generation for Faithful 6.9分 前50% 方法研究 #音频生成 22. Listen, See and Track: Spatio-Temporal Audio-Visual Sou 6.7分 前50% 数据集与基准 #音视频问答 23. From Speech to Interaction: Analyzing Multimodal System 6.6分 前50% 系统技术报告 #音视频语音识别 24. MADBench: A Benchmark for Modality-Aware Audio Deepfake 6.6分 前50% 数据集与基准 #音视频理解 25. A Unifying Perspective on Audio Generative Modeling: La 6.5分 前50% 理论研究 #音频生成 26. Multilingual Emotion Neurons in Large Audio-Language Mo 6.5分 前50% 方法研究 #语音情感识别 27. DAVE: A Decoupled Audio-Visual Enhancement Framework fo 6.5分 前50% 系统技术报告 #音视频语音分离 28. Structured Phonological Representations for Audio-Artic 6.5分 前50% 方法研究 #语音属性识别 29. CtrlSpeech: Coarse-to-Fine Control for Expressive Speec 6.4分 前50% 方法研究 #语音合成 30. Neural Array-Generic Direction-of-Arrival Estimation Ex 6.4分 前50% 方法研究 #声源定位 31. AI-Guided Learning: Research on Knowledge and Skill Acq 6.3分 前50% 系统技术报告 #音视频理解 32. Speaker Role and Language Diarization for Analyzing Mul 6.3分 前50% 应用研究 #说话人日志 33. MusicLayout: Explicit Structural Planning for Controlla 6.3分 前50% 系统技术报告 #音乐生成 34. Mitigating Over-Suppression in Speech Enhancement via I 6.2分 前50% 方法研究 #语音增强 35. Physics-Informed Learning for Robust Acoustic Localizat 6.2分 前50% 方法研究 #声源定位 36. EmoS: A Theory-Grounded Framework for Evaluating and Al 6.2分 前50% 数据集与基准 #语音情感识别 37. Dynamic Clustering for Cross-Segment Permutation Alignm 6.2分 前50% 方法研究 #语音分离 38. The Voiceprint Fallacy: Why Voices Are Not Unique Biome 6.0分 前50% 综述 #说话人验证 39. Investigating Multimodal Informativity under Different 5.9分 前50% 方法研究 #多模态模型 40. Machine-Learning-Based Diagnostic Framework for Passive 5.6分 前50% 应用研究 #音频分类 📋 论文列表 🥇 AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward 8.4/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ...

 · 更新于 2026-09-05 · 约 33 分钟 · 6905 字 阅读 →
研究条目

Objects as Audio-Visual Modal Sound Fields

📄 Objects as Audio-Visual Modal Sound Fields 标签:#音频生成 #多模态模型 #自监督学习 7.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #多模态模型 | #自监督学习 | arxiv 👥 作者与机构 共同一作:Zisen Shao(马里兰大学)、Zihao Wei(马里兰大学),论文脚注标注 “Equal contribution” 作者列表:Zisen Shao、Zihao Wei、Derong Jin、Ruohan Gao(马里兰大学,College Park) 通讯作者:未标注 💡 毒舌点评 把视觉语义先验注入模态声场重建,方向聪明,实验也比一般短文扎实:两个真实数据集、四组消融、非对称子集案例、甚至补了 N-shot 和输入视图数扫描。但审稿人不能忽略两个硬伤:第一,在 ObjectFolder Real 完整数据集上,KNN 的 L1 Log(0.930)实际上好于本方法(0.951),“显著优于强基线"这个结论只在部分指标上成立;第二,论文明确写"对每个物体运行 single-damping 和 spatial-damping 两个变体,根据 ENV 指标选最好的模型”——这是在测试集上做模型选择,所报数字存在系统性高估。代码仓库藏在项目主页里,正文连链接都不给,开源姿态不够大方。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 729 字 阅读 →
研究条目

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

📄 Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation 标签:#音视频交互 #大语言模型 #多模态模型 5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 📝 5.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #大语言模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Ziyun Xu(Meta Platforms, Menlo Park, California, USA) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Ziyun Xu(Meta Platforms)、Bosen Ding(Meta Platforms)、Yue Zhang(Meta Platforms)、Ji Qi(Meta Platforms)、Qingyuan Song(Meta Platforms)、Jizhou Huang(Meta Platforms)、Liwei Wang(Meta Platforms)、Jeffrey Santelli(Meta Platforms)、Yue Weng(Meta Platforms)、Qichao Que(Meta Platforms)、Zhenheng Yang(Meta Platforms)、Junfeng Pan(Meta Platforms)、Linhong Zhu(Meta Platforms) 💡 毒舌点评 用真实生产流量完成了闭环验证,76.02%的上下文感知Pill使用率与“Pills Only vs Full System”的在线消融,把“界面收集信号”和“服务流执行信号”拆得足够干净。但整篇论文在可复现性上近乎封闭:α/τ取值缺失、Semantic Profile的schema缺失、prompt模板缺失;更关键的是,LLM-as-a-Judge不仅用于SFT标注,还参与了DPO偏好对构造和离线评估集的构建,独立人工集只有1029条,循环评估风险并未真正消除。真正值得行业关注的是“减少政治类短剧”这类实时负向约束能在工业线上生效,这本身就是对被动行为表征的一次清晰否定——可惜论文没有把负向约束如何编码进列表式打分和剪枝的细节讲透。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 413 字 阅读 →
研究条目

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

📄 StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding 标签:#多模态模型 #大语言模型 #基准测试 7.6/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #多模态模型 | #大语言模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Xichen Zhang(The Hong Kong University of Science and Technology; Xiaohongshu Inc.) 通讯作者:未说明 作者列表:Xichen Zhang(The Hong Kong University of Science and Technology; Xiaohongshu Inc.)、Guankai Li(Xiaohongshu Inc.)、Yinghao Zhu(The University of Hong Kong)、Shijian Wang(Xiaohongshu Inc.)、Sitong Wu(The Chinese University of Hong Kong)、Shaozuo Yu(The Chinese University of Hong Kong)、Meng Chu(The Hong Kong University of Science and Technology)、Yuan Lu(Xiaohongshu Inc.)、Jiaya Jia(The Hong Kong University of Science and Technology) 💡 毒舌点评 把流式视频评测从短视频/选择题推向“小时级+开放问答+主动监测”,并给出前端/后端两层 worker 的系统方案,工程量和开放材料都很完整,这是明显亮点。但系统级比较的核心结论被骨干规模差异污染:StreamMind 用 Qwen3.5-397B-A17B 对比多个 3B/7B/8B 流式基线,且没有组件消融,因此“架构带来增益”的归因并不牢靠。Tool 的 228.1% 相对提升只建立在 MiniCPM-o 17.1% 的弱基准上,绝对准确率仍与人类参考 95.2% 差距巨大,不能据此宣称工具调用能力已接近实用。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 759 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-10

语音/音乐/音频论文速递 2026-08-10 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 2篇 ██ #音乐理解 2篇 ██ #音频伪造检测 2篇 ██ #音频生成 2篇 ██ #多模态模型 1篇 █ #歌唱生成 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 How Much AI Is in This Track? Quantifying the Proportio 8.3分 前25% 方法研究 #音频伪造检测 🥈 Objects as Audio-Visual Modal Sound Fields 7.6分 前25% 方法研究 #音频生成 🥉 StreamArena: Toward Continuous, Interactive, and Long-H 7.6分 前25% 数据集与基准 #多模态模型 4. Frame-Level Pansori Mode Classification with Complement 7.6分 前25% 数据集与基准 #音乐理解 5. Multi Codec Discrete Diffusion Model for Text Guided Sp 7.3分 前50% 方法研究 #语音编辑 6. MI-MIDI: Mechanistic Interpretability of Text-to-MIDI G 7.1分 前50% 方法研究 #音乐生成 7. SemBridge: Semantic Token Anchoring for Continuous-Late 7.0分 前50% 方法研究 #语音合成 8. Do Audio Language Models Use Paralinguistic Evidence? C 6.9分 前50% 数据集与基准 #语音情感识别 9. Separating Decision-Rule Misalignment from Readout-Cove 6.8分 前50% 方法研究 #语音情感识别 10. MMAG: A Multi-Control Mixed Audio Generation Benchmark 6.8分 前50% 数据集与基准 #音频生成 11. Assessing AI-generated music detection in real-world br 6.8分 前50% 数据集与基准 #音频伪造检测 12. LSEAD: A Privacy-Preserving LLM-Based Speech Analysis F 6.6分 前50% 系统技术报告 #语音识别 13. Cloud-Boosted Low-Compute Multi-Channel Speech Enhancem 6.0分 前50% 方法研究 #语音增强 14. Shape Your Feed: An LLM-based Agentic System for Conver 5.7分 前50% 系统技术报告 #音视频交互 15. From Prompting to Describing: A Cross-Cultural Study of 5.5分 前50% 应用研究 #音乐理解 16. Beyond Call and Response: Modelling Reciprocal Coordina 5.5分 前50% 方法研究 #歌唱生成 📋 论文列表 🥇 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

 · 更新于 2026-09-05 · 约 14 分钟 · 2864 字 阅读 →
研究条目

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

📄 C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models 标签:#音视频问答 #多模态模型 #基准测试 #数据集 #可解释性 5.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.5/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Swapnanil Mukherjee(Microsoft Research India) 通讯作者:Swapnanil Mukherjee(Microsoft Research India,论文提供联系邮箱为 swapnanil.mukherjee12@gmail.com) 作者列表:Swapnanil Mukherjee(Microsoft Research India)、Agyeya Negi(IIIT Hyderabad)、Tanuja Ganu(Microsoft Research India)、Ponnurangam Kumaraguru(IIIT Hyderabad) 💡 毒舌点评 用自动管道造了一个看似覆盖全模态、实际由 Gemini 单方生成并单方审计的 C3PO 基准,再用这个基准宣称“Gemini-3.1-Pro 最强”,存在明显的循环评价风险。不过其 IC/CC 双轴设计与注意力熵分析确实触碰到了多模态模型“过早承诺单模态”这一真问题,且模板粒度很细,值得后续工作修正生成偏差后复用。如果作者不公开生成产物和完整模板逻辑,这个基准的实际影响力会大打折扣。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 690 字 阅读 →
研究条目

KVAE: Family of Tokenizers for Multimodal Generative Models

📄 KVAE: Family of Tokenizers for Multimodal Generative Models 标签:#多模态模型 #变分自编码器 #音频编码 #音频理解 #Transformer 8.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 🔥 8.1/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频编码 | #变分自编码器 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Andrey Shutkin(Kandinsky Lab) 通讯作者:未说明 作者列表:Andrey Shutkin、Denis Parkhomenko、Ivan Kirillov、Kirill Chernyshev、Kirill Malakhov、Ilia Vasiliev、Ilia Trushkin、Valeriya Kobenko、David Chikovani、Alexander Ivanov、Azat Saginbaev、Egor Silvestrov、Ivan Mikheev、Konstantin Zakharov,均署名 Kandinsky Lab 💡 毒舌点评 把 tokenizer 当作影响扩散生成的第一公民来做,跨图像、视频、音频统一评估 diffusability,并用 tokenizer-swap 和主观评测证明“重建好不等于生成好”,这是很实用的工程视角。但最关键的音频对齐目标、感知损失具体配置和大量精确超参数被推到“后续 publication”,导致读者很难独立复现。更值得注意的是,客观指标上并非处处 SOTA:音乐域 FAD/CLAP 仍落后于 MMAudio,语音域 SI-SDR 仍落后于 MovieGen DACVAE;最终“全面超越”的结论主要靠 side-by-side 主观胜率撑住,而主观评测又没有给出标注者数量、一致性和置信区间。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 887 字 阅读 →
研究条目

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

📄 PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads 标签:#音视频生成 #多模态模型 #端到端 #高效推理 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #多模态模型 | #端到端 #高效推理 | arxiv 👥 作者与机构 Ao Fu(ORCID: 0009-0006-9933-9240,邮箱:220232248@seu.edu.cn):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 Yi Zhou(ORCID: 0000-0003-3021-3229,邮箱:yizhou.szcn@gmail.com):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 论文发表于 Proceedings of the 34th ACM International Conference on Multimedia(MM ‘26),2026年11月10–14日,巴西里约热内卢。DOI: 10.1145/3767308.3835096。 💡 毒舌点评 把音素级离散语言信息和连续音频特征用门控融合注入 3DGS 说话头,确实打中了“漏嘴”(leaky mouth)和嘴部过平滑这一真实痛点;LFM 的可视化也让融合过程有了初步可解释性。但整体仍是对 per-person 说话头框架的组件级改进,而非范式级突破:所谓音素来自离线 ASR+强制对齐,且仅 2 个受试者的消融与跨数据集实验支撑一个高达 40 音素的词汇表,证据链偏单薄;代码权重一概未公开,可复现性近于零。把“phoneme-driven”的普适性说到太满之前,至少应给出多身份、多语言、对 ASR 噪音的鲁棒性分析。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 721 字 阅读 →
研究条目

A Dual Evaluation for Music Transcription

📄 A Dual Evaluation for Music Transcription 标签:#音乐转录 #自监督学习 #多模态模型 #音频理解 #Transformer 7.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐转录 | #自监督学习 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Ping Wang(华盛顿大学;按署名顺序为第一作者) 作者列表: Ping Wang(华盛顿大学) Guang Yang(华盛顿大学) Nazif Can Tamer(华盛顿大学) Victoria Ebert(华盛顿大学) Noah A. Smith(华盛顿大学和艾伦人工智能研究所) 通讯作者:论文未明确标注通讯作者 💡 毒舌点评 这项工作的核心贡献在于把“转录质量”拆成“书面记谱”和“播放感知”两个正交维度,并通过大规模人类 ABX 实验确认了 CLEWS 这一最便宜的自动指标恰好在人类偏好上相关性最高,这一发现具有很高的实用价值。但整套评估始终以西方古典钢琴独奏、前三分钟片段为边界,所谓“dual evaluation”能否迁移到乐队、人声或非古典风格,论文既没有证据也没有给出令人信服的理论预期;同时,记谱侧从未用真人读谱或编辑工时做验证,OMR-NED 衡量的仍只是“符号层面的编辑距离”。这使论文更像一份高质量但边界明确的评估基准,而非已经确立的通用 AMT 评估范式。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 408 字 阅读 →
研究条目

AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

📄 AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation 标签:#音频生成 #多模态模型 #大语言模型 #音频理解 #Transformer 6.8/10 | 创新 1.5/2 | 严谨 0.8/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音频生成 | #多模态模型 | #大语言模型 #音频理解 | arxiv 👥 作者与机构 作者列表(按原文署名顺序):Jinting Wang、Yuguang Yang、Shengyu Li、Yan Rong、Shan Yang、Xiaoda Yang、Li Liu。 第一作者:Jinting Wang(机构编号 1,机构名称原文未给出)。 通讯作者:原文未标注。 机构编号:1、2、3 对应不同单位,但具体机构名称在可见原文中未说明。 💡 毒舌点评 该工作把“结构化声景表示 + 复杂度感知分层 + rubric 细粒度验证”组合成一个可操作的 TTA 评测协议,方向正确且工程化程度较好,弥补了纯 CLAP 相似度无法定位语义失败的缺陷。但当前作为 benchmark 论文却通篇不提自有代码、数据集、评测脚本或发布计划,核心产物完全不可获取。更严重的是,语音内容指标 SCCA@0.60 只做顺序无关的词/字覆盖率剪枝匹配,不惩罚语序错误和额外转录内容,且多数通用模型在此维度得分为零,区分度和解释力都有限。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 450 字 阅读 →