研究条目

C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

📄 C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning 标签:#音视频理解 #多模态模型 #音频理解 #Transformer #模型评估 4.1/10 | 创新 1.2/2 | 严谨 0.3/1.5 | 实验 0.8/1.5 | 清晰 0.4/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.5/1.5 📝 4.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yuntao Shou(Central South University of Forestry and Technology;邮箱后缀为 xjtu.edu.cn,与署名机构不一致,原文未解释) 通讯作者:未说明 作者列表:Yuntao Shou(Central South University of Forestry and Technology)、Tao Meng(Central South University of Forestry and Technology)、Wei Ai(Central South University of Forestry and Technology)、Keqin Li(State University of New York, New Paltz, USA;另附“Xi’an, China”但机构名未说明) 💡 毒舌点评 把一致性拆给一个专家、互补性拆给另一个专家的MoE思路是有嚼头的,且实验覆盖了特定缺失与随机缺失两种设置,工作量值得肯定。但核心信息论目标是自相矛盾的:一致性专家在最小化条件熵的同时又在最大化边缘熵,这在理论上并不自洽;互补预测采用最大化重构误差,实际会鼓励输出偏离真实分布。加上公式编号大面积重复、表2中多个基线数值在不同缺失率下完全相同、关键训练细节与图结构定义缺失,当前版本只能算一份不成熟的工作稿。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 801 字 阅读 →
研究条目

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

📄 EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot 标签:#音视频交互 #大语言模型 #语音合成 #语音情感识别 #多模态模型 7.1/10 | 创新 1.1/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.1/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #大语言模型 | #语音合成 #语音情感识别 | arxiv 👥 作者与机构 第一作者:Jie Yang(新加坡国立大学,National University of Singapore) 通讯作者:Hao Fei(牛津大学,University of Oxford;论文中标注为 Corresponding author) 作者列表:Jie Yang(新加坡国立大学)、Wenhao Xu(新加坡国立大学)、Shuhui Lin(清华大学,Tsinghua University)、Hao Fei(牛津大学,University of Oxford) 💡 毒舌点评 把 ASR/SER/TTS/3DGS 这些开源模块用 LLM 编排成一个可运行的 empathetic avatar 系统,工程完成度和开源诚意值得肯定,尤其在“Response Planning”将情感意图显式传给语音和渲染模块这一点上设计清晰。但论文把“Tri-Agent”和“Response Planning”讲得很重,实际更像分层提示词与 JSON 合约,实验也没有对这两项做任何组件消融;45.8 秒的平均端到端延迟更让它离“live chatbot”还有实质性距离。整体是一个有价值的工程基线和测试平台,但不是论文所暗示的智能突破。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 1043 字 阅读 →
研究条目

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

📄 HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models 标签:#语音情感识别 #参数高效微调 #语音大模型 #多模态模型 #零样本 7.2/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #LoRA | #参数高效微调 #语音大模型 | arxiv 👥 作者与机构 第一作者:Tian Jin(同济大学;香港中文大学(深圳)) 通讯作者:未说明 作者列表:Tian Jin(同济大学;香港中文大学(深圳))、Ruikang Zhang(同济大学;北京大学)、Zefeng Zhao(香港中文大学(深圳))、Ding Luo(同济大学)、Jin Zeng(同济大学) 💡 毒舌点评 把双曲几何引入 LALM 的语音情感识别微调,角度确实少见,MELD 上全面超过 LoRA/Adapter、以及 IEMOCAP 上少数类 UA 提升都是值得肯定的结果。但 HGA 的数学形式经过 exp/log 恒等化简后,实际上等价于对冻结权重行的切空间表示做逐元素缩放,“双曲权重调制”更多是几何解释而非计算上的非线性变换;另外全文在 0.12% 参数预算与约 6.78M 可训练参数之间出现了算术口径不一致(约 6.78M / 8.4B ≈ 0.081%,而非 0.12%),这种细节问题出现在顶会投稿中会被直接放大。欧氏对照没有匹配的几何损失,统计显著性更是完全缺失——审稿人不会因为框架漂亮就忽略这些。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1167 字 阅读 →
研究条目

Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE

📄 Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE 标签:#音视频语音分离 #多模态模型 #基准测试 #数据集 #数据清洗 6.8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.2/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频语音分离 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 Peijun Yang(武汉大学网络空间安全学院 / 武汉大学人工智能学院),Zhan Jin(武汉大学计算机学院),Juan Liu(武汉大学计算机学院 / 武汉大学人工智能学院,共同通讯作者),Ming Li(武汉大学人工智能学院 / 香港中文大学(深圳)人工智能学院,共同通讯作者)。通讯邮箱:liujuan@whu.edu.cn, ming.li.cuhksz@gmail.com。 💡 毒舌点评 “QiangDa 把 AV-TSE 评测从’独立录音合成的干净混合’拉回到’同一物理场景共同录制的双人重叠’,并要求同一段混合分别在 A/B 视觉提示下输出两个不同身份,OSD-first 严格判定也确实堵住了 visual bypass——这个评测思路比只报 SI-SNR 聪明得多,发布 VoxBlink2-AVSE 也有实际价值。但作为 benchmark 论文,实验通篇只有自家 8 个检查点的内部互比,VisualVoice、USEV、AV-GridNet 这些已有 AV-TSE 方法一个直接对比都没有,读者无法判断 QiangDa 到底比旧基准难在哪、新方法比旧方法强在哪;最强的无 speaker-loss 检查点启动 CLI 未完整保存,等于资源论文里最亮的数字作者自己都复现不出来。基准的’锚’没打好,严谨性和可用性都要打折扣。” ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1415 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-06

语音/音乐/音频论文速递 2026-08-06 共分析 26 篇论文 ⚡ 今日概览 📥 抓取 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 3篇 ███ #语音增强 2篇 ██ #语音质量评估 2篇 ██ #音乐理解 2篇 ██ #音视频理解 2篇 ██ #音视频生成 2篇 ██ #音频事件检测 2篇 ██ #语音属性识别 1篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Equivariant Music Transformer 8.6分 前25% 方法研究 #音乐生成 🥈 Breaking the Curse ofMultilinguality inMany-to-Many Spe 8.2分 前25% 方法研究 #语音翻译 🥉 PASE: Leveraging the Phonological Prior of WavLM for Lo 8.1分 前25% 方法研究 #语音增强 4. Towards Robust Version Identification in the Wild: A Da 8.0分 前25% 数据集与基准 #音乐检索 5. Agogic: Performance-Timed Music Tokens for LLM-Native T 7.9分 前25% 方法研究 #音频理解 6. OmniPack: Unified Token Compression for Efficient Omni- 7.7分 前25% 方法研究 #音视频理解 7. OmniVR: Joint Video-Audio Conditional Generation for Re 7.7分 前25% 方法研究 #音视频生成 8. A Dual Evaluation for Music Transcription 7.7分 前25% 方法研究 #音乐转录 9. Crowdsourced Multilingual Speech Intelligibility Testin 7.5分 前25% 数据集与基准 #语音质量评估 10. MERaLiON-GR: Speech Gender Recognition Model for Englis 7.5分 前25% 模型报告 #语音属性识别 11. HyPASE: Hyperbolic Geometry for Parameter-Efficient Spe 7.2分 前50% 方法研究 #语音情感识别 12. Transfer Learning for Avian Bioacoustics under Sparse P 7.1分 前50% 方法研究 #音频分类 13. Helping Music Co-Creation Agents ‘Listen’ Well: Hierarc 7.1分 前50% 方法研究 #音乐理解 14. EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Li 7.1分 前50% 系统技术报告 #音视频交互 15. StuPASE: Towards Low-Hallucination Studio-Quality Gener 7.0分 前50% 方法研究 #语音增强 16. Identity-Faithful Audio-Visual Target Speaker Extractio 6.8分 前50% 数据集与基准 #音视频语音分离 17. AudioScape-TTA: A Structured Soundscape Benchmark for F 6.8分 前50% 数据集与基准 #音频生成 18. Visual Representation Matters: Exploiting Temporal Diff 6.8分 前50% 方法研究 #音视频生成 19. Spoken Function Calling: A New Perspective on Spoken La 6.7分 前50% 数据集与基准 #音频理解 20. Masked diffusion enables coherent beat tracking 6.5分 前50% 方法研究 #音乐理解 21. InvFlowFD: Reference-Free and Background-Set-Free Perce 6.4分 前50% 方法研究 #音频质量评估 22. Smartphone Audio Based Distress Detection 6.3分 前50% 系统技术报告 #音频事件检测 23. Assessing speech quality metrics for evaluation of neur 6.0分 前50% 数据集与基准 #语音质量评估 24. Modality Agreement- and Conflict-Aware Prototype Hyperg 5.5分 前50% 方法研究 #音频理解 25. Deep Learning for Real-Time Sound Order Recognition in 5.2分 后50% 方法研究 #音频事件检测 26. C\(^2\)MOE: Consistency and Complementarity-guided Mixtur 4.1分 后50% 方法研究 #音视频理解 📋 论文列表 🥇 Equivariant Music Transformer 8.6/10 | 创新 1.4/2 | 严谨 1.5/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

 · 更新于 2026-09-05 · 约 23 分钟 · 4884 字 阅读 →
研究条目

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

📄 Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition 标签:#音视频理解 #多模态模型 #音频理解 #Transformer #模型评估 6.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Suraj Kumar(未说明) 通讯作者:Soumi Chattopadhayay(Indian Institute of Technology Indore) 作者列表:Suraj Kumar(未说明)、Mohnish Raj(未说明)、Soumi Chattopadhayay(Indian Institute of Technology Indore)、Chandranath Adak(未说明)、Ayan Dutta(未说明) 💡 毒舌点评 PRIME 采用闭环“诊断-修复-重评估”范式处理多模态不可靠问题,想法有洞察且模块设计完整。但训练高度依赖合成 corruption,与真实世界退化分布的一致性完全未经验证,这削弱了可靠性估计在真实场景中的说服力。在只包含两个中小规模对话数据集的基准上验证,缺少对大规模、流式或极端缺失场景的泛化性证据,让人质疑方法的可扩展性。此外,大量关键训练超参数和实现细节的缺失使得复现困难重重。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 419 字 阅读 →
研究条目

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

📄 Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning 标签:#音视频问答 #多模态模型 #音频理解 #Transformer #模型评估 4.7/10 | 创新 0.8/2 | 严谨 0.7/1.5 | 实验 0.2/1.5 | 清晰 0.7/1 | 影响 0.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 4.7/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频问答 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Sahil Al Farib(未说明机构) 通讯作者:未说明 作者列表:Sahil Al Farib(未说明机构)、Momota Ahsana Meem(未说明机构)、Sheikh Redwanul Islam(未说明机构)、Md. Tanvir Raihan(未说明机构) 💡 毒舌点评 论文试图将证据锚定引入多模态教育知识图谱构建,审计性设计在逻辑上动机是好的。但实验部分仅有3个视频和3条查询,且无任何基线对比,这使其所有结论都停留在“初步探索”层面,远未达到顶会论文的最低实证标准。此外,核心任务是对讲座视频的结构化知识抽取与问答,音频信号处理仅作为ASR工具被被动调用,该工作与语音/音频领域核心问题关联极弱,难以在本领域产生影响力。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 290 字 阅读 →
研究条目

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

📄 Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication 标签:#音视频问答 #多模态模型 #音频理解 #Transformer #模型评估 6.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Joohyuk Park(POSTECH, Department of Electrical Engineering) 通讯作者:Yo-Seb Jeon(POSTECH, Department of Electrical Engineering)、Jihong Park(Singapore University of Technology and Design) 作者列表:Joohyuk Park(POSTECH, Department of Electrical Engineering)、Junyong Shin(POSTECH, Department of Electrical Engineering)、Yongjeong Oh(Singapore University of Technology and Design)、Jihong Park(Singapore University of Technology and Design)、Yo-Seb Jeon(POSTECH, Department of Electrical Engineering) 💡 毒舌点评 亮点在于将无线通信中的 germ-grain 模型巧妙地迁移到了多模态 token 的几何对齐上,这个跨领域类比很有洞察力,且方法在 VQA/AVQA 任务上相比简单基线有显著提升。短板也很明显:整个框架严重依赖一个未验证的多查询共识假设(Hypothesis 1),其对感知任务性能的决定性作用被当作公理使用,缺乏深入的因果分析;更关键的是,论文研究多模态通信任务,但仅测试了视觉导向的 QA,完全避开了音频领域的主流 benchmark(如声源定位、音频场景分类),其"影响力"评估仅凭两个基准支撑,说服力不足。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 488 字 阅读 →
研究条目

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

📄 Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning 标签:#音频理解 #强化学习 #多模态模型 #后训练 #Transformer 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #强化学习 | #多模态模型 #后训练 | arxiv 👥 作者与机构 第一作者:Fangxu Yu(University of Maryland, College Park) 通讯作者:未说明 作者列表:Fangxu Yu(University of Maryland, College Park)、Tao Feng(University of Illinois Urbana-Champaign)、Dehai Min(University of Illinois Chicago)、Zinan Lin(Microsoft Research)、Weijia Xu(Microsoft Research)、Michael Xu(Microsoft Research)、Philip S. Yu(University of Illinois Chicago)、Ge Liu(University of Illinois Urbana-Champaign)、Tianyi Zhou(MBZUAI) 💡 毒舌点评 这篇论文把“进化评分标准”引入音频推理的RL训练,想法确实漂亮,用模型自己的rollout来动态生成新标准,解决了静态奖励信号饱和的老大难问题。实验数据看着也扎实,在多个基准上刷到了同级最优。但整个框架本质上是在“用魔法打败魔法”,把核心的评判权交给了一个外部的、可能更黑盒的大模型,导致整个训练信号链路的健壮性存疑。作者虽承认这一点,但分析浅尝辄止,没有深入挖掘这种依赖可能带来的系统性偏差和失效模式,这让方法的可靠性打了个问号。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 389 字 阅读 →
研究条目

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

📄 Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations 标签:#音视频理解 #多模态模型 #鲁棒性 #音频理解 #Transformer 6.2/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #鲁棒性 #音频理解 | arxiv 👥 作者与机构 第一作者:Chunlei Meng(复旦大学) 通讯作者:Chun Ouyang(复旦大学) 作者列表:Chunlei Meng(复旦大学)、Jacqueline J. Pang(未说明)、Pengbin Feng(未说明)、Zhenyu Yu(未说明)、Chun Ouyang(复旦大学)、Zhongxue Gan(复旦大学) 💡 毒舌点评 论文对不完整多模态情感分析中的模态可靠性问题给出了清晰且动机良好的诊断,显式建模的思路具有洞察力;实验对比全面,消融分析扎实。然而,可靠性代理目标完全由模型自身预测派生,存在循环论证风险,且代码与权重完全未公开,使得这一框架的真实泛用性和实现细节存疑——如果不能开源,该工作的工程参考价值将大打折扣。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 716 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-05

语音/音乐/音频论文速递 2026-08-05 共分析 32 篇论文 ⚡ 今日概览 📥 抓取 32 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 6篇 ██████ #语音合成 3篇 ███ #音频生成 3篇 ███ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #多任务学习 1篇 █ 📊 论文评分排行榜(32 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8分 前25% 系统技术报告 #音乐转录 🥈 Efficient Audio Enhancement with a Differentiable Psych 8.2分 前25% 系统技术报告 #音频超分辨 🥉 GROW: Group-Relative Advantage-Weighted On-Policy Reinf 8.0分 前25% 方法研究 #语音合成 4. Reinforcement Learning with Evolving Rubrics as Rewards 7.6分 前25% 方法研究 #音频理解 5. Cross-cultural evaluation of taste-sound correspondence 7.5分 前25% 应用研究 #音乐理解 6. dots.tts.edit: Precisely Controlled Speech Editing with 7.4分 前50% 模型报告 #语音编辑 7. Anomalous Sound Detection Meets Noise-Aware Self-Superv 7.2分 前50% 方法研究 #音频事件检测 8. Towards More Expressive Spoken LLMs: Fine-Grained Inten 7.2分 前50% 方法研究 #语音交互 9. CLASVS: Continuous-Latent Autoregression for Melody-Pre 7.1分 前50% 方法研究 #自回归模型 10. Music Restoration via Latent Operator Optimization and 7.0分 前50% 方法研究 #音频修复 11. DDSynth-RL: Audio Synthesizer Inversion via Discrete Di 7.0分 前50% 方法研究 #音频生成 12. Language-Specialized Multi-Teacher On-Policy Distillati 6.9分 前50% 方法研究 #语音识别 13. AI-Based Sound Effect Generation: A Narrative Review of 6.9分 前50% 综述 #音频生成 14. Hear to See: Discerning Stateful Listening for Audio-Vi 6.8分 前50% 方法研究 #音频理解 15. On the Geometry of Music Bandwidth Extension in Latent 6.7分 前50% 方法研究 #音频理解 16. Learning Music Style for Piano Arrangement Through Cros 6.6分 前50% 方法研究 #音乐生成 17. Adaptive Modality Reliability Diagnosis and Restoration 6.4分 前50% 方法研究 #音视频理解 18. Latent Softmax for Data-Efficient Phoneme-Based Multili 6.3分 前50% 方法研究 #语音识别 19. Echo-Aware Modulation for Compact-Latent Frequency-Time 6.3分 前50% 方法研究 #语音增强 20. Geometric Cross-Modal Token Selection for Latency-Const 6.2分 前50% 方法研究 #音视频问答 21. Rethinking Modality Reliability in Multimodal Sentiment 6.2分 前50% 方法研究 #音视频理解 22. Towards Real-world Environment-aware Zero-shot Text-to- 6.1分 前50% 方法研究 #语音合成 23. MeloCodec: Harnessing Melodic Priors for High-Fidelity 6.1分 前50% 方法研究 #歌唱生成 24. Speaker Verification Under Real Classroom Conditions fo 5.7分 前50% 应用研究 #说话人验证 25. Band-Count Dense Modal Estimation with Fixed-Frequency 5.6分 前50% 方法研究 #音频理解 26. Simulation-Based Plate-Reverb Parameter Estimation from 5.5分 前50% 方法研究 #音频理解 27. MEMS Microphones as Ultrasonic Transducers: Nonlinear E 5.5分 前50% 系统技术报告 #音频生成 28. Beyond One-Size-Fits-All: Personalized and Culturally A 5.2分 后50% 方法研究 #语音合成 29. Deep Learning-Based Active Trim Panels for Enhanced Air 5.0分 后50% 方法研究 #多任务学习 30. Calliphony: A Calligraphy-Driven Interface for Real-Tim 5.0分 后50% 系统技术报告 #音乐生成 31. Evidence-Grounded Multimodal Knowledge Graph Constructi 4.7分 后50% 系统技术报告 #音视频问答 32. What Is Sonification? Toward a Philosophy of Sonificati 3.8分 后50% 理论研究 #音频理解 📋 论文列表 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

 · 更新于 2026-09-05 · 约 24 分钟 · 4991 字 阅读 →
研究条目

AcoustiTrace: When Plausible Sound Violates Physics

📄 AcoustiTrace: When Plausible Sound Violates Physics 标签:#音视频生成 #多模态模型 #音视频理解 #基准测试 #扩散模型 6.9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #多模态模型 | #音视频理解 #基准测试 | arxiv 👥 作者与机构 第一作者:Shiyang Li (中科院的机构1和2) 通讯作者:Changqing Zou (中科院的机构1和6) 作者列表:Shiyang Li (机构1,2), Yuewen Cao (机构2), Yihao Liu (机构2), Yuandong Pu (机构3), Baochang Zhang (机构4), Xiaofei Li (机构5), Changqing Zou (机构1,6) 机构说明:论文未明确给出机构全称,仅以数字标记了6个不同机构。 💡 毒舌点评 AcoustiTrace以其声学物理过程的三阶段八维度拆解,为现有音视频生成评估中“听着真但物理假”的棘手问题,提供了一套迄今最具结构感的诊断工具箱。它细致、体面、有洞见。然而,当这个基准的全部数据、验证过的评估器以及精心设计的提示套件都被作者们揣在兜里,拒绝开源时,它就从社区的公共基础设施退化成了一场自娱自乐的内部演习。再精巧的“手术刀”,若只允许少数人使用,其价值也大打折扣。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 434 字 阅读 →
研究条目

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

📄 Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification 标签:#音频分类 #预训练 #基准测试 #多模态模型 #音频理解 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音频分类 | #预训练 | #基准测试 #多模态模型 | arxiv 👥 作者与机构 第一作者:Sajjad Abdoli(Perle)、Ghassan Al-Sumaidaee(Perle)(共同第一作者,按字母序排序) 通讯作者:Sajjad Abdoli(Perle)、Ghassan Al-Sumaidaee(Perle) 作者列表:Sajjad Abdoli(Perle)、Ghassan Al-Sumaidaee(Perle)、Ahmad ElShiekh(Perle)、Ahmed Rashad(Perle) 💡 毒舌点评 论文聪明地用"分层benchmark"避开了让关公战秦琼的陷阱,实验设计很巧,想法也足够落地。但说到底,这就是在一个没公开的小数据集上跑了一遍现有模型,然后做了些推理链的统计描述。思维链分析部分确实有新发现,但"策略-准确率相关性纯属混杂"这个核心结论更像是给基准测试找补的饭后甜点,没有深入建立因果模型。工程指导价值高于学术贡献,像一份扎实的内部技术报告。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 403 字 阅读 →
研究条目

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

📄 CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation 标签:#音视频生成 #多模态模型 #基准测试 #数据集 #模型评估 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.5/1.5 ✅ 7.2/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Xianjing Han(Nanyang Technological University) 通讯作者:Bin Zhu(Singapore Management University, binzhu@smu.edu.sg) 作者列表:Xianjing Han(Nanyang Technological University)、Yuhan Su(Centrale Supélec)、Yang Deng(Singapore Management University)、Dong Ma(University of Cambridge)、Wee Peng Tay(Nanyang Technological University)、Bin Zhu(Singapore Management University, 通讯作者) 💡 毒舌点评 本文准确命中了当前T2V评估的一个盲区:文化理解,并构建了一个多维度、覆盖12国的文化视频基准。论文的设计思路清晰,问题定义精准。然而,作为一个纯粹的CV/多模态生成评测工作,它对语音/音乐/音频社区的直接贡献微乎其微,音频评估仅作为极小附属部分存在。此外,评估的可靠性高度依赖MLLM与少数标注者,缺乏对MLLM自身文化偏见的反思,导致基准和评估工具的权威性都需打上问号。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 473 字 阅读 →
研究条目

SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching

📄 SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching 标签:#语音分离 #CNN #多模态模型 #助听器 #低资源 7.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音分离 | #CNN | #多模态模型 #助听器 | arxiv 👥 作者与机构 第一作者:Xuefei Wang(南方科技大学电子与电气工程系) 通讯作者:Fei Chen(南方科技大学电子与电气工程系) 作者列表:Xuefei Wang(南方科技大学电子与电气工程系)、Ximin Chen(首都医科大学生物医学工程学院)、Yuting Ding(未说明机构)、Chunlin Li(未说明机构)、Fei Chen(南方科技大学电子与电气工程系) 💡 毒舌点评 这篇工作瞄准了EEG引导说话人提取中“试次内注意力切换”这个真实但棘手的动态难题,提出了一个软门控加延迟补偿的组合方案,想法是好的。但做出来的结果切换延迟2.04秒,仍停留在秒级,远谈不上“实时神经操控”,而且整套东西跑在仅18人自建数据上,代码没放、关键超参数表是空的,消融实验也缺了点统计检验。整体看着像个概念验证,离顶会solid work还差口气。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 403 字 阅读 →
研究条目

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

📄 Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds 标签:#音频生成 #多模态模型 #空间音频 #零样本 #音频理解 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #多模态模型 | #空间音频 #零样本 | arxiv 👥 作者与机构 第一作者:Masaki Yoshida(北海道大学) 通讯作者:未说明 作者列表:Masaki Yoshida(北海道大学)、Ren Togo(北海道大学)、Takahiro Ogawa(北海道大学)、Miki Haseyama(北海道大学) 💡 毒舌点评 论文定义了一个新颖且实用的任务——为预训练的3DGS世界自动生成空间一致的音景,并用一套巧妙的“无训练”流水线解决了跨视角实例关联这一核心难题,Gaussian Set Matching的设计具有洞察力。然而,整篇工作在本质上仍是对多个成熟基础模型(VLM、SAM、T2A)的工程组合,缺乏对生成声音本身与视觉场景之间细粒度语义对齐的深度建模,且提出的评价指标在真值依赖和语义绑定上存在明显空白,难以支撑“高质量音景生成”这一更高级别声明。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 695 字 阅读 →
研究条目

SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces

📄 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces 标签:#语音识别 #CNN #数据集 #多模态模型 #基准测试 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.3/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音识别 | #CNN | #数据集 #多模态模型 | arxiv 👥 作者与机构 第一作者:Ruidong Zhang(Cornell University) 通讯作者:未说明 作者列表:Ruidong Zhang(Cornell University)、Jiacheng Liu(Cornell University)、François Guimbretière(Cornell University)、Cheng Zhang(Cornell University) 💡 毒舌点评 这篇论文为可穿戴无声语音接口(SSI)领域带来了期盼已久的"弹药"——首个大规模、开放词汇、三模态数据集,将可穿戴SSI从"几十个词的玩具"推到了"有可能对话"的起跑线上。基线26.3%的WER虽远非可用,但足以证明此路可通。然而,单一说话人、安静环境、无语言模型的设定,让"开放词汇"这块招牌含金量打折——我们看到的更多是"同分布下的模式匹配"而非"真正的词汇泛化"。此外,硬件故障导致的单声道数据混入,给本应干净的基线实验埋了颗不大不小的雷。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 237 字 阅读 →
研究条目

Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art

📄 Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art 标签:#RNN #多模态模型 #实时处理 #音频理解 #Transformer 5.7/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 📝 5.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #RNN | #Transformer | #多模态模型 #实时处理 | arxiv 👥 作者与机构 第一作者:Luciano Ciamarone(independent researcher) 第二作者:Dora Motèque(independent researcher) 第三作者/通讯作者:Marco Giordano(Department of Information Engineering, Computer Science and Mathematics (DISIM), University of L’Aquila) 💡 毒舌点评 论文将触觉绘画、电容传感、CNN-LSTM技术与网络艺术进行了整合,工程管线完整,代码开源。但作为一篇投递至Organised Sound(论文明确目标为该期刊"Embedding Algorithms"特辑)的艺术工程论文,全篇缺乏任何定量评估、用户研究或与同类系统的公平对比,声称的“引导”“幽灵协作者”等现象仅依赖于展览中的非正式观察与日志初步描述,论文自身也明确承认“未进行正式分析”且“不作出明确声明”。这种声明与证据的巨大落差,使得其核心贡献仍停留在设计理念与工程蓝图层面。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 234 字 阅读 →
研究条目

Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior

📄 Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior 标签:#音频分类 #多模态模型 #音频理解 #Transformer #模型评估 6.3/10 | 创新 0.8/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频分类 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者/通讯作者:Ehsan Yaghoubi(Weihenstephan-Triesdorf University of Applied Sciences, Department of Sustainable Agricultural and Energy Systems) 作者列表:Ehsan Yaghoubi, Florian Haselbeck(均为同一机构) 💡 毒舌点评 这项工作精准地抓住了声学监测中的一个实际痛点—在非受控环境下,波形和语谱图两种互补表征的可靠性会动态变化,并用一个干净的贝叶斯融合方案解决了静态融合中噪声被传播或放大的问题。但整体技术方案是COLD Fusion框架在动物声学领域的直接适配与移植,核心融合机制缺乏原创性理论突破。实验在两个小规模数据集上展示了相对改善,但完全缺失与近年更强音频预训练模型(如AST、AVES、HuBERT等)的对比,使方法的绝对竞争力存疑。对于NeurIPS/ICML这类方法导向的会议,这种应用迁移工作的技术贡献相当有限。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 430 字 阅读 →
研究条目

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

📄 DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs 标签:#音视频语音识别 #多模态模型 #大语言模型 #音频理解 #Transformer 7.4/10 | 创新 1.8/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频语音识别 | #多模态模型 | #大语言模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Ziwei Cheng(东北大学软件学院,辽宁沈阳) 通讯作者:Zhenhua Tan(东北大学软件学院,辽宁沈阳) 作者列表:Ziwei Cheng(东北大学软件学院)、Zhenhua Tan(东北大学软件学院)、Zhuomin Zhu(东北大学软件学院) 💡 毒舌点评 这篇论文将音视频融合从“一次拼接”推到了“多轮迭代+自适应修复”的Level,motivation清晰且消融实验扎实,在0.68% WER和极端噪声下的提升颇有说服力。然而,作者只在单一的babble噪声上炫耀鲁棒性,不对称权重0.7/0.3和旋转矩阵的启发式选择几乎没说清楚原理,而且一丁点代码和模型都没放出来,复现只能靠“祈祷”。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 668 字 阅读 →