Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

📄 Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox #语音情感识别 #语音识别 #多模态模型 ✅ 6.8/10 | 前50% | #语音情感识别 | #语音识别 | #多模态模型 | arxiv 学术质量 4.5/7 | 影响力 1.8/2 | 可复现性 0.5/2 | 置信度 中 👥 作者与机构 作者:Jiacheng Pang (南加州大学 USC),Ashutosh Chaubey (MIT),Mohammad Soleymani (南加州大学 USC) 机构:信息科学研究所 (USC),计算机科学与人工智能实验室 (CSAIL, MIT) 💡 毒舌点评 合成数据的“温室花朵”效应:VoxParadox 基准虽然精巧,但完全依赖 TTS 合成数据。论文声称其设计“由构造保证”,但这恰恰是它最大的软肋。模型在这个精心控制的对抗性环境中取得的任何提升,在面对真实世界中充满噪声、歧义、文化背景和微小语气变化的“言不由衷”时,可能都只是镜花水月。生态效度(ecological validity)的短板,使得方法的实用价值大打折扣。 “灵丹妙药”式的改进声明:论文将 PCLM+DPO 描述为解决瓶颈的有效方案,但证据链并不完整。在一个模型(Audio Flamingo 3)上取得巨大成功,远不足以证明该方案的普适性。论文未报告其他被评估模型(如 SALMONN, Qwen-Audio 等)的改进情况,这使得方法的“通用性”声明显得仓促。是方法真的巧妙,还是仅仅在 Audio Flamingo 3 的特定架构上“过拟合”了? “黑箱”模块缺乏透视:PCLM 被描述为“自适应地组合多层信息”,但其内部机制如同黑箱。论文没有提供任何可视化或定量分析,展示在不同任务或输入下,模型究竟如何、以及为何选择了特定的音频层组合。这种“Prompt-Conditioned”的承诺,在缺乏可解释性分析的情况下,说服力有限。 消融研究的缺失:将 PCLM 和 DPO 打包提出,却没有进行充分的消融实验,这是方法论上的重大遗漏。我们不知道性能提升有多少归功于表征质量的改善(PCLM),有多少归功于偏好引导(DPO),两者的协同效应究竟如何。这使得方法的贡献难以被准确归因和理解。 实验对比的模糊性:虽然声称评估了“多种”Audio LLMs,但 Table 1 的细节在提供的文本中不完整。审稿人需要清晰地看到所有基线模型在所有任务上的具体数字,以判断 VoxParadox 是否真的暴露了模型的共性问题,以及所提方法是否在所有情况下都有效。泛泛的“显著提升”结论,缺乏足够的数据支撑。 📌 核心摘要 本文针对 Audio LLMs 在副语言信息理解上的不足(过度依赖文本转录而非声学线索),提出了系统性的分析、评估与改进方案。首先,设计了对抗性基准 VoxParadox(2000 样本,10 类任务),通过控制语音合成制造转录与声学风格的矛盾,以量化模型的模态偏见。实验表明,模型普遍在声学真值上准确率低(AccGT),却对文本暗示的错误标签高度一致(ALA)。其次,通过层级探测(layer-wise probing)分析瓶颈,发现副语言信息在编码器深层及编码器-LLM 接口处可能退化,且即使信息存在于音频 token 中,LLM 也常忽略。为解决此问题,提出 Prompt-Conditioned Layer Mixer(PCLM)以自适应融合多层音频表征,并结合 Direct Preference Optimization(DPO)训练模型偏好声学证据。在 Audio Flamingo 3 上,该方法将 VoxParadox 准确率从 17.40% 提升至 65.20%,MMSU 副语言子集从 37.74% 提升至 54.78%。 ...

2026-05-28 · 更新于 2026-07-31 · 3 min · 554 words

EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

📄 EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction #多模态模型 #多任务学习 🔥 8/10 | 前50% | #多模态模型 | #多任务学习 | arxiv 学术质量 5.1/7 | 影响力 1.4/2 | 可复现性 1.5/2 | 置信度 高 👥 作者与机构 作者:Chong Jing, Zitong Lan, Junan Zhang, Zhizheng Wu 机构:香港中文大学(深圳)(Chong Jing, Junan Zhang, Zhizheng Wu),宾夕法尼亚大学(Zitong Lan) 💡 毒舌点评 这篇工作在工程应用上做得扎实,但理论原创性的天花板清晰可见。它成功地将视觉领域的“交替注意力”机制“移植”到了音频这个新场景,并辅以一个动机良好的物理调制模块,最终在特定任务上取得了SOTA。这种“旧瓶装新酒”的范式在应用层屡试不爽,但作为顶会论文,其核心贡献的“新颖性”需要打折。更令人遗憾的是,作为一篇同时期的工作,却完全回避了与最直接竞争对手FLAC的正面比较(仅以“并发工作”一笔带过),这在实验对比的完整性上留下了无法回避的短板。论文的强项在于细致的消融实验,特别是掩码探针实验设计巧妙,试图解释模型行为,这比单纯刷分更有价值。然而,写作上的细节疏忽(图表引用混乱)和某些技术描述的含糊(如DiT块的具体操作)拉低了整体的精致感。总的来说,这是一篇扎实的系统工作(systems paper),而非一篇具有颠覆性思想的理论突破。 📌 核心摘要 本文针对从稀疏观测预测新视角房间脉冲响应(RIR)的逆问题,提出了EigeNet框架。该框架旨在解决现有方法在多视角时空关系建模不足和物理可解释性缺失两大瓶颈。核心创新包括:1)提出交叉视角交替注意力Transformer(CVAT),交替进行视角内局部和跨视角全局注意力,以显式建模局部声学结构和全局空间关系;2)设计几何信息调制模块与基于7倍频带功率谱的辅助损失,显式建立几何特征与RIR功率谱的关联,将单任务转化为多任务学习。在模拟数据集AcousticRooms和真实数据集HAA上的实验表明,EigeNet在EDT、C50、T60等指标上显著优于xRIR等基线,并展现出良好的跨模态泛化性和物理可解释性。 🔗 开源详情 代码:https://github.com/FEAfeatherTHER/EigeNet 模型权重:https://github.com/FEAfeatherTHER/EigeNet 数据集: AcousticRooms:论文中声明通过Treble平台获取(https://www.treble.tech/),但未提供直接���预处理数据下载链接。 Hearing-Anything-Anywhere (HAA):论文中未提供任何公开获取链接。 Demo:论文中未提及。 复现材料:未提供单独的复现材料包(如训练脚本、配置文件)。复现依赖于上述GitHub仓库的代码以及自行获取的数据集。 🏗️ 方法概述和架构 EigeNet框架旨在利用稀疏的参考视角RIR及其对应的几何信息,预测目标新视角的RIR。其整体架构如图1所示,包含编码、调制、核心Transformer处理和解码预测四个主要阶段。 问题形式化与输入: 给定\(N\)个参考视角,每个视角\(i\)包含:源位置\(tx_i \in \mathbb{R}^3\),接收器位置(设为坐标原点)\(rx_i \in \mathbb{R}^3\),以及对应的RIR信号\(h_i \in \mathbb{R}^{1 \times L}\)。同时,为目标视角(索引为0)提供接收器位置处的全景深度图\(D\)。目标是估计目标视角在\(tx_0\)处的RIR \(h_0\)。 ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 403 words

From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection

📄 From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection 🔥 8.7/10 | 前50% | #语音伪造检测 | arxiv 学术质量 6.4/7 | 影响力 1.5/2 | 可复现性 0.8/2 | 置信度 高 👥 作者与机构 作者:Ke Liu, Jiwei Wei, Wenyu Zhang, Shuchang Zhou, Ruikun Chai, Yutao Dai, Chaoning Zhang, Yang Yang 机构:未明确说明具体单位,根据作者姓名推测可能来自中国的高校或研究机构。 💡 毒舌点评 这篇论文敏锐地抓住了当前音频-视觉深度伪造检测中的一个关键盲区——“唱歌”场景。当所有方法都盯着“说话”时,唱歌带来的节奏变化和更丰富的面部表情确实让现有的唇音同步检测器“露馅”。作者们提供了新的数据集(SHDF)和框架(T-AVFD),实验结果也足够亮眼,尤其是在唱歌数据集上把基线方法“按在地上摩擦”。但是,那个手动设置的调制向量α像是一根拐杖,虽然好用,但让整个自适应融合的优雅性打了折扣。开源只给项目页面,不给代码,这在顶会审稿人眼里属于“诚意不足”。总的来说,这是一篇扎实的“填坑”论文,问题明确,方案有效,但离“完美”还有几步关键的台阶没迈上去。 📌 核心摘要 本文针对音频-视觉深度伪造检测中从“说话”到“唱歌”场景转换所带来的域偏移挑战。作者首先通过域偏移诊断(MMD²)和分数分布重叠分析,定量证明了唱歌场景对现有检测器构成巨大挑战。为此,他们构建了首个唱歌场景的伪造检测数据集SHDF。为了应对跨场景泛化难题,提出了一个无监督的文本引导框架T-AVFD,该框架仅使用真实说话视频训练,通过面部真实性模式学习器(FAPL)和多模态差分权重学习模块(MMDWL)联合建模面部语义和唇音一致性,在多个说话数据集和SHDF上实现了显著优于基线方法的泛化性能和鲁棒性。 🔗 开源详情 代码:论文中提供了项目主页链接 https://LiuKe3068LikWix.github.io/SingingHead-DeepFake/,但未明确提供官方代码仓库的直接链接。 模型权重:未提及模型权重的下载链接。 数据集: 数据集名称:Singing Head DeepFake (SHDF)。 获取链接/开源协议:论文未提供数据集直接下载链接。真实视频部分承诺提供YouTube链接(见附录A.2),伪造视频部分计划通过生成管道提供。数据集仅用于学术研究。 Demo:未提及在线演示链接。 复现材料:论文提供了详细的训练配置(优化器:Adam,学习率:9×10⁻⁴,批大小:512)、超参数设置和实验设置描述,但未提及提供检查点文件下载。 论文中引用的开源项目: Alpha-CLIP:https://github.com/sunao-phi/AlphaCLIP MEMO:https://github.com/MEMO-Head/MEMO Hallo2:https://github.com/fudan-generative-vision/hallo2 EchoMimic:https://github.com/BadToBest/EchoMimic DreamTalk:https://github.com/DreamTalk-AI/DreamTalk Sonics:论文中引用,但未提供具体链接。 AVAD:https://github.com/MauriceFeng/AVAD AVH-Align:https://github.com/Smeu-Alexandru/AVH-Align 🏗️ 方法概述和架构 T-AVFD框架旨在学习场景无关的伪造检测特征,其核心架构包含两个模块,仅使用真实说话视频进行训练。 ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 384 words

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

📄 Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini #多模态模型 #对比学习 #语音识别 ✅ 7.9/10 | 前25% | #语音识别 | #对比学习 | #多模态模型 | arxiv 学术质量 5.9/7 | 影响力 1.5/2 | 可复现性 0.5/2 | 置信度 高 👥 作者与机构 Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini(共81位作者)。 ...

2026-05-28 · 更新于 2026-07-31 · 3 min · 634 words

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

📄 HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities ✅ 7.5/10 | 后50% | #Transformer | arxiv 学术质量 5.5/7 | 影响力 0.5/2 | 可复现性 1.5/2 | 置信度 高 👥 作者与机构 Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura National Institute of Advanced Industrial Science and Technology (AIST) 📌 核心摘要 本文提出了HOME-KGQA,一个基于家庭日常活动多模态知识图谱的问答基准数据集。该数据集旨在弥补现有KGQA基准在百科知识偏见、单一模态和缺乏细粒度时空数据方面的不足,以更好地服务于具身智能等真实世界场景。数据集构建基于VHAKG多模态知识图谱,通过马尔可夫链概率生成了包含超过1.5亿三元组的100天情景知识图谱。问题-SPARQL对通过模板与LLM结合生成,并利用检索增强生成方法进行改写。实验在i.i.d.和组合泛化两种设置下进行,评估了直接文本到SPARQL(零样本、少样本、微调)和基于交互智能体的KBQA两类方法。结果表明,HOME-KGQA对现有方法构成了比传统基准大得多的挑战,特别是在问题改写和组合泛化场景下,模型性能显著下降,突显了在真实日常活动场景中部署KGQA系统的困难。 🔗 开源详情 代码:https://github.com/aistairc/home-kgqa (提供情景知识图谱构建、问题-SPARQL生成、问题改写脚本) 模型权重:未提供直接下载链接。实验使用了gpt-4o-mini-2024-07-18(需通过OpenAI API访问)和Llama-3.1-8B-Instruct(Meta开源模型,权重可通过HuggingFace等获取,但论文未提供具体链接)。 数据集:HOME-KGQA数据集。获取链接与代码仓库相同:https://github.com/aistairc/home-kgqa。论文未说明具体开源协议。 Demo:未提及在线演示链接。 复现材料:论文公开了用于构建情景知识图谱、生成问题-SPARQL对以及进行问题改写的所有脚本代码。未单独提供训练配置文件或模型检查点的下载链接。 论文中引用的开源项目: VirtualHome:用于生成合成数据的模拟器。论文未提供链接,公开项目为 https://github.com/xnpeng/VirtualHome。 VHAKG:多模态知识图谱构建研究(Egami et al., 2024)。论文未提供该项目的具体链接。 Interactive-KBQA:交互式知识图谱问答方法(Xiong et al., 2024)。论文未提供该项目的具体链接。 OpenAI API (gpt-4o-mini):用于问题生成和实验的模型服务。论文未提供项目链接。 🏗️ 方法概述和架构 HOME-KGQA的构建与评估方法涵盖三个核心阶段:情景知识图谱构建、问答数据集生成以及模型评估实验。 ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 334 words

I Hear, Therefore I Trust: A Socio-Technical Investigation of Humans as Synthetic Speech Detectors

📄 I Hear, Therefore I Trust: A Socio-Technical Investigation of Humans as Synthetic Speech Detectors #语音合成 ✅ 6.5/10 | 前50% | #语音合成 | #语音合成 | arxiv 学术质量 4.3/7 | 影响力 1.7/2 | 可复现性 0.5/2 | 置信度 中 👥 作者与机构 论文作者为 Lelia Erscoi 和 Tomi Kinnunen,隶属于芬兰东芬兰大学计算语音组。 💡 毒舌点评 这篇论文试图将合成语音检测从纯粹的技术挑战扩展到社会技术语境,想法值得肯定。然而,它读起来更像一篇心理学或人机交互领域的实验报告,其“社会技术”框架下的核心实验操纵(三种信任线索)均未产生显著效果,这严重削弱了其理论贡献。实验设计本身存在根本性缺陷:在一个明确告知用户“检测合成语音”的任务中,探讨“信任”如何影响判断,无异于在一场明确的反恐演习中研究路人对可疑包裹的自然反应——其生态效度值得怀疑。方法上,47人的样本量、20个刺激、单一TTS模型生成策略,很难支撑其宣称的“生态效度较高”的结论。论文最大的价值在于实证了普通人在受控条件下对当前高质量合成语音的检测能力低下,但这几乎是一个已知事实(文献综述已大量引用),而其试图探索的“社会技术”维度并未提供新的洞见。开源信息几乎为零,复现性很差。 📌 核心摘要 本研究是一项关于人类检测合成语音能力的实证研究,属于感知心理学与人机交互的交叉领域。论文将合成语音检测置于一个“社会技术信任”框架下,提出环境上下文(如指令框架、情感启动、来源标注)是影响人类判断的关键但被忽视的维度。研究采用在线实验(N=47),设计了一种“合成语音定位任务”:参与者在聆听混有真实、完全合成和部分合成语音的20段音频时,需标注出可疑片段。三种信任线索作为自变量进行操纵。主要发现包括:1)话语类型(真实/部分合成/完全合成)是检测准确性的决定性因素;2)三种信任线索对检测准确性均无显著主效应;3)参与者的主观质量评分能区分语音类型,但与客观检测行为脱节;4)参与者表现出系统性过度自信。结论指出,期望普通用户在复杂社会技术环境中独立、可靠地检测合成语音是不现实的。 🔗 开源详情 代码:未提及。论文使用Python和Streamlit开发了实验平台,但未公开实验代码或分析代码。 模型权重:未提及。论文未提供其实验所涉及的任何模型的权重。 数据集: 论文主要使用 LlamaPartialSpoof 数据集,并提供了指向其生成所用TTS模型(LJ JETS等)的GitHub/HuggingFace链接。数据集本身的具体下载链接未直接提供,但引用了相关工作。 论文引用了 LibriTTS 数据集(作为LlamaPartialSpoof的说话人来源),但未提供其直接下载链接。 论文引用了 Open Affective Standardized Image Set (OASIS) 用于情感启动,提供了引用信息。 论文引用了 International Soundscape Database 用于环境音,提供了引用信息。 Demo:未提及。 复现材料:未提及。论文详细描述了方法,但未提供实验材料、配置或数据的下载链接。 论文中引用的开源项目: LJ JETS: https://github.com/espnet/espnet/tree/master/egs2/ljspeech/tts1 YourTTS: https://github.com/coqui-ai/TTS/ XTTS V2: https://huggingface.co/coqui/XTTS-v2 GPT-SoVITS: https://huggingface.co/lj1995/GPT-SoVITS/tree/main CosyVoice: https://github.com/FunAudioLLM/CosyVoice ElevenLabs: https://elevenlabs.io (作为商业服务引用) Streamlit: https://streamlit.io 🏗️ 方法概述和架构 本研究的核心方法是设计并实施一项人类感知实验,以探究社会技术因素对合成语音检测行为的影响。其架构可分为五个相互关联的组件: ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 405 words

LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

📄 LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation #音频生成 ✅ 7/10 | 前50% | #语音合成 | #音频生成 | arxiv 学术质量 4.5/7 | 影响力 1/2 | 可复现性 1.5/2 | 置信度 高 👥 作者与机构 第一作者 Zhisheng Zhang 及主要作者 Xiang Li 来自清华大学深圳国际研究生院,其中脚注说明Xiang Li的工作是在ModelBest Inc.实习期间完成的(Work conducted while interning at ModelBest.)。所有作者共同隶属于清华大学深圳国际研究生院和ModelBest Inc.。 💡 毒舌点评 论文解决的问题(如何统一音频理解与生成表示)是领域内热点,但核心创新(将高维语义表示压缩至128维)听起来有些“老生常谈”,尽管引入了时间关系损失。 “低维”带来的优势(降低下游DiT模型负担)在理论上合理,但实验部分存在“选择性比较”:与DashengTokenizer对比时,仅展示其512维DiT(215M参数)表现不佳,而自己使用相同配置(208M参数)表现更好,这有点“田忌赛马”。为何不展示DashengTokenizer在更大参数(975M)配置下已经能获得较好甚至更优性能(例如TTS WER 3.652 vs. 3.030)的事实? 论文声称解决了“理解”与“生成”的统一,但从结果看,LoSATok在理解任务(59.30平均分)上远低于其语义基线(MiDashengLM 75.48)和DashengTokenizer(74.67),也低于Ming-UniAudio(63.27)。这到底是“统一”还是“在理解上妥协以换取生成的微小优势”?结论过于乐观。 消融实验(Table 5)表明去掉低维语义监督(w/o \(\\mathcal{L}_{L}\))后理解能力几乎崩塌(ESC从91.25降至47.25),这强烈暗示整个框架的成功极其依赖SemBo提供的“教师信号”。这更像是一个“知识蒸馏”应用,而非一个独立、稳健的表示学习方案。 重建质量(Table 4)明显落后于专精重建的模型(如UniFlow-Audio, SeedTTS-EN PESQ 3.833 vs. 3.051)。论文轻描淡写地解释为“有意的权衡”,但在音频领域,重建质量是生成质量的基石,这个牺牲可能被低估了。 📌 核心摘要 现有统一音频分词器将语义与声学信息编码在高维连续潜空间中,增加了下游扩散Transformer(DiT)的建模负担。本文提出LoSATok,一个用于跨域音频理解与生成的低维(128维)语义-声学分词器。首先,通过分析发现预训练高维语义表示(来自MiDashengLM,1280维)存在信息冗余。为此,提出了语义瓶颈(SemBo),通过一个可学习的压缩器-恢复器结构,将高维语义特征压缩到低维空间,并通过重建损失和一种新提出的时间关系损失(对齐高低维特征的时间相似度矩阵)进行监督。基于此低维语义信号,构建了LoSATok分词器,采用双层语义监督策略:使用高维语义表示提供全局监督,同时使用低维语义表示作为直接监督,引导声学编码器学习与语义信息对齐的低维统一表示。实验表明,LoSATok在XARES基准的15个理解任务上取得了有竞争力的平均分(59.30),优于HuBERT和WavLM等SSL模型,但低于高维语义表示。在下游DiT生成任务(TTS, TTM, TTA)上,LoSATok在相同或更小的DiT配置(如512维,208M参数)下,性能持续优于高维DashengTokenizer和纯声学UniFlow-Audio。论文承认其重建保真度不及专精声学分词器,这是为获得更优生成性能与更低维度所做的权衡。 ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 422 words

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

📄 MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation #语音生成 #多模态模型 #基准测试 🔥 9.9/10 | 前25% | #语音生成 | #多模态模型 | #基准测试 | arxiv 学术质量 6.3/7 | 影响力 1.7/2 | 可复现性 1.9/2 | 置信度 高 👥 作者与机构 Haitian Li, Yanghao Zhou, Heyan Huang, Liangji Chen, YiMing Cheng, Xu Liu, Dian Jin, Jiajun Xu, Jingyun Liao, Tian Lan, Ziqin Zhou, Yueying Liu, Yu Bai, Changsen Yuan, Jinxing Zhou, Xian-Ling Mao, Xuefeng Chen, Yousheng Feng。机构包括:上海大学、北京理工大学、上海戏剧学院、清华大学、合肥工业大学、字节跳动(Inkeverse)、阿德莱德大学、北京工业大学、北京人工智能研究院、OpenNLP Lab。 ...

2026-05-28 · 更新于 2026-07-31 · 3 min · 486 words

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation

📄 OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation #音频检索 #对比学习 #知识蒸馏 #参数高效微调 🔥 9.2/10 | 前25% | #音频检索 | #对比学习 | #知识蒸馏 #参数高效微调 | arxiv 学术质量 6.1/7 | 影响力 1.5/2 | 可复现性 1.6/2 | 置信度 高 👥 作者与机构 作者: Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen 机构: Memories.ai Research 💡 毒舌点评 优点:论文精准地指出了一个实际存在但被忽视的问题——统一AVT编码器的联合嵌入\(z_{TVA}\)在训练中未被监督。提出的“融合即教师蒸馏”方法简洁、直观且有效,尤其是\(\mathcal{L}_D\)损失贡献巨大。构建的OmniRetriever-Bench基准填补了评估多模态查询方向的关键空白,对社区有明确贡献。实验设计周密,包括了跨骨干验证、损失权重敏感性分析等,增强了结论的说服力。 缺点:论文在视频-文本任务上并未达到顶尖水平,其主要优势局限于音频相关的检索方向。方法的核心创新在于损失函数的设计,架构上是基于现有骨干(WAVE-7B)的适配器微调,新颖性更多体现在训练范式而非网络结构。提出的新基准测试(OmniRetriever-Bench)仅提供标识符和字幕,未公开媒体文件,限制了其广泛使用和独立验证。部分技术细节,如模态轮换硬负例的具体实现逻辑,描述可进一步清晰化。此外,虽然方法通用,但对语音/音乐领域的直接贡献(如理解语音内容、音乐情感)有限,其影响力更偏向于通用的多模态表示学习。 📌 核心摘要 本文针对现有统一音频-视频-文本(AVT)编码器训练中联合嵌入\(z_{TVA}\)未被监督的关键缺陷,提出了“融合即教师蒸馏”(Fusion-as-Teacher Distillation)训练范式。该方法利用模型自身前向传播产生的、经停止梯度处理的联合嵌入\(z_{TVA}\)作为教师信号,通过InfoNCE损失() \mathcal{L}_D \()指导单模态嵌入(\(z_T, z_V, z_A\))的学习。同时,引入Tuple-InfoNCE损失() \mathcal{L}_T \()配合模态轮换的硬负例,直接监督联合嵌入\(z_{TVA}\),防止其退化。该方法在开源WAVE-7B骨干上实例化为OmniRetriever-7B模型。在六个零样本检索基准测试中,OmniRetriever-7B在Clotho和SoundDescs音频-文本检索任务上显著超越闭源Gemini Embedding 2(R@1提升13.3-18.0),并接近专门音频-文本检索模型(CLAP家族)水平。论文同时发布了首个覆盖全部12个音频-视频-文本检索方向的评估基准OmniRetriever-Bench,并在该基准上取得了SOTA结果。 🔗 开源详情 代码:论文摘要和结论声明将发布代码,但未提供具体链接。 模型权重:论文摘要和结论声明将发布模型权重,但未提供具体链接(如HuggingFace, ModelScope)。 数据集: 训练数据集:论文提及训练数据由以下公开数据集采样构成,且不重新分发训练子集: InternVid (链接) InternVid-FLT (链接) Panda-70M (项目页面) PVD (链接) 另有一小部分内部收集数据。 评估基准:论文发布OmniRetriever-Bench,包含3,782个经人工校对的三元组。发布时将提供评估流程、字幕文本、源视频标识符和片段区间,但不重新分发底层媒体文件。 复现材料:论文在附录中提供了极其详尽的复现信息,包括但不限于: 附录A & B:骨干架构、LoRA配置、所有训练超参数。 附录C:端到端推理延迟。 附录D:损失权重敏感性分析。 附录E:训练语料描述与统计。 附录F & H:OmniRetriever-Bench构建方法、许可证与统计。 附录G:后处理压缩分析。 附录I:外部基准完整结果。 附录J:OmniRetriever-Bench方向消融分析。 附录L:Omni-Embed-Nemotron-3B跨骨干验证。 附录M:字幕改写鲁棒性分析。 附录N:\(\mathcal{L}_T\)种子稳定性分析。 论文中引用的关键开源项目:CLIP, ImageBind, LanguageBind, WAVE, Omni-Embed-Nemotron, SigLIP/SigLIP-2, Whisper, BEATs, CLAP (多种), InternVideo2, LoRA, DeepSpeed。 🏗️ 方法概述和架构 OmniRetriever的核心是一个统一的AVT嵌入器\(f_\theta\),它能够分别处理文本(T)、视频(V)、音频(A)单模态输入,生成对应嵌入\(z_T, z_V, z_A\),并能同时处理三元组输入,生成联合嵌入\(z_{TVA}\)。其训练目标由三个损失函数构成: ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 296 words

Robust Quantum-MUSIC for DoA Estimation Using Rydberg Atomic Receiver Arrays

📄 Robust Quantum-MUSIC for DoA Estimation Using Rydberg Atomic Receiver Arrays 📝 5.7/10 | 前50% | arxiv 学术质量 5.1/7 | 影响力 0.3/2 | 可复现性 0.3/2 | 置信度 中 👥 作者与机构 Sourav Banerjee: 印度理工学院德里分校应用电子研究中心(CARE),博士生。 Neel Kanth Kundu: 印度理工学院德里分校应用电子研究中心(CARE)及电信技术与管理学院,DST INSPIRE教员研究员(IFA22-ENG 344),同时是墨尔本大学荣誉研究员。 Prajwalita Borah: 印度理工学院德里分校应用电子研究中心(CARE),博士生。 📌 核心摘要 本文针对里德伯原子接收器阵列进行方向估计的量子MUSIC算法,提出了一种鲁棒性增强的框架(RobQMUSIC)。原始算法的信道恢复步骤依赖\(\ell_2\)范数最小化,对硬件故障、传感器饱和或对抗干扰引起的离群值测量极为敏感。为解决此问题,RobQMUSIC将\(\ell_2\)范数替换为对离群值更鲁棒的\(\ell_1\)范数。求解由此产生的非凸问题时,采用了交替最小化框架,并在每个外层迭代的幅度更新步骤中嵌入了迭代重加权最小二乘(IRLS)算法。IRLS通过迭代地根据当前残差大小调整测量值的权重,有效降低了离群值的影响。数值仿真实验证明,在理想条件下,RobQMUSIC的精度与原始算法相当;而在存在离群值的场景下,原始算法迅速失效,而RobQMUSIC能在高达70%的离群值比例下维持可靠的DoA估计性能。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:论文中未提及 Demo:论文中未提及 复现材料:论文中未提及 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 本文提出的RobQMUSIC框架旨在增强原始量子MUSIC算法对测量离群值的鲁棒性。其核心思想是在信道恢复(即从幅度测量中恢复复数信道)阶段,用对异常值不敏感的\(\ell_1\)范数优化替代敏感的\(\ell_2\)范数优化。整体架构可分为以下几个相互关联的组件和步骤,数据流如下: 输入与问题建模: 输入:来自\(M\)个里德伯原子接收器(每个对应一个空间传感器)的\(P\)个快拍的幅度测量矩阵\(\tilde{\mathbf{Z}} \in \mathbb{R}_+^{M \times P}\),该矩阵受稀疏离群值污染。导引矢量参数、已知偏置\(\mathbf{b}_m\)、外层迭代次数\(N\)、内层IRLS迭代次数\(T\)、以及IRLS正则化常数\(\epsilon\)。 核心问题:对每个传感器\(m\),其幅度测量行向量\(\tilde{\mathbf{z}}_m^T\)与复数信道向量\(\mathbf{h}_m\)的关系被建模为\(\tilde{\mathbf{z}}_m = |\mathbf{S}^H \mathbf{h}_m + \mathbf{b}_m| + \mathbf{e}_m\),其中\(\mathbf{e}_m\)是稀疏离群值。目标是从\(\tilde{\mathbf{z}}_m\)中恢复\(\mathbf{h}_m\)。 谱初始化 (Spectral Initialisation): ...

2026-05-28 · 更新于 2026-07-31 · 2 min · 380 words