HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

📄 HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding #语音合成 #语音识别 #自监督学习 #知识蒸馏 #多任务学习 #模型压缩 🔥 8.6/10 | 前25% | #语音合成 | #自监督学习 | #语音识别 #知识蒸馏 | arxiv 学术质量 5.7/7 | 影响力 1.8/2 | 可复现性 1.1/2 | 置信度 高 👥 作者与机构 作者: Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu. 机构: 1. 上海交通大学 X-LANCE 实验室;2. 小红书 Hi-lab。 ...

2026-05-29 · 更新于 2026-08-14 · 4 min · 673 words

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

📄 MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables #语音合成 #语音识别 #变分推断 ✅ 7.3/10 | 前50% | #语音合成 | #变分推断 | #语音识别 | arxiv 学术质量 5.9/7 | 影响力 1.4/2 | 可复现性 0/2 | 置信度 中 👥 作者与机构 Sung-Lin Yeh\(^{1}\), Wei Zhou\(^{2}\), Gil Keren\(^{3}\), Duc Le\(^{3}\), Zhong Meng\(^{3}\), Hao Tang\(^{3}\), Jay Mahadeokar\(^{3}\), Ozlem Kalinli\(^{3}\), Alexandre Mourachko\(^{3}\) (\(^{1}\)University of Edinburgh, \(^{2}\)Google DeepMind, \(^{3}\)Meta Superintelligence Labs) 📌 核心摘要 本文提出了MELD(Mel-Spectrogram-Based Discrete Latent Language Model),一种基于梅尔频谱图和离散潜变量的语音语言模型框架。其核心创新在于联合优化一个量化编码器和一个自回归语言模型,直接对连续的梅尔频谱帧进行建模,从而避免了传统两阶段方法(先训练独立的编码器/编解码器,再训练语言模型)中编码器无法感知下游任务目标的问题。MELD通过引入离散潜变量空间进行采样,有效缓解了直接自回归建模梅尔频谱时常见的静音延长和单词遗漏问题。模型在单一框架内通过不同的控制令牌(<TTS> 和 <STT>)支持零样本文本到语音(TTS)合成和语音到文本(STT)识别任务,并在LibriSpeech数据集上展示了相比基线方法(如Codec-LM、MELLE、dMel)的优势,特别是在STT性能和联合TTS-STT建模方面。 ...

2026-05-29 · 更新于 2026-08-14 · 1 min · 115 words

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

📄 OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants #多模态模型 #基准测试 #语音识别 #语音合成 ✅ 7.8/10 | 前50% | #语音识别 | #多模态模型 | #基准测试 #语音合成 | arxiv 学术质量 4.9/7 | 影响力 1.2/2 | 可复现性 1.7/2 | 置信度 高 👥 作者与机构 作者:Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li 机构:CUHK MMLab (香港中文大学多媒体实验室), SJTU (上海交通大学), NTU (南洋理工大学), McMaster (麦克马斯特大学), CityUHK (香港城市大学), JUFE (江西财经大学) ...

2026-05-29 · 更新于 2026-08-14 · 2 min · 416 words

The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models

📄 The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models #语音识别 #语音合成 #自监督学习 ✅ 7/10 | 前50% | #语音识别 | #自监督学习 | #语音合成 | arxiv 学术质量 5.2/7 | 影响力 1.5/2 | 可复现性 0.3/2 | 置信度 高 👥 作者与机构 Xiangyu Zhang (The University of New South Wales), Yuxin Li (Nanyang Technological University), Haoyang Zhang (Nanyang Technological University), Shiqi Han (The University of New South Wales), Hexin Liu (Nanyang Technological University), Qiquan Zhang (The University of New South Wales), Beena Ahmed (The University of New South Wales), Julien Epps (The University of New South Wales) ...

2026-05-29 · 更新于 2026-08-14 · 3 min · 500 words

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

📄 VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents #语音合成 #语音识别 #多模态模型 ✅ 7.9/10 | 前25% | #语音合成 | #语音识别 | #多模态模型 | arxiv 学术质量 5.9/7 | 影响力 1.5/2 | 可复现性 0.5/2 | 置信度 高 👥 作者与机构 Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello. 机构:NVIDIA, David AI. 论文为arXiv预印本(ID: 2605.30256),未说明投稿会议。 💡 毒舌点评 这篇论文做了一件“正确但不够性感”的事:它为新兴的全双工音视觉对话代理领域建立了一个急需的评估基准。这就像给一群刚学会跑的婴儿做体能测试——很有必要,但别指望能测出马拉松冠军。其核心贡献在于“定义问题”而非“解决问题”,这在学术上是合法的,但也意味着其影响力上限在论文发表时就已被锁定。实验设计严谨,分析也很到位,尤其是对级联系统局限性的剖析。然而,数据集规模(237片段)和语言单一性(英语)是其阿喀琉斯之踵,严重限制了结论的普适性。用它来评判现有模型可以,但若想用它指导下一代模型的设计,那证据就稍显薄弱了。 📌 核心摘要 本文提出了VideoFDB,首个用于评估全双工音视觉到音视觉(AV2AV)对话代理的基准。现有基准无法评估代理同时听、说、观察并产生非语言线索(如点头、微笑)的能力。VideoFDB包含:1)一个基于非语言交流科学的分类法,涵盖11种对话动态;2)一个包含237个人类标注双人视频通话片段的数据集;3)一个基于评分标准和语言模型裁判的评估框架,从“感知”(流利度、对话流、语义关联)和“生成”(情感匹配、非语言线索恰当性)两个维度评估代理。实验评估了闭源(Gemini, OpenAI)和开源(MiniCPM-o等)模型,以及级联语音-头像系统。主要发现是:所有模型均远低于人类水平;视觉输入常被用于显式问答而非提升对话动态;级联系统无法生成实时、独立的非语言线索。这揭示了当前系统在利用视觉信息进行自然对话方面的根本局限。 🔗 开源详情 代码:论文中提及将发布评估代码至公开的HuggingFace,但未提供具体URL或代码仓库链接。复现所需的评估流程、Prompt模板(附录F.5与F.6)、评分标准(Rubric)详细说明见于论文附录F。 模型权重:论文评估了多个开源模型(MiniCPM-o 4.5, MiniOmni2, VITA-1.5),但未在论文中提供其模型权重的具体下载链接。这些模型的权重通常可在其各自的GitHub仓库中获取。 数据集:论文提供了VideoFDB评估数据集的匿名访问地址及访问方式。 匿名访问页面:https://anonvfdb.github.io/ 访问密码:sH6A+P12qMaJWtyMJ2vIx9Oi 承诺在论文发表前,将数据集发布至公开的HuggingFace,但未提供具体链接。匿名页面包含两个验证片段、分类法和元数据模式,完整数据集约5GB。 复现材料:论文附录详细描述了评测流程、Prompt模板(Appendix F.5 与 F.6)、评分准则(Rubric)以及数据集构建细节(Appendix A),这些构成复现评测的关键材料。 论文中引用的开源项目: 模型/方法:论文引用了Moshi, dGSLM, OmniFlatten, SyncLLM, SALM, PersonaPlex, Qwen2.5/Qwen3-Omni, MiniCPM-o, MiniOmni2, VITA-1.5等开源项目。 工具/平台:LiveKit, Anam, Keyframe, Silero VAD, Parakeet ASR。 补充链接(自动提取): 代码仓库:https://github.com/OpenBMB/MiniCPM-o/blob/main/docs/MiniCPM_o_45_technical_report.pdf 代码仓库:https://github.com/snakers4/silero-vad HuggingFace:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 🏗️ 方法概述和架构 VideoFDB的核心方法是构建一个全面的评估体系,包含三个相互关联的组件:评估数据集、评估框架和评估指标。 ...

2026-05-29 · 更新于 2026-08-14 · 2 min · 425 words

Benchmarking AI for low-resource contexts: Thinking beyond leaderboards

📄 Benchmarking AI for low-resource contexts: Thinking beyond leaderboards #语音识别 #语音合成 #语音增强 #计算机视觉 #低资源 📝 5.1/10 | 后50% | #语音识别 | #语音合成 | #语音增强 #计算机视觉 | arxiv 学术质量 4.5/7 | 影响力 0.3/2 | 可复现性 0.3/2 👥 作者与机构 Aakash Pant, Kavya Shah, Apoorv Agnihotri, Sneha Nikam, Prasaanth Balraj, Nakul Jain. ( 表示同等贡献). 机构:Wadhwani AI Global. 日期:2026年5月. 💡 毒舌点评 这篇论文像一份写给捐赠机构和政策制定者的“高级产品说明书”。其核心诉求(别只看排行榜,要看实际部署)在AI领域确实是个老生常谈但至关重要的痛点,尤其是在医疗、农业等低资源场景。优点是逻辑清晰、目标明确,且贴心地附上了“基准卡”这种傻瓜式工具,试图弥合技术社区与非技术决策者之间的鸿沟。然而,它的弱点也异常明显:这是一份纯粹的“倡议书”或“愿景文档”。全文没有提出任何新颖的算法、模型或实验方法,而是对现有基准(FLEURS, HELM, ImageNet-C等)进行了一次梳理和重新包装。它的“创新”更多体现在视角和倡导上,而非技术贡献。对于寻求具体技术突破的读者(如NeurIPS/ICML的典型审稿人)来说,这可能显得“干货不足”。论文最大的硬伤是缺乏任何形式的实证验证:它提出的框架是否有效?基准卡在实际采购中是否真的能帮助决策?读者无从知晓。它更像是一个设计精良的提案,而非一篇完整的科研论文。 📌 核心摘要 本文是一篇系统性白皮书,旨在批判当前AI基准测试(以排行榜为代表)在评估面向低资源环境(如网络不稳、设备低端、多语言代码转换)部署的系统时的不足。作者指出,现有评估通常孤立地测试模型性能,而忽略了由数据捕获、预处理、工作流和运行条件构成的完整系统。论文提出了一种新的评估范式:1)将“部署系统”而非“孤立模型”作为评估的基本单元;2)采用三层评估框架(组件层、工作流层、运行条件层)分别报告性能;3)为语音、对话/RAG、视觉三类应用定义包含压力测试和核心指标的标准化“基准卡”。最终目标是提供一个对部署上下文敏感、可操作的标准化报告框架,以真正支持低资源环境下的AI系统选型与部署决策。 🔗 开源详情 代码:论文中未提及任何新开发的代码或框架实现。 模型权重:论文中未提及任何模型权重。 数据集:论文未提供新数据集。文中提及了多个现有基准数据集用于说明,具体如下: FLEURS: 用于多语言语音任务评估。链接:https://doi.org/10.1109/SLT54892.2023.10023141 Speech Robust Bench: 用于ASR鲁棒性评估。链接:https://openreview.net/forum?id=D0LuQNZfEl HELM / HELM Instruct: 用于大语言模型综合评估。链接:https://crfm.stanford.edu/helm/ 和 https://crfm.stanford.edu/helm/instruct/latest/ RAGAs: 用于RAG管道评估。链接:https://doi.org/10.18653/v1/2024.eacl-demo.16 CRAG: 用于检索增强生成评估。链接:https://github.com/facebookresearch/CRAG ImageNet-C / ImageNet-P: 用于图像鲁棒性(损坏和扰动)评估。链接:https://doi.org/10.48550/arXiv.1903.12261 WILDS: 用于野外分布偏移评估。链接:https://doi.org/10.48550/arXiv.2012.07421 COCO-C, PASCAL-C, Cityscapes-C: 用于目标检测/分割的鲁棒性评估,具体链接未在论文中提供,参考文献[14]。 其他提及的本地多语言测试集、领域特定评估集等,均未提供统一获取链接。 Demo:论文中未提及。 复现材料:论文中未提及。 🏗️ 方法概述和架构 本文的方法论核心是提出一个用于设计和评估低资源AI部署系统的框架,而非具体的算法实现。该框架的核心架构包括以下几个关键组成部分: ...

2026-05-28 · 更新于 2026-08-14 · 2 min · 239 words

Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts

📄 Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts #语音识别 #多语言 ✅ 6.0/10 | 前50% | #语音识别 | #多语言 | arxiv 学术质量 6.0/7 | 影响力 5.5/2 | 可复现性 1.5/2 | 置信度 中 👥 作者与机构 论文作者为 Prasenjit K Mudi 和 Dahlia Devapriya(并列第一作者),Sheetal Kalyani。机构未明确说明,但第一作者邮箱后缀显示 affiliation 可能与 Indian Institute of Technology Madras 有关。 💡 毒舌点评 这篇论文的工作像是在为ASR社区做一件必要的“脏活累活”。它指出了一个实际且具体的问题:现有的对齐工具(sclite)在非拉丁文字上表现糟糕,导致下游的语法分析(PoS)完全跑偏。作者提出的解决方案,一个字符宽度感知的改进型Needleman-Wunsch算法,虽然看起来不是什么惊天动地的理论创新,但确实是一个实用、针对性强的工程解决方案,并且通过多个例子和消融实验证明了其有效性。将PoS错误信息融入ASR训练的PoS感知Transformer也提供了一个直观的思路。然而,文章的局限性也相当明显。首先,它明确将自己框定在“分词书写系统”内,这极大地限制了其在ASR领域更广泛的应用(如中日泰)。其次,PoS权重的选择是“启发式”的,缺乏理论指导或更优的自动化方法。最后,文章在实验部分没有与任何近期或SOTA的对齐方法进行定量比较,仅仅是和sclite比,说服力打了折扣。总的来说,它是一篇扎实的、针对特定问题的“工具论文”,为后续研究提供了基础,但自身的理论深度和影响力受限。 📌 核心摘要 本文针对自动语音识别(ASR)评估中,现有对齐工具(如sclite)在非拉丁文字语言上对齐效果不佳的问题,提出了一种字符宽度感知的改进型Needleman-Wunsch对齐算法。该算法通过考虑字符的渲染宽度而非仅字符计数,并包含后处理步骤(合并连续的插入-删除对为替换),实现了对阿布吉达文字(泰米尔语、印地语、卡纳达语)、字母文字(俄语、希腊语、英语)和阿贾德文字(阿拉伯语)的鲁棒对齐。基于正确的对齐结果,论文利用多种PoS标注工具(spaCy, Stanza等)实现了自动化的词性级错误分析,揭示了不同文字系统下语言的错误模式差异。此外,论文提出了一种PoS感知的Transformer模型,通过在解码器交叉注意力机制中为不同PoS类别的词元分配不同权重,将PoS错误信息融入模型训练,最终在泰米尔语、阿拉伯语和俄语上降低了词错误率(WER)。该工作填补了非拉丁文字语言细粒度ASR错误自动分析的空白,为多语言ASR系统的开发和错误理解提供了实用的分析工具和改进思路。 🔗 开源详情 代码:论文未提及提供对齐算法或PoS感知Transformer的代码。 模型权重:论文未提及提供训练好的模型权重。 数据集: SPRING_INX 数据集(泰米尔语、印地语、卡纳达语):https://asr.iitm.ac.in/dataset (协议:CC BY 4.0) Mozilla Common Voice 数据集(俄语、希腊语、阿拉伯语):通过 Mozilla 公共存储库获取(协议:CC0-1.0) LibriSpeech 测试集(英语):标准公开数据集,论文未给出具体链接。 Demo:论文未提及。 复现材料:论文未提供独立的训练脚本或检查点。复现细节包含在论文正文和附录中: 训练配置与超参数:详见附录G,包括模型架构、优化器、学习率、批大小、SpecAugment设置等。 PoS权重表:附录G的表XX列出了泰米尔语、阿拉伯语和俄语的PoS特定权重。 数据集划分:附录G的表XXI提供了各数据集训练/验证/测试集的语句数量。 论文中引用的开源项目: spaCy:用于NLP,特别是PoS标注。链接:https://github.com/explosion/spaCy Stanza:斯坦福大学的神经NLP工具包。链接:https://github.com/stanfordnlp/stanza spaCy-stanza:集成spaCy和Stanza的包装器。链接:https://github.com/explosion/spacy-stanza AI4Bharat IndicBERTv2:用于卡纳达语的PoS标注模型。链接:https://huggingface.co/ai4bharat/IndicBERTv2-alpha-POS-tagging CAMeL Tools:用于阿拉伯语NLP的工具包。链接:https://github.com/CAMeL-Lab/camel_tools gr-nlp-toolkit:用于希腊语NLP的工具包。链接:https://github.com/nlpaueb/gr-nlp-toolkit Whisper:OpenAI的语音识别模型。论文使用了Whisper small模型的微调版本(希腊语):https://huggingface.co/mozilla-ai/whisper-small-el。Whisper模型本身遵循Apache-2.0许可证。 Aksharamukha:用于将印度语言音译为罗马字母的工具(脚注提及)。 Lexilogos:用于将俄语、阿拉伯语等语言音译为罗马字母的工具(脚注提及)。 sclite:NIST语音评分工具包的一部分,被用作对比基线。链接未在论文中明确提供,属于NIST SCTK工具包。 🏗️ 方法概述和架构 本文的方法主要分为两个核心部分:1)一个鲁棒的文本对齐算法,用于正确对齐ASR假设(HYP)、参考文本(REF)和评估序列(EVAL);2)一个PoS感知的Transformer解码器,用于利用对齐后的错误分析信息改进ASR性能。 ...

2026-05-28 · 更新于 2026-08-14 · 3 min · 446 words

Building Community-Centred NLP Resources for Puno Quechua

📄 Building Community-Centred NLP Resources for Puno Quechua #语音识别 #自监督学习 #低资源 ✅ 7.2/10 | 前50% | #语音识别 | #自监督学习 | #低资源 | arxiv 学术质量 3.7/7 | 影响力 1.5/2 | 可复现性 2/2 | 置信度 高 👥 作者与机构 Elwin Huaman (剑桥大学) Adrian Gamarra Lafuente (斯坦福大学) Johanna Cordova (法国国立东方语言文化学院 ERTIM) Anna Korhonen (剑桥大学) 💡 毒舌点评 一篇扎实、具有重要社会影响力的基础设施建设工作。贡献明确,数据集和开源生态是其最大亮点。然而,论文在技术深度和实验分析的严谨性上存在明显短板,例如测试集划分策略不明、银数据质量分析缺失、以及未在大型基线模型上进行微调对比,这些缺陷削弱了其作为顶级会议论文的技术说服力。论文更像是一份优秀的社区资源报告,而非一篇方法论驱动的技术论文。 📌 核心摘要 本文旨在为秘鲁普诺地区的克丘亚语变体(qxp)构建社区驱动的数字资源。主要贡献包括:1) 构建了针对单一克丘亚语变体迄今最大的语音语料库(66小时,含36小时人工验证数据),通过四阶段参与式设计收集;2) 建立了首个针对该变体的系统性ASR基准,评估了Whisper-base, wav2vec2-base, XLS-R-300M等模型在微调(含/不含持续预训练CPT)后的表现,并与大规模多语言模型(omniASR, MMS)进行对比;3) 完全开源所有数据集、代码和模型。关键发现表明:银数据(自动转写)对自发语音识别性能的提升起决定性作用(相对WER降低达77%);持续预训练(CPT)对脚本语音有稳定增益;所有微调模型在域外(OOD)泛化能力上存在明显差距,而超大基线模型表现更优。 🔗 开源详情 数据集:在Mozilla Data Collective上发布,包含: Common Voice Scripted Speech v25:34.81小时(30.5小时验证) Common Voice Spontaneous Speech v3:35.3小时(5.18小时验证 + 30小时银数据) 一个小型域外(OOD)语料库(Add_data,约16分钟) 许可证:CC0-1.0 代码:提供明确的GitHub仓库链接:https://github.com/QuechuaBase/asr-puno-quechua 模型权重:所有微调模型(包括Whisper-base、wav2vec2-base、XLS-R-300M及其CPT变体,在V和V+S配置下)均开源。提供Hugging Face组织主页链接:https://huggingface.co/QuechuaBase Demo:论文中未提及专门的在线演示(Demo)地址。 复现材料:论文提供了详细的复现信息,包括: 数据划分:70/25/5(训练/开发/测试)。 训练配置:超参数(学习率、更新步数、调度器等)和不同数据集配置(V, V+S)细节。 硬件环境:所有实验在单块48GB L40S GPU上完成。 评估结果:完整的WER和CER结果表格(表2和表3)。 未提及单独的“复现材料”代码仓库或文档包。 🏗️ 方法概述和架构 本文的核心方法框架是一个“参与式设计数据收集 + 基础模型微调与评估”的流程,旨在构建一个服务于普诺克丘亚语社区的端到端ASR系统。架构图(Figure 1)展示了一个从数据收集到模型部署的简化流程。 ...

2026-05-28 · 更新于 2026-08-14 · 2 min · 385 words

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

📄 Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox #语音情感识别 #语音识别 #多模态模型 ✅ 6.8/10 | 前50% | #语音情感识别 | #语音识别 | #多模态模型 | arxiv 学术质量 4.5/7 | 影响力 1.8/2 | 可复现性 0.5/2 | 置信度 中 👥 作者与机构 作者:Jiacheng Pang (南加州大学 USC),Ashutosh Chaubey (MIT),Mohammad Soleymani (南加州大学 USC) 机构:信息科学研究所 (USC),计算机科学与人工智能实验室 (CSAIL, MIT) 💡 毒舌点评 合成数据的“温室花朵”效应:VoxParadox 基准虽然精巧,但完全依赖 TTS 合成数据。论文声称其设计“由构造保证”,但这恰恰是它最大的软肋。模型在这个精心控制的对抗性环境中取得的任何提升,在面对真实世界中充满噪声、歧义、文化背景和微小语气变化的“言不由衷”时,可能都只是镜花水月。生态效度(ecological validity)的短板,使得方法的实用价值大打折扣。 “灵丹妙药”式的改进声明:论文将 PCLM+DPO 描述为解决瓶颈的有效方案,但证据链并不完整。在一个模型(Audio Flamingo 3)上取得巨大成功,远不足以证明该方案的普适性。论文未报告其他被评估模型(如 SALMONN, Qwen-Audio 等)的改进情况,这使得方法的“通用性”声明显得仓促。是方法真的巧妙,还是仅仅在 Audio Flamingo 3 的特定架构上“过拟合”了? “黑箱”模块缺乏透视:PCLM 被描述为“自适应地组合多层信息”,但其内部机制如同黑箱。论文没有提供任何可视化或定量分析,展示在不同任务或输入下,模型究竟如何、以及为何选择了特定的音频层组合。这种“Prompt-Conditioned”的承诺,在缺乏可解释性分析的情况下,说服力有限。 消融研究的缺失:将 PCLM 和 DPO 打包提出,却没有进行充分的消融实验,这是方法论上的重大遗漏。我们不知道性能提升有多少归功于表征质量的改善(PCLM),有多少归功于偏好引导(DPO),两者的协同效应究竟如何。这使得方法的贡献难以被准确归因和理解。 实验对比的模糊性:虽然声称评估了“多种”Audio LLMs,但 Table 1 的细节在提供的文本中不完整。审稿人需要清晰地看到所有基线模型在所有任务上的具体数字,以判断 VoxParadox 是否真的暴露了模型的共性问题,以及所提方法是否在所有情况下都有效。泛泛的“显著提升”结论,缺乏足够的数据支撑。 📌 核心摘要 本文针对 Audio LLMs 在副语言信息理解上的不足(过度依赖文本转录而非声学线索),提出了系统性的分析、评估与改进方案。首先,设计了对抗性基准 VoxParadox(2000 样本,10 类任务),通过控制语音合成制造转录与声学风格的矛盾,以量化模型的模态偏见。实验表明,模型普遍在声学真值上准确率低(AccGT),却对文本暗示的错误标签高度一致(ALA)。其次,通过层级探测(layer-wise probing)分析瓶颈,发现副语言信息在编码器深层及编码器-LLM 接口处可能退化,且即使信息存在于音频 token 中,LLM 也常忽略。为解决此问题,提出 Prompt-Conditioned Layer Mixer(PCLM)以自适应融合多层音频表征,并结合 Direct Preference Optimization(DPO)训练模型偏好声学证据。在 Audio Flamingo 3 上,该方法将 VoxParadox 准确率从 17.40% 提升至 65.20%,MMSU 副语言子集从 37.74% 提升至 54.78%。 ...

2026-05-28 · 更新于 2026-08-14 · 3 min · 554 words

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

📄 Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini #多模态模型 #对比学习 #语音识别 ✅ 7.9/10 | 前25% | #语音识别 | #对比学习 | #多模态模型 | arxiv 学术质量 5.9/7 | 影响力 1.5/2 | 可复现性 0.5/2 | 置信度 高 👥 作者与机构 Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini(共81位作者)。 ...

2026-05-28 · 更新于 2026-08-14 · 3 min · 634 words