Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

📄 Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech #语音合成 #扩散模型 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8/10 | 前25% | #语音合成 | #扩散模型 | arxiv 👥 作者与机构 第一作者:Vadim Popov(Huawei Noah’s Ark Lab, National Research University Higher School of Economics) 通讯作者:Vadim Popov(popov.vadim1@huawei.com) 作者列表:Vadim Popov(Huawei Noah’s Ark Lab, National Research University Higher School of Economics)、Wenju Gu(Huawei Noah’s Ark Lab)、Tasnima Sadekova(Huawei Noah’s Ark Lab, National Research University Higher School of Economics)、Georgii Aparin(Huawei Noah’s Ark Lab, National University of Science and Technology MISIS)、Assel Yermekova(Huawei Noah’s Ark Lab) 💡 毒舌点评 这篇论文巧妙地将 FSQ 的几何结构注入了连续扩散混合生成的理论框架, 从路径测度 KL 散度给出了一个漂亮的解释, 并用一套完整的 TTS 系统秀了肌肉。但理论的华美长袍下藏着“等先验”的致命伤疤, 一旦面对真实世界中不平衡的 token 分布, 所谓“最优性”可能瞬间沦为纸上谈兵, 而作者在实验中对此几乎是讳莫如深。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 783 words

PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation

📄 PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation #音乐生成 6.6/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | #音乐生成 | #扩散模型 | arxiv 👥 作者与机构 第一作者:Taekoan Yoo(NHN Corp. AI Tech Lab.) 通讯作者:Kyeongbo Kong(Pusan National University) 作者列表:Taekoan Yoo、Wonkyung Jung、Kyunghun Kim(均为NHN Corp. AI Tech Lab.),Kyeongbo Kong(Pusan National University) 💡 毒舌点评 论文在“文本到音乐扩散模型的多样性退化”这个真实痛点上有清晰motivation,PADS的直觉(只扰动padding、不碰语义token)简洁有效,TAL的MoE-mVAE设计在表示层面为genre一致生成提供了结构支撑,两者组合在消融中表现一致。但整体创新层次不高——两个组件本质都是已有技术的迁移和改造(CADS→PADS,MoE-mVAE→TAL),缺乏新的方法论贡献。更令人担心的是,genre作为“全局语义”的唯一代理,严重窄化了T2M多样性问题的定义;实验上MelBench被处理成器乐子集,削弱了genre结论的外部效度;对比基线仅围绕CADS展开,与其他多样性增强方法的对比局限在Fig. 10的trade-off曲线上,未做深入调参和讨论。按顶会标准看,问题定义有价值、方案合理、实验基本完整,但贡献的深度和广度均未达到突破性水平。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 451 words

PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding

📄 PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding #实时处理 6.4/10 | 创新 0.8/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | #实时处理 | #实时处理 | arxiv 👥 作者与机构 第一作者:Xiran Chen(安徽大学,计算机科学与技术学院,光电信息获取与防护技术国家重点实验室),Xiaoke Yang(同等贡献第一作者,同上) 通讯作者:Cunhang Fan(安徽大学,计算机科学与技术学院,光电信息获取与防护技术国家重点实验室) 作者列表:Xiran Chen, Xiaoke Yang, Jian Zhou, Zhao Lv, Cunhang Fan(均属于安徽大学上述学院与国家重点实验室) 💡 毒舌点评 本文试图通过引入相位信息来给EEG听觉注意解码注入新的方法论血液,这思路本身不差,但实际落地更像是一次工程上的模块搬家。TCC、MTA、RSI、DDI等组件拼装感强烈,本质上是对现有时间注意力、扩张卷积、复数频谱处理等技术的整合与重命名。虽然文中强调"相位感知",但所谓的"精炼"其实就是将实部和虚部分别送入结构对称的卷积块,再用一个从幅度谱生成的掩码打回去,这和真正的神经生理学相位校准机制相差甚远,解释性不足,有过度包装之嫌。论文最大的硬伤在于没有进行任何跨被试(LOSO)实验,这导致其宣称的SOTA性能在个体差异面前可能极度脆弱,无法说服审稿人其具有真实的泛化能力。极短的0.1s窗口下KUL数据集达到98.4%的准确率近乎完美,这在信噪比极低的EEG信号中显得反常,不排除存在微妙的时间信息泄露或过拟合于特定被试。 📌 核心摘要 问题:现有EEG听觉注意解码方法大多仅依赖幅度或功率谱特征,忽略了EEG信号相位信息在编码神经振荡与时间结构中的关键作用。这限制了模型在低信噪比环境下区分结构化神经模式与随机噪声的能力。 方法:提出PCRNet,包含时序上下文校准(TCC)模块和双域集成(DDI)模块。TCC利用多尺度时序注意力(MTA)结合门控机制,在进入频域分析前对Q、K、V投影进行精细校准;DDI则并行运行一个时序扩张卷积分支和一个基于残差频谱接口(RSI)块的频谱分支,RSI在复数域中通过可学习的幅度重要性门控对实部和虚部分别进行精炼、动态抑制噪声频段,再经逆傅里叶变换重构特征。 新意:与以往只关注能量/幅度的主流方法不同,PCRNet明确地在复数域操作,对实部和虚部进行独立的特征混合和精炼,并引入数据驱动的幅度掩码以实现相位感知的频谱滤波,旨在保留并重校准因噪声受损的相位结构。 主要实验结果:在KUL、DTU和AVED三个公开数据集上,与包括SSF-CNN、MBSSFCC、DBPNet、DARNet、SSF-DST、MHANet在内的六种现有方法对比,PCRNet在所有决策窗口(0.1s, 1s, 2s)下均取得了最高的平均准确率,尤其在KUL数据集的0.1s窗口下达到98.4%的准确率。参数总量仅为0.03M。 实际意义:极低的模型参数量和极短决策窗下的高性能,使其在神经导向助听器等需要低功耗、低延迟的边缘计算实时脑机接口应用中展现出潜力。 主要局限性:仅在受试者内(within-subject)划分下进行评估,完全缺乏跨被试(cross-subject)或留一被试(LOSO)的必要泛化性验证;所有数据集均为实验室受控短时程实验范式,未涉及真实场景下的连续流式处理;对相位增益的解释停留在模型消融,缺乏与神经生理学机制的深入关联分析。 🔗 开源详情 代码:https://github.com/SunshineGreeny/PCRNet 模型权重:论文中未提及 数据集:使用公开数据集KUL、DTU、AVED,但未提供具体获取链接 Demo:论文中未提及 复现材料:论文第3.3节提供了训练配置和网络参数等实现细节,但未提供单独的配置文件、检查点或复现脚本。 论文中引用的开源项目:PyTorch (https://pytorch.org/) 🏗️ 方法概述和架构 PCRNet是一个端到端的神经网络,旨在从EEG信号中解码听觉注意对象(左耳或右耳)。其输入是经过公共空间模式(CSP)预处理的EEG片段 \(\tilde{E} \in \mathbb{R}^{C \times T}\)(C为通道数,T为时间点),输出为二分类标签。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 385 words

PHALAR: Phasors for Learned Musical Audio Representations

📄 PHALAR: Phasors for Learned Musical Audio Representations #音乐生成 #对比学习 #CNN #工业应用 8/10 | 创新 1.3/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8/10 | 前25% | #音乐生成 | #对比学习 | #CNN #工业应用 | arxiv 👥 作者与机构 第一作者:Davide Marincione(Department of Computer Science, Sapienza University of Rome, Italy) 通讯作者:Davide Marincione(Sapienza University of Rome)、Michele Mancusi(Sapienza University of Rome; Moises Systems, Inc.) 作者列表: Davide Marincione(Sapienza University of Rome)、Michele Mancusi(Sapienza University of Rome; Moises Systems, Inc.)、Giorgio Strano(Sapienza University of Rome)、Luca Cerovaz(Sapienza University of Rome; Paradigma, Inc.)、Donato Crisostomi(Sapienza University of Rome)、Roberto Ribuoli(Sapienza University of Rome)、Emanuele Rodolà(Sapienza University of Rome; Paradigma, Inc.) 💡 毒舌点评 这篇工作的核心洞察——用傅里叶移位定理将时间对齐映射为复数相位旋转——确实漂亮,让等变设计从“能用”变成“应该用”。在stem检索任务上以不到一半参数拿到69%的相对提升,训练速度是前SOTA的7倍,效率优势让人眼前一亮。不过,方法对周期性假设的依赖过于刚性,一旦遇到速度漂移或非周期性节奏,所谓“相位相干性”就变成了空中楼阁。人耳评估的样本量和被试规模也仅能勉强支撑与部分强基线的显著差异,跨到“与人类判断高度相关”的强宣称还差一口气,更别提在零样本节拍跟踪上与监督模型的鸿沟了。 ...

2026-07-04 · 更新于 2026-07-28 · 5 min · 886 words

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

📄 PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs #空间音频 #Transformer #大语言模型 #参数高效微调 #多通道 8.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.7/10 | 前25% | #空间音频 | #Transformer | #大语言模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Artem Dementyev (Google DeepMind, Cambridge, USA) 通讯作者:Artem Dementyev (Google DeepMind, Cambridge, USA) 作者列表:Artem Dementyev (Google DeepMind, Cambridge, USA)、Wazeer Zulfikar (Media Lab, MIT, Cambridge, USA)、Sinan Hersek (Google AR, Seattle, WA)、Pascal Getreuer (Google DeepMind, Cambridge, USA)、Anurag Kumar (Google DeepMind, Cambridge, USA)、Vivek Kumar (Google DeepMind, Cambridge, USA) 💡 毒舌点评 在LLM普遍缺乏空间听觉的当下,提出几何无关的空间音频编码器并与Gemma集成,切入点精准,但实验验证过分依赖合成数据,如同在声学真空里练出绝世武功,一到真实环境的混响、遮挡和噪声面前就难免露怯。定向转录准确率仅44%-52%,离实用还很遥远,更像是给LLM装上了一副度数不太准的眼镜。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 512 words

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

📄 PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios #音视频问答 #基准测试 #多模态模型 #流式处理 #数据集 7.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.3/10 | 前50% | #音视频问答 | #多模态模型 | #基准测试 #流式处理 | arxiv 👥 作者与机构 第一作者:Xudong Lu(香港中文大学 MMLab) 通讯作者:Rui Liu(华为研究,liu.rui2@huawei.com)、Hongsheng Li(香港中文大学 MMLab,hsli@ee.cuhk.edu.hk) 作者列表:Xudong Lu(香港中文大学 MMLab)、Huankang Guan(华为研究)、Yang Bo(华为研究)、Jinpeng Chen(华为研究)、Xintong Guo(华为研究)、Shuhan Li(华为研究)、Fang Liu(香港城市大学)、Peiwen Sun(香港中文大学 MMLab)、Xueying Li(上海交通大学)、Wei Zhang(上海交通大学)、Xue Yang(上海交通大学)、Rui Liu(华为研究)、Hongsheng Li(香港中文大学 MMLab) 💡 毒舌点评 这篇论文发现了一个真实且普遍的“模型太猴急”问题,用精心设计的流式基准把主流 MLLM 都打回了原形,Forward 任务的惨淡分数极具说服力。但作为 benchmark 论文,它过度依赖 Gemini 3 Pro 做数据生成和 Qwen3-235B 做评估,一旦这两个闭源/强模型更新,基准的稳定性和公平性就很微妙;而且在多模态流式领域,作者把“音频”当成了加分项来宣传,结果消融实验却显示开音频反而让 Forward 性能更差,这个自曝其短的结论让人既敬佩又哭笑不得。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 836 words

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

📄 Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training #音乐生成 #预训练 #自监督学习 #Transformer #SFT 8.1/10 | 创新 1.1/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | #音乐生成 | #预训练 | #自监督学习 #Transformer | arxiv 👥 作者与机构 第一作者:Hong-Jie You(南京大学 计算机软件新技术国家重点实验室、人工智能学院) 通讯作者:Yu-Feng Li(南京大学 计算机软件新技术国家重点实验室、人工智能学院) 作者列表:Hong-Jie You(南京大学)、Jie-Jing Shao(南京大学 人工智能学院)、Xiao-Wen Yang(南京大学 人工智能学院)、Lin-Han Jia(南京大学 人工智能学院)、Lan-Zhe Guo(南京大学 智能科学与技术学院)、Yu-Feng Li(南京大学 人工智能学院) 💡 毒舌点评 本文将一个在NLP/CV中已被验证的预训练范式成功迁移到钢琴演奏渲染这一小众领域,并用漂亮的客观/主观双料SOTA数据说明了其有效性,故事逻辑完整。但“范式转变”的帽子扣得略大,本质上仍是“Masked Token Prediction + SFT”的标准配方,且10B-token预训练带来的性能增益在消融中仅依赖“有/无预训练”的二值比较,缺乏更细致的scaling law分析,使得“10B”这个数字更像一个资源配置的结果而非深刻的科学洞察。局限性讨论过于温和,对为何在踏板维度上未能全面领先SOTA避而不谈。 ...

2026-07-04 · 更新于 2026-07-28 · 1 min · 161 words

Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

📄 Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration #音乐生成 #扩散模型 #零样本 6.5/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | #音乐生成 | #扩散模型 | #零样本 | arxiv 👥 作者与机构 第一作者:Haowen Li(华南理工大学未来技术学院) 通讯作者:Qi Liu(华南理工大学未来技术学院) 作者列表:Haowen Li(华南理工大学未来技术学院)、Tianxiang Li(华南理工大学未来技术学院)、Yi Yang(华南理工大学未来技术学院)、Boyu Cao(华南理工大学未来技术学院)、Qi Liu†(华南理工大学未来技术学院)(*表示共同第一作者,†表示通讯作者) 💡 毒舌点评 这篇论文找到了一个非常漂亮的insight——将BSS的判别式输出(IRM)转化为扩散模型里的软注意力约束,以此解决复调音乐中纯语义注意力“找不到北”的问题。想法本身是成立的,实验也基本撑住了SOTA的claim。但问题是,整个框架厚重地寄生在预训练AudioLDM 2的躯体上,推理慢如牛(10秒音频需24秒),且对BSS模型的质量有硬依赖——本质上是用一个黑箱去修另一个黑箱的缺陷。更致命的是,最强对手PPAE被以“复现困难”为由直接踢出局,这让实验的公平性打上问号。代码和模型权重均未公开,同态可复现性堪忧,这让论文更像一场精巧的概念验证秀,而非社区可信赖的基线。 📌 核心摘要 问题:本文要解决的是零样本、声部级(stem-specific)的复调音乐音色迁移——即精准改变特定声部的音色(如人声→小提琴),同时严格保留其他声部和整体音乐结构不变。现有方法(如Melodia、SteerMusic)因依赖纯语义交叉注意力而缺乏频谱分辨率,在密集混音中遭遇“语义-声学不对齐”(Semantic-Acoustic Misalignment),导致非目标声部失真(Non-target Distortion)或目标声部编辑失败(Target Misalignment)。 方法核心:提出Polyphonia框架,核心是“声学先验校准注意力”(Acoustic-Informed Attention Calibration)。通过盲源分离(BSS)模型HT-Demucs提取概率化的理想比率掩码(IRM)作为声学先验 \(G_{IRM}\),将其注入预训练扩散模型AudioLDM 2的T-UNet注意力层,实施两种校准操作:源插值(Source Interpolation)保背景,声学调制(Acoustic Modulation)强目标,从而在粗粒度频谱边界内进行精粒度语义合成。 新颖性:首次形式化复调音乐编辑中的“语义-声学不对齐”问题;将判别式的BSS输出(IRM)转化为生成式扩散模型内的软注意力偏差,统一了判别与生成范式;提出了在Pre-Softmax logit空间进行注意力干预的机制,利用Softmax的非线性放大效应以实现更锐利的决策边界。 主要实验结果:在MUSDB18-HQ和MusicDelta数据集上,使用自建的PolyEvalPrompts基准(1170个编辑任务)进行评测。Polyphonia的CLAP分数比最优基线Melodia提升约15.5%(MusicDelta: 0.437 vs. 0.380)。在结构保持与音色对齐的综合指标(ASB, AMB)上取得最优平衡,但在LPAPS和CQT1-PCC等结构保真度指标上并非最优,展现了灵敏度-保真度的清晰trade-off。主观评估中,Polyphonia在目标音色准确性(TTA)和全局音频一致性(GAC)上得分最高。 实际意义:为音乐制作提供了一种零样本的声部级精确编辑工具,避免了对昂贵监督微调(如Music ControlNet)的依赖,具有直接集成的工程潜力。 主要局限性:推理速度慢(扩散迭代100步),高度依赖BSS模型的分离质量和预训练生成模型的能力天花板。作者声称将探索flow-matching等加速策略。 🔗 开源详情 代码:未提供任何代码仓库链接。 模型权重:未发布 Polyphonia 自身的模型权重。实验依赖于预训练的第三方模型:AudioLDM 2 的 cvssp/audioldm checkpoint、MusicGen 的 facebook/musicgen-melody checkpoint、HT-Demucs、Open-Unmix 等,这些均为公开可获取的开放权重。 数据集:使用公开数据集 MUSDB18-HQ 和 MusicDelta(来自MedleyDB)。自建的 PolyEvalPrompts 数据集已公开在Demo页面,但未提供直接下载链接。 Demo:https://polyphonia2026.github.io/polyphonia-demo/ 复现材料:论文附录(C、E、G、J)提供了详细的实现细节、超参数配置与评估方法,并包含核心算法的伪代码。但缺少实际源码、配置文件或模型权重,不能直接复现。 论文中引用的开源项目: AudioLDM 2:https://github.com/haoheliu/AudioLDM2 HT-Demucs:https://github.com/facebookresearch/demucs Open-Unmix:https://github.com/sigsep/open-unmix-pytorch LAION-CLAP:https://github.com/LAION-AI/CLAP MusicGen(来自 AudioCraft):https://github.com/facebookresearch/audiocraft T5(text-to-text-transfer-transformer) GPT-2:https://github.com/openai/gpt-2 nnAudio:https://github.com/KinWaiCheuk/nnAudio Qwen-Audio:https://github.com/QwenLM/Qwen-Audio Qwen3:https://github.com/QwenLM/Qwen3 fadtk(FAD 工具):https://github.com/gudgud96/fadtk 🏗️ 方法概述和架构 Polyphonia是一个基于预训练AudioLDM 2扩散模型的双路径零样本编辑框架。其核心思想是:利用盲源分离(BSS)获得的概率化频谱掩码作为外部声学先验,在扩散模型的逆序推理(Inversion)和编辑去噪(Editing)过程中,对T-UNet的注意力图进行校准,从而解决纯语义注意力在复调音乐中无法精确定位目标声部的问题。整体流程分为三个阶段: ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 475 words

PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models

📄 PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models #多模态模型 #音视频理解 3.6/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0/1.5 📝 3.6/10 | 后50% | #音视频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Song Li(北京邮电大学 网络与交换技术国家重点实验室) 通讯作者:Yongping Xiong(北京邮电大学 网络与交换技术国家重点实验室) 其他作者:无。论文仅列出两位作者。 💡 毒舌点评 本文基于对多模态大模型中注意力的观察,构建了一套无训练的推理阶段令牌压缩流水线。这种“观察-设计-验证”的套路本身并无新意,且每个模块(早期融合、注意力剪枝、频域压缩)均是现有技术的直接借用或微调。更致命的是,论文声称“高效推理”,却完全没有提供任何代码、模型权重或复现配置,这使得所有所谓的效率提升、记忆开销减少和延迟降低都成了无法核实的“纸上谈兵”。在开源已成为顶级会议标配的今天,这种做法严重削弱了论文的可信度和影响力,对于注重实践和复现的语音/音频社区而言,这更是一篇参考价值几乎为零的工作。 📌 核心摘要 这篇论文旨在解决大型多模态模型(LMMs)在推理长音视频内容时,因输入令牌数量巨大而导致的计算和内存开销过高的问题。文章通过对LLM内部注意力分布的分析,做出了两个核心观察:(1)跨模态交互主要集中在LLM的浅层,深层则趋于稀疏和抽象;(2)在所有层中,音频令牌获得的注意力权重始终高于视频令牌,表明音频包含更密集的语义信息,而视频则存在大量冗余。基于这些观察,作者提出了PRIM,一个无需额外训练、即插即用的推理阶段协同压缩框架。该框架包含四个主要模块:多模态交叉融合(MCF)将文本-音视频的早期交互外移至LLM之前;注意力引导的选择(AGS)利用音频显著性动态控制各时间窗口的视频令牌压缩比率;频率感知压缩(FAC)利用2D-DCT保留低频能量分量以压缩视频令牌;任务自适应剪枝(TAA)则根据指令复杂度在LLM内部动态分配令牌预算。实验在Qwen2.5-Omni、LLaVA-OneVision、LLaVA-Video等模型和多个音视频基准(如MVBench、VideoMME、AVUT)上展开,结果表明PRIM在显著降低FLOPs(低至28%)和推理延迟的同时,能保持与全量模型接近甚至更优的准确率。其声称的实际意义在于为多模态模型的部署提供了一种低成本方案。 核心实验数据(基于Qwen2.5-Omni-7B)如下所示: 方法 保留率 FLOPs比 MVBench MLVU LongVideoBench VideoMME Overall 平均分 Qwen2.5-Omni-7B (全量) 100% 100% 59.0 58.5 67.3 60.7 61.4 PRIM (Ours) 65% 54% 58.8 58.3 67.1 60.3 61.1 PRIM (Ours) 50% 41% 57.6 58.4 65.9 59.6 60.4 PRIM (Ours) 35% 28% 54.3 53.2 62.9 56.2 56.7 主要局限包括:方法强依赖于固定时间窗口划分,无法直接处理流式输入;所有评估均基于离线长视频理解基准,缺乏对纯音频任务(如ASR、音频事件检测)的验证,在多任务/多场景下如何自动、泛化地分配压缩比率仍未解决;完全没有提供开源代码或模型,复现和实际应用价值存疑。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 293 words

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

📄 ProactiveLLM: Learning Active Interaction for Streaming Large Language Models #流式处理 #语音识别 #语音翻译 7.2/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | #语音识别 | #知识蒸馏 | #流式处理 #语音翻译 | arxiv 👥 作者与机构 第一作者:Junlong Tong(上海交通大学,Eastern Institute of Technology, Ningbo) 通讯作者:Xiaoyu Shen(Eastern Institute of Technology, Ningbo) 作者列表:Junlong Tong(上海交通大学,Eastern Institute of Technology, Ningbo)、Yao Zhang(Eastern Institute of Technology, Ningbo)、Anhao Zhao(Eastern Institute of Technology, Ningbo,香港理工大学)、Yingqi Fan(Eastern Institute of Technology, Ningbo)、Yunpu Ma(Munich Center for Machine Learning, LMU)、Xiaoyu Shen(Eastern Institute of Technology, Ningbo) 该论文发表于 ICML 2026(Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026) 💡 毒舌点评 该论文提出了一种巧妙的"内生信号驱动"范式,用自蒸馏和掩码训练替代外部对齐标注,让流式LLM学会"审时度势",在非单调对齐任务(如QA)上展现了惊艳的上下文裁剪能力(如仅用78%上下文恢复97%性能)。然而,其决策头(熵/注意力驱动)的设计相对简单,本质上只是一个阈值触发器,远未触及学习型策略的上限。与强学习型基线的对比仅用了2000条数据,难以令人信服地论证内生策略的绝对优势。更令人担忧的是,在单调任务MT上,Proactive-Entr的延迟实际上高于Wait-9(AIL 8.36 vs 6.87),论文正文中"maintaining lower latency"的笼统宣称有过度包装之嫌——读者需仔细区分Proactive-Attn和Proactive-Entr的不同表现,不可被论文的修辞所误导。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 344 words