Audio Spotforming via Post-Filtering Using Cross-Array Non-target Estimates

📄 Audio Spotforming via Post-Filtering Using Cross-Array Non-target Estimates #维纳滤波 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 6.6/10 | 前50% | #维纳滤波 | #维纳滤波 | arxiv 👥 作者与机构 作者: Yuto Ishikawa († 通讯作者), Li Li, Shogo Seki, Kouei Yamaoka 机构: 作者1, 2属于未明确说明的机构;作者1同时在CyberAgent实习期间完成此工作。 💡 毒舌点评 这篇工作提出了一个想法上颇为巧妙的解决方案:用其他麦克风阵列“看到”的非目标成分,来估计当前阵列“看不到”的非目标成分,从而避免了传统方法中棘手的低秩模型拟合问题。这就像利用多个视角的监控摄像头互相补充盲区信息,概念上很吸引人。然而,审稿人必须指出其“巧妙”背后的代价:1)它严格依赖于精确的、预先知道的目标方向假设,这在真实动态场景中是个巨大的理想化;2)其核心模块GC-ILRMA本身就是一个计算量不小的独立ILRMA,所谓的“计算复杂度降低”是相对于需要海量基函数(如300个基)的NTF基线而言,这有点田忌赛马的味道;3)整个评估被限制在极度理想化的模拟环境中(最多4个说话人,干净的房间响应,等功率混合),这使得“优于传统方法”的结论说服力大打折扣。作者将方法的性能增益部分归功于先验分布的稀疏诱导作用,但实验显示不加先验的版本(w/o prior)在多数指标上反而更好,这暗示了那个精心设计的逆伽马先验可能是个“多此一举”的复杂度,其必要性和鲁棒性需要更严格的消融研究来证明。 📌 核心摘要 本文针对音频聚束(Audio Spotforming)中的后滤波(PF)阶段,提出了一种新方法。传统方法(如基于NMF/NTF)依赖低秩近似来估计目标语音的公共谱结构,但低秩模型难以匹配语音信号的复杂性,且需要大量基函数,导致计算复杂度高。本文的核心创新在于:利用分布式麦克风阵列观察到的一个关键几何特性——对于一个阵列而言,与目标方向重叠的非目标成分,可以从其他阵列被空间分离。基于此,作者提出使用来自其他阵列的非目标成分估计,通过加权求和(公式4)来建模当前阵列中目标方向的非目标方差,从而绕开低秩假设。具体实现采用两阶段框架:1)空间滤波(SF)阶段:使用几何约束独立低秩矩阵分析(GC-ILRMA)为每个阵列估计空间滤波器,分离出目标方向信号和多个非目标方向信号;2)后滤波(PF)阶段:对每个阵列构建多通道维纳滤波器,其中非目标方差由跨阵列估计得到。通过最大化后验概率(引入逆伽马先验诱导稀疏性),采用Majorization-Equalization(ME)算法迭代估计目标方差、非目标方差及跨阵列权重。实验表明,所提方法在模拟数据上,在大多数评估指标(SDR, PESQ, STOI)上优于传统NMF/NTF基线,且计算复杂度显著降低。 ...

2026-06-03 · 更新于 2026-08-03 · 4 min · 747 words

BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language

📄 BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language #语音识别 #低资源 #迁移学习 7.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.8/10 | 前25% | #语音识别 | #迁移学习 | #低资源 | arxiv 👥 作者与机构 Muhammad Ali,独立研究者,巴基斯坦吉尔吉特-巴尔蒂斯坦。 💡 毒舌点评 这是一篇典型的“填坑”论文,对于社区的价值大于其技术新颖性。优点是把一个完全被忽视的语言拉进了语音研究的视野,并且极其规范地开源了所有资源(数据、模型、代码、Demo),堪称低资源社区研究的模范。缺点是技术路线非常直白,就是拿现成模型微调,没有在数据增强、归一化、模型架构或评估方法上做出任何实质性的推进。30%的WER说明路还很长,论文更像是一个“开始”的宣言,而非一个“解决”的方案。它最大的贡献是证明了“可行性”并提供了“工具”,而不是“最优解”。 📌 核心摘要 本研究针对在NLP和语音研究中几乎空白的巴尔蒂语,推出了首个公开语音语料库BaltiVoice和对应的微调ASR模型。语料库源自Mozilla Common Voice,包含16.8小时的经验证朗读语音。研究者以OpenAI Whisper-small为基础模型,使用HuggingFace的Seq2SeqTrainer进行微调,并在验证集上取得了30.07%的WER,相比零样本基线的182.18%有大幅提升。论文开源了所有数据、模型、代码和演示,为巴尔蒂语ASR研究建立了可复现的基线。 🔗 开源详情 代码:https://github.com/mohdali-dev/BaltiVoice-ASR 模型权重:https://huggingface.co/mohdali1/whisper-small-balti 数据集:BaltiVoice ASR 数据集,16.8小时巴尔蒂语朗读语音,10,060条经验证语句,采用CC0协议开源。获取链接:https://huggingface.co/datasets/mohdali1/baltivoice-asr Demo:https://huggingface.co/spaces/mohdali1/baltivoice-demo 复现材料:论文提供了详细的训练超参数(如表2所示)和训练曲线(如图3所示)。论文提到提供可复现的训练流程和一个Colab笔记本,并指明可从代码仓库获取。 论文中引用的开���项目: Whisper (Radford et al., 2023):基础模型,项目信息见原论文引用。 HuggingFace Transformers:微调框架,项目主页为 https://github.com/huggingface/transformers。 pydub:音频格式转换工具,项目主页为 https://github.com/jiaaro/pydub。 机器学习影响计算器 (Machine Learning Impact Calculator):用于碳排放估算,来源于 (Lacoste et al., 2019),项目主页为 https://github.com/mlco2/impact。 🏗️ 方法概述和架构 论文的方法论清晰且可复现,主要分为数据构建、模型选择、预处理与微调三个阶段。 ...

2026-06-03 · 更新于 2026-08-03 · 2 min · 254 words

Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

📄 Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals #多模态模型 #语音情感识别 7.2/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.8/1.5 ✅ 7.2/10 | 前50% | #语音情感识别 | #多模态模型 | arxiv 👥 作者与机构 论文作者为 Jiyuan Liu, Liangwei Nathan Zheng, Wei Emma Zhang, Xinpei Wang, Weitong Chen。主要机构为 Adelaide University(澳大利亚)和 Shandong University(中国)。 💡 毒舌点评 这篇工作想在融合前做点事情,动机听起来不错,就是觉得特征里有好有坏,得先挑挑拣拣。VGMR设计得挺精巧,像个精致的瑞士军刀,模块套模块。实验也铺得挺开,五个数据集、两种骨干,消融分析一套一套的,看起来很努力。但问题在于,“价值”这东西到底是个啥,你说它来自交叉模态的一致与冲突,但具体怎么影响最终门控,还是个黑盒。那个用模态移除算出的监督信号\(L_{value}\),感觉像是用一个粗糙的全局指标去指导一个精巧的局部操作,有点拧巴。作者自己也说了计算开销不小,推理延迟翻了几倍,实际落地得掂量掂量。最后,虽然号称通用,但大部分实验还是在情感分析上打转,对真正考验多模态能力的、模态质量参差不齐的现实场景(比如一边说话一边被风吹麦克风)缺乏验证。总的来说,是一篇扎实但创新有限的工作,离“ask what to keep”这个启发性问题的深刻答案还有距离。 ...

2026-06-03 · 更新于 2026-08-03 · 2 min · 296 words

Benchmarking Speech-to-Speech Translation Models

📄 Benchmarking Speech-to-Speech Translation Models #语音合成 #语音识别 #基准测试 #多模态模型 #低资源 8.7/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.6/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.7/10 | 前25% | #语音合成 | #语音识别 | #基准测试 #多模态模型 | arxiv 👥 作者与机构 Alkis Koudounas†, Hayato Futami†, Quentin Jodelet†, Osamu Take†, Shinji Watanabe‡, Emiru Tsunoo† †Sony Group Corporation, Japan ‡Carnegie Mellon University, USA 💡 毒舌点评 这是一篇扎实的“元研究”(meta-research)论文。优点很明显:S2ST领域确实急需一个统一的评估标准,作者们以惊人的工程量(1248个配置!)构建并发布了这个COMPASS框架,这种“苦力活”对于社区发展的价值毋庸置疑。然而,审稿人需要清醒地认识到,这篇论文的核心贡献在于“测量工具”和“大规模实证”,而非提出新的翻译或合成算法。因此,它的“创新性”应相对于评估框架领域来评判,而非模型架构领域。论文的实验设计非常全面,但其结论在某种程度上依赖于特定的基准数据集(FLEURS, CVSS),这在作者自己提出的局限性中已经承认。最大的短板在于开源状态:承诺的工具包代码尚未公开,这严重影响了论文的即时可用性和可复现性。总体而言,这是一篇对社区有用的基础设施论文,但距离一个“完美”的基准评估还存在距离。 ...

2026-06-03 · 更新于 2026-08-03 · 2 min · 343 words

Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching

📄 Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching 6.9/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 6.9/10 | 前50% | arxiv 👥 作者与机构 作者: Nishchay Nilabh, Neeraj Kumar Sharma 机构: 未提及 💡 毒舌点评 这篇论文的点子挺巧妙,就像给对话系统做“亲子鉴定”,看看表示模型到底是学到了两人互动的“化学反应”,还是只记住了每个人的“声纹指纹”。实验做得也挺系统,用了四种“探针”(嵌入模型),还拉了朗读语料来当对照组,结论似乎挺有说服力。但是,它的问题也和它的优点一样明显。理论深度像一层窗户纸,通信适应理论(CAT)提了一嘴就过去了,DDM到底是不是描述CAT现象的“标准答案”都没说清楚。方法细节上,那个“per-speaker z-normalization”到底是在哪一步做的?是在算矩阵之前还是之后?这可不是小问题,直接影响实验的公平性。实验分析也差点意思,光说语义嵌入区分度最好,但预训练语言模型自己可能就认识这些句子,这到底算DDM的功劳还是模型的功劳?统计显著性也没提,让人心里没底。总的来说,框架不错,是个有用的工具,但离一篇理论扎实、论证严密的顶会论文还有距离。 📌 核心摘要 该论文针对对话交互表示评估中的一个核心挑战——如何区分真正的交互结构与说话者个体特征——提出了一个名为“说话者切换测试”的诊断框架。其核心思想是:通过将一个对话中的一位说话者替换为无关的其他说话者,构建一个破坏了原配对共适应性但保留了个体特征分布和轮次结构的“切换DDM”,然后训练分类器来区分真实DDM与切换DDM。如果分类器能够成功区分,则证明原始DDM编码了真实的交互特有结构。论文在CANDOR自然对话和LibriSpeech朗读语音数据集上,对四种不同类型的嵌入(声学:wav2vec 2.0,说话者:x-vector;声学:openSMILE;语义:all-MiniLM)生成的DDM进行了评估。结果表明,所有嵌入类型生成的DDM均可被以高于随机水平的准确率区分,其中语义嵌入区分效果最佳。跨语料库对比发现,在朗读语音上的区分度普遍高于自然对话。GradCAM分析揭示了不同模态下分类器决策依赖的DDM区域结构差异。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集: CANDOR语料库:论文中未提及具体获取链接(论文仅引用了 [reece2023])。 LibriSpeech语料库:论文中未提及具体获取链接(论文仅引用了 [panayotov2015])。 Demo:论文中未提及 复现材料:论文中未提及训练配置、检查点或附录等具体复现材料。 论文中引用的开源项目: wav2vec 2.0:论文中未提供链接(论文仅引用了 [baevski2020])。 openSMILE:论文中未提供链接(论文仅引用了 [eyben2010, eyben2016])。 ECAPA-TDNN (x-vector模型):论文中未提供链接(论文仅引用了 [desplanques2020],并通过 pyannote.audio 进行提取)。 pyannote.audio:论文中未提供链接(论文仅引用了 [bredin2023pyannote])。 all-MiniLM (Sentence-BERT模型):论文中未提供链接(论文仅引用了 [reimers2019])。 GradCAM:论文中未提供链接(论文仅引用了 [selvaraju2017])。 PyTorch:论文中未提供链接(论文仅引用了 [paszke2019])。 Adam优化器:论文中未提供具体开源链接(这是一个标准优化算法)。 🏗️ 方法概述和架构 本文提出的方法是一个用于评估对话表示是否编码了交互结构的诊断框架,核心是说话者切换测试。其架构和流程可分为以下几个关键阶段: ...

2026-06-03 · 更新于 2026-08-03 · 2 min · 337 words

C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification

📄 C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification #音频分类 #数据增强 #生成模型 7.3/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.3/10 | 前50% | #音频分类 | #变分自编码器 | #数据增强 #生成模型 | arxiv 👥 作者与机构 作者:Ziqi Ma, Mengyu Han, Anteng Cai, Zhanchong Liu, Bowen Feng, Hang Yu, Sheng Hu 机构:上海大学计算机工程与科学学院;西交利物浦大学创业与技术学院(太仓)人工智能与先进计算学院;大阪大学情报科学研究科 💡 毒舌点评 这篇论文工作量扎实,试图用离散表示和Transformer来解决呼吸音分类这个老大难问题。动机清晰,痛点抓得准,方法设计也算精巧,特别是那个“原型融合”的想法。但作者在讲故事时,有些关键的“证据链”断了。你说你的方法“临床有效”,请问有医生背书吗?生成的湿啰音,是能骗过老中医还是能骗过听诊器?另外,实验都在自家精心清洗过的数据集上,这就像在无尘车间里测试防尘口罩——看起来很美好,但离真实世界的“脏乱差”还有多远?最后,代码、数据、权重,三无产品,让想复现的同行只能对着公式空想。总之,是个不错的工作,但离“临床可用”和“广泛可复现”的终点,还有好几公里的坑要填。 ...

2026-06-03 · 更新于 2026-08-03 · 2 min · 233 words

Cosmos 3: Omnimodal World Models for Physical AI

📄 Cosmos 3: Omnimodal World Models for Physical AI #多模态模型 #扩散模型 #音频生成 #强化学习 10/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 10/10 | 前10% | #音频生成 | #强化学习 | #多模态模型 #扩散模型 | arxiv 👥 作者与机构 论文作者:NVIDIA(英伟达)。贡献者来自NVIDIA的多个部门,包括模型架构、Reasoner预训练/后训练数据、生成器数据、训练、基础设施、结果和基准测试等团队。 💡 毒舌点评 Cosmos 3是一篇典型的“巨无霸”式工业技术报告,旨在通过发布一个全模态(语言、图像、视频、音频、动作)统一模型,为Physical AI(机器人、自动驾驶)提供一个通用的骨干网络。其核心动机——打破理解、生成和行动模型的分离——是清晰且有价值的。模型在架构上(MoT)和训练策略上(分阶段、多模态课程)都有扎实的工程实践,并在多个SOTA榜单上取得了优异成绩。然而,它的优势很大程度上源于NVIDIA庞大的资源和数据工程能力,而非基础科学层面的颠覆性创新。论文本身是出色的工程集成和系统设计的展示,但在分析某个具体子问题(如长尾物理规律的建模、跨具身迁移的理论基础)时深度有限。更关键的是,作为一篇技术报告,其“自我声明”的局限性部分(sim-to-real gap等)论述得相当克制,甚至可以说是轻描淡写,对于一篇宣称要解决真实世界Physical AI问题的工作来说,这需要读者自己更批判性地审视。开源程度很高,但模型的巨大规模和复杂的基础设施栈,使得真正的“可复现性”对普通研究者而言几乎是一个伪命题。 📌 核心摘要 Cosmos 3 是一个统一的全模态世界模型家族,旨在联合处理和生成语言、图像、视频、音频和动作序列,以支持Physical AI(具身智能)。其核心架构是基于Mixture-of-Transformers (MoT) 的双塔结构:一个自回归Reasoner路径负责理解和推理,一个扩散Generator路径负责生成,两者通过双流联合注意力机制交互。模型采用多阶段训练流程,Reasoner先在大规模图文/视频-文本数据上预训练,再在Physical AI任务上微调;Generator则采用渐进式多模态课程训练,从图像、视频、音频预训练开始,逐步引入动作和传输数据进行中期训练,最后在特定领域数据上进行后训练。评估显示,Cosmos 3在多个理解与生成基准测试上达到或超越了当时的开源及部分闭源模型的最佳水平,其后训练版本在Artificial Analysis榜单上被评为最佳开源文生图和图生视频模型,在RoboArena上被评为最佳机器人策略模型。论文同时开源了代码、模型权重、合成数据集和评估基准。 ...

2026-06-03 · 更新于 2026-08-03 · 3 min · 629 words

CoughSense: Five-Class Respiratory Disease Classification via Whisper Encoder Fine-Tuning and Dual-Encoder Cross-Attention Fusion with Balanced Contrastive Learning

📄 CoughSense: Five-Class Respiratory Disease Classification via Whisper Encoder Fine-Tuning and Dual-Encoder Cross-Attention Fusion with Balanced Contrastive Learning #数据增强 #领域适应 9.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 9.1/10 | 前25% | #数据增强 | #数据增强 | #领域适应 | arxiv 👥 作者与机构 作者: Nikhil Vincent 机构: Independent Researcher, Bothell, Washington, USA 通讯作者: Nikhil Vincent (nikhil.vincent.v@gmail.com) 💡 毒舌点评 这篇工作像一篇扎实的工程报告,而非充满灵光的科学探索。其核心卖点——“主动帧QKV注意力池化”——本质上是对预训练模型输入不匹配问题的一种直接而有效的工程修补,虽然实用,但理论深度有限。论文更像是一个“最佳实践”集锦,将FiLM、SupCon、GRL、Balanced Mixup等现有技术组合在一起应对医学音频的挑战,这种“工具箱”式的整合创新性不足。真正的短板在于其评估的“离线”本质:在公开数据集上刷分容易,但论文对标签噪声、儿科与成人领域偏移等关键问题的讨论仅停留在表面,缺乏深入的量化分析或解决方案,这使得“部署为实时移动应用”的结论显得有些仓促和过度自信。作者将“Whisper首次应用于多类咳嗽分类”作为首要贡献,但这更多是应用上的首次,而非方法论上的突破。总体而言,这是一篇完成度高但突破性弱的工作,适合寻求实用方案的工程师,但难以满足追求理论创新的顶级会议。 ...

2026-06-03 · 更新于 2026-08-03 · 3 min · 452 words

Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

📄 Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening #语音合成 #扩散模型 #生成模型 7.1/10 | 创新 1/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | #语音合成 | #扩散模型 | #生成模型 | arxiv 👥 作者与机构 Xinqi Bao: KTH Royal Institute of Technology, Stockholm, Sweden; Karolinska Institutet (KI), Stockholm, Sweden Jia Bi: Rutherford Appleton Laboratory, United Kingdom Xin Chen: Peng Cheng Laboratory, China Ernest Nlandu Kamavuako: King’s College London, United Kingdom Saikat Chatterjee: KTH Royal Institute of Technology, Stockholm, Sweden ...

2026-06-03 · 更新于 2026-08-03 · 2 min · 330 words

Domain-Agnostic Incremental Learning for Sound Classification. A DCASE 2026 Challenge task

📄 Domain-Agnostic Incremental Learning for Sound Classification. A DCASE 2026 Challenge task 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.1/10 | 前50% | arxiv 👥 作者与机构 论文为DCASE 2026挑战赛任务介绍,未明确列出论文作者及所属机构。 💡 毒舌点评 这篇论文本质上是一个挑战赛的任务说明书和基线描述。它的核心贡献是“定义了一个问题”并“提供了一个很弱的起点”,而不是解决了问题。作为一篇独立的研究论文,其技术深度和创新性严重不足。基线系统采用了一个十年前就流行的“领域特定BN层”思路,在推理时通过熵选择域的机制存在明显设计缺陷(偏向于先验D1)。论文缺乏任何新颖的方法提出、深入的理论分析或对基线的系统性消融研究。结果数字(44.9%)也表明基线几乎不可用。这篇论文的价值完全在于其作为“任务定义”的开创性(首次在DCASE形式化DAIL),而非作为一篇学术论文的技术贡献。 📌 核心摘要 本文首次在DCASE 2026挑战赛中形式化并提出了“声音分类的域无关增量学习”任务。该任务要求模型依次学习来自不同声学域(D1, D2, D3)的相同声音类别数据,且在推理时没有域标识。论文提供了一个基于PANNs CNN14架构的基线系统,其核心是在每个新域上仅调整/添加域特定的批归一化层。推理时,系统通过计算各域特定BN层组合预测的熵,选择不确定性最低的域进行分类。在开发集上,基线系统在三个域上的平均准确率仅为44.9%。论文指出,当前性能瓶颈主要在于域识别错误,若使用真实域标签,平均准确率可提升至67.6%。本文的核心价值在于为音频社区建立了一个标准化的评估框架和基准,以推动针对动态分布变化场景下抗遗忘和泛化算法的研究。 🔗 开源详情 代码:未提供 模型权重:未提供 数据集:论文提及了 “DIL-DCASE26 development dataset”,但未提供下载链接或开源协议。具体需参考DCASE 2026挑战赛官方发布。 Demo:未提供 复现材料:论文详细描述了基线系统的训练配置(网络架构、优化器参数、输入特征等),但未提供预训练检查点或可直接运行的脚本。 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 论文提出的基线系统架构基于PANNs CNN14,旨在实现域无关增量学习。其核心思想是使用域特定的批归一化层来适应不同的数据分布,同时共享其他所有层的参数。 ...

2026-06-03 · 更新于 2026-08-03 · 1 min · 146 words