Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

📄 Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery 标签:#音频理解 #Transformer #自监督学习 #低资源 8.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #Transformer | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Hayat Rajani(Computer Vision and Robotics Research Institute (ViCOROB), University of Girona, Spain) 通讯作者:Hayat Rajani 作者列表:Hayat Rajani、Nuno Gracias、Rafael Garcia(机构:Computer Vision and Robotics Research Institute (ViCOROB), University of Girona, Spain) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 758 words

语音/音乐/音频论文速递 2026-08-26

语音/音乐/音频论文速递 2026-08-26 共分析 26 篇论文 ⚡ 今日概览 ✅ 筛选入选 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 7 篇 ███████ #空间音频 3 篇 ███ #语音交互 2 篇 ██ #语音合成 2 篇 ██ #音乐生成 2 篇 ██ #音视频理解 2 篇 ██ #声源定位 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions… 9.6 前10% 方法研究 #语音合成 🥈 LAION-BVD: A 10-Million-Hour Open Video Dataset for… 9.4 前10% 数据集与基准 #音视频理解 🥉 The ISCSLP 2026 Real-World Audio-Visual Speech… 8.8 前25% 数据集与基准 #音视频语音分离 4. EM-KalmanNet: Learned Expectation-Maximization for… 8.8 前25% 方法研究 #声源定位 5. EXAM\(^2\): \(\underline{Ex}tending\) \(\underline{A}udio\)… 8.7 前25% 数据集与基准 #音频理解 6. FireRedAudio: A General-Purpose Audio Language Model… 8.7 前25% 模型报告 #音频理解 7. Arbitrary Polygon Oscillator: Generalizing Polygonal… 8.7 前25% 方法研究 #音乐生成 8. Relative Time Intervals Representation for Word-level… 8.6 前25% 方法研究 #语音识别 9. REDnet: Recursive Encoder and Decoder for Speech… 8.2 前25% 方法研究 #语音分离 10. From local kernels to global form: modeling the… 8.2 前25% 理论研究 #音乐理解 11. Lost in Speech: Trilingual Spoken Hallucination… 8.2 前25% 数据集与基准 #音频理解 12. Weakly Supervised Seafloor Segmentation for Seagrass… 8.1 前25% 方法研究 #音频理解 13. SonarLLM: A Native Sonar–Optical Multimodal Large… 8.0 前25% 方法研究 #音频理解 14. CoSTALA: Compositional Spatio-Temporal Audio-Language… 7.9 前25% 方法研究 #空间音频 15. Don’t Just Listen, Try Planning: Graph-based Retrieval… 7.8 前25% 方法研究 #音频理解 16. On the Robustness of Audio Deepfake Detection under… 7.7 前25% 方法研究 #音频伪造检测 17. Speech-to-SOAP: End-to-End Summarization of Medical… 7.7 前25% 系统技术报告 #音频理解 18. Array-Agnostic Ambisonics Encoding via Diffusion… 7.5 前25% 方法研究 #空间音频 19. OmniJudge or OmniBias? Diagnosing Multimodal Judges… 7.4 前50% 数据集与基准 #音频质量评估 20. Task-disentangled Low-Rank Adaptation for Versatile… 7.4 前50% 方法研究 #音视频理解 21. Anatomy of a Scam Call: What 10,000 real scam and spam… 7.3 前50% 应用研究 #语音交互 22. Preference Optimization for Non-Verbal Vocalization… 7.1 前50% 方法研究 #语音合成 23. One Timeline, Many Renderings: A Wolfram Language… 7.0 前50% 系统技术报告 #音乐生成 24. Visually-Guided Spatial Audio Generation for… 6.9 前50% 方法研究 #空间音频 25. Benchmarking LLM Judges for Voice-Agent Evaluation… 6.6 前50% 数据集与基准 #语音交互 26. Investigating voiced and unvoiced regions of speech… 6.4 前50% 方法研究 #语音伪造检测 📋 论文列表 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ...

2026-08-26 · 更新于 2026-09-04 · 22 min · 4543 words

MusPyExpress: Extending MusPy with Enhanced Expression Text Support

📄 MusPyExpress: Extending MusPy with Enhanced Expression Text Support 标签:#音乐理解 #Transformer #开源工具 #数据集 #音乐生成 8.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐理解 | #Transformer | #开源工具 #数据集 | arxiv 👥 作者与机构 第一作者:Phillip Long(Computer Science & Engineering Department, University of California, San Diego) 通讯作者:正文未明确标注 作者列表:Phillip Long、Hao-Wen Dong、Julian McAuley、Zachary Novack(机构:Computer Science & Engineering Department, University of California, San Diego;Department of Performing Arts Technology, University of Michigan, Ann Arbor) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 588 words

语音/音乐/音频论文速递 2026-08-25

语音/音乐/音频论文速递 2026-08-25 共分析 46 篇论文 ⚡ 今日概览 ✅ 筛选入选 46 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 7 篇 ███████ #音视频理解 4 篇 ████ #语音交互 3 篇 ███ #语音增强 3 篇 ███ #语音情感识别 3 篇 ███ #音频事件检测 3 篇 ███ #音频理解 3 篇 ███ #语音合成 2 篇 ██ 📊 论文评分排行榜(46 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 TLive-Omni: An Omni-Modal Understanding Model for E… 10.0 前10% 系统技术报告 #音视频理解 🥈 sanoTTS: The Smallest Real-Time Neural TTS on a… 10.0 前10% 系统技术报告 #语音合成 🥉 Do Spoken Language Models Hear Speech as They Read… 10.0 前10% 方法研究 #语音交互 4. LipsAM: Lipschitz-continuous Neural Networks for… 10.0 前10% 理论研究 #音频修复 5. PolyChirp: Multi-Species Birdsong Classification Using… 10.0 前10% 系统技术报告 #音频分类 6. EchoWM: Open and Enterable Omnimodal World Models 10.0 前10% 系统技术报告 #音视频生成 7. Simulation-to-Real First-Break Segmentation for… 9.8 前10% 应用研究 #音频事件检测 8. A Computationally Efficient Likelihood Approximation… 9.8 前10% 方法研究 #声源定位 9. A Factorial Ablation of a Speech-to-SFT Pipeline… 9.7 前10% 应用研究 #语音交互 10. Self-Supervised Speech Representations Track Spoken… 9.7 前10% 应用研究 #语音属性识别 11. AudioWorldSim: Realistic Binaural Audio Datasets For… 9.7 前10% 系统技术报告 #空间音频 12. AT-ADD: A Benchmark and Challenge for Robust and All… 9.6 前10% 数据集与基准 #音频伪造检测 13. WnW: Waxing-and-Waning KV Cache for Long-Form Speech… 9.4 前10% 方法研究 #语音交互 14. Better Retrieval, Worse Robustness: How Multi-hop RAG… 9.1 前10% 应用研究 #音频理解 15. Training DeepFilterNet with Accurate Room Acoustic… 9.0 前10% 应用研究 #语音增强 16. TurboBias 2.0: Streaming Context-Biasing for… 9.0 前10% 系统技术报告 #语音识别 17. FlowSep 2: Self-Supervised Flow Matching for Language… 9.0 前10% 方法研究 #音频分离 18. Pre-Decoding Acoustic Triage for Budgeted Vision… 9.0 前10% 方法研究 #音视频理解 19. Do SpeechLMs Hear Their Own Opinions? Diagnosing and… 8.9 前25% 方法研究 #语音情感识别 20. MRMAD: A Multi-Round Multi-Audio Benchmark for… 8.9 前25% 数据集与基准 #音频质量评估 21. Unsupervised Speech Recognition at the Syllable Level 8.9 前25% 方法研究 #语音识别 22. Towards Actionable Surgical Team Dynamics: from… 8.9 前25% 数据集与基准 #音视频理解 23. Long-Horizon Audio-Visual Generation for Persistent… 8.9 前25% 系统技术报告 #音视频生成 24. Do Time-Series Foundation Models Pay Off for… 8.8 前25% 应用研究 #音频事件检测 25. MusPyExpress: Extending MusPy with Enhanced Expression… 8.7 前25% 系统技术报告 #音乐理解 26. Adaptive Hierarchical Representation Alliance for… 8.6 前25% 方法研究 #语音情感识别 27. Vibrato Matching for Modulation Control and Blending… 8.5 前25% 方法研究 #音频生成 28. Spiking Neural Networks for Energy-Efficient Object… 8.5 前25% 应用研究 #音频事件检测 29. Development and Feasibility Evaluation of an Edge AI… 8.4 前25% 应用研究 #语音识别 30. Dual-Scale State-Space Modeling with Speaker-Wise… 8.4 前25% 方法研究 #语音情感识别 31. μNet: Ultra-Low-Memory and Low-Complexity Speech… 8.3 前25% 方法研究 #语音增强 32. Cross-Subject Generalization in Decoding Perceived… 8.3 前25% 方法研究 #语音识别 33. Reasoning-Oriented Post-Training and Inference-Time… 8.3 前25% 应用研究 #音频理解 34. Multi-Modal Semantic Expansion with Constrained LLM… 8.3 前25% 系统技术报告 #音乐推荐 35. DAMOS: Learning Distortion-Aware Speech Quality… 8.2 前25% 方法研究 #语音质量评估 36. Multi-Task Learning for Non-Canonical Phoneme… 8.2 前25% 方法研究 #语音识别 37. MetaSICL: Globalizing Auditory LLMs for Underserved… 8.0 前25% 方法研究 #音频理解 38. AudioNoisePrints: Model-free audio watermarking using… 7.9 前25% 方法研究 #音频水印 39. Building and Evaluating a Synthetic Bengali Speech… 7.6 前25% 数据集与基准 #语音合成 40. SlimDiffuSE: Towards Efficient Diffusion-Based Speech… 7.6 前25% 方法研究 #语音增强 41. DiaScriber: A Speech LLM for Joint Diarization and… 7.3 前50% 方法研究 #语音识别 42. A Regularized Block Diagonal RLS Algorithm for… 7.2 前50% 方法研究 #回声消除 43. Separating Voice from Age in COPD Screening 7.2 前50% 应用研究 #语音属性识别 44. Mitigating Speaker Leakage in Cascaded Multi-talker… 7.1 前50% 方法研究 #语音识别 45. Motion-Aware Reasoning from Speech to Mask Tracks… 7.1 前50% 系统技术报告 #音视频理解 46. Humanoid Musical Robots as Experimental Interfaces for… 5.9 前50% 应用研究 #音视频交互 📋 论文列表 🥇 TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming 10.0/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ...

2026-08-25 · 更新于 2026-09-04 · 34 min · 7173 words

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

📄 Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners 标签:#音频理解 #自监督学习 #Transformer #预训练 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #自监督学习 | #Transformer #预训练 | arxiv 👥 作者与机构 Umberto Cappellazzo、Stavros Petridis、Maja Pantic 来自帝国理工学院,Xubo Liu 来自萨里大学。论文首页提供项目页与代码链接(HTML 超链接形式),致谢中感谢 Nvidia 研究员的讨论。 💡 毒舌点评 这是那种让整个子领域重新审视自己「配方复杂度」的论文:当音频自监督学习卷到需要重建解码器、声学分词器、EMA 教师网络和正则化辅助损失齐上阵时,作者只用了因果掩码加停止梯度就做到了与最强方法打平——AS-2M 上 50.18 mAP 追平依赖音频混合监督与学生教师架构的 SSLAM,IEMOCAP 上以 3.5 个点的优势大幅刷新。设计哲学的克制(极简配方)与实验的全面(六基准、三规模、逐层探针、注意力可视化)形成了少见的平衡。但严格审视仍有几处值得较真。其一,「追平 SSLAM」的说法要打折:SSLAM 的预训练数据与 NAPE 并不完全同口径,50.2 对 50.18 的差距在无方差报告的情况下无法解读为等价。其二,全部实验没有多种子方差或置信区间,自监督训练对种子和超参敏感是常识,单点数字的说服力有限。其三,因果扫描顺序虽然被论证为音频的关键设计轴,但对角扫描相对光栅的优势幅度很小且随规模变化,这一「音频特有设计轴」的实际重要性可能被叙事放大了。其四,线性探针绝对值偏低(AS-2M 最高 27.1 mAP),说明预测目标与线性可分性的错位真实存在,特征要用起来还是得微调。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 408 words

Tracking the Trend in How Speech Synthesizers Deceive People

📄 Tracking the Trend in How Speech Synthesizers Deceive People 标签:#语音伪造检测 #Transformer #语音合成 #音频质量评估 6.0/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 ✅ 6.0/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音伪造检测 | #Transformer | #语音合成 #音频质量评估 | arxiv 👥 作者与机构 Milan Šalko、Anton Firc、Kamil Malinka、Vojtěch Staněk、Martin Perešini、Filip Pleško、Jakub Reš 来自布尔诺理工大学(Brno University of Technology)Security@FIT 实验室,捷克共和国。研究通过该校伦理委员会审批(EK:2024-002),受校内项目 FIT-S-26-9011 资助;生成内容刻意避开敏感、政治或冒犯性表述以保护被克隆的公众人物。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 407 words

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

📄 VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation 标签:#音视频生成 #强化学习 #Transformer #模型评估 8.3/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #强化学习 | #Transformer #模型评估 | arxiv 👥 作者与机构 Yinming Huang、Shuyuan Tu(共同一作)、Xi Yan、Zihan Yang 来自复旦大学与上海创新研究院,Jianhua Han、Xu Hang 来自银旺智能科技,Yu-Gang Jiang 与 Zuxuan Wu(通信作者)来自复旦大学。代码已在 GitHub 公开,数据构建使用 Gemini 3.1 与 Qwen3.5-Omni 等商业及开源模型。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 391 words

语音/音乐/音频论文速递 2026-08-21

语音/音乐/音频论文速递 2026-08-21 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 3篇 ███ #语音交互 2篇 ██ #语音伪造检测 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #助听器 1篇 █ #语音情感识别 1篇 █ #音乐检索 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Listening Forward: Next Patch Embedding Prediction… 8.8分 前25% 方法研究 #音频理解 🥈 Towards Quantifying Benchmark Optimization in ASR… 8.5分 前25% 方法研究 #语音识别 🥉 \(TCP_α\): Margin-Controlled Confidence estimation for… 8.4分 前25% 方法研究 #音乐理解 4. VA-Judger: Reward Modeling from Human Preference… 8.3分 前25% 方法研究 #音视频生成 5. Unified Music Identification for Tracks and Versions 8.2分 前25% 数据集与基准 #音乐检索 6. Fourier is Frontier: Frequency-Aware Autoencoding for… 7.5分 前25% 方法研究 #音乐生成 7. Explainability by Design: Structured Kolmogorov-Arnold… 7.5分 前25% 方法研究 #语音伪造检测 8. Represented but Ignored: A Causal Account of Prosodic… 7.2分 前50% 方法研究 #音频理解 9. A Speech Corpus for Mizo Automatic Speech Recognition… 6.7分 前50% 数据集与基准 #语音识别 10. Hear2Act: Benchmarking When Prosody Should Change What… 6.4分 前50% 数据集与基准 #语音交互 11. DAVSS: Distilled Audio-Visual State Space Models 6.4分 前50% 方法研究 #音视频理解 12. A Resource-Efficient CNN-Based EEG Auditory Attention… 6.2分 前50% 系统技术报告 #助听器 13. Tracking the Trend in How Speech Synthesizers Deceive… 6.0分 前50% 应用研究 #语音伪造检测 14. Does Mapping Non-Maximal Probabilities to GMM… 5.6分 前50% 方法研究 #音频理解 15. MultiVerse: A Creator-Centered Approach to Steering… 5.4分 后50% 应用研究 #音乐生成 16. Robust Incomplete Multimodal Sentiment Analysis via… 5.4分 后50% 方法研究 #语音情感识别 17. Does Listening Matter? Backchanneling and Nodding in… 5.2分 后50% 应用研究 #语音交互 18. Dancing Through Soundscapes: Designing a Low-Cost… 5.2分 后50% 应用研究 #音频交互 📋 论文列表 🥇 Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ...

2026-08-21 · 更新于 2026-09-04 · 13 min · 2651 words

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

📄 CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection 标签:#音视频理解 #多模态模型 #对比学习 #Transformer #内容审核 7.2/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #对比学习 #Transformer | arxiv 👥 作者与机构 第一作者:Yuchen Zhang(Institute for Analytics and Data Science, University of Essex) 通讯作者:未明确标注 作者列表: Yuchen Zhang(Institute for Analytics and Data Science, University of Essex) Shuang Dai(Department of Engineering, University of Exeter) Zeyu Fu(Department of Computer Science, University of Exeter) Yunfei Long(School of Electronic Engineering and Computer Science, Queen Mary University of London) Ravi Shekhar(Institute for Analytics and Data Science, University of Essex) Haralambos Mouratidis(Institute for Analytics and Data Science, University of Essex) 💡 毒舌点评 这篇论文把“utterance-aligned clip 多模态对齐 + MoE 动态融合 + local-global 对比学习 + VLM rationale + gated Transformer”组合得比较完整,并且在 HateMM、MHC_CN、MHC_EN、DeHate 四个评测设置上稳定超过 MM-HSD、HVGuard、MoRE 等强基线,工程完成度和实验覆盖度不低。但方法层面的核心增量更像是对现有 MoE、对比学习、clip 级分割和 VLM reasoning 的重新打包,缺乏本质上新的建模机制或理论 insight。更直接地说,rationale 中显式包含 VLM 对 hate/non-hate 的最终判断,存在模型直接利用 Qwen3VL 的预测信号而非真正学会跨模态仇恨理解的嫌疑;论文并未对 rationale 字段做拆解消融来排除这一点。作为音视频理解论文,其音频表征本身并非创新来源,音频只是多模态通道之一,语音领域的核心贡献有限。 ...

2026-08-18 · 更新于 2026-09-04 · 6 min · 1137 words

Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task

📄 Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task 标签:#音频伪造检测 #Transformer #音乐理解 #鲁棒性 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #Transformer | #音乐理解 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Alexandru-Ștefan Moroșanu(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) 作者列表: Alexandru-Ștefan Moroșanu(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) Valerian Cecan(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) Ștefan-Daniel Achirei(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) Laura Erhan(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering;Free University of Bozen-Bolzano) 通讯作者:论文原文未标注通讯作者。 💡 毒舌点评 该文把“编辑音频”作为硬负例来考验 AI 音乐检测器,并通过按参考曲目分组切分来减少泄漏,问题定义比单纯 AI-vs-原始歌曲更有现实价值;但只有 Random Forest 和 MobileNetV2 这类弱基线,又不公开数据、代码或模型,最终只能证明 PaSST 在这个自建数据集上“能用”,难以支撑更一般的鲁棒性结论。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 935 words