XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds

📄 单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作 英文题目:XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds 一句话:针对单通道心肺音频带重叠与非平稳耦合的盲分离难题,XVAE-WMT 以连续小波前端、时序一致性正则与软掩码约束改造变分自编码器,并用 SHAP 筛选潜维度,在人工混合集上取得 26.8 dB SDR 的同时保留可解释的分离路径。 标签:#音频分离 | #变分自编码器 | #医疗音频 | #可解释性 | #无监督学习 评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yasaman Torabi:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. Shahram Shirani:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. James P. Reilly:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. 💬 毒舌点评 将连续小波变换(Continuous Wavelet Transform, CWT)、时序一致性(Temporal Consistency, TC)与软掩码塞进变分自编码器(Variational Autoencoder, VAE)并用SHAP(SHapley Additive exPlanations)做事后剪枝,工程拼装完整且在自制混合集上指标亮眼。问题在于双数据集均为人工随机混合、无真实临床混合验证,时序平滑项与掩码的因果归因被过度包装为可解释性,且关键超参数与统计显著性缺失导致可信度打折。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1456 words

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

2026-09-02 · 更新于 2026-09-04 · 24 min · 4954 words

Disentangling Representation using Attributes-based Gaussian Estimation for Medical Sound Diagnosis

📄 把咳嗽声拆开:用高斯对齐让模型忘记敏感属性 英文题目:Disentangling Representation using Attributes-based Gaussian Estimation for Medical Sound Diagnosis 一句话:针对咳嗽声诊断中属性域偏移与可解释性不足,论文用属性映射嵌入将标量属性高斯化并与 VAE 隐向量对齐、再以互信息上界解耦,在 COUGHVID 过滤后的 2850 段上取得 95.5% AUC,但仅单数据集验证且 99% 召回的可信度仍待检验。 标签:#音频分类 #变分自编码器 #医疗音频 #可解释性 评分:5.5/10 | 创新 1/2 | 技术严谨 0.7/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Ke Zhao:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于将属性映射嵌入(Attribute Mapping Embedding,AME)与变分自编码器(Variational AutoEncoder,VAE)结合,用高斯参数化实现可计算的 Kullback-Leibler 散度(\(D_{KL}\))对齐和互信息(Mutual Information,MI)解耦,思路直观且在小规模咳嗽数据上确实提升了召回率。短板是方法论证与实验支撑均显单薄:仅在 720 例原始音频过滤后的 COUGHVID 单数据集上验证、数学推导存在符号与不等式方向瑕疵、公平性仅靠 t-SNE 定性展示而无定量指标,99% 召回率更像过拟合或划分泄漏的信号而非泛化能力的证明。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1195 words

Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems

📄 口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开 英文题目:Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems 一句话:论文用语言学距离把 L1/L2 的二分偏差变成可回归的连续变量,并在 6 个数据集与 4 种架构上证明:距离越大词错率越高,且深层声学表征会按母语把说话人系统性地隔离而非归一化。 标签:#语音识别 #语音大模型 #多语言 #鲁棒性 #可解释性 评分:6.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Ting-Hui Cheng:Department of Applied Mathematics and Computer Science Line Katrine Harder Clemmensen:Technical University of Denmark Sneha Das:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语言学距离(Linguistic Distance,LD)这一经典二语习得变量系统引入英语自动语音识别(Automatic Speech Recognition,ASR)偏差分析,并用 Tweedie 混合效应模型与层级表征距离关联了误差与潜空间隔离,问题意识清晰。短板是 LD 度量依赖单一网站复合分数且缺乏语言学效度论证,统计报告多处缺失效应量与校正细节,t-SNE 可视化与相关性分析难以支撑因果性结论,整体更像相关性观测报告而非机制解释。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1412 words

MusGU+: Toward a Musician-Centered Evaluation Framework and Discovery Tool for Generative Music AI

📄 别再比谁更像人:当生成音乐的评价回到音乐人的工作台 英文题目:MusGU+: Toward a Musician-Centered Evaluation Framework and Discovery Tool for Generative Music AI 一句话:针对生成音乐系统只比输出质量却难进真实创作流程的问题,论文提出以适应性、可用性、可控性为三轴的 15 项分级框架 MusGU+,用 10 个系统的横向评估揭示仅少数系统真正支持小数据与实时工作流集成,并以可筛选的交互工具把选型权交回音乐人。 标签:#音乐生成 #生成模型 #模型评估 #基准测试 #可解释性 评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Laura Ibáñez-Martínez:机构信息未在 arXiv HTML 中可靠披露 Roser Batlle-Roca:机构信息未在 arXiv HTML 中可靠披露 Xavier Serra:机构信息未在 arXiv HTML 中可靠披露 Martín Rocamora:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音乐人真正关心的适配性与工作流整合问题从空洞的民主化口号中剥离出来,形成了可操作的 15 项分级标准并配了可筛选的交互工具。短板是整个框架几乎完全基于作者内部讨论与非正式访谈推导,10 个模型的打分依赖作者主观交叉审阅而无任何音乐人实测验证,Controllability 等核心维度的效度仍停留在纸面定义。 ...

2026-09-01 · 更新于 2026-09-04 · 4 min · 722 words

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

📄 模型听见的是期待的语调:当讽刺检测依赖高音与停顿的刻板印象 英文题目:When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection 一句话:论文用五模态分解与 PSOLA 因果操纵证明,多模态大模型在中英讽刺检测中并未学会真实韵律线索,而是依赖高基频与不规则停顿的跨语言刻板印象,仅改这两个维度就能在独立样本上诱发最高 60.5% 的假阳性。 标签:#语音情感识别 #多模态模型 #可解释性 #模型评估 评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yongjian Chen:Magellan Technology Research Institute (MTRI);Center for Language and Cognition, University of Groningen, the Netherlands Pengfei Wei:Magellan Technology Research Institute (MTRI) Yiqun Sun:Magellan Technology Research Institute (MTRI) Zhu Li:Center for Language and Cognition, University of Groningen, the Netherlands Lawrence B. Hsieh:Magellan Technology Research Institute (MTRI) 💬 毒舌点评 亮点在于把讽刺检测从拼 F1 的基准游戏拉回到因果诊断,用五模态分解加 PSOLA 定向操纵实锤了模型依赖高音调与不规则停顿的跨语言刻板印象,证据链罕见地完整。短板是全程零样本黑盒探针却未触及融合层定位,且两套语料均为电视表演语音,所谓跨语言泛化更像是跨表演风格泛化,离真实对话的落地还有距离。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1801 words

语音/音乐/音频论文速递 2026-09-01

语音/音乐/音频论文速递 2026-09-01 共分析 49 篇论文 ⚡ 今日概览 ✅ 筛选入选 49 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 8 篇 ████████ #语音情感识别 5 篇 █████ #音乐生成 5 篇 █████ #语音合成 4 篇 ████ #语音增强 4 篇 ████ #音乐理解 4 篇 ████ #说话人日志 2 篇 ██ #音乐转录 2 篇 ██ 📊 论文评分排行榜(49 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Anchoring Speech with Semantics: A Multimodal Adapter… 8.4 前25% 方法研究 #语音识别 🥈 Playability-Aware Audio-to-Tablature Guitar… 8.2 前25% 方法研究 #音乐转录 🥉 When Vocal Tone and Literal Meaning Diverge: An… 8.1 前25% 数据集与基准 #语音情感识别 4. Self-Supervised Pretext Tasks for Infant Cry Analysis… 8.1 前25% 方法研究 #音频分类 5. ImageEval 2026: Culturally Grounded Arabic Multimodal… 8.1 前25% 数据集与基准 #语音识别 6. Perceptually Better, Semantically Worse: Measuring… 8.0 前25% 数据集与基准 #语音增强 7. Vocal Music under Phoneme-Conditional Analysis 8.0 前25% 方法研究 #音乐理解 8. Likelihood-Constrained Acoustic Reranking for Training… 7.8 前25% 方法研究 #语音识别 9. Using Prosody to Predict Syntactic Structure 7.6 前25% 方法研究 #Transformer 10. When Does Predictor-Based RL Align with Human… 7.6 前25% 方法研究 #语音合成 11. V2TATC: A Joint Voice-Trajectory Embedding Framework… 7.5 前25% 方法研究 #对比学习 12. Sequential Trajectories and Simultaneous Blending… 7.5 前25% 方法研究 #语音合成 13. No Detectable Change in Side-Level WER from Prompt… 7.4 前50% 应用研究 #语音识别 14. VocalAffectBench: Evaluating Vocal Emotion Recognition… 7.4 前50% 数据集与基准 #语音情感识别 15. When Models Hear What They Expect: Diagnosing Prosodic… 7.4 前50% 方法研究 #语音情感识别 16. Context-Aware Interleaved Batching for WhisperX 7.4 前50% 方法研究 #语音识别 17. Enabling Proactive Spoken Turns via a Generalized… 7.3 前50% 方法研究 #语音交互 18. MusGU+: Toward a Musician-Centered Evaluation… 7.3 前50% 数据集与基准 #音乐生成 19. Stride-k Subsampling: Train-Free Audio Token Reduction… 7.2 前50% 方法研究 #语音识别 20. TEMPO: Temporally-grounded Multi-task Post-training… 7.1 前50% 方法研究 #音频事件检测 21. VIBE: Video Instruction-aligned Background music… 7.1 前50% 方法研究 #音乐生成 22. Diagnose, Then Refine: A Closed-Loop TTS System with… 7.0 前50% 方法研究 #语音合成 23. HEAR Who Said What: Unlocking Speaker-Attributed… 7.0 前50% 数据集与基准 #说话人日志 24. Evidence-Bounded Mental Health Reasoning from… 7.0 前50% 数据集与基准 #语音情感识别 25. SPHERE: Automatic Music Upmixing via Audio Language… 6.9 前50% 方法研究 #音乐生成 26. Linguistic Distance Segregates Latent Representations… 6.9 前50% 应用研究 #语音识别 27. Closing the Verification Loop: Self-Check Captioning… 6.8 前50% 方法研究 #音频字幕生成 28. Conjoint Audio-to-Spikes Encoding and Processing for… 6.8 前50% 方法研究 #语音识别 29. Neural Multichannel Distant Speaker Diarization and… 6.6 前50% 方法研究 #说话人日志 30. PhysWave: Physics-Guided Latent Diffusion Models for… 6.6 前50% 方法研究 #音频生成 31. What Are You Listening to? Temporal Music Grounding… 6.5 前50% 数据集与基准 #音乐理解 32. CoJEPA: Combining Contrastive Learning and JEPA for… 6.5 前50% 方法研究 #音乐理解 33. Ouroboros: Self-Referential Backdoor Attacks on Speech… 6.4 前50% 方法研究 #语音增强 34. Textual Acoustic Grounding for Generalizable LLM-Based… 6.4 前50% 方法研究 #语音伪造检测 35. Towards Balanced Spectral Reconstruction: Spectrally… 6.4 前50% 方法研究 #语音增强 36. Accurate Plate Reverb Parameter Estimation Using Two… 6.3 前50% 方法研究 #音乐理解 37. Beyond Speech: Dual-Domain SSL Fusion for Unified All… 6.3 前50% 系统技术报告 #音频伪造检测 38. Weakly Supervised Tabla Stroke Transcription via an… 6.3 前50% 方法研究 #音乐转录 39. Language-Statistical Analysis of Neural Audio Codec… 6.3 前50% 方法研究 #语音编码 40. Parallel Time-Band Mixing with Learned Observation… 6.2 前50% 方法研究 #语音增强 41. How Well Do Generative Music Models Follow Emotion… 6.0 前50% 数据集与基准 #音乐生成 42. Multimodal Adaptive Expert Selection with Text Routing… 6.0 前50% 方法研究 #音视频理解 43. Evoking Harmony via Convolution 5.9 前50% 方法研究 #音乐生成 44. DreamX-Creator: Democratizing Native Audio-Video… 5.9 前50% 模型报告 #扩散模型 45. Leveraging Bayesian Optimization for Array Shape Self… 5.7 前50% 方法研究 #声源定位 46. Opinionated, Hesitant and Stressed: Three Studies of… 5.6 前50% 应用研究 #语音情感识别 47. Disentangling Representation using Attributes-based… 5.5 前50% 方法研究 #音频分类 48. Decoupled Latent Flow Matching for Few-Step Joint… 5.3 后 50% 方法研究 #音乐源分离 49. Audio-Driven Adversarial Defense for 3D Talking Face… 4.3 后 50% 方法研究 #语音合成 📋 论文列表 🥇 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages ...

2026-09-01 · 更新于 2026-09-04 · 55 min · 11646 words

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

📄 对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化 英文题目:Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict 一句话:论文把语义矛盾的音视频配对当作组合推理探针,用三级时序对齐与对数透镜审计检验 VideoLLaMA 2-7B-AV,发现时序对齐只会搬运答案偏置而无法把准确率抬离随机线,承诺层稳定在 25.5±1 层的晚期固化覆盖了 15 至 18 层已出现的冲突检测信号。 标签:#音视频理解 #多模态模型 #参数高效微调 #可解释性 评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Adarsh Sudheer:Independent Researcher David Li:Independent Researcher Omar Elbanna:Independent Researcher Ishaan Kodarapu:Independent Researcher Arjun Bahuguna:Independent Researcher Vasu Sharma:Independent Researcher 💬 毒舌点评 把音视频矛盾包装为组合泛化探针并用对数透镜定位到 25.5±1 层的晚期固化,为先验主导提供了可复现的机制叙事;代价是行为评估依赖精确字符串匹配的 Yes/No 子集且机制审计仅在 100 样本上以未校准阈值完成,对齐流水线又未做序列长度等混淆因素对照,结论更多是相关性描述而非因果验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 969 words

Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1

📄 当和声不再只谈音高:用搬运代价度量音色的几何 英文题目:Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1 一句话:论文把归一化频谱当作概率分布,用一维最优传输距离以赫兹为单位拆解音色差异,并以三角形面积与方差度量和弦的融合度,却只在少量自采录音上给出个案验证。 标签:#音乐理解 #生成模型 #可解释性 #理论分析 评分:5.5/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Yusei Tamura:机构信息未在 arXiv HTML 中可靠披露 Shigekazu Ishihara:机构信息未在 arXiv HTML 中可靠披露 Ken Ito:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于将一维 Wasserstein 距离与频谱质心偏移解耦为可解释的音色差异量,并尝试把和声学从音高扩展到音色几何,概念上呼应了 Schönberg 的 Klangfarbenmelodie 命题。短板是全篇停留在 2 至 3 个音色的玩具示例与可视化热力图,没有可复现的基准、统计检验或与现有音色相似度度量的量化对比,更像一篇思辨性音乐学随笔而非可验证的信息几何模型。 ...

2026-08-31 · 更新于 2026-09-04 · 3 min · 582 words

Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness

📄 0.76 分里的诚实:当语音失灵时,眼睛如何泄露下一句话的时机 英文题目:Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness 一句话:在四人自由对话中用转折前 3 秒的响度与符号化注视预测间隙还是重叠,论文以弹性网络逻辑回归证明注视能在噪声下提供稳定但幅度有限的互补增益,代价是刻意稀疏的语音特征与小样本实验室数据把天花板压在了 0.76 的 ROC AUC。 标签:#语音交互 #可解释性 #模型评估 评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5 👥 作者与机构 Mark Dourado:Research & Exploration, GN Store Nord, Ballerup, Denmark;Department of Architecture, Design and Media Technology, Aalborg University, Copenhagen, Denmark Karim Haddad:Research & Exploration, GN Store Nord, Ballerup, Denmark Henrik G. Hassager:Research & Exploration, GN Store Nord, Ballerup, Denmark Stefania Serafin:Department of Engineering Technology and Didactics, Technical University of Denmark, Kongens Lyngby, Denmark 💬 毒舌点评 用可解释的注视二元组 bigram 熵与寻址权重在真实四人自由对话上验证了视觉线索的噪声鲁棒性,设计克制且主动放弃用未来说话人响度作弊;短板是语音侧仅用响度 Phon 单一特征且全程依赖弹性网络逻辑回归,在无现代时序模型对比、代码闭源的背景下 0.76 的 ROC AUC 难以判断是任务天花板还是模型容量不足,小样本实验室数据的泛化说服力有限。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 1059 words