The Attention Triangle in Audio-Video Models

📄 谁在替鹦鹉说话:当音频偷偷改写了画面 英文题目:The Attention Triangle in Audio-Video Models 一句话:针对文本到音视频联合生成中声音被绑到错误实体的问题,该工作把文本、音频、视频的三边交叉注意力看作可干预的路由三角,用无训练的两遍偏置转向同时约束直接绑定与经音频中转的间接耦合,在 100 个挑战提示上把声源归属从 0.1216 提升到 0.1349,代价是约数倍推理开销与对外部份割的依赖。 标签:#音视频生成 | #扩散模型 | #声源定位 | #可解释性 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel Noa Kraicer:Tel Aviv University, Tel Aviv, Israel Gal Metzer:Tel Aviv University, Tel Aviv, Israel Zhuo Ning:Simon Fraser University, Burnaby, Canada Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel Raja Giryes:Tel Aviv University, Tel Aviv, Israel 💬 毒舌点评 把文本音频视频三边泄漏统一为注意力三角并用双向路由可视化把玄学先验变成可干预通路,视角干净且干预无需训练。短板是全套转向依赖基线解码加 SAM3 外部分割与人工标注短语,成本约 2.5 倍且分割或音频显著性失效便无从纠偏,评估又建在人工筛选变异的失败富集提示集上,外推性存疑。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 809 words

ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection

📄 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection 一句话:针对一段音频里真伪线索并存的混合伪造问题,ToolDF 让音频大模型做分诊编排而非直接判真假,在复合测试上拿到 81.89 的复合平均分,代价是性能仍受分离器和专家检测器上限牵制。 标签:#音频伪造检测 | #多模态模型 | #参数高效微调 | #基准测试 评分:8.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Taewoo Kim:Multi-Modal Research Center, KETI, South Korea;Department of Artificial Intelligence, Korea University, South Korea Young Han Lee:Multi-Modal Research Center, KETI, South Korea Nam In Park:机构信息未在 arXiv HTML 中可靠披露 Chanwoo Kim:Department of Artificial Intelligence, Korea University, South Korea 💬 毒舌点评 把混合真伪检测从整段二分类改写为可解析的编排推理,用监督轨迹把分离与分诊决策学了出来,思路干净。短板是整套裁决仍被外挂分离器和四个专家上限锁死,工具错则编排再漂亮也只是把错误解释得很清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 815 words

VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis

📄 先查账再唱歌:VoxReason 把语音的“怎么说”变成可引用的计划 英文题目:VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis 一句话:针对表达性语音在合成前就已决定交付方式却无法问责的问题,VoxReason 把交付决策显式化为带源引用的说话计划并用确定性校验器加单线索反事实检验源依赖,在 1440 例受控源标签集上证明去源记录使引用约束分降 0.488 而局部性修复同时恢复准确率与局部性,代价是仅覆盖两种语句与单一场景且不评价波形质量。 标签:#语音合成 | #SFT | #基准测试 | #模型评估 | #可解释性 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mengzhe Geng:National Research Council Canada 💬 毒舌点评 把合成前说话计划做成带引用校验的查账任务,切断了用好听波形掩盖无据决策的退路,证伪链条设计得相当清醒。但受控到只有两种语句和单一场景的验证,更像一份自我设限的诊断说明书,离通用语音规划基准还有明显距离。 📌 核心摘要 表达性语音在波形生成前已决定情感与韵律等交付方式,但现有音频评分无法判断该决策是否得到源记录许可。VoxReason提出源引用说话计划(source-cited speaking plan)作为合成前预测对象,以确定性校验器检查引用合法性、槽位一致与单线索反事实局部性。论文在1440例源标签受控集上证明去除源记录会大幅降低引用约束得分,而局部性修复后的学习规划器同时恢复槽位准确率与反事实一致性。在波形质量完全排除于当前主张之外后,该方法为对话与叙述类语音提供了先验账本。当前结论仍被窄语句、固定场景与确定性标签映射所限定。 🔗 开源与复现资源 代码:https://github.com/MENGZHEGENG/voxreason,提供衍生切分与评估代码 模型权重:论文中未提及 数据集:RAVDESS衍生source-label切分含1440条记录,通过GitHub仓库获取,不再分发原始音频 Demo:论文中未提及 复现材料:论文提供手稿源码,planner schema,verifier评估代码和重跑表格命令 论文中引用的开源项目:未提及 资源可达性验证:code=temporarily_unreachable 🧭 深度解读 同一句话,为何换个心情就该换个说法 想象你在做一个对话助手,用户只说了一句孩子在门口玩,文字本身没有情绪。可如果病例记录写着说话人刚经历丧失,你若用欢快的语调催促,就会显得冷漠,若用低沉缓慢的安慰,反而恰当。这种差别不在文字里,而在文字背后的许可记录里。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 754 words

语音/音乐/音频论文速递 2026-09-04

语音/音乐/音频论文速递 2026-09-04 共分析 30 篇论文 ⚡ 今日概览 ✅ 筛选入选 30 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音增强 5 篇 █████ #语音合成 3 篇 ███ #语音交互 2 篇 ██ #语音质量评估 2 篇 ██ #声源定位 1 篇 █ #语音情感识别 1 篇 █ #语音编码 1 篇 █ 📊 论文评分排行榜(30 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ToolDF: Tool-Integrated Reasoning for Mixed… 8.4 前25% 方法研究 #音频伪造检测 🥈 Geometric Ceilings on Time-Frequency Masking for… 7.9 前25% 理论研究 #音乐源分离 🥉 CRAW: Codec Robust Audio Watermarking 7.7 前25% 方法研究 #音频水印 4. The 2026 PNPL Competition: Word Classification and… 7.5 前25% 数据集与基准 #语音识别 5. Test-time adaptation for speech enhancement with an… 7.5 前25% 方法研究 #语音增强 6. Alignment-Free Text-Audiobox for Voice Dubbing and… 7.5 前25% 系统技术报告 #语音合成 7. Listen to the Latents: Self-Correcting Speech… 7.2 前50% 方法研究 #语音识别 8. StreamWSR: Streamable and Lightweight Waveform-Domain… 7.2 前50% 方法研究 #语音增强 9. DuplexSpeechBench-IFEval: Evaluating Implicit… 7.2 前50% 数据集与基准 #语音交互 10. Building and Evaluating Fixed-Voice Thai TTS from… 7.2 前50% 系统技术报告 #语音合成 11. PACodec: A Low-bitrate Neural Speech Codec with… 7.1 前50% 方法研究 #语音编码 12. Decoupling Turn-Taking from Semantics: A Decoupled… 7.0 前50% 方法研究 #语音交互 13. Summary of the ChinaVoices Challenge 2026: Data, Tasks… 6.9 前50% 数据集与基准 #语音识别 14. The Attention Triangle in Audio-Video Models 6.9 前50% 方法研究 #音视频生成 15. Compressing Streaming Neural Audio Encoders via Latent… 6.9 前50% 方法研究 #语音识别 16. Dual-Form ASR: Semantics-Aware Inverse Text… 6.8 前50% 方法研究 #语音识别 17. Deep Neural Compression for RIR-Characterized Acoustic… 6.6 前50% 方法研究 #音频编码 18. SISER: Speaker-Invariant Speech Emotion Recognition… 6.5 前50% 方法研究 #语音情感识别 19. Masked Autoregressive Speech Enhancement with… 6.4 前50% 方法研究 #语音增强 20. Last Translation Benchmark 6.4 前50% 数据集与基准 #语音翻译 21. Neural Music Enhancement with Dual Time-Frequency… 6.2 前50% 方法研究 #语音增强 22. CAPQ-FAST: Content-Adaptive Perceived Quality… 6.2 前50% 应用研究 #音频质量评估 23. Beyond .WAV: Design and Software Verification of… 6.1 前50% 系统技术报告 #语音质量评估 24. Broadband Acoustic Intensity Direction Estimation with… 6.1 前50% 方法研究 #声源定位 25. Local Chord Corruption Is Not Recognizer Replay: Chord… 6.1 前50% 方法研究 #音乐生成 26. VoxReason: Listener-Free Evaluation of Source-Grounded… 5.9 前50% 数据集与基准 #语音合成 27. Is Semantics Enough for Speech Mean Opinion Score… 5.9 前50% 方法研究 #语音质量评估 28. Fairness Evaluation of Edge-AI Implementation for… 5.6 前50% 应用研究 #语音识别 29. StrixAE: An Intelligent Agent for Audio Enhancement… 5.5 前50% 系统技术报告 #语音增强 30. Opening mind by opening architecture: analysis… 4.5 后 50% 系统技术报告 #音频生成 📋 论文列表 🥇 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection ...

2026-09-04 · 更新于 2026-09-04 · 26 min · 5367 words

A Common Measure of Communication for Speech Brain-Computer Interfaces

📄 百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子 英文题目:A Common Measure of Communication for Speech Brain-Computer Interfaces 一句话:针对语音脑机接口词表各异导致准确率与词错误率不可比的问题,论文提出以参考分布加权的开放词汇互信息统一度量覆盖与保真,并在八个异构系统与三域选词实验中验证其排序与最高 16.3% 相对增益,代价是依赖均匀误差与词独立假设的标量近似。 标签:#语音识别 | #对比学习 | #模型评估 | #低资源 评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Dulhan Jayalath:Neural Processing Lab (PNPL), University of Oxford Benjamin Ballyk:Neural Processing Lab (PNPL), University of Oxford Oiwi Parker Jones:Neural Processing Lab (PNPL), University of Oxford 💬 毒舌点评 把词表覆盖率与词表内保真度乘进同一个互信息量,让侵入式尝试言语与非侵入感知语音终于能在同一标尺下对账,这是该领域久缺的诚实度量。代价是历史比较几乎全靠均匀误差对称信道与 \(P=1-\mathrm{WER}\) 换算硬撑,最脆弱的信道建模恰恰被平均掉了。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 730 words

ARFT: A Synchronized Multimodal RF-Acoustic Dataset for Positioning in Distributed Environments

📄 同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上 英文题目:ARFT: A Synchronized Multimodal RF-Acoustic Dataset for Positioning in Distributed Environments 一句话:ARFT 针对室内分布式定位缺乏同步多模态真值数据的难题,用共架漫游车与逐周期编排把 91 路超声波形和 42 阵元射频快照绑定到同一位姿,并以 0.110 m 二维声学基线证明数据可用,代价是单房间静态采集且射频定位仍缺定量验证。 标签:#声源定位 | #端到端 | #数据集 | #基准测试 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Daan Delabie:机构信息未在 arXiv HTML 中可靠披露 Jarne Van Mulders:机构信息未在 arXiv HTML 中可靠披露 Bert Pyck:机构信息未在 arXiv HTML 中可靠披露 Gustav Nilsson Gisleskog:机构信息未在 arXiv HTML 中可靠披露 Gilles Callebaut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 三模态逐周期绑定加42阵元近满快照确实补上了室内分布式定位缺失的同步融合底座,声学最小二乘基线也让数据开箱可验。遗憾是射频端仍停留在指纹可视化而无定位精度,动态跟踪与跨房间泛化缺席让联合定位愿景只兑现了一半。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 908 words

Auditory Illusion Benchmark for Large Audio Language Models

📄 听错了才是听懂了?当大音频模型遇上人类幻听 英文题目:Auditory Illusion Benchmark for Large Audio Language Models 一句话:论文把十种听觉错觉做成可对照人类听感的选择题来考大音频模型,发现最像人的模型也只有人类一半的易感度,而像人与忠于物理信号之间至今没有模型能兼得,代价是提示词稍改结果就大变。 标签:#音频理解 | #多模态模型 | #基准测试 | #模型评估 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Hayoon Kim:机构信息未在 arXiv HTML 中可靠披露 Eunice Hong:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把听觉错觉从演示视频变成可跑分、可对照人类分布的基准,这个选题确实抓住了音频评测的盲区。问题是人类基线只靠20名绝对音感听者撑场面,控制准确率又普遍在随机线附近晃悠,所谓最像人的模型更像蒙对了选项而非真听错了。 📌 核心摘要 人类听觉会系统性偏离物理信号,而现有大型音频语言模型评测多围绕转录、分类、检索等客观真值任务,缺乏对主观错觉的系统检验。本文提出首个听觉错觉基准 Auditory Illusion Benchmark,覆盖音乐、声音、语音三大内容域的10种代表性错觉,并按主导机制划分为物理型与物理加知识型,同时配套错觉刺激与匹配控制刺激和人类听觉实验。方法核心是将每种错觉转化为二选一或三选一感知判断题,以人类多数投票定义错觉标签,并用人类相似准确率、现实符合率与错觉易感指数刻画模型位置。与已有视觉错觉基准相比,新意在于面向音频的参数化生成管线与人类同题对照协议,以及对自下而上声学与自上而下先验的分离讨论。关键结果是最佳模型平均错觉易感指数仅约0.455,远低于人类参照的1.0,且高易感常伴随低于随机水平的控制准确率,提示偏差多于感知;知识驱动错觉上多个模型由信号忠实反转为类人易感,提示对齐可能来自语言先验而非共享低层听觉处理。实际意义是为认知对齐提供独立于识别精度的诊断维度,可用于区分字面检测器与类人感知者,并明确高易感在交互场景与安全精密场景下的不同可取性。主要局限是人类样本特殊、合成刺激与自然经验有差距、指令措辞可带来超过模型间差异的波动,外推到一般听众与真实场景时需谨慎。 🔗 开源与复现资源 代码:https://github.com/gillosae/aib 模型权重:论文中未提及 数据集:AIB基准数据集,包含10种听觉错觉,共10385个错觉刺激和4444个对照刺激,总计14829个样本,另有包含1032个错觉刺激和534个对照刺激的mini子集,总计1566个样本,获取链接为 https://github.com/gillosae/aib Demo:论文中未提及 复现材料:论文提及提供用于系统生成基准错觉的开源实现以及通过受控听觉实验构建的人类基线数据,获取方式为访问 https://github.com/gillosae/aib,论文证据中未提及训练配置与检查点细节 论文中引用的开源项目:评估中提及 Pengi、Voxtral-Mini、MuLLaMa、Kimi-Audio-Instruct、Audio Flamingo 3、Fun-Audio-Chat、Qwen-Audio-Chat、Qwen2-Audio-Instruct、GLM-4-Voice、Gemini 3.1 Pro,论文证据中未给出上述项目的HTTPS链接 资源可达性验证:code=temporarily_unreachable;dataset=temporarily_unreachable;reproduction=temporarily_unreachable 🧭 深度解读 耳朵为什么总在骗大脑? 想象你在琴房里听老师弹了一个低音,你发誓听到了那个浑厚的根音,可频谱仪却告诉你那个频率根本没有发出。这不是你走神,而是听觉系统在主动补全。人类听声音从来不是麦克风式的忠实录音,大脑会用谐波关系、掩蔽记忆、节奏预期和语言知识去猜测世界,这种猜测大多数时候高效,偶尔就会系统性跑偏,形成听觉错觉。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 550 words

AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking

📄 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking 一句话:口语对话状态跟踪中实体误识会跨轮污染累积状态,AVERT 冻结基座与文本编辑器、只训练一个音频验证器对候选值打分再做投票补全替换,在 SpokenWOZ 上从 38.34 提升到 40.13 联合准确率,代价是双解码器与字面佐证覆盖有限。 标签:#语音识别 | #多模态模型 | #参数高效微调 评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5 👥 作者与机构 Chunggi Lee:Harvard University;Cambridge, Massachusetts, USA Hanspeter Pfister:Harvard University;Cambridge, Massachusetts, USA 💬 毒舌点评 把音频从生成器降级为验尸官是聪明的偷懒,用两倍解码器参数换取长对话稳定性也算诚实交易;可惜字面首词匹配的门控把近八成错误直接判了死刑,验证器那点增益更像给跨轮投票打了一针弱效强心剂。 📌 核心摘要 口语对话状态跟踪需要从含噪语音中恢复累积槽值状态,实体名与数字的识别错误会在多轮中持续污染后续预测。AVERT保持基座语音模型与文本编辑器冻结,新增音频条件验证器对已形成候选值逐个打分,再与跨轮加权一致性及词面佐证门控结合。投票、补全与替换三个算子分别处理不一致、遗漏和音频不支持三类可恢复错误,且每个算子仅在开发集选定的槽子集上启用。在SpokenWOZ因果评测下,管线从基座的33.04联合目标准确率提升到编辑器的38.34,再到AVERT的40.13,超过读取完整语音历史的1B对照系统的39.32。该设计使音频上下文不随轮数增长,相对增益随对话变长而放大。局限在于字面佐证覆盖率低、仅验证1B主干且槽选择依赖目标域开发集。 🔗 开源与复现资源 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:SpokenWOZ测试集用于评估,Loquacious与Fisher用于ASR预训练,论文说明SpokenWOZ与Loquacious为开放获取而Fisher需要LDC许可,论文中未提及数据集下载链接 Demo:论文中未提及 复现材料:基座模型RR采用WavLM-large编码器接入冻结的OLMo-2-1B并搭配rank-16 LoRA微调。第1阶段训练占用4张NVIDIA A100 GPU。第2阶段微调与验证器训练各占用1张GPU。验证器每槽每轮采样8个候选值并以focal二元交叉熵优化。增加阈值为0.3。论文中未提及检查点下载链接 论文中引用的开源项目:提及WavLM-large,OLMo-2-1B,SpokenWOZ,Loquacious与Fisher等但论文中未提及下载链接 资源可达性验证:未发现可验证的官方 HTTPS 资源 URL。 🧭 深度解读 语音助手最怕的不是听不清,而是记错还不改 想象你对语音助手说从剑桥到莱斯特,登记在詹姆斯名下。它把莱斯特听成近音词,把詹姆斯听成杰伊。这个错误不会只停在这一轮,下一轮它会带着错误的地名继续订票,再下一轮还会用错名字取票。对刚入门的同学,关键是理解口语对话的累积性:每一轮的状态都是历史槽值的并集,1 次实体误识会被后续所有轮次继承。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 590 words

Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases

📄 一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调 英文题目:Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases 一句话:在同一位匈牙利语重度构音障碍说话人和固定小数据配方下比较七种低秩适配器与两种语音基座,发现只有标准低秩家族真正有效且内部打成平手,于是选择更简单省时的标准低秩作为每患者部署默认,并用注册时长与适配位置阶梯标定临床代价。 标签:#语音识别 | #参数高效微调 | #低资源 | #医疗音频 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5 👥 作者与机构 Bernard Muller:The Scott-Morgan Foundation, Torquay, United Kingdom László Tóth:Institute of Informatics, University of Szeged, Szeged, Hungary LaVonne Roberts:The Scott-Morgan Foundation, Torquay, United Kingdom 💬 毒舌点评 把每患者独立适配器这一生产设定做成控制变量的诚实对照值得肯定,还敢把NeMo崩溃和匈牙利语热启动回退写成命名小节。但证据厚度只有单说话人单语言单病因,核心选型结论建立在复用评测集和单样本区间上,跨变体推广更像临床备忘而非可泛化结论。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 906 words

Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification Cascade

📄 先听见,再分清:两级级联如何把稀有虎鲸从海噪里捞出来 英文题目:Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification Cascade 一句话:针对连续水听器背景压倒信号与部署域偏移,论文用两级 ResNet-18 级联分离检测与生态型判别,在 DCLDE 上将七分类宏平均 F1 做到 0.933 并把稀有 OKW 从 0.842 拉到 0.930,再经主动学习把 Puget Sound 检测 F1 从 0.405 恢复到 0.755,代价是约 5% 漏检无法挽回且连续流召回仍未验证。 标签:#音频分类 | #CNN | #音频事件检测 | #领域适应 评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 ...

2026-09-03 · 更新于 2026-09-04 · 6 min · 1120 words