Benchmark Radar 第三十二天:从不吭声的错误、没有二进制的采纳、像人写的简报
Published:
Benchmark Radar 的第三十二天。我们修掉了静默失败的数据错误,让排名在发布不附带任何二进制文件时也能统计采纳,还把每日简报改写成像人写的。记分牌:113 颗星,21 个 fork。
静默数据错误是指数据已被弄坏、但流程没有大声报错,管道对损坏的数据报告成功。采纳表示某个东西被使用的广度;对发布而言,过去只统计二进制文件的下载量。简报是每天简短总结当天动向的文本。
PR #403 在整个管道里追查静默错误。GitHub 和 Hugging Face 记录的创建时间与更新时间现在分开保存,格式错误和未来时间戳被拒绝而不是凭空捏造新鲜度,纯日期值统一按 UTC 解析。各个第一方源和 OpenReview 的会议互相隔离,一个源失败不再抹掉健康结果。每日去重和同日快照的身份判定真正传递闭包化,迟到的重试不会覆盖更新的同日通过元数据,还修复了 arXiv PDF 身份、Semantic Scholar 边界日丢失和回填跨日篡改。这些错误之前全部是静默的。
PR #407 改变了排名里采纳的含义。GitHub Release 记录过去只用发布资产的下载量计采纳,一个没有二进制资产却被广泛使用的仓库看起来像没人用。现在收集到的发布会在分页之后、单独的请求额度下补充仓库星标和 fork 数据,发布解析器升级到 github-releases/3。排名也不再给例行更新与首次发布同等的时效加分,并发布带字段级溯源检查的 v5 规则。
PR #378 让每日简报读起来像人写的。简报是 GPT 写的当天证据摘要,之前读起来像 AI 口水文:名词堆叠、列表化、没有白话骨架。现在给简报指令加了一段写作风格要求,测试把规则钉死,未来任何改动都无法悄悄删掉它。同一天,简报从 3 条扩展到最多 10 条洞见,中文条目上限与英文对齐。
为什么要在意
静默错误比大声错误更糟,因为没人看到就没人修。错误的时间戳会把新基准悄悄变老;不传递的去重会把一条记录悄悄翻倍。修好这些,每日快照才可信,而且修复带着回归测试,静默不会回来。
没有二进制的采纳很重要,因为多数 AI 基准是代码仓库,不是带安装包的产品。一个 2 万星、没有发布资产的仓库过去按零采纳计分。把仓库星标和 fork 与下载量一起统计,才是衡量这个领域,而不是只衡量它的安装器。
没人愿意读的每日简报,等于没人读的每日简报。写作风格修复不碰证据管道就改了输出,测试钉住规则意味着下次换模型不会悄悄把口水文带回来。
解决的问题
- #371:排名 v5,采纳纳入仓库星标和 fork
- #377:每日简报像人写的,写作规则由测试钉死
- #378:简报从 3 条扩展到最多 10 条洞见
- #403:修复时间戳、去重、身份、隔离等静默管道数据错误
- 记分牌:113 / 1000 星,21 个 fork
第三十三天:一个能抓到关键词搜索永远抓不到的基准发布的雷达。
