Benchmark Radar 第二十五天:分数落在它们所属的日期上,一个不再推荐自己的雷达
Published:
一个会把自己排进榜单的雷达,不配叫雷达。第二十五天我们做了三件事:让排名不再跟自己玩博弈,让每天抓来的分数落在它该在的发布日期上,再让那些还没人评分的基准自己说出身份。先说一个词:排行榜(leaderboard)就是一张公开榜单,谁分数高谁排前面。
今天做了什么
PR #291 上线了评分第 4 版。它把 ktwu01/benchmark-radar 这个仓库从自己的排行榜里踢了出去。因为这个仓库的描述全都是基准相关的词,又每天都在提交,之前的相关性计算让它在头 27 个采集日里有 9 天挤进了前五。排除时用的是精确的「owner/name」配对,绝不用模糊的子串匹配,所以像 H20Zhang/Agent-Benchmark-Radar 这种真记录纹丝不动。
为什么要在意:排行榜不再自己给自己刷分,你看到的排名才可信。
评分第 4 版还给下载量设了上限。有个数据集下载 25,238 次却只有 1 个赞,原本能拿 88.0 分,从一颗 3,265 星的仓库手里抢走第二名。设上限后,原始下载量再也没法压过真实的采纳信号。
为什么要在意:一个被刷爆下载的数据集,不会再假装比真正受欢迎的仓库更好。
PR #290 修了 #279。全部 5,544 行抓来的分数本来都带有 announcement_date(发布日期),可之前的整理程序一直把它扔掉。现在排行榜前沿图按发布日期排,不再按分数排。像 ?view=leaderboard&lfrontier=llm-stats-aime-2025 这样的链接,不会再画出一条看起来像进步、其实只是排序表的光滑斜坡。
为什么要在意:图不会再用一条顺滑上升的线,骗你说「有进展」。
PR #289 修了 #287。之前链接写 ?view=leaderboard&lfrontier=rsi_bench,画出来的却是 AutomationBench 的图。RSI-Bench 还没有任何采纳者,所以采纳者筛选比守卫先跑,把它过滤掉了。现在守卫先跑,筛选后跑。
为什么要在意:你点开哪个基准的永久链接,看到的就该是哪个基准,不会串台。
PR #285 把 RSI-Bench 加进了注册表,采纳数先填 0。这个 0 是一个真实读数,不是抓数据漏了。恰恰是一个没人评分的基准,读者才最没法从别处找到。每条记录带着名字、常用别名、发布方、发布日期,还有一个 id,等第一张报告它的卡片来解析。
为什么要在意:还没人评的基准也进得了表,你不会漏看新东西。
PR #284 修了 #245 的搜索那一半。现在 ?q= 不光查每天的新源,也会查注册表。像 ?q=researchclawbench 和 ?q=terminal-bench 这样的词能找到真实记录了,以前搜索框根本够不到注册表。
为什么要在意:你想找某个具体基准,搜一下就能定位,不用翻遍全站。
PR #294 修了 #292。四个写着 released: null(没发布日期)的基准,其实各自都有论文。ExploitBench(一篇 arXiv 论文,arXiv 是研究者发论文预印本的地方,编号 2605.14153)、BlueprintBench 2(发布博客)、BioMysteryBench(Anthropic 公告)、VIBench(CAIS 2026 会议)现在都补上了日期。全部 80 个注册表基准都注了日期,年代筛选也能专门挑「无日期」的条目。
为什么要在意:按年份筛选时,不会再漏掉那些其实有日期的基准。
PR #295 关掉了 #265。文件 data/external/llm_stats_identity_overrides.yml 记下了 50 个分数密集基准里、被两个来源都锚定到的 19 个的身份,是人工逐个核对过的。包括 SWE-bench Verified/Pro/Multilingual、HLE、MMMU-Pro、Terminal-Bench 1.0/2.0/2.1。剩下 31 个在找到第二个锚点前先留空,因为写错的发布方或许可证,比诚实地留白更糟。有两个爬错的值被改对,而不是原样照搬。
为什么要在意:每个基准的归属更准,你不会看到张冠李戴的发布方。
PR #296 关掉了 #264。九个 RSS/Atom 订阅源被收进 config.yml 的 sources.first_party_feeds.feeds,每一个都重新核验过能正常解析,且至少带一条有标题的内容。它们是:Qwen、Ollama、Stability AI、Nomic AI、Replicate、NVIDIA Developer、IBM Research、Databricks、LangChain。因为 Qwen 的订阅源最新一条停在 2025-09-23,我们给它加了搜索兜底。
为什么要在意:这些厂商自己发的消息被正式纳入,雷达能更早抓到它们的新基准。
PR #281 和 #282 关掉了 #276。七个只在项目内部说得通的词,全换成了平实的英文。Pareto 就绪面板、site/logos.html、还有中文译文里最后的五处也重写了。原本报出 25 处黑话的审计,现在归零。
为什么要在意:页面文字更直白,你读起来不费劲。
PR #297 在 pytest 配置里加了 pythonpath = ["src"]。这样跑测试时测的是你当前分支上的代码,而不是已经 pip 装好的那份。
为什么要在意:测试不会再拿旧版本冒充新改动,开发者不会被假绿灯骗过。
为什么要在意
把自己排进榜单的修复,保住的是排名的可信度。一个在读者眼皮底下把自己顶到第 2 的排行榜,会教你怀疑页面上每一个数字。把雷达踢出自己的排名,不是看不起自己,而是排名还能成立的前提。
日期轴的修复改了一张图在说什么。把按分数排的列表画成平滑斜坡,等于在宣称「一直在进步」,可它其实只是一张排序表。让那 5,544 行分数落到各自的发布日期上,是让数据自己开口,而不是替它编故事。
围绕 RSI-Bench 的那一串修复,把注册表和图表之间的回路接通了。在还没人评分时就记下这个基准,并让没评分的基准自己报上名,你点开的永久链接就是它本来的样子。身份覆写在数据层做同一件事:诚实地留白,好过自信地填错。
解决的问题
- #244:RSI-Bench 新基准
- #245:搜索找到基准
- #264:第一方厂商订阅源
- #265:llm-stats 身份覆写
- #276:术语审计归零
- #278:自我推荐与下载量封顶
- #279:爬取分数的 announcement_date
- #287:无人评分的基准画出自己的图
- #292:无日期注册表基准
- 含自我排除的评分 v4
- 日期排序的前沿图
- 九个经核验的第一方订阅源
- 19 个基准的身份覆写
- Pytest 工作树导入修复
第二十六天:隐藏曲线与返回按钮的回归。
