Benchmark Radar 第十六天:计数准确性与渐进式披露

less than 1 minute read

Published:

你好,我是 Koutian。第十六天,我们修了一个会悄悄骗人的数,还让界面不再一打开就吓到人。

作者:Koutian Wu;GitHub: ktwu01

Benchmark Radar 已上线。 每天追踪新的 AI 基准测试、数据集与排行榜:打开仪表盘 或 在 GitHub 上 Star。

只有一个模型采用的基准测试,以前被少算了。一种基准测试如果只被一张模型卡(model card,记录某个 AI 模型长啥样的说明卡)采用,我们之前会漏数它。现在修好了,哪怕只有一个人用,也照样算进去。你看到的采纳数量更准确,不会被低估。

我们恢复了「渐进式披露」。排行榜、每日问答和主页里那些能展开的面板,现在默认是收起来的。你想看哪块再点开,不用一上来面对一大堆。你第一次进来不会被信息淹没,想深挖的人也能展开看细节。

每日社交清单的 issue 恢复了。它之前被误关,现在回来。issue 的日期改为从报告日期推算,不再用系统时钟。这样跨时区也不会标错日子。你看到的每日帖文日期是对的。

workflow_dispatch 的发布默认值设成了 true(Issue #88)。这是手动触发工作流时的一个开关。以前手动跑得自己勾上发布标志,现在默认就发。你手动补跑一次,自动就发布了,少一步操作。

前沿圆圈里用了真品牌图标。采纳前沿图(就是画着谁采用了哪个基准的圆点图)现在显示真实厂标,比如 OpenAI、Google、Anthropic,而不是通用小标记。你一眼就知道这个点子是谁家的。

为什么值得你关心。

单一采纳者计数修复,是个数据准确性的事。某个基准恰好只有一个采纳者时,少算它,会让「谁在用」的格局看着比实际更单一。一个号称追踪基准采纳的工具,数字错了就没人信了。你看到的采纳多样性是真实的。

渐进式披露,是种对付信息太多的办法。雷达攒了一大堆数据,全摊开新用户会懵。面板收起来,偶尔看看的人看摘要就行,认真研究的人再展开。你按自己的节奏看,不被压垮。

前沿圆圈的品牌图标,是帮你认图。你在某个基准的采纳点旁看到 OpenAI 的标,不用翻图例就知道是谁用了它。你读图更快。

解决的问题。

  • Issue #88:手动触发发布时默认就发,并恢复了每日社交 issue,日期按报告算
  • Issue #99:修好了只被一个模型采用的基准测试被少算的问题
  • Issue #183:把收起的面板恢复了(渐进式披露)
  • Issue #184:恢复了每日社交 issue
  • Issue #185:手动触发的默认值
  • Issue #187:查了一遍单一采纳者的情况
  • Issue #188:恢复了渐进式披露
  • Issue #178:前沿圆圈用上真实品牌图标

第十七天:审计加固、顶栏操作和生产级美化。

想跟进 Benchmark Radar?在 GitHub 上 Star 仓库 获取每日更新,或 打开实时仪表盘 浏览扫描结果。阅读论文:arXiv:2609.11115。