Benchmark Radar 第九天:采纳前沿与分数进展层
Published:
排行榜以前只是一张排名表。第九天,我们把它改成了能回答问题的研究工作台,加了采纳前沿、分数进展和饱和度可视化。
Benchmark Radar 已上线。 每天追踪新的 AI 基准测试、数据集与排行榜:打开仪表盘 或 在 GitHub 上 Star。
大家好,我是 Koutian。先解释几个词。排行榜(leaderboard)就是一张公开排名表,看哪些基准测试得分高。模型卡(model card)是研究者写的一张卡片,说明一个模型跑过哪些基准、得了多少分。commit 是我们保存的一段代码改动。
第九天我们做了这些事。
我们加了一个「采纳前沿」视图。它能看出哪些基准被各家实验室采纳得最快。图上的横轴是基准的成熟度,纵轴是采纳速度,一眼就能看清趋势。
我们新增了一层「分数进展」数据。里面有 70 条分数记录,每条都链接到报告它的模型卡或论文,还标了具体的文件和行号。你点进去就能核对原始出处。
现在仪表盘把「分数饱和度」和「采纳趋势」画在同一条时间轴上。你能看到某个基准的分数什么时候不再往上涨,以及实验室什么时候不再用它。
研究工作台重新设计过了,内部编号是 FINDING-001。原来的排名列表现在改成了工作台。每条基准都展示分数历史、采纳轨迹和来源证据。
我们加了分数验证。每引用一个分数,系统都会去核对它到底属于哪个基准。这样能抓出把分数张冠李戴的情况。
阅读间隔也修好了。它指一个基准最近一次被提到,到今天隔了多少天。以前用全局时钟算,现在按每个基准自己的最近一次提及来算,更准确。
流水线也修了。自定义注册表和默认分数的配对问题解决了,默认注册表现在能被识别。不是有限数值的分数会被直接拒绝。
8 月 2 日那天的快照我们补回了。那天采集出了缺口,现在填上了。
我们还补写了「发现窗口」的文档,说明 CI 流程里的第二个发现窗口是干什么的。
为什么这些重要。
第九天是雷达从「采集工具」变成「分析仪器」的转折。分数进展层让你能问出这种问题:GPT-4 的 MMLU 分数在几个版本之间是怎么变的?采纳前沿让你能问:实验室们正在往哪些基准上靠?如果你也在决定自己的模型该跑哪些基准,这些问题才是你真正关心的。
工作台的重新设计也说清了我们服务谁。排名列表给随便看看的人用,工作台给需要把结论追溯回来源的研究者用。
解决掉的 issue 和 PR:
- #106:记录发现窗口
- #108:回填 8 月 2 日快照
- #113:记录发现窗口
- #114:饱和度可视化
- #115:8 月 2 日快照回填
- 分数进展层(70 条来源验证观察)
- 基准采纳前沿
- 研究工作台重新设计
第十天:我们做了每日简报、GPT 洞察,并准备发布。
想跟进 Benchmark Radar?在 GitHub 上 Star 仓库 获取每日更新,或 打开实时仪表盘 浏览扫描结果。阅读论文:arXiv:2609.11115。
