Benchmark Radar 第七天:模型卡采纳排行榜与注册表 v0.3.0

less than 1 minute read

Published:

最大的一天。模型卡采纳排行榜上线,注册表扩展到 2026 年前沿,版本号升至 0.3.0。

作者:Koutian WuGitHub: ktwu01

今日交付

模型卡采纳排行榜。 全新的排行榜视图,按照引用某个基准的模型卡数量来排名。一个被 GPT-4、Claude 和 Gemini 模型卡同时引用的基准,排名自然高于只被一篇论文引用的基准。排名基于一个经过人工整理的模型卡到基准的映射注册表计算。

注册表扩展。 注册表从摘要计数扩展到了完整记录,再扩展到 2026 年前沿。每张模型卡现在展开为它报告的具体基准,并建立了从基准到引用它的模型卡的反向链接。

Frontier-Bench 合并入 Terminal-Bench。 Frontier-Bench 系列被合并进了 Terminal-Bench 系列(#96)。总数保持 13 个不变,因为这是一次对重叠基准的整合,而非增加。

双向注册表链接。 注册表现在是一个双向图:模型卡链接到它们引用的基准,基准也反向链接到每一张引用它的模型卡。

学术来源可靠性加固。 来自学术期刊的来源现在被赋予比随机网页抓取更高的可靠性权重。

校验加固。 关闭了注册表中剩余的三个校验漏洞。拒绝了:重复文档、标量别名、不可能的提及。日期校验也得到了加固。

版本号升至 0.3.0。 版本号升级以反映注册表扩展的规模。

Fable 5 / Mythos 5 基准。 从一张对比表中提取了这些基准并添加到了注册表中。

分类法盖章。 已有语料库被盖上了对其进行分类的分类法标签,类别计数与产出它们的分类法绑定。重新分类变成了一个可见的事件。

采纳排名可引用。 采纳排名现在可被引用,并增加了贡献者入口。

为什么重要

模型卡采纳排行榜是项目第一个竞争情报功能。雷达不再只是罗列基准,而是开始回答:顶级实验室在发布模型时,实际在用哪些基准?这是一个与”有哪些基准存在”根本不同的问题,而对于任何在考虑把评估精力投向哪里的人来说,前者的答案要有用得多。

注册表从摘要计数到完整记录的扩展,是一次对数据质量的承诺。不完整的数据只能得出不完整的结论,完整记录才能产出可审计的结论。

分类法盖章解决了一个微妙但关键的问题:如果你对语料库重新分类,你需要记录每个条目是被哪个版本的分类法分类的。否则历史对比就毫无意义。

解决的问题

  • #85:模型卡采纳排行榜
  • #87:学术来源可靠性
  • #89:扩展模型卡注册表
  • #92:排行榜 Fable/Mythos 基准
  • #93:版本号升至 0.3.0
  • #96:合并 Frontier-Bench 到 Terminal-Bench
  • #100:Frontier-Bench 引用合并
  • #101:可引用的采纳排名
  • #102:将类别计数绑定到分类法
  • #103:为已有语料库盖上分类法标签

第八天:稳定化与最小修复。