Benchmark Radar 第九天:采纳前沿与分数进展层

less than 1 minute read

Published:

排行榜变成了研究工作台。第九天加入了采纳前沿、分数进展和饱和度可视化。

作者:Koutian WuGitHub: ktwu01

今日交付

基准采纳前沿。 全新的可视化视图,展示哪些基准在模型卡发布中被采用得最快。前沿图将采纳速度与基准成熟度绘制在同一坐标上。

分数进展层。 全新的数据层,包含 70 条经过来源验证的基准分数观察。每条观察都链接到报告该分数的具体模型卡或论文,并附有文件和行号的证据。

饱和度与采纳在同一时间轴上。 仪表盘现在将分数饱和度和采纳趋势绘制在同一条时间轴上,使得可以看到一个基准的分数何时趋于平稳,相对于实验室何时停止采纳它。

研究工作台重新设计。 排行榜被重新设计(FINDING-001),从简单的排名列表转变为研究工作台。每个基准条目现在展示分数历史、采纳轨迹和来源证据。

分数验证。 每个被引用的分数卡都会与其声称报告的实际基准进行核对。这能捕捉到分数被错误归属到另一个基准的情况。

阅读间隔修复。 阅读间隔(基准最新提及与当前日期之间的时间差)现在按照每个基准自身的最新提及来计算,而不是用全局时钟。

流水线修复。 修复了自定义注册表与默认分数的配对问题。默认注册表现在能通过等效路径被识别。非有限分数值被拒绝。

8 月 2 日快照回填。 在一次采集缺口后,回填了 8 月 2 日的快照。

发现窗口文档。 为 CI 工作流中的第二个发现窗口补充了文档。

为什么重要

这一天是雷达从”采集工具”跨越到”分析仪器”的转折点。分数进展层使得可以提出这样的问题:”GPT-4 的 MMLU 分数在各版本间是如何变化的?”采纳前沿使得可以提出这样的问题:”实验室正在趋向哪些基准?”对于任何在决定自己的模型应该跑哪些基准的人来说,这些才是真正重要的问题。

研究工作台的重新设计反映了工具服务对象的转变。一个排名列表服务于随意浏览的读者,一个工作台服务于需要将声明追溯到来源的研究者。

解决的问题

  • #106:记录发现窗口
  • #108:回填 8 月 2 日快照
  • #113:记录发现窗口
  • #114:饱和度可视化
  • #115:8 月 2 日快照回填
  • 分数进展层(70 条来源验证观察)
  • 基准采纳前沿
  • 研究工作台重新设计

第十天:每日简报、GPT 洞察与发布准备。