Benchmark Radar 第二十三天:外部基准目录与排行榜导航器

less than 1 minute read

Published:

雷达吸收了外部目录。第二十三天构建了外部目录系统,并在排行榜中新增了基准测试搜索功能。

作者:Koutian WuGitHub: ktwu01

今日交付

外部基准目录。 新系统将外部基准目录(llm-stats、OpenCompass)规范化为雷达内部格式。每个来源经过爬取、规范化为按基准分片的文件,并通过身份层验证。

身份层。 人工核验的基准身份种子文件(identity.yml)锚定了规范化流程。候选身份由系统自动生成,但权威身份经人工验证。这在允许自动化扩展的同时防止错误合并。

按基准分片。 normalize-external 命令输出按基准组织的分片文件。每个分片包含该基准的元数据、分数和来源引用,格式统一。

排行榜基准搜索。 排行榜导航器现在包含基准搜索功能(M1 起点)。用户可按名称、能力等级或厂商搜索特定基准。

搜索索引。 搜索索引输出至 site/data,供客户端搜索使用。这实现了快速、离线可用的基准查询。

OpenCompass 第二轮集成。 OpenCompass 第二轮目录已合并至外部目录,完成全量身份解析。

折叠式 issue 区块。 Issue #240 区块默认折叠但可见,减少视觉杂乱同时保持内容可访问。

Pages 部署支持外部目录。 外部目录的构建和部署已纳入 GitHub Pages 工作流。

不变量锁定。 分片和身份不变量锁定在 100%,确保规范化管道保持完美一致性。

导航器审计修正。 修正了导航器的声明,并记录了 office hours 的发现。

Ruff 格式化。 所有外部目录模块均已通过 ruff 格式化。

为什么重要

外部目录是雷达最大的一次架构扩展。此前,雷达从自身来源采集数据;此后,它可以吸收和规范化外部基准注册表的数据。这意味着雷达的覆盖范围不再受限于自身爬虫的能力;通过集成现有目录,它可以纳入整个基准测试生态。

身份层是关键的技术决策。自动化规范化强大但危险:一次错误的合并(两个不同基准被合并为一个,或一个基准被拆分为两个)会永久损坏数据。人工核验的种子在基础层面保证正确性,而自动化系统处理规模问题。

排行榜搜索是让雷达数据可大规模导航的第一步。面对数百个基准测试,仅靠滚动浏览是不够的。搜索功能让用户在几秒内找到特定基准。

解决的问题

  • #240: 外部目录区块
  • #246: 外部目录模块
  • #247: 导航器审计修正
  • 外部目录系统(llm-stats、OpenCompass)
  • 人工核验种子的身份层
  • 按基准分片输出
  • 排行榜基准搜索
  • 搜索索引生成
  • 不变量锁定 100%

这标志着 Benchmark Radar 开发的前23天。从空白仓库到具备中文国际化、AI 驱动简报、社交媒体集成和外部目录规范化的全功能基准情报平台,项目连续三周每天都有交付。