Benchmark Radar 第三十四天:可以离线在命令行里跑的雷达

less than 1 minute read

Published:

Benchmark Radar 的第三十四天。雷达现在可以从你自己电脑的命令行运行,离线可用,中间不隔仪表盘,编码智能体可以直接从数据里回答基准测试的问题。记分牌:121 颗星,23 个 fork。

作者:Koutian WuGitHub: ktwu01

Benchmark Radar 已上线。 每天追踪新的 AI 基准测试、数据集与排行榜:打开仪表盘在 GitHub 上 Star

命令行是你在文本窗口里向电脑输入指令的地方,CLI 就是在那里运行的程序。同步是把本地数据副本更新到与主副本一致。校验和是文件的短指纹,文件一变指纹就变。社交图是链接被分享时展示的那张图。

PR #426 是这次的重头,12 分。它加入了一个本地优先的查询 CLI,包含 searchshowrecentstatusinitsync 六个命令。搜索保持离线且可复现;同步先检查那个很小的清单文件,支持 ETag 缓存,在切换到新版本前校验大小、SHA-256、ZIP 安全、目录完整性和分片齐全度。激活失败会保留上一个已验证的版本,下载器也拒绝不安全的降级。同一个 PR 还发布了 benchmark-radar 智能体技能,让智能体把问题路由到 CLI 而不是自己猜,并配了中英双语说明。公开的一键安装直到 HTTPS 路由修好之前一直保持阻塞。

PR #418 补上了扩大的简报限额暴露出来的预算缺口,证据不再被悄悄丢弃。PR #427 通过删掉一个多余的根 CNAME 修好了 Pages 发布,并在保留严格数量校验的同时重试了一条不安全的机器翻译。PR #428 让社交图显示饱和度图表,而不是排行榜卡片。

PR #429 和 PR #431 修好了贡献者头像流水线。README 里的贡献者头像一度渲染成六个裂开的图标,因为作为图片加载的 SVG 不能抓取外部资源,新的生成器于是把每张头像直接内联进去。更新图片的工作流现在改成开拉取请求而不是直接推送到受保护的主分支,缺失的 Actions 权限也开了,一个外部 action 换成了 runner 上本来就装好的 CLI。

PR #435 让 README 更容易扫读:开头只写一个数字,37 个公开数据源,内部文档挪到可折叠的块里。

为什么要在意

能离线跑的雷达就是能在任何地方跑的雷达,笔记本、工作站或智能体都行,而且每次给出的答案都可复现。仪表盘仍然是正门,CLI 让数据可以随身带走。

看不见的修复和看得见的功能一样重要。一张裂开的社交图或一个失败的贡献者工作流看似小事,直到它挡住项目被分享,或挡住给帮忙的人记功。Pages 发布、机器翻译重试、贡献者头像,这些是其他一切跑在其上的轨道。

解决的问题

  • #426:本地优先 CLI、托管数据同步和 benchmark-radar 智能体技能
  • #404:社交图现在显示饱和度图表
  • #396:贡献者图片更新改为开拉取请求而不是直接推送
  • #430:README 开头精简为 37 个公开数据源
  • #378:简报预算缺口补齐,包括中文渲染
  • 记分牌:121 / 1000 星,23 个 fork

第三十五天:每个基准都有自己的网址,做给搜索引擎而不是屏幕看。

想跟进 Benchmark Radar?在 GitHub 上 Star 仓库 获取每日更新,或 打开实时仪表盘 浏览扫描结果。