Benchmark Radar 第十六天:计数准确性与渐进式披露

less than 1 minute read

Published:

单一采纳者的基准测试被少算了。展开面板令人不知所措。第十六天同时修复了这两个问题。

作者:Koutian WuGitHub: ktwu01

今日交付

单一采纳者基准测试计数修复。 仅被一个模型卡采用的基准测试此前一直被少算。修复后确保这些基准测试即使在采纳范围很窄的情况下也能被准确计数。

渐进式披露恢复。 排行榜、每日问答和主页中的展开面板现在默认折叠。用户可以按需展开想看的内容,而不是一次性面对所有信息。

每日社交清单 issue 恢复。 每日社交清单 issue 在意外退役后已恢复。issue 日期现在从报告日期推导,而非系统时钟,从而避免时区相关的错位问题。

workflow_dispatch 发布默认值。 workflow_dispatch 的 publish 输入现在默认为 true(issue #88)。此前手动触发工作流需要显式设置发布标志。

前沿圆圈中的品牌图标。 采纳前沿圆圈现在显示真实的品牌图标(OpenAI、Google、Anthropic 等),而非通用标记。这使得前沿图一眼即可识别。

为什么重要

单一采纳者计数修复解决了一个数据准确性问题。当某个基准测试恰好只有一个采纳者时,少算它会让采纳格局看起来比实际情况更不多样。对于一个声称追踪基准测试采纳情况的工具来说,这类错误会损害可信度。

渐进式披露是应用在信息密度上的 UX 原则。雷达收集了大量数据;一次性全部展示会让新用户感到不知所措。折叠展开面板让仪表板既能服务偶然浏览者(看到摘要),也能服务深度研究者(展开需要的内容)。

前沿圆圈中的品牌图标是视觉识别的提升。当你在某个基准测试的采纳点旁看到 OpenAI 的标志,无需查看图例就能立即知道是谁采纳了它。

解决的问题

  • #88:workflow_dispatch 发布默认值设为 true,恢复每日社交 issue,日期从报告推导
  • #99:修正被少算的单一采纳者基准测试
  • #183:恢复渐进式披露
  • #184:恢复每日社交 issue
  • #185:workflow_dispatch 默认值
  • #187:单一采纳者审计
  • #188:渐进式披露恢复
  • #178:前沿圆圈中的品牌图标

第十七天:审计加固、顶栏操作和生产级美化。