Benchmark Radar 第二十四天:结果优先的今日视图与诚实的空状态

less than 1 minute read

Published:

今天我们把首页重做了一遍,让它先把结果摆出来,而不是先甩给读者一个空页面。我们还让那些「爬到了但没结果」的来源变得看得见了。先解释两个词:PR 是别人提议改的一段代码,issue 是一个待办或 bug。

作者:Koutian WuGitHub: ktwu01

今天做了什么

PR #249 把今天视图的顺序调了过来。匹配到的结果排在最前面。每日简报和问答搬到了右边一栏。上方筛选栏收成一行小控件,点一下会展开更多筛选。

为什么要在意:你打开页面第一眼看到的就是答案,不用先读一堆说明。

PR #252 按 #248 的评审意见改了首页的样子。每一行以标题为主,分数在 100 分制下优先显示整数,去掉了全大写的小标签。我们拿掉了 RECOMMENDED 徽标,因为它给几乎每一行头部都打上了标记,却没说出任何有用的东西。

为什么要在意:页面不再用花哨标签迷惑你,你看到的分数就是实数。

PR #255 和 #270 让来源筛选不挑大小写。你写 /?source=GitHub+Release/?source=First-party+feed,不管大小写怎么变、加号怎么编码,都能正常过滤。

为什么要在意:你从别处复制来的链接,不会再因为大小写不对而打不开。

PR #258 把饱和面板砍到只剩一条分数曲线。原来那一堆东西全删了:采纳阶梯、推进菱形、卡片地毯、发布标记、报告阶段徽标、计数行,还有按阶段标记进度的那一列,通通拿掉。现在不再用线段把两个分数点连起来假装有趋势。

为什么要在意:图上看不到假趋势,你不会被一条平滑上升的线骗到。

PR #271 加了一个小脚本 scripts/audit_jargon.py。它每周一凌晨 2 点(UTC 时间)扫一遍页面上用户能看到的文字,专门找 15 个只有项目内部人才懂的词。第一轮就逮到 25 处。

为什么要在意:以后页面上不会再冒出只有开发者才懂的黑话。

PR #274 让来源清单(Source mix)把「查了但今天零结果」的来源也列出来。这样你就能分清两种空:一种是今天查了没东西,一种是这个来源压根不存在。

为什么要在意:你能一眼看出是今天没新货,还是这个源坏了。

PR #275 把原来分门别类的报告菜单换成一个简单的 issue 表单,只要填三个字段。它替换掉了 #272 和 #273 两套旧表单。

为什么要在意:你想报个问题或提个建议,现在填三行就够,不用在菜单里绕。

PR #277 修掉了一个甩锅的提示。有时证据从没被采集过,页面却叫读者「清除筛选以扩大范围」。这半是 #274 没做完的活,现在补上了:该说没数据就说没数据,不赖读者的筛选。

为什么要在意:页面不会再把空白怪到你头上。

PR #247 改正了一处审计声明。真正的缺口是:在约 1066 个被爬取的基准里,只有 79 个能被选中,而不是之前说的「79 个里只有 13 个」。结论写进了 OFFICE-HOURS-DISPLAY.md

为什么要在意:数字准了,你才知道雷达到底覆盖了多少。

issue #266 和 #267 给 24 个组织换上了真正的 logo,之前画的是通用占位标记。还修了 5 个在图表那么小尺寸下看不清的文字标。这解决了 #261。

为什么要在意:图上的图标现在是真的,你认得出是谁。

issue #268 暴露了一个问题:23 个组织旗下的 75 个被爬取的模型,在审计页上缺了模型家族卡片。

为什么要在意:你想看某个模型属于哪一家,现在这个信息会补上。

issue #259 把爬取任务收窄到 76 个数据密集的 llm-stats 基准。之前先在 #263 里修好了 6 个写错的 source_benchmark_ids

为什么要在意:爬取更聚焦,跑得更快,也更不容易抓错东西。

为什么要在意

把答案放在最前面,是为了不跟你抢注意力。今天视图重排之后,结果排第一,简报和问答退到一边,你不用先读说明才知道发生了什么。

空状态这件事实则是诚实。雷达现在分得清「没采到」和「数据压根不存在」,而且从不把缺口怪到你的筛选上。一个长期停在零的来源多半是坏了,现在页面会直说。

术语审计不是一次性的打扫,而是一道常设的门槛。它每周一跑一次,防止页面文字悄悄退回只有开发者懂的黑话。

解决的问题

  • #247:导航器声明修正
  • #248:首页 UI 评审
  • #252:首页评审落地
  • #254:第一方源与 GitHub Release 为零
  • #255、#270:大小写不敏感来源筛选
  • #257:可视化 issue 模板字段
  • #258:饱和面板精简
  • #259:爬取身份收窄
  • #260:来源缺口可见
  • #261、#266、#267:真实品牌标识
  • #263:修正错误的 source_benchmark_ids
  • #268:模型家族审计
  • #271:每周术语审计
  • #274:显示一无所获的来源
  • #275:单一报告表单
  • #277:列表为何为空

第二十五天:分数落在它们所属的日期上,一个不再推荐自己的雷达。