Benchmark Radar 第二十一天:OpenReview 认证与响应式布局

less than 1 minute read

Published:

OpenReview 完成了认证接入,宽屏布局得以扩展,手机端的显示问题也修复了。第二十一天是横跨多个模块的修复日。

作者:Koutian Wu;GitHub: ktwu01

Benchmark Radar 已上线。 每天追踪新的 AI 基准测试、数据集与排行榜:打开仪表盘 或 在 GitHub 上 Star。

你好,我是 Koutian。第二十一天,我们补上了几个一直拖着的窟窿。

先说 OpenReview。它是个托管顶会论文评审的平台(issue,就是待办或 bug,可以理解为一种投稿系统)。雷达现在用 openreview-py 客户端,正式连上了它的 API v2。这意味着 NeurIPS、ICML、ICLR 这些顶级会议的同行评审数据,雷达能读到了。你以后不只能看到哪些基准测试发了,还能看到圈内人怎么评价它。

我们顺手加了个测试工作流(CI,就是自动跑测试的流程),专门盯着 OpenReview 的认证状态。凭证哪天出问题,能尽早发现,不用等用户来投诉。

中英文切换按钮终于活了。之前它摆在那儿,点下去啥也不干。现在点击真有反应了。按钮上显示的也不是泛泛的标签,而是「中/EN」这样的字形,告诉你点完会变成哪种语言。你切语言不再靠猜。

手机端的工具网格修了三处。小屏幕上图标渲染不对,我们改了。窄屏手机上标题栏会换行,挡住工具格,我们也让它在窄屏自动包裹,不再溢出。手机上的方块还缩到了 2.1rem,320px 宽的屏幕也能放下。你用手机通勤时看雷达,不会再是一团乱。

宽屏布局也好了。雷达现在会利用更多横向空间(issue #223)。头部导航图标放大了,右边空白也少了。你在 4K 显示器上打开,它不再把自己挤成一条窄缝。

仪表盘跑得更快了。数据文件 radar.json 现在会缓存,筛选器重渲染加了防抖(issue #222)。说白了,你每敲一个键,它不再把整个页面重画一遍。你筛选数据时,页面不卡了。

饱和分数现在用模型 Logo 标出来,图自己就能说明白。每日问答那块区域也加宽了,读起来更舒服。工具图标点上去有即时视觉反馈。国际化的改动之后,代码格式也回到了干净基线。

为什么值得你关心。

OpenReview 是当天分量最重的一笔。它装着顶级 AI 会议的评审数据。一个在 NeurIPS 拿高评价的基准测试,比一个被拒稿的更可能被大家用起来。雷达连上它,你能看出一个测试是真好还是只是发布了。

手机修复是为了让你用得了。如果雷达在 320px 的手机上显示崩了,你通勤路上就完全没法看。宽屏修复是另一头,大显示器上它就该用满空间,不该缩成窄列。你无论用啥设备,都能正常看。

解决的问题。

  • #220: 移动端工具网格溢出
  • #221: 语言切换接通
  • #222: 缓存 radar.json 并防抖筛选器
  • #223: 宽屏水平空间
  • OpenReview API v2 认证
  • 语言字形显示
  • 仪表盘性能优化
  • 每日问答区域宽度

第二十二天:数据完整性、社区渠道与 RSS 订阅源。

想跟进 Benchmark Radar?在 GitHub 上 Star 仓库 获取每日更新,或 打开实时仪表盘 浏览扫描结果。阅读论文:arXiv:2609.11115。