Benchmark Radar 第二十天:完整中文支持与洞察块

less than 1 minute read

Published:

雷达开始说中文了。第二十天交付了完整的 zh 国际化词典、洞察块和完整的社交清单。

作者:Koutian WuGitHub: ktwu01

今日交付

完整 zh 国际化词典。 添加了完整的中文翻译词典并接入静态 HTML。每个 UI 字符串、标签和描述都有了对应的中文版本。

中文标题。 网站在中文模式下翻译为”Benchmark 雷达日报”。

Today 页面洞察块。 每日扫描现在编译成可快速浏览的洞察块。用户无需逐条阅读原始发现,而是看到按重要性组织的结构化摘要。

社交清单全面改版。 每日社交清单进行了全面改版:

  • 个人和直接渠道从每日轮转中移除
  • 新增 Reddit 子版块链接和 Hacker News 提交链接
  • 周度频率渠道与每日渠道分离
  • 每个每日清单现在以记录数徽章开头
  • 非每日渠道每天仍会渲染,但单独分组

新增模型卡。 DeepSeek-V4-Pro-0813、GLM-5.1、GLM-5.2、Qwen3.8-27B 和 AI2 OLMo 3 已添加到采纳注册表中。

README 简化。 README 围绕核心用例进行了简化。发布了基于数据的记录数徽章。

zh-CN README。 添加了中文 README,包含微信群二维码。

Caveat 豁免收紧。 每日问答的 caveat 豁免范围已收窄:不再适用于非类别份额。未引用的 100 分现在会被验证拒绝。

社交测试时区修复。 社交测试渠道已标记为每日执行,避免因时区导致的测试失败。

为什么重要

中文国际化是一个市场决策。AI 基准测试生态在中国有大量活跃度:DeepSeek、Qwen、GLM 等中国模型实验室频繁发布基准测试成果。让雷达支持中文显著扩大了其潜在受众。

洞察块是信息密度的 UX 改进。原始发现需要解读;洞察块提供预解读的摘要。这对于花三十秒扫一眼仪表板而非花三十分钟深入研究的用户来说至关重要。

社交清单改版体现了从”到处发”到”在对的地方发”的转变。个人渠道是噪声;Reddit 和 Hacker News 才是信号。

解决的问题

  • #197:记录数徽章和 zh-CN README
  • #201:简化 README
  • #203:Today 页面洞察块
  • #206:社交清单全面改版
  • #207:每日问答未引用分数拒绝
  • #210:记录数徽章每日更新
  • #211:洞察块
  • #213:图标修复
  • #216:zh 国际化词典
  • #217:社交测试时区修复
  • 模型卡新增(DeepSeek、GLM、Qwen、OLMo)

第二十一天:OpenReview 认证、宽屏布局和移动端修复。