Benchmark Radar 第四天:历史记忆与新鲜度检测
Published:
雷达学会了记忆。第四天加入了历史数据回填、过期检测和 agentic 分类。
今日交付
simulate-history 命令。 新增了一个 CLI 命令,通过模拟过去的采集运行来回填历史快照。生成了四个历史快照,让趋势图有真实数据可展示。
过期提示横幅。 仪表板现在会在数据超过预期时间后显示提示横幅。如果每日运行失败或停滞,用户会看到警告,而不是继续信任过时的数据。
按分类统计语料库总量。 Today 视图现在显示按分类(基准、数据集、排行榜、研究)拆分的去重工件总数,让人对整体规模一目了然。
Agentic 分类。 在分类学中新增了 “agentic” 类别,并配上了对应的检索关键词。之前 agent 类基准被笼统地归入通用类别,现在它们有了自己的归属。
趋势增量修复。 将重新发布的更新排除在趋势增量之外。新增了仅限 releases 的视图。收紧了 arXiv 关键词过滤,聚焦于基准和数据集的首次发布。
记录展开修复。 展开记录时,仪表板现在会显示新内容,而不是重复展示预告文字。
每日雷达调度。 将雷达配置为每天运行两次,这样一次触发失败后当天还能重试。
为什么重要
没有历史的雷达是日报。有历史的雷达是地图集。simulate-history 命令弥合了”我们昨天才启动”和”我们有几个月的数据”之间的鸿沟,让趋势图有实实在在的东西可展示。
过期提示横幅同样重要。如果数据是两天前的,仪表板就应该明说。信任需要对新鲜度保持透明。
Agentic 分类的加入反映了一个真实的市场转变:agent 类基准(SWE-bench、WebArena、OSWorld)增长很快,已经值得单独分类了。
解决的问题
- #35, #42, #45:过期提示横幅、语料库总量、历史回填
- #52:语料库总量可见性
- #53:新鲜度字段
- #55:趋势增量修复
- #58:agentic 分类
明天:趋势图悬浮卡片和基准全景分析报告。
