Benchmark Radar:面向 AI 基准的、以证据为先的每日雷达

less than 1 minute read

Published:

AI 基准现在出现得比任何研究员评估它们的速度都快,所以我建了一个雷达,让发现变成每日的、透明的、可审计的。

作者:Koutian WuGitHub: ktwu01

Benchmark Radar 是一个开源系统,每天寻找新发布的 AI 基准、评估方法、数据集、排行榜和数据质量研究。它从一手和结构化来源收集记录、去重、用一套可见的分类法分类、用可解释的信号排序,并且每天发布一个 GitHub Issue 和一个累计仪表盘

我正要开启一段新冒险,我工作的重要一部分就是寻找这类信息。我需要知道哪些基准、评估方法、数据集和数据质量想法正在出现——我也需要一种可靠的方式跟上它们。这就是为什么我需要 Benchmark Radar,也是为什么我建了它。

这个项目解决一个简单的问题:跟踪 AI 评估工作本身已经变成了一项研究工作。

一个新基准可能最初以 arXiv 论文、OpenReview 投稿、GitHub 仓库或 Hugging Face 数据集的形式出现。它的排行榜可能晚些才到。同一个产物随后可能被几个二手来源讨论,每个来源的标题和描述都略有出入。一个普通的 feed 会把这些记录一视同仁地呈现出来,把”什么是新的、什么是重复的、什么背后有真实证据”留给读者自己去重构。

Benchmark Radar 是我让这个过程更系统化的一次尝试。

雷达在监视什么

默认分类学覆盖四个彼此相连的领域:

  • 新的 AI 和 LLM 基准、挑战集和评估套件;
  • 评估框架、裁判模型、安全与能力评估、以及排行榜;
  • 公开数据集、偏好数据、合成数据,以及其他数据发布;
  • 关于污染、泄漏、来源、去重、标注质量及相关数据质量问题的研究。

收集器查询 arXiv、OpenReview、Hugging Face、GitHub、GitHub Releases、Semantic Scholar、OpenAlex 和 Brave Search。可选来源发生故障或不可用,也不会中断每日报告。发生这种情况时,来源健康表会显示缺失的覆盖范围,而不是静默地假装这次运行是完整的。

这个细节很重要。一条由变化的来源覆盖范围构建出来的趋势线,即使在它仅仅是一种收集伪影时,看起来也像动量。

证据先于新颖性

核心设计选择是:每个被排序的条目都带四个可见的分项得分:

  • 相关性(Relevance) 衡量这条记录与基准、评估、数据集和数据质量分类学的匹配程度。
  • 证据(Evidence) 奖励一手或结构化来源、署名信号和佐证产物。
  • 新鲜度(Recency) 捕捉这项工作最近多久被发布或实质更新。
  • 采纳度(Adoption) 用星标、下载、点赞或引用等信号,按对数尺度计算。

默认优先级得分是:

0.35 relevance + 0.20 evidence + 0.20 recency + 0.25 adoption

结果按 0–100 分报告。权重和分项区间与给记录打分的代码放在同一处,这套评分细则也会导出到仪表盘。点开一个优先级得分,会显示该记录的分项值和它排位背后的加权计算。

这并不会让排序客观正确。它让它可被检视。

Benchmark Radar 是一个分诊系统,不是科学质量裁判。它无法判断一个基准是否测量了作者声称的能力、它的测试集是否被污染、或者一个排行榜结果能否复现。它能做的是展示为什么一个产物出现在每日列表上,并给读者一条更干净的证据线索,用来决定什么值得更仔细看一看。

统计产物,而不是提及

去重是这个系统里不那么显眼、却更重要的部分之一。

累计语料库通过 DOI、arXiv、OpenReview、GitHub 和 Hugging Face ID 等精确标识符解析实体。它不会用模糊匹配静默合并两个标题相似的工程。观察结果始终连接到它们被发现时的产物,仪表盘可以展开多条记录,而不会把每一次提及都变成一个新基准。

同样的谨慎也适用于历史比较。趋势计算只比较用相同报告限制和相同连接器覆盖签名收集的快照。不完整的日子保持可见并被标注,而不是被平滑抹掉。

这听起来很保守,因为它就是保守。只有当图表上升意味着”爬虫今天表现不同”以外的更多东西时,雷达才有用。

一件每日研究产物

整个工作流在 GitHub Actions 里于 UTC 12:15 运行,也可以手动触发。一次运行会收集并给记录打分、校验一个带版本号的每日快照、更新按日期过滤的 GitHub Issue,并重建累计仪表盘。

每个快照都记录从拉取记录到去重、合格、发布条目的选择漏斗。它还保留检索时间、解析器版本,以及上游载荷的指纹,而不发布凭证或原始 API 响应。

因此这个仓库包含的不只是生成的网页。它包含生产这份 feed 所需的代码、配置、schema 和带版本号的观察记录。

你可以用 Python 3.11 或更高版本在本地运行它:

git clone https://github.com/ktwu01/benchmark-radar.git
cd benchmark-radar
python3 -m venv .venv
source .venv/bin/activate
python -m pip install -e '.[dev]'
benchmark-radar

主要输出是一份 Markdown 报告、一份机器可读的证据快照、一份带日期的语料库快照,以及仪表盘使用的浏览器可用数据。

我为什么公开构建它

AI 评估需要更好的发现基础设施,但它也需要对做发现的基础设施保持怀疑。

排序系统很容易把编辑决定藏在一个分数后面。数据管道很容易用一个清爽的界面把缺失的来源藏起来。累计仪表盘很容易把注意力当成证据、把重复提及当成新活动。Benchmark Radar 没有消除这些风险,但它试图在产品本身里暴露它们:可见的分项、来源健康警告、带版本号的 schema、明确的限制、确定性的重建,以及返回到被发现的记录的反向链接。

这个项目受到 agents-radar 的启发,其来源和评分是为基准与 AI 数据研究重新设计的。它按 MIT 许可证发布,源码在线仪表盘都公开。

目标不是再产出一个排行榜。而是让基准周围那个快速变化的版图稍微更容易检视——也稍微更难被误读。