开放数据集 — AI 就绪度评分
每一次产出可用测量的 AgentFit 审计,汇成一个文件。11705 个主机上的 11762 个入口 URL,按六大类 28 项标准计 0–100 分。CC BY 4.0。每日重新生成。
下载
dataset.csv 2.1 MB,23 列,RFC 4180 · dataset.json 5.8 MB,含总体描述信封
生成于 2026-09-10。 两个文件是同一快照的同一批行。
包含什么
每个受审入口 URL 一行:主机、入口 URL、最近一次有效审计的日期、总分、六个分类分数及其满分、评分标准版本、该 URL 的有效审计次数,以及运行 id —— 它指向 /r/{run_id} 上的完整公开报告,含全部证据。文件中的每个主机都有一个可访问的页面 /browse/site/{host}。
不包含什么:任何从受审站点抓取的内容 —— 没有页面文本、没有证据片段、没有 HTML、没有标题。没有 IP 地址,也没有提交者信息;文件只含我们计算出的数字和我们分配的标识符。逐项标准的细节留在报告页面上。
列
| 列 | 含义 |
|---|---|
host | 主机名,小写,punycode。不唯一:少数主机在多个入口 URL 下被审计过。 |
entry_url | 规范化后的入口 URL。唯一 —— 这是文件的主键。 |
is_canonical_for_host | 在 /browse/site/{host} 作为该主机入口 URL 展示的那一行上为 true。 |
audited_on | 最近一次有效审计的日期,UTC。 |
first_audited_on | 该入口 URL 首次审计的日期,不论有效性,UTC。 |
ok_run_count | 该入口 URL 有多少次有效审计 —— 证据有多厚。 |
run_id | 本行全部分数所来自的那次运行。可在 /r/{run_id} 打开。 |
validity | 恒为 ok。保留此列是为了让筛选条件在文件内部可见。 |
rubric_version | 测量该行所用的评分标准。不同版本的行不可比较。 |
total_score | 该次运行的总分。 |
total_max | 总分所处的量表 —— 写在文件里,而不是写在文档里。 |
A_discovery … F_agent_surface | 该次运行中某一分类(A–F)的分数。 |
A_discovery_max … F_agent_surface_max | 在本行的评分标准版本下该分类的满分。 |
license | 常量:许可证及完整声明所在页面。每一行都重复,以便 CSV 脱离本页后仍能说明自身来源。 |
标准版本
分类分值在评分标准的各版本之间发生过变化:v2 中六个分类分别值 13/20/24/19/14/10;当前标准为 14/21/17/23/21/4,标准项数为 28 项而非 30 项。rubric_version 不同的行出自不同的量具。
任何计算之前请先按 rubric_version 分组。这与 /diff 拒绝把跨版本差值当作站点变化来呈现,是同一条规则。
各评分标准版本的行数: v7: 11111 · v6: 96 · v5: 46 · v4: 290 · v3: 216 · v2: 3
仅有效
只有当审计确实取得了足以完成测量的响应(validity = ok)时才会有对应的行。被反爬规则拦截、或遇到不可达主机的运行被排除在外:它们的总分测量的是我们的访问,而不是站点。
公开索引中的 13742 个入口 URL 里,有 1212 个没有任何有效运行,因而缺席。另有 768 个有有效运行,但发生在版本标记出现之前 —— 没有量尺的分数不可复现,因此同样缺席,并会随着语料重新审计而回归。
总体
这些是人们自行提交的 URL,而不是经过筛选的 API 文档清单。该分布描述的是被提交的内容,而不是市场。请勿将其解读为 API 行业排名。
它还存在单向偏差:许多提交的 URL 根本不是 API 文档,得分接近零——约五分之一的主机低于 10 分,约一半低于 20 分。因此,凡是基于本文件计算的百分位或排名,都会比在真正的文档站点集合中显得更好看。若要发布,请一并说明。
滚动导出
文件由实时数据生成,并随站点被重新审计而变化。这是刻意为之:季度性的冻结发布会持续分发我们已被要求删除的行。
代价是没有可供引用的版本号 —— 因此请引用你下载的日期,并保留自己的副本。下载文件之所以命名为 agentfit-dataset-YYYY-MM-DD.csv,正是出于这个原因。
许可
AgentFit AI-readiness dataset © 2026 Gumeniuk Stanislav 依 CC BY 4.0 许可发布。查看许可全文: https://creativecommons.org/licenses/by/4.0/
分数是我们计算出的事实。在某些法域,事实与「单薄」汇编根本不受著作权保护;在受保护之处,或在数据库特别权利(sui generis)适用之处,许可为 CC BY 4.0。在不产生此类权利之处,无需授权,下面的署名是请求而非条件。
CC BY 4.0 仅覆盖 /dataset.csv 与 /dataset.json 中的数据 —— 不包括 AgentFit 服务、站点内容、评分标准文本或源代码。
如何引用
复制下面三种形式之一。其中的获取日期是本页快照的日期;如果你更早下载了文件,请改用你自己的日期。
纯文本
AgentFit AI-readiness dataset by Gumeniuk Stanislav (agentfit.dev), licensed under CC BY 4.0. Retrieved 2026-09-10 from https://agentfit.dev/dataset
HTML
<a href="https://agentfit.dev/dataset">AgentFit AI-readiness dataset</a> by Gumeniuk Stanislav, <a href="https://creativecommons.org/licenses/by/4.0/">CC BY 4.0</a>, retrieved 2026-09-10.
BibTeX
@misc{agentfit_dataset,
title = {AgentFit AI-readiness dataset},
author = {Gumeniuk, Stanislav},
year = {2026},
howpublished = {\url{https://agentfit.dev/dataset}},
note = {Rolling dataset, CC BY 4.0. Retrieved 2026-09-10}
}
独立性
独立的自动化评估。AgentFit 与受审站点没有关联,也未征求发布许可。分数是启发式的,由某一天的一次自动抓取产生,描述的是机器能读到什么 —— 而不是文档背后产品的质量。属于我们自己的行不在导出里:agentfit.dev 和 gumeniuk.com 已从所有汇总和所有公开数字中排除,因为唯一一个我们无法保持距离去评判的站点,就是自己的。
删除
如果某一行涉及你所控制的 URL 而你希望将其移除,请将报告链接发送至 [email protected]。30 个日历日内报告会从 /browse 移除,直链返回 404;导出文件会在此后 24 小时内跟进,因为它每日重新生成。他人已经下载的副本无法收回 —— 任何开放许可都是如此,这也正是我们采用滚动导出而非一系列永久季度发布的原因。