Conjunto de datos abierto — puntuaciones de AI-readiness

Cada auditoría de AgentFit que produjo una medición utilizable, en un único archivo. 11762 URL de entrada en 11705 hosts, puntuadas de 0 a 100 sobre 28 criterios en seis categorías. CC BY 4.0. Se regenera a diario.

Descargar

dataset.csv 2.1 MB, 23 columnas, RFC 4180 · dataset.json 5.8 MB, con un sobre que describe la población

Generado el 2026-09-12. Ambos archivos contienen las mismas filas de la misma instantánea.

Qué contiene

Una fila por URL de entrada auditada: el host, la URL de entrada, la fecha de la última auditoría válida, la puntuación total, las seis puntuaciones por categoría con sus máximos, la versión de la rúbrica, cuántas auditorías válidas tiene esa URL y el identificador de la ejecución, que abre el informe público completo en /r/{run_id}, con todas las evidencias. Cada host del archivo tiene una página viva en /browse/site/{host}.

Qué no contiene: nada obtenido de los sitios auditados — ni texto de página, ni fragmentos de evidencia, ni HTML, ni títulos. Ninguna dirección IP ni dato de quien envió la URL; el archivo solo contiene números que calculamos e identificadores que asignamos. El detalle por criterio permanece en las páginas de informe.

025507510011,064 scored hosts · rubric v7 · submitted URLs, not a curated list1,266 · 11.4%median 27
Son URL que la gente envió por su cuenta, no una lista curada de documentación de API. La distribución describe lo enviado, no el mercado: buena parte no es documentación de API en absoluto y puntúa casi cero. SVG

Columnas

ColumnaSignificado
hostNombre de host, en minúsculas, en punycode. No es único: unos pocos hosts se auditaron bajo más de una URL de entrada.
entry_urlLa URL de entrada normalizada. Única — es la clave primaria del archivo.
is_canonical_for_hosttrue en la fila que /browse/site/{host} muestra como URL de entrada del host.
audited_onFecha de la última auditoría válida, UTC.
first_audited_onFecha de la primera auditoría de esta URL de entrada, de cualquier validez, UTC.
ok_run_countCuántas auditorías válidas tiene esta URL de entrada — el grosor de la evidencia.
run_idLa ejecución de la que proceden todas las puntuaciones de la fila. Se abre en /r/{run_id}.
validitySiempre ok. La columna mantiene el filtro visible dentro del propio archivo.
rubric_versionQué rúbrica midió la fila. Las filas de versiones distintas no son comparables.
total_scorePuntuación total de esa ejecución.
total_maxLa escala sobre la que se apoya el total, en el archivo y no en la documentación.
A_discoveryF_agent_surfacePuntuación de una categoría (A–F) en esa ejecución.
A_discovery_maxF_agent_surface_maxCuánto valía esa categoría bajo la versión de rúbrica de esta fila.
licenseConstante: la licencia y la página con el aviso completo. Se repite en cada fila para que un CSV separado de esta página siga diciendo qué es.

Épocas

Los presupuestos por categoría cambiaron entre versiones de la rúbrica: en v2 las seis categorías valían 13/20/24/19/14/10; en la rúbrica actual valen 14/21/17/23/21/4, sobre 28 criterios en lugar de 30. Las filas con distinto rubric_version las produjeron instrumentos distintos.

Agrupe por rubric_version antes de calcular nada. Es la misma regla que aplica /diff cuando se niega a presentar una diferencia entre versiones como un cambio del sitio.

Filas por versión de la rúbrica: v7: 11111 · v6: 96 · v5: 46 · v4: 290 · v3: 216 · v2: 3

Solo válidas

Una fila existe solo donde la auditoría obtuvo realmente respuestas suficientes para medir (validity = ok). Las ejecuciones bloqueadas por reglas anti-scraping, o que dieron con un host inalcanzable, quedan excluidas: su total mide nuestro acceso, no el sitio.

De las 13742 URL de entrada del índice público, 1212 no tienen ninguna ejecución válida y no aparecen. Otras 768 sí la tienen, pero anterior al sellado de versiones: una puntuación sin regla graduada no es reproducible, así que tampoco aparecen, y volverán a medida que se reaudite el corpus.

Población

Son URL que la gente envió por su cuenta, no una lista curada de documentación de API. La distribución describe lo que se envió, no el mercado. No la lea como una clasificación del sector.

Además está sesgado en una sola dirección: muchas URLs enviadas no son documentación de API y puntúan casi cero —alrededor de una quinta parte de los hosts queda por debajo de 10 puntos y cerca de la mitad por debajo de 20—. Cualquier percentil o clasificación calculada a partir de este archivo favorece por tanto a sus sujetos frente a un conjunto de sitios de documentación reales. Dígalo si publica una.

Export vivo

El archivo se genera a partir de datos vivos y cambia a medida que los sitios se reauditan. Es deliberado: una publicación trimestral congelada seguiría distribuyendo filas que nos han pedido retirar.

El coste es que no hay número de versión que citar — cite entonces la fecha en que lo descargó y conserve su copia. El archivo se llama agentfit-dataset-AAAA-MM-DD.csv precisamente por eso.

Licencia

AgentFit AI-readiness dataset © 2026 Gumeniuk Stanislav se publica bajo licencia CC BY 4.0. Para consultar la licencia, visite https://creativecommons.org/licenses/by/4.0/

Las puntuaciones son hechos que calculamos. En algunas jurisdicciones los hechos y las compilaciones «delgadas» no gozan de derecho de autor alguno; donde sí lo hacen, o donde se aplica un derecho sui generis sobre bases de datos, la licencia es CC BY 4.0. Donde no existe tal derecho, no hace falta permiso y la atribución de abajo es una petición, no una condición.

CC BY 4.0 cubre únicamente los datos de /dataset.csv y /dataset.json — no el servicio AgentFit, ni el contenido del sitio, ni el texto de la rúbrica, ni el código fuente.

Cómo citar

Copie una de las tres formas de abajo. La fecha de consulta que aparece en ellas es la de la instantánea de esta página; si descargó el archivo antes, cite su propia fecha.

Texto

AgentFit AI-readiness dataset by Gumeniuk Stanislav (agentfit.dev), licensed under CC BY 4.0. Retrieved 2026-09-12 from https://agentfit.dev/dataset

HTML

<a href="https://agentfit.dev/dataset">AgentFit AI-readiness dataset</a> by Gumeniuk Stanislav, <a href="https://creativecommons.org/licenses/by/4.0/">CC BY 4.0</a>, retrieved 2026-09-12.

BibTeX

@misc{agentfit_dataset,
  title        = {AgentFit AI-readiness dataset},
  author       = {Gumeniuk, Stanislav},
  year         = {2026},
  howpublished = {\url{https://agentfit.dev/dataset}},
  note         = {Rolling dataset, CC BY 4.0. Retrieved 2026-09-12}
}

Independencia

Evaluación automática e independiente. AgentFit no está afiliado a los sitios auditados y no pidió permiso para publicar. Las puntuaciones son heurísticas, producidas por una sola recuperación automática en una sola fecha, y describen lo que una máquina pudo leer — no la calidad del producto que hay detrás de la documentación. Las filas que nos pertenecen no están en la exportación: agentfit.dev y gumeniuk.com quedan excluidos de toda colección y de toda cifra publicada, porque el único sitio que no podemos juzgar con distancia es el nuestro.

Retirada

Si una fila se refiere a una URL que usted controla y quiere que desaparezca, escriba a [email protected] con el enlace del informe. En un plazo de 30 días naturales el informe se retira de /browse y el enlace directo devuelve 404; la exportación lo sigue en otras 24 horas, porque se regenera a diario. Las copias que otras personas ya descargaron no pueden recuperarse — eso es cierto para cualquier licencia abierta, y por eso esto es una exportación viva y no una serie de publicaciones trimestrales permanentes.

Cómo se puntúan los criterios · Explorar el corpus · Términos · Privacidad