Conjunto de datos abierto — puntuaciones de AI-readiness
Cada auditoría de AgentFit que produjo una medición utilizable, en un único archivo. 11762 URL de entrada en 11705 hosts, puntuadas de 0 a 100 sobre 28 criterios en seis categorías. CC BY 4.0. Se regenera a diario.
Descargar
dataset.csv 2.1 MB, 23 columnas, RFC 4180 · dataset.json 5.8 MB, con un sobre que describe la población
Generado el 2026-09-12. Ambos archivos contienen las mismas filas de la misma instantánea.
Qué contiene
Una fila por URL de entrada auditada: el host, la URL de entrada, la fecha de la última auditoría válida, la puntuación total, las seis puntuaciones por categoría con sus máximos, la versión de la rúbrica, cuántas auditorías válidas tiene esa URL y el identificador de la ejecución, que abre el informe público completo en /r/{run_id}, con todas las evidencias. Cada host del archivo tiene una página viva en /browse/site/{host}.
Qué no contiene: nada obtenido de los sitios auditados — ni texto de página, ni fragmentos de evidencia, ni HTML, ni títulos. Ninguna dirección IP ni dato de quien envió la URL; el archivo solo contiene números que calculamos e identificadores que asignamos. El detalle por criterio permanece en las páginas de informe.
Columnas
| Columna | Significado |
|---|---|
host | Nombre de host, en minúsculas, en punycode. No es único: unos pocos hosts se auditaron bajo más de una URL de entrada. |
entry_url | La URL de entrada normalizada. Única — es la clave primaria del archivo. |
is_canonical_for_host | true en la fila que /browse/site/{host} muestra como URL de entrada del host. |
audited_on | Fecha de la última auditoría válida, UTC. |
first_audited_on | Fecha de la primera auditoría de esta URL de entrada, de cualquier validez, UTC. |
ok_run_count | Cuántas auditorías válidas tiene esta URL de entrada — el grosor de la evidencia. |
run_id | La ejecución de la que proceden todas las puntuaciones de la fila. Se abre en /r/{run_id}. |
validity | Siempre ok. La columna mantiene el filtro visible dentro del propio archivo. |
rubric_version | Qué rúbrica midió la fila. Las filas de versiones distintas no son comparables. |
total_score | Puntuación total de esa ejecución. |
total_max | La escala sobre la que se apoya el total, en el archivo y no en la documentación. |
A_discovery … F_agent_surface | Puntuación de una categoría (A–F) en esa ejecución. |
A_discovery_max … F_agent_surface_max | Cuánto valía esa categoría bajo la versión de rúbrica de esta fila. |
license | Constante: la licencia y la página con el aviso completo. Se repite en cada fila para que un CSV separado de esta página siga diciendo qué es. |
Épocas
Los presupuestos por categoría cambiaron entre versiones de la rúbrica: en v2 las seis categorías valían 13/20/24/19/14/10; en la rúbrica actual valen 14/21/17/23/21/4, sobre 28 criterios en lugar de 30. Las filas con distinto rubric_version las produjeron instrumentos distintos.
Agrupe por rubric_version antes de calcular nada. Es la misma regla que aplica /diff cuando se niega a presentar una diferencia entre versiones como un cambio del sitio.
Filas por versión de la rúbrica: v7: 11111 · v6: 96 · v5: 46 · v4: 290 · v3: 216 · v2: 3
Solo válidas
Una fila existe solo donde la auditoría obtuvo realmente respuestas suficientes para medir (validity = ok). Las ejecuciones bloqueadas por reglas anti-scraping, o que dieron con un host inalcanzable, quedan excluidas: su total mide nuestro acceso, no el sitio.
De las 13742 URL de entrada del índice público, 1212 no tienen ninguna ejecución válida y no aparecen. Otras 768 sí la tienen, pero anterior al sellado de versiones: una puntuación sin regla graduada no es reproducible, así que tampoco aparecen, y volverán a medida que se reaudite el corpus.
Población
Son URL que la gente envió por su cuenta, no una lista curada de documentación de API. La distribución describe lo que se envió, no el mercado. No la lea como una clasificación del sector.
Además está sesgado en una sola dirección: muchas URLs enviadas no son documentación de API y puntúan casi cero —alrededor de una quinta parte de los hosts queda por debajo de 10 puntos y cerca de la mitad por debajo de 20—. Cualquier percentil o clasificación calculada a partir de este archivo favorece por tanto a sus sujetos frente a un conjunto de sitios de documentación reales. Dígalo si publica una.
Export vivo
El archivo se genera a partir de datos vivos y cambia a medida que los sitios se reauditan. Es deliberado: una publicación trimestral congelada seguiría distribuyendo filas que nos han pedido retirar.
El coste es que no hay número de versión que citar — cite entonces la fecha en que lo descargó y conserve su copia. El archivo se llama agentfit-dataset-AAAA-MM-DD.csv precisamente por eso.
Licencia
AgentFit AI-readiness dataset © 2026 Gumeniuk Stanislav se publica bajo licencia CC BY 4.0. Para consultar la licencia, visite https://creativecommons.org/licenses/by/4.0/
Las puntuaciones son hechos que calculamos. En algunas jurisdicciones los hechos y las compilaciones «delgadas» no gozan de derecho de autor alguno; donde sí lo hacen, o donde se aplica un derecho sui generis sobre bases de datos, la licencia es CC BY 4.0. Donde no existe tal derecho, no hace falta permiso y la atribución de abajo es una petición, no una condición.
CC BY 4.0 cubre únicamente los datos de /dataset.csv y /dataset.json — no el servicio AgentFit, ni el contenido del sitio, ni el texto de la rúbrica, ni el código fuente.
Cómo citar
Copie una de las tres formas de abajo. La fecha de consulta que aparece en ellas es la de la instantánea de esta página; si descargó el archivo antes, cite su propia fecha.
Texto
AgentFit AI-readiness dataset by Gumeniuk Stanislav (agentfit.dev), licensed under CC BY 4.0. Retrieved 2026-09-12 from https://agentfit.dev/dataset
HTML
<a href="https://agentfit.dev/dataset">AgentFit AI-readiness dataset</a> by Gumeniuk Stanislav, <a href="https://creativecommons.org/licenses/by/4.0/">CC BY 4.0</a>, retrieved 2026-09-12.
BibTeX
@misc{agentfit_dataset,
title = {AgentFit AI-readiness dataset},
author = {Gumeniuk, Stanislav},
year = {2026},
howpublished = {\url{https://agentfit.dev/dataset}},
note = {Rolling dataset, CC BY 4.0. Retrieved 2026-09-12}
}
Independencia
Evaluación automática e independiente. AgentFit no está afiliado a los sitios auditados y no pidió permiso para publicar. Las puntuaciones son heurísticas, producidas por una sola recuperación automática en una sola fecha, y describen lo que una máquina pudo leer — no la calidad del producto que hay detrás de la documentación. Las filas que nos pertenecen no están en la exportación: agentfit.dev y gumeniuk.com quedan excluidos de toda colección y de toda cifra publicada, porque el único sitio que no podemos juzgar con distancia es el nuestro.
Retirada
Si una fila se refiere a una URL que usted controla y quiere que desaparezca, escriba a [email protected] con el enlace del informe. En un plazo de 30 días naturales el informe se retira de /browse y el enlace directo devuelve 404; la exportación lo sigue en otras 24 horas, porque se regenera a diario. Las copias que otras personas ya descargaron no pueden recuperarse — eso es cierto para cualquier licencia abierta, y por eso esto es una exportación viva y no una serie de publicaciones trimestrales permanentes.
Cómo se puntúan los criterios · Explorar el corpus · Términos · Privacidad