Jeu de données ouvert — scores d'AI-readiness

Chaque audit AgentFit ayant produit une mesure exploitable, en un seul fichier. 11762 URL d'entrée sur 11705 hôtes, notées de 0 à 100 sur 28 critères en six catégories. CC BY 4.0. Régénéré chaque jour.

Télécharger

dataset.csv 2.1 MB, 23 colonnes, RFC 4180 · dataset.json 5.8 MB, avec une enveloppe décrivant la population

Généré le 2026-09-10. Les deux fichiers contiennent les mêmes lignes du même instantané.

Contenu

Une ligne par URL d'entrée auditée : l'hôte, l'URL d'entrée, la date du dernier audit valide, le score total, les six scores de catégorie avec leurs maxima, la version du barème, le nombre d'audits valides de cette URL, et l'identifiant de l'exécution — qui mène au rapport public complet sur /r/{run_id}, preuves comprises. Chaque hôte du fichier possède une page vivante sur /browse/site/{host}.

Ce qui n'y est pas : rien de ce qui a été récupéré sur les sites audités — ni texte de page, ni extraits de preuve, ni HTML, ni titres. Aucune adresse IP, aucune information sur l'auteur de la soumission ; le fichier ne contient que des nombres que nous avons calculés et des identifiants que nous avons attribués. Le détail par critère reste sur les pages de rapport.

025507510011,063 scored hosts · rubric v7 · submitted URLs, not a curated list1,266 · 11.4%median 27
Ce sont des URL soumises par les gens eux-mêmes, pas une liste choisie de documentations d'API. La distribution décrit ce qui a été soumis, pas le marché : une grande partie n'est pas de la documentation d'API et obtient un score proche de zéro. SVG

Colonnes

ColonneSignification
hostNom d'hôte, en minuscules, en punycode. Non unique : quelques hôtes ont été audités sous plusieurs URL d'entrée.
entry_urlL'URL d'entrée normalisée. Unique — c'est la clé primaire du fichier.
is_canonical_for_hosttrue sur la ligne que /browse/site/{host} affiche comme URL d'entrée de l'hôte.
audited_onDate du dernier audit valide, UTC.
first_audited_onDate du premier audit de cette URL d'entrée, quelle qu'en soit la validité, UTC.
ok_run_countNombre d'audits valides de cette URL d'entrée — l'épaisseur de la preuve.
run_idL'exécution dont proviennent tous les scores de la ligne. S'ouvre sur /r/{run_id}.
validityToujours ok. La colonne garde le filtre visible dans le fichier lui-même.
rubric_versionLe barème qui a mesuré la ligne. Des lignes de versions différentes ne sont pas comparables.
total_scoreScore total de cette exécution.
total_maxL'échelle sur laquelle repose le total, dans le fichier plutôt que dans la documentation.
A_discoveryF_agent_surfaceScore d'une catégorie (A–F) dans cette exécution.
A_discovery_maxF_agent_surface_maxCe que valait cette catégorie sous la version du barème de cette ligne.
licenseConstante : la licence et la page qui porte la notice complète. Répétée sur chaque ligne pour qu’un CSV séparé de cette page dise encore ce qu’il est.

Époques

Les budgets de catégorie ont changé entre les versions du barème : en v2 les six catégories valaient 13/20/24/19/14/10 ; dans le barème actuel elles valent 14/21/17/23/21/4, sur 28 critères au lieu de 30. Des lignes de rubric_version différents ont été produites par des instruments différents.

Regroupez par rubric_version avant tout calcul. C'est la règle qu'applique /diff lorsqu'il refuse de présenter un écart entre versions comme un changement du site.

Lignes par version du barème : v7: 11111 · v6: 96 · v5: 46 · v4: 290 · v3: 216 · v2: 3

Valides

Une ligne n'existe que là où l'audit a réellement obtenu assez de réponses pour mesurer (validity = ok). Les exécutions bloquées par des règles anti-scraping, ou tombées sur un hôte injoignable, sont exclues : leur total mesure notre accès, pas le site.

Sur les 13742 URL d'entrée de l'index public, 1212 n'ont aucune exécution valide et sont absentes. 768 autres en ont une, mais antérieure à l'estampillage des versions : un score sans règle graduée n'est pas reproductible, elles sont donc absentes aussi et reviendront au fil du réaudit du corpus.

Population

Ce sont des URL que des personnes ont soumises elles-mêmes, pas une liste curée de documentations d'API. La distribution décrit ce qui a été soumis, pas le marché. Ne la lisez pas comme un classement du secteur.

Il est aussi biaisé, et dans un seul sens : beaucoup d’URL soumises ne sont pas de la documentation d’API et obtiennent un score proche de zéro — environ un cinquième des domaines est sous 10 points et à peu près la moitié sous 20. Tout centile ou classement calculé à partir de ce fichier flatte donc ses sujets par rapport à un ensemble de vrais sites de documentation. Dites-le si vous en publiez un.

Export vivant

Le fichier est généré à partir de données vivantes et change au fil des réaudits. C'est délibéré : une publication trimestrielle figée continuerait à diffuser des lignes qu'on nous a demandé de retirer.

Le prix à payer : il n'y a pas de numéro de version à citer — citez donc la date de votre téléchargement, et conservez votre copie. Le fichier s'appelle agentfit-dataset-AAAA-MM-JJ.csv exactement pour cette raison.

Licence

AgentFit AI-readiness dataset © 2026 Gumeniuk Stanislav est publié sous licence CC BY 4.0. Pour consulter cette licence, voir https://creativecommons.org/licenses/by/4.0/

Les scores sont des faits que nous avons calculés. Dans certaines juridictions, les faits et les compilations « minces » ne sont couverts par aucun droit d'auteur ; là où ils le sont, ou là où s'applique un droit sui generis sur les bases de données, la licence est CC BY 4.0. Là où aucun tel droit n'existe, aucune autorisation n'est nécessaire et l'attribution ci-dessous est une demande, non une condition.

CC BY 4.0 ne couvre que les données de /dataset.csv et /dataset.json — pas le service AgentFit, pas le contenu du site, pas le texte du barème, pas le code source.

Citer

Copiez l'une des trois formes ci-dessous. La date de consultation qui y figure est celle de l'instantané présenté ici ; si vous avez téléchargé le fichier plus tôt, citez votre propre date.

Texte

AgentFit AI-readiness dataset by Gumeniuk Stanislav (agentfit.dev), licensed under CC BY 4.0. Retrieved 2026-09-10 from https://agentfit.dev/dataset

HTML

<a href="https://agentfit.dev/dataset">AgentFit AI-readiness dataset</a> by Gumeniuk Stanislav, <a href="https://creativecommons.org/licenses/by/4.0/">CC BY 4.0</a>, retrieved 2026-09-10.

BibTeX

@misc{agentfit_dataset,
  title        = {AgentFit AI-readiness dataset},
  author       = {Gumeniuk, Stanislav},
  year         = {2026},
  howpublished = {\url{https://agentfit.dev/dataset}},
  note         = {Rolling dataset, CC BY 4.0. Retrieved 2026-09-10}
}

Indépendance

Évaluation automatique et indépendante. AgentFit n'est affilié à aucun des sites audités et n'a pas demandé l'autorisation de publier. Les scores sont heuristiques, produits par une seule récupération automatique à une seule date, et décrivent ce qu'une machine a pu lire — pas la qualité du produit derrière la documentation. Les lignes qui nous appartiennent ne sont pas dans l'export : agentfit.dev et gumeniuk.com sont exclus de toutes les collections et de tous les chiffres publiés, parce que le seul site que nous ne pouvons pas juger à distance est le nôtre.

Retrait

Si une ligne concerne une URL que vous contrôlez et que vous souhaitez la voir disparaître, écrivez à [email protected] avec le lien du rapport. Sous 30 jours calendaires, le rapport est retiré de /browse et le lien direct renvoie 404 ; l'export suit dans les 24 heures qui suivent, puisqu'il est régénéré chaque jour. Les copies déjà téléchargées par d'autres ne peuvent pas être rappelées — c'est vrai de toute licence ouverte, et c'est pourquoi il s'agit d'un export vivant plutôt que d'une série de publications trimestrielles permanentes.

Comment les critères sont notés · Parcourir le corpus · Conditions · Confidentialité