MESURER · COMPARER · CONSERVER LES ÉCHECS

Quand le classement aide.
Et quand il ne change rien.

Nous séparons le calcul des moteurs, l’extraction des modèles, la lecture structurée Sanity et les missions d’agents. Un test de code n’est pas une recherche autonome.

Campagne actuelle : résultats partiels, échecs conservés

Les appels aux modèles et les tests logiciels de cette campagne ont lieu dans Kaggle. E2B héberge les navigateurs Linux isolés. Le corpus comporte 120 documents, 10 paquets et 60 questions ; les 24 questions réelles attendent leur revue humaine.

État observé le 2026-09-30T18:57:07Z · les tâches terminées ne sont pas des scores de pertinence
SuiteRésultat observéExécution
A · Tests logiciels59 tests réussis, zéro échecKaggle · 354209018 ↗
B · Moteurs déterministes108 évaluations et 324 invariants réussis ; 36 questions synthétiquesKaggle · 354204770 ↗
C · Modèles et trois moteurs37 tâches terminées sur 60 ; 23 erreurs à auditerKaggle · 354204770 ↗
D · Context contre recherche textuelleAucune trajectoire complète ; premières versions : champ absent, puis limite de tours SDK. Relance bornée également en erreurKaggle · 354223310 ↗
E · Agents WebMCP natifs8 navigateurs et 15 outils natifs précontrôlés ; 1 trajectoire terminée, 143 erreurs. Limite SDK et refus de quota Pro observésKaggle · 354216830 ↗

Les notebooks restent privés. Les liens sont accessibles au propriétaire du compte ; cette page ne prétend pas fournir une reproduction publique complète. Une exécution de notebook marquée « successful » peut contenir des tâches en erreur : elles restent comptées ci-dessus.

Les huit accès temporaires de la campagne navigateur sont révoqués : les demandes ultérieures ont reçu HTTP 401. La clé du compte E2B n’était pas incluse dans les notebooks. Aucun moteur gagnant ni avantage scientifique n’est annoncé.

Télécharger l’état factuel et les limites ↧ · Comparer les trois moteurs dans Orbit ↗

Pilotes historiques et matériel de développement · séparés de la campagne actuelle

Archive : égalité sur le jeu de développement

Les trois configurations donnent les mêmes décisions attendues sur 36 questions synthétiques. Ce jeu a servi à corriger le code : il ne démontre aucune supériorité scientifique, ni une performance sur des sources réelles.

Suite A · exécution du 2026-09-29 · développement
ConfigurationDécisionsInvariantsRelations
Référence classique36 / 36108 / 10818 / 18
N · preuves T/I/F36 / 36108 / 10818 / 18
P · relations par attributs36 / 36108 / 10818 / 18

Les invariants vérifiés ici portent sur l’ordre des documents, la répétition d’une source et l’ajout d’une source sans rapport. Les relations couvrent notamment portée et version. Une nouvelle campagne indépendante doit éprouver les règles qui distinguent réellement P de N.

Télécharger la mesure agrégée et les empreintes ↧

Lire le rapport du pilote · PDF de cinq pages ↧ · Télécharger le tableau CSV ↧

Kaggle : Flash et Pro ont exécuté le pilote

Le notebook a exécuté deux modèles avec le SDK Kaggle Benchmarks 0.6.1, sur les mêmes douze documents et six questions synthétiques. La version 2 précise le contrat de portée après un échec de schéma observé dans la version 1.

Kaggle · pilote v2 · une répétition par modèle
ModèleDécisionsPassages exactsAssertionsSchéma
google/gemini-3.8-flash6 / 68 / 853 / 530 erreur
google/gemini-3.1-pro-preview6 / 68 / 853 / 530 erreur

Référence, N et P donnent chacun six décisions correctes sur ces extractions. Les 53 assertions contrôlent plusieurs aspects des six cas : elles ne constituent pas 53 observations indépendantes. Ce résultat ne départage pas les moteurs.

Le notebook et la tâche Kaggle v1 restent privés et sont accessibles au propriétaire du compte. La page de tâche affiche initialement Flash seulement ; les deux exécutions comparées ici proviennent de l’export du notebook. Aucun article ni dossier de concours n’a été soumis.

Antigravity : conserver aussi l’échec du contrat

Antigravity · pilote v1 · exécutions distinctes
Modèle et hôteDécisionsPassages exactsCalcul NSchéma
Gemini 3.8 Flash High
Antigravity 2.18.1 desktop
6 / 68 / 85 / 51 erreur
gemini-3.1-pro-high
Antigravity official CLI 1.2.13
6 / 68 / 85 / 51 erreur
gemini-3.8-flash-high
Antigravity official CLI 1.2.13
6 / 68 / 85 / 51 erreur

Les trois sorties v1 donnent la bonne décision et les passages attendus. Une preuve contextuelle du cinquième cas fournit toutefois une portée incomplète : le schéma la refuse. Nous avons clarifié le prompt v2 et conservé les sorties v1 intactes. Les scores des deux versions ne sont pas regroupés.

Les réglages de raisonnement et les hôtes diffèrent. Nous ne déduisons aucune hiérarchie de vitesse ou d’intelligence entre Antigravity et Kaggle.

Télécharger les résultats, versions et limites ↧

48 sources réelles préparées, sans score anticipé

Quatre paquets de douze documents et vingt-quatre questions sont maintenant préparés. Leurs textes et empreintes sont conservés localement. Les références ci-dessous restent des candidates : aucune réponse attendue n’a encore reçu sa revue humaine, et aucune de ces sources n’a été importée automatiquement dans la Knowledge Base.

Politiques IA et conservation · 12 documents · 6 questions à revoir
Documentation Sanity · 12 documents · 6 questions à revoir
Pollinisation robotique · 12 documents · 6 questions à revoir
Essaims : simulation, laboratoire et terrain · 12 documents · 6 questions à revoir

Le corpus distingue explicitement navigation, contact, fécondation et rendement, ainsi que simulation, laboratoire et terrain. Une différence entre ces conditions ne sera pas appelée contradiction. Une date de collecte ne prouve pas qu’une politique remplace une autre.

Les textes complets restent hors du téléchargement public tant que leurs licences ne sont pas validées. Les six anciens paquets synthétiques restent du matériel de développement ; ils ne constituent pas une campagne finale indépendante.

Examiner les références, questions, empreintes et limites ↧

Les premiers choix d’outils sur le site public

Un adaptateur externe reçoit les actions JSON choisies par Gemini, exécute les outils natifs de la vraie page, puis rend les observations au modèle. Les appels ne sont pas une séquence de fonctions imposée au modèle. Cette boucle fonctionne avec le compte Antigravity existant ; elle ne répare pas son intégration MCP native.

W01 · découverte et refus d’une question non partagée · développement
ModèleAppels exécutésÉtat de la revue
gemini-3.8-flash-high2Critères centraux réussis ; interprétation à corriger
gemini-3.1-pro-high1Parcours incomplet ; limite de session respectée

Flash observe correctement quinze outils, un dossier non partagé et le refus de la question privée. Sa réponse affirme aussi, sans l’avoir vérifié, que Context nécessiterait ce même consentement : c’est une erreur conservée dans l’audit. Pro lit les capacités, puis son appel suivant est refusé après un changement de page. Aucun de ces résultats ne représente une recherche complète.

Les capacités et le guide distinguent maintenant explicitement le corpus public du dossier privé. Les traces précédentes restent inchangées ; une nouvelle exécution sera identifiée comme telle.

Lire les observations, ressources et défauts des agents ↧

W02 : la réponse existe, sa chaîne de preuves reste incomplète

Flash et Pro ont choisi leurs lectures du vrai sommaire Context pour examiner l’exécution différée et la conservation des données chez OpenAI et Google. Les deux parcours produisent une réponse, mais aucun ne satisfait tous les critères de provenance. Ce défaut n’est pas masqué par un score de connexion réussi.

W02 · essais de développement, versions conservées séparément
EssaiAppels WebMCPPassages liés à une lecture individuelleRéférences avec URL observée
w02-json-loop-flash-v1
gemini-3.8-flash-high
0Non évalué : démarrage interrompuNon évalué
w02-json-loop-flash-v2
gemini-3.8-flash-high
44 / 41 / 4
w02-json-loop-pro-v2
gemini-3.1-pro-high
0Non évalué : démarrage interrompuNon évalué
w02-json-loop-pro-v3
gemini-3.1-pro-high
0Non évalué : démarrage interrompuNon évalué
w02-json-loop-pro-v4
gemini-3.1-pro-high
20 / 20 / 2

Flash lit les deux entrées séparément : quatre passages correspondent au texte reçu, mais trois affirmations n’ont pas d’URL d’origine. Son quatrième extrait demande aussi une revue de pertinence. Pro regroupe les entrées malgré la consigne : le contrôle refuse d’associer ses deux extraits à un chemin individuel ; leurs URL sont également absentes.

Plusieurs références Web de l’entrée Deep Research reviennent déjà sans URL dans la réponse Sanity. Orbit conserve ce texte et signale provenance.status: incomplete. Il n’invente pas les liens et ne prétend pas avoir ouvert les documents originaux. Les essais interrompus avant tout appel du modèle restent distincts des défauts de ses réponses.

Dernière inspection en lecture seule du Dashboard : 30 imports, une somme de 82 documents dans la liste des sources, 20 entrées et aucun problème en attente. Ces comptes sont distincts ; ils ne prouvent pas un compteur interne d’indexation. Aucun ajout, suppression ou changement d’instruction n’a été effectué lors de cette inspection.

Cinq suites distinctes, dans Kaggle

A · Logiciel
Contrats, migrations, propositions et outils : assertions exécutées dans Kaggle.
B · Moteurs déterministes
Même paquet TypeScript pour le site et le Studio ; entrées contrôlées, provenance, portée et invariants.
C · Modèles et moteurs
Gemini Flash et Pro : extraction commune, modèle seul, référence standard, N et P. Trois répétitions planifiées ; résultats partiels conservés.
D · Apport de Sanity Context
Deux cas, mêmes originaux, lecture structurée contre recherche textuelle. Les erreurs de transport et les limites du SDK restent distinctes de la qualité des conclusions.
E · Agents WebMCP
Modèles Kaggle, navigateurs E2B, outils natifs de la page. Permissions de test explicites, aucune approbation humaine fabriquée.

Ce qui reste à valider

Le harnais corrigé borne la sortie à 4 096 tokens et autorise les tours nécessaires au budget de vingt appels. Une préparation de code ne constitue pas une validation de sa prochaine exécution.

Ce que les chiffres signifient

Une citation présente n’est pas nécessairement pertinente. Le moteur vérifie des passages et des attributs déclarés ; il ne prouve pas la vérité d’une source. T, I et F sont des ensembles indépendants, sans pourcentage de vérité.

HOLD doit préserver une incertitude utile sans devenir une réponse systématique. Nous mesurerons les décisions injustifiées, la couverture, les différences de portée, les références perdues et les ressources observées. Les questions d’un même paquet ne seront pas traitées comme entièrement indépendantes.

Les corrigés restent hors des contextes des agents. Les versions, empreintes, refus et exécutions partielles sont conservés. Les décisions humaines restent distinctes des propositions.

Rejouer et examiner

Le harnais tools/benchmark_suite_a.py appelle tools/engine-jsonl.ts. Le corpus de développement est préparé avec tools/benchmark-corpus.ts. Les résultats bruts restent dans le dossier de benchmark, avec la méthode et les limites ; aucun jeton ni dossier privé n’est distribué ici.

Pour comprendre les calculs et préparer une mission, consultez les moteurs, HOLD et les quinze outils.

Documentation officielle Kaggle · API WebMCP Chrome · Sanity Context