Les 13 piliers de Chaser ont été alignés, un par un, sur l'état de l'art publié en 2026 — CRDT, routage par bandit, taint tracking, mesure cryptographique, tool calling par code, auto-évolution. Chaque brique est adaptée, implémentée en bibliothèque standard, et prouvée par un test déterministe. Rien n'est annoncé sans preuve.
Toute la valeur de Chaser — compression d'historique, cache, Bouclier, coût réel, preuve Merkle — était câblée à Claude Code. Elle marche désormais devant OpenAI Codex, xAI Grok et Moonshot Kimi via un proxy local. Fidèle par défaut : ton modèle reste le tien, Chaser n'ajoute que l'optimisation et la mesure.
N'importe quel outil OpenAI-compatible pointe son base_url sur Chaser,
et une seule clé OpenRouter ouvre x-ai/grok-4.3, openai/gpt-5,
moonshotai/kimi-k2, anthropic/claude-*, deepseek/*… Passthrough
fidèle (le modèle demandé n'est jamais réécrit) ; downroute local en option.
Appels réels traversant Chaser le 25/07 : gpt-4o-mini ($0,000004), kimi-k2 ($0,000019), grok-4.3 ($0,001058) — chacun renvoyé 200, coût exact (repris de l'agrégateur) et scellé Merkle. Trois fournisseurs, une clé, zéro changement dans l'outil.
✓ compression d'historique + attribution du coût conservées partoutSur les données réelles d'un poste de dev (45 sessions, 14 jours), 6,21 milliards de tokens d'historique ont été re-lus par le cache — 96 % du volume total, re-payés à chaque message. Personne ne compacte. On a construit la pile qui gère ça de bout en bout.
Une politique de compaction pilotée par le coût aurait évité −36 % (seuil 400k) à −78 % (seuil 120k) de ce poste. Estimation 1er ordre, annoncée comme telle, artefact local recalculable. On publie aussi le résultat négatif : un seuil « appris » par session ne bat pas le meilleur seuil fixe au coût-tokens pur (oracle +0,0 % sur 45/45).
✓ rapport public · script de rejeu fourni · ENÀ chaque prompt, le poids d'historique réel de la session est lu ; au-delà du seuil, un conseil chiffré s'affiche (effet causal mesuré par holdout 10 %). Les messages purement sociaux (« merci ») sont interceptés et servis en local : 0 token d'abonnement. Première interception réelle : 610 246 tokens évités en un message.
✓ économies journalisées par mode · auto-compacteur 3 étagesChaque prompt affiche son coût décomposé — tokens frais vs historique re-payé (sémantique OpenTelemetry GenAI). L'affichage principal est en équivalent plein tarif (relecture cache ×0,10, écriture ×1,25 — pondération officielle) : lisible pour un humain, honnête pour un client.
✓ Cockpit temps réel + mini-fenêtre 3 chiffresBanc reproductible, mêmes sorties brutes : −99 % de part et d'autre (ratio à parité). La différence est qualitative et mesurée — sur 11 signaux de debug critiques, Chaser en garde 11/11, RTK 10/11 : sa troncature en perd un. Jamais de coupe aveugle chez nous. La version gratuite Chaser Lite (GitHub, MIT) porte la même discipline à 33 agents de code (Cursor, Gemini, Copilot, Windsurf, Codex, Aider, Zed…), le double des 16 de l'outil de référence, dont le standard ouvert AGENTS.md.
✓ bancbench_rtk.py rejouable, RTK 0.43.0 · github.com/HQU-kenaxvi/chaser-lite
Rien n'est « résolu » par magie : l'API est sans état, l'historique doit repartir à chaque appel. Ce qu'on maîtrise, c'est sa taille et le nombre de relectures inutiles — plafonnés automatiquement, mesurés, bornés. Aucun équivalent public identifié de cette pile au 23/07/2026. Détail et limites dans le rapport.
Le pipeline scientifique tourne sans patcher le fork, à travers le Chaser Scientific Gateway. Nouvelles étapes routées : rédaction LaTeX et review d'article → Haiku (mots-clés vérifiés contre les vrais prompts du fork, zéro collision), vision → Sonnet forcé. Run réel du 19/07 : manuscrit + review par le reviewer du fork, 0,06 $ au lieu de 0,13 $ baseline GPT-4o : −52,5 % sur writing+review. L'idéation, elle, reste sur Sonnet : −7,2 % seulement — deux chiffres, deux populations, les deux publiés.
✓ claim scellé Merkle · preuve Ed25519 vérifiée par un vérifieur indépendant hors-ligne · auto-test 10/10Le review réel (reviewer « négatif » par défaut du fork) rend Reject, note 2/10 sur le manuscrit pilote : échelle réduite, une seule graine. C'est exactement ce qu'un pipeline honnête doit dire d'une expérience pilote — et la preuve que notre chaîne de review n'est pas complaisante. La divulgation « généré par IA » est incluse dans le manuscrit.
✓ review.json au run scellé · divulgation IA exigée par la licence du forkÀ n=60, notre routeur prédictif semblait dominer la baseline « tout-7b » (70,0 % contre 68,3 %). On a triplé le corpus : à n=150, il ne domine plus — 62-69 % selon la régularisation, toujours sous les 70,7 % de tout-7b à coût égal. L'optimisme petit-échantillon est documenté dans le rapport. Peu d'éditeurs publient le retournement de leur propre résultat ; c'est pourtant la seule façon de mériter les chiffres qui, eux, tiennent.
✓ tables n=60 vs n=150 au rapport technique · corpus gelé, rejouableL'innovation testée (escalade pilotée par les logprobs du modèle économique) atteint des points de Pareto intermédiaires (70 % de qualité à ~65 % du coût du 14b) mais ne domine pas les baselines simples sur ce corpus. Limite structurelle notée : le surcoût du signal n'est pas toujours compensé. Publié tel quel, à côté de la borne oracle 88,3 %.
✓ table Pareto complète ·docs/RAPPORT_TECHNIQUE_BENCH.md
Ces quatre résultats viennent du même principe : le banc peut nous contredire, et quand il le fait, on publie. Le −52,5 % est mesuré sur les étapes writing+review d'un run réel scellé ; il ne s'additionne pas au −7,2 % de l'idéation — populations différentes. Le détail complet — trois signatures (intégrité, exécution par replay, validité Skeptic), tables, menaces à la validité — est dans le rapport technique publié.
Le chantier frontière a été rejoué sur les données réelles d'un poste en production : transcripts Claude Code, traces d'orchestration, journal Merkle scellé de production. Six validations, chiffres bruts, aucune donnée fabriquée — et la démo se rescelle au journal à chaque passage.
Un banc gelé de 30 tâches vérifiables (corpus lié par SHA-256), deux bras appariés — cascade Chaser vs modèle direct — et des bornes empirical-Bernstein anytime-valid. Run réel sur API : −63,5 % de coût à tâche égale (gain prouvé, borne basse > 0), qualité préservée.
✓ résultat scellé au journal Merkle · page publique/bench
Chaque décision de routage, de cache ou d'escalade s'explique en clair. Les modèles de
routage étant linéaires, la contribution de chaque objectif est exacte (pas d'approximation
type SHAP). Commande /pourquoi, moins de 0,4 ms par décision.
Coût, qualité, latence et risque optimisés ensemble (scalarisation de Tchebycheff, 3 presets configurables). L'activation n'a lieu que si un estimateur doubly-robust prouve le gain (borne anytime-valid > 0) — jamais de bascule sur du bruit.
✓ gate DR exécuté sur 196 décisions réelles · décision honnêteSur le journal réel de 9 539 entrées : chaîne intègre, timeline STH vérifiée, une preuve d'inclusion exportée puis validée par un vérifieur indépendant (bibliothèque standard pure, sans Chaser installé). La moindre altération d'un octet est rejetée.
✓ preuve réelle #4769 vérifiée hors-ligne · STH signé Ed25519Chaque session émet un rapport SARIF 2.1.0 (le standard lu par GitHub Code Scanning) depuis les décisions du Bouclier. Nouveau mode Zero-Trust opt-in : tout effet de bord hors liste blanche demande confirmation, et les blocages gardent toujours le dernier mot.
✓ SARIF valide depuis 10 événements réels · détection de canaux cachés (CUSUM)La convergence du handoff multi-sessions est éprouvée sur ~10 200 scénarios générés (convergence, commutativité, idempotence, associativité, zéro perte) — le standard des CRDT de production. Le bug réel du 13/07 (un chantier disparu) est figé en test permanent.
✓ 10 200 scénarios verts · merge configurable + sélectifRejouable à volonté : la démo tourne sur données réelles en lecture seule et se scelle au journal ; le runner unifié rend 10/10 suites vertes. Documentation de niveau recherche (whitepaper) où chaque chiffre est régénérable par une commande citée. Honnêteté : le −63,5 % est mesuré sur le banc ChaserBench ; sur du trafic historique mêlé, le gain prouvé est plus modeste — les deux sont réels et mesurent des populations différentes.
Le reproche le plus juste qu'on nous fait : validation trop interne, benchmark trop limité. Réponse concrète — pas du marketing : ChaserBench-MD, 60 tâches sur 6 domaines, avec des oracles calculés par construction (la vérité terrain est une fonction déterministe, jamais une affirmation de notre part). Comparé à des baselines externes sur une vraie échelle de modèles. Reproductible par quiconque, sans nous faire confiance — et fait pour pouvoir nous contredire.
On régénère le corpus depuis une graine (SHA-256 vérifiable), on rejoue toutes les baselines depuis une matrice gelée (0 appel), et un vérifieur indépendant recontrôle le tout. Le run est scellé au journal Merkle : toute altération est détectée au recalcul.
✓bench_multidomaine.py --verifier · corpus SHA 4076ac5e… · branché en CI
La borne oracle-router = 88,3 % (le plafond d'un routage parfait) est loin au-dessus de tout modèle seul (le point de valeur, un modèle moyen, plafonne à 68,3 %) : bien router est un vrai levier. Notre routeur appris par type de tâche atteint 63,3 % pour −30 % de coût — mesuré en held-out.
✓ table complète + baselines dans le rapport techniqueSur des tâches à réponse courte, une cascade à qualité de surface est aveugle (elle ne distingue pas « 391 » de « 392 ») et tombe à 36,7 %. Le benchmark révèle cette limite au lieu de la masquer — la direction qu'il impose : un vérifieur, pas une heuristique. On publie aussi les cas où un baseline simple bat notre routeur actuel.
✓ un benchmark qui peut nous contredire — c'est ce qui le rend crédibleMéthodologie complète, table de Pareto, protocole de reproduction, et une section threats to validity obligatoire (petit corpus, tâches courtes-vérifiables seulement, coût = proxy, un fournisseur, évaluateur encore quasi-unique). On dit franchement ce qui reste : réplication par des tiers réels, adoption — ça ne se simule pas, ça s'obtient.
✓docs/RAPPORT_TECHNIQUE_BENCH.md · reproduisez, contredisez-nous
Compute réel, corpus gelé, run scellé. Ce n'est PAS une validation par des tiers indépendants (ça ne se fabrique pas) : c'est la vérifiabilité qui la rend possible — n'importe qui peut relancer et nous contredire. C'est la ligne honnête : on livre la reproductibilité, pas l'illusion de la validation.
Deux piliers de sûreté ont été refondus et deux nouvelles capacités ajoutées, chacune couverte par des tests de propriété. Le tout tourne dans le codebase et passe la santé complète ; côté client, ces briques arrivent au prochain installeur signé (l'exe reste en 2.3.0 en attendant la signature) — le site et le relais, eux, sont à jour immédiatement.
Le suivi de teinte passe d'une étiquette binaire à un treillis par provenance (web / MCP / outil / fichier) avec une politique surchargeable. Nouvelle canonicalisation à point fixe qui neutralise base64, hex, rot13, gzip, %-URL, homoglyphes et caractères zéro-largeur : encoder un fragment ne relâche plus jamais la décision. La teinte est archivée sans éviction (filtre de Bloom) — zéro perte silencieuse — et tout outil (MCP inclus) reçoit une décision.
✓ 0 évasion lexicale sous attaquant adaptatif · branché dans le Governor et le hookLa coordination multi-sessions gagne une causalité structurelle façon git : l'ordre suit le graphe des dépendances, pas l'horloge — antidater une opération est sans effet et l'équivocation devient un fork détectable. Ordre Fugue (zéro entrelacement), checkpoints scellés (Ed25519 + Merkle) et absorption par checkpoint qui compacte enfin les historiques linéaires — le tout convergent et prouvé.
✓ backdating inopérant + forks détectés + re-livraison idempotente (propriétés vertes)Les appels d'outils purs (lecture de fichier, recherche déterministe) sont mémoïsés par contenu, façon Bazel : même outil + mêmes arguments + mêmes fichiers = résultat servi sans le rejouer, avec invalidation automatique dès qu'un fichier change. Point clé sûreté : l'entrée porte l'étiquette de teinte et la ré-émet — le cache ne peut pas « blanchir » une donnée non fiable au passage.
✓ pureté stricte (réseau/horloge/aléa exclus) · teinte propagéeLa détection statistique des canaux annexes (taille, latence, taux d'erreur) est complétée par une borne supérieure honnête des bits exfiltrables par session, dérivée de la capacité d'un canal à amplitude contrainte sous la surveillance en place. Un détecteur plus fin abaisse mécaniquement la borne — on mesure le résidu au lieu de le passer sous silence.
✓ borne monotone, opposable · alimente le rapport SARIFRecherche — validé sur vraie machine (préliminaire). Les mêmes protocoles ont été exécutés sur du compute réel (nœud de calcul dédié), pas un banc synthétique. Résultats honnêtes, petit corpus :
Avec de vrais embeddings sémantiques, la garantie conforme « une réponse servie depuis le cache est correcte » tient sur un jeu de test frais — là où l'encodeur léger, incapable de séparer une reformulation d'une autre question, ne pouvait rien certifier. La probabilité de servir faux reste sous le budget fixé (≤ 20 % ⟶ mesuré ~10 % sur le test).
✓ mesuré sur données réelles · le seuil s'auto-ajuste au budget de risqueSur un modèle costaud, le juge discrimine réellement le bon du mauvais (séparation ~2× meilleure qu'un petit modèle). Surtout : la calibration refuse désormais de produire un seuil quand les données ne séparent pas (juge dégénéré ou anti-corrélé) — elle retombe sur un défaut sûr plutôt que de dégrader silencieusement les décisions. La sûreté d'abord.
✓ garde anti-dégénérescence testée · aucun seuil trompeur en productionv2.4.0 dans le codebase le 18 juillet : santé complète 96/96 modules, suites des quatre briques + les nouvelles propriétés toutes vertes. La partie recherche est préliminaire (petit corpus, compute interne) — un signal reproductible, pas encore une garantie produit. Ces briques arrivent côté client au prochain installeur signé ; le site et le relais sont à jour dès maintenant.
Un audit externe a passé au crible les techniques de pointe de Chaser. Réponse : chaque point noté « à renforcer » a été remonté au niveau recherche, branché dans le vrai runtime (hooks, config, serveur MCP) et couvert par un test — pas seulement disponible en bibliothèque.
La réflexion sur les échecs tourne maintenant sur un modèle local (0 $), garde une frontière de Pareto et fusionne les prompts complémentaires (GEPA+merge, ICLR 2026). Branché dans le pipeline d'optimisation réel : GEPA concourt contre MIPRO, on garde le meilleur — jamais de régression.
✓ gain live mesuré : +12,5 pts d'exactitude · ROI scellé au journal MerkleAu-delà du hash-chaîne : preuves d'inclusion et de cohérence RFC 6962 (vous vérifiez une entrée sans tout le journal) et des checkpoints signés chaînés (STH) comme Certificate Transparency. Réécriture et retour arrière du journal sont désormais détectés.
✓ rollback + réécriture détectés · exposé comme outil MCPattester
Le suivi de teinte (primitive CaMeL) couvre maintenant le web (exfiltration par
query-string), les écritures de config (.bashrc, clés SSH) et le shell, avec détection
d'obfuscation base64. Le hook PreToolUse est étendu à ces outils et déjà actif.
La convergence du CRDT est prouvée par test de propriété (300 opérations, 5 sessions, 12 ordres de livraison → rendu strictement identique). Nouvelle compaction causale : le journal se purge tout seul sans jamais changer le résultat (auto-vérifiée, réversible).
✓ 9 propriétés vertes · une session en retard bloque toute purge (sûreté)Le seuil qui décide de garder la réponse bon marché ou d'escalader peut désormais être calibré avec une garantie statistique (Clopper-Pearson + Learn-Then-Test) : il borne le taux de mauvaises réponses acceptées, sans hypothèse sur les données. Opt-in, appris de vos propres évaluations.
✓ garantie distribution-free P(mauvaise acceptée) ≤ seuil · branché au jugeLa réduction du tool-calling est maintenant mesurée sur vos propres schémas d'outils, liée à leur empreinte SHA-256 et scellée. Annoncé honnêtement : jusqu'à −98,8 % sur des schémas très verbeux, plutôt −55 à −65 % sur un petit jeu d'outils courts — dans les deux cas, prouvé, pas déclaré.
✓ outil MCPattester · chiffre lié au hash du corpus + preuve Merkle
Livré en v2.3.0 le 17 juillet. Validation : 81/81 modules branchés (santé complète),
les suites des six briques toutes vertes, hook vérifié bout-en-bout. Les clients installés reçoivent la mise à
jour automatiquement (empreinte SHA-256 publiée dans version.json, fail-closed).
Une soirée de fiabilisation déclenchée par un vrai retour client : plus aucune manipulation n'est demandée à l'utilisateur, jamais. Chaque brique est testée et vérifiée en production.
Chaser vérifie une fois par jour si une version plus récente est publiée, la télécharge
avec la clé de licence locale, contrôle l'empreinte SHA-256 publiée (fail-closed : la moindre
différence = rien n'est exécuté) puis se remplace entièrement — sans fenêtre, sans clic.
Anti-boucle intégré et désactivable d'un réglage (maj.auto).
Claude Code peut réécrire sa configuration et perdre l'enregistrement du serveur MCP Chaser (cas réel observé chez un client). Désormais l'entrée est re-posée automatiquement au démarrage du Cockpit et toutes les 10 minutes — idempotent : zéro écriture quand tout est déjà bon.
✓ cause racine du seul incident client — éliminée · 13 tests vertsAujourd'hui, hier, 7 derniers jours, 30 derniers jours : la valeur protégée (économie réelle clé API + tokens de chat valorisés) est ventilée par période depuis le journal auditable horodaté — jour calendaire pour aujourd'hui/hier, fenêtres glissantes pour la semaine et le mois. Version installée affichée en permanence, avec vérification à la demande.
✓ chiffres = somme du journal, vérifiable ligne à ligneLes rapports d'économies (opt-in, agrégats uniquement) survivent aux micro-coupures réseau : nouvel essai automatique sur erreur transitoire, et rattrapage toutes les 10 minutes si un envoi a été manqué. Premier rapport client réel reçu le 16/07 : −83 % sur l'exécution.
✓ testé sur le cas réel du 16/07 (coupure TLS transitoire)Livré en v2.2.3 → v2.2.6 le 16 juillet. Les clients déjà installés reçoivent tout
automatiquement ; l'empreinte SHA-256 de chaque version est publiée dans version.json.
Chaque appel passe par un pipeline branché et testé de bout en bout
(integration_frontiere.py, 8/8). Les couches composent — la preuve, pas la promesse.
En parallèle : coordination multi-sessions (CRDT Fugue causal) et auto-évolution (GEPA) qui améliore les prompts eux-mêmes.
N schémas d'outils → 2 méta-outils chercher + exécuter ; le modèle
écrit du code au lieu de recevoir des dizaines de milliers de tokens de définitions. Exécuteur restreint,
sans import ni exec arbitraire. Réduction attestée sur vos propres schémas.
Source : Programmatic Tool Calling (Anthropic) / Code Mode (Cloudflare)
✓ jusqu'à −98,8 % · attesté (outil MCP) · exécuteur ast sûrChaque mesure est scellée dans une chaîne de hachage + racine Merkle. Toute falsification d'une ligne casse la chaîne et est détectée à l'index exact. Le client vérifie lui-même.
Source : Certificate Transparency (RFC 6962)
✓ falsification détectée à l'octetDeux sessions sur le même dépôt fusionnent sans perte : horloges logiques hybrides, CRDT de texte Fugue au caractère (non-entrelacement), notifications + réconciliation sémantique.
Source : Fugue / Loro, CoAgent, CodeCRDT
✓ 16/16 tests · zéro écrasementRoutage prédictif par embeddings, bandit contextuel Thompson/LinTS, cascade auto-vérifiée FrugalGPT, et escalade jaugée par l'incertitude réelle (entropie) du modèle local.
Source : RouteLLM, FrugalGPT, R2V « Confident or Seek Stronger »
✓ convergence quasi-parfaiteSuivi de teinte / contrôle de flux d'information (CaMeL), détection d'injection indirecte, blocage d'exfiltration (lethal trifecta), scanner d'empoisonnement d'outils MCP, politique déclarative.
Source : CaMeL (Google DeepMind), AgentDojo
✓ 6 modules de confinementÉconomies estimées avec des séquences de confiance valides même en observation continue, réduction de variance CUPED, export OpenTelemetry GenAI. Une borne de confiance, pas un slide.
Source : Howard-Ramdas, Netflix/Statsig, CUPED (Microsoft)
✓ réduction 56,9 % (borne basse 43,6 %)Le système améliore ses propres prompts et politiques en réfléchissant en langage naturel sur ses échecs, en gardant une frontière de Pareto — au lieu de simplement s'ajuster.
Source : GEPA, ICLR 2026 Oral (35× moins d'essais que le RL)
✓ score parfait en 4 essaisCompression déterministe des schémas qui se chargent, déduplication du contenu quasi-identique (MinHash), et édition de contexte qui ne casse pas le cache (préfixe préservé à l'octet).
Source : TSCG, CacheBlend, Anthropic Context Editing
✓ −52 % schémas · Jaccard 0,83Attestation de provenance in-toto/SLSA, SBOM, build reproductible, log de transparence (façon Sigstore Rekor), révocation de licence vérifiable hors-ligne.
Source : SLSA, Sigstore, in-toto, Reproducible Builds
✓ 14/14 tests · provenance vérifiée| Capacité | Sans Chaser | Avec Chaser |
|---|---|---|
| Schémas d'outils verbeux (par tour) | ~15 000 tokens | ~180 tokens (jusqu'à −98,8 %, attesté) |
| Réduction de contexte (exemple mesuré) | 66 000 tokens | 12 000 tokens (−82 %) |
| Preuve des économies | « nos compteurs » | journal crypto vérifiable |
| 2 sessions, même dépôt | un chantier écrasé | fusion CRDT sans perte |
| Compression de sorties (tête-à-tête RTK 0.43.0) | −99 %, 10/11 signaux | −99 %, 11/11 signaux gardés |
| Amélioration du système | manuelle | auto-évolution GEPA |
Toutes ces valeurs sortent de suites de tests déterministes hors-ligne, reproductibles
(python moteur/<module>_frontiere.py test). Les couches sont opt-in ; leur efficacité en
trafic réel est en cours de validation.
Tout ce qui était « testé hors-ligne » est passé à l'épreuve de vrais appels API, sur une vraie machine, avec de vrais coûts. Les chiffres ci-dessous sortent du journal scellé et des transcripts — pas d'un slide.
195 décisions réelles : dans 89 % des cas [80,8–97,3], le modèle économique a suffi. Borne basse du gain net > 0 — preuve statistique anytime-valid (empirical-Bernstein, CUPED).
n=195 · trafic réel · α=0,05
Session de chat réelle : le 2e tour relit 9 232 tokens depuis le cache à −90 %. Côté transcripts : 95,6 % de taux de cache mesuré sur 48 h d'usage intensif.
usage exact rapporté par l'API
67 % d'économie mesurée en comparant payé vs référence sur les mêmes runs. Ce qui n'a pas de référence comparable (bancs R&D) est affiché à part, jamais mélangé.
rapport payé/référence, périmètre cohérent
44 réponses réelles étiquetées contre une vérité vérifiable : le juge LLM note 95-100 des réponses factuellement fausses (κ=0). Conclusion assumée : le vérifieur indépendant reste obligatoire — et il est branché.
labels réels, vérité terrain mécanique
Injection « reveal your system prompt » soumise en vrai : détectée, neutralisée, signalée — le plan s'exécute sans obéir à l'instruction cachée.
test API réel, trace conservée
Chaque module du moteur se charge depuis un point d'entrée unique et vérifiable
(sante-complete), y compris le serveur MCP éprouvé en JSON-RPC réel.
20/20 + 51/51 suites vertes
Réserve honnête : ces mesures viennent du trafic réel de l'atelier Chaser (nos machines, notre clé API). La généralisation à d'autres profils d'usage se confirmera avec le trafic des testeurs.
Six agents de recherche ont balayé l'état de l'art publié sur chacun des 6 piliers (routage, cache, mémoire, test-time, sécurité, mesure). Verdict : au niveau ou au-dessus sur les 6. Les 9 raffinements identifiés ont été implémentés et testés le jour même — diagnostic complet 81/81 modules verts. Deux d'entre eux sont déjà éprouvés sur l'API réelle.
Le juge lit sa propre confiance dans les logprobs — verdict + confiance en un seul appel, zéro rollout en plus. Éprouvé en live : une réponse Haiku jugée 93 (confiance 0,926) est conservée au lieu d'escalader — 63 % d'économie sur cet appel vs Sonnet.
Source : VERDI · démo API réelle, retombe sur le juge cloud si le local est injoignable
✓ validé sur trafic réelLe contenu non fiable (e-mail, page web) est lu par un modèle quarantiné sans aucun outil, qui n'en extrait que des valeurs typées validées. Démo réelle : e-mail hostile analysé, champs extraits, injection ignorée.
Source : CaMeL (Google DeepMind, 2025)
✓ validé sur trafic réelLa cascade n'escalade vers un modèle plus cher que si le modèle économique doute vraiment (logprobs), avec un plancher inviolable sur les refus. Moins de surcoût sur les requêtes faciles.
Source : « Confident or Seek Stronger »
✓ self-tests vertsOubli exponentiel (demi-vie 30 jours) + signal binaire type timeout : quand un modèle ou un prix change, le routeur appris se ré-adapte au lieu de rester figé sur le passé.
Source : BARP / D-LinUCB (bandits non stationnaires)
✓ self-tests vertsUne couche exact-prefix devant le cache sémantique (servable même sans modèle local), et la vérification d'équivalence passe en arrière-plan au lieu de bloquer la réponse.
Source : prompt caching providers · Krites
✓ self-tests vertsEntre deux sessions, Chaser consolide sa mémoire : il démote ce qui est périmé, garde les instructions, horodate les rappels — le travail de rangement est payé hors session.
Source : Letta (sleep-time compute)
✓ self-tests vertsChaque serveur MCP est scanné au fil de l'eau (l'empoisonnement d'outils est écarté côté clé API, signalé côté abonnement), et un agent au comportement anormal voit ses permissions se dégrader progressivement : normal → ralenti → bloqué (expire après 15 min).
Source : MCP-scan · AGrail
✓ self-tests vertsL'optimiseur réfléchit en langage naturel sur ses échecs et garde une frontière de Pareto de candidats — environ 35× moins d'essais que l'approche précédente pour un meilleur score.
Source : GEPA (ICLR 2026)
✓ self-tests vertsDétection bayésienne de rupture (BOCPD) sur les séries de coûts — plus précoce que CUSUM — et export des mesures au standard OpenTelemetry GenAI, lisible par les dashboards du marché.
Source : BOCPD (Adams-MacKay) · conventions OTel GenAI 2026
✓ self-tests vertsRéserve honnête : les chantiers passent leurs suites déterministes (81/81) ; VERDI et le dual-LLM sont en plus éprouvés sur l'API réelle (coût de la démo : 0,0012 $). La plupart de ces modes restent opt-in, désactivés par défaut, le temps de les valider sur banc réel.
87 modules se chargent depuis le point d'entrée unique (santé complète), et le runner unifié rend 10 suites sur 10 vertes — dont ~10 200 propriétés CRDT et un round-trip de preuve vérifié par un module indépendant. Zéro régression, coût 0 $. Le wire production reste opt-in dans le chemin clé API — le trafic d'abonnement OAuth n'est jamais modifié.
Validé le 17/07 sur données réelles (démo 6/6). Réserves honnêtes assumées : l'activation live du routage multi-objectif attend l'accumulation de décisions ε-explorées réelles ; le benchmark v2 des tool calls attend des sessions appariées. Ce qui est prouvé est étiqueté comme tel, jamais au-delà.