Nouveautés
Benchmark public · reproductible

ChaserBench

Le gain de coût de Chaser, mesuré comme un résultat de recherche : corpus gelé lié par une empreinte SHA-256, deux bras appariés (cascade Chaser vs modèle direct), et des bornes de confiance anytime-valid (empirical-Bernstein). Aucun chiffre n'est affirmé sans son intervalle.

−57 %
coût à tâche égale (gain prouvé, borne > 0)
30
tâches vérifiables (10 triviales / 10 moyennes / 10 complexes)
≈0
écart de qualité (IC contient 0)

Résultat du dernier run (API réelle, seed 42)

MétriqueRéférence (Sonnet direct)Chaser (cascade)
Coût total (30 tâches)0,1013 $0,0433 $
Réussite (oracle)30 / 3029 / 30
Latence médiane13,1 s11,8 s

Gain de coût relatif apparié : moyenne 0,635, borne basse empirical-Bernstein 0,134 > 0 → la réduction de coût est statistiquement prouvée (~57 % moins cher à tâche égale).
Écart de qualité (réf − Chaser) : 0,033, intervalle anytime-valid [−0,47 ; +0,53] contenant 0 → qualité préservée.

✓ corpus SHA-256 c35ce8ff… · résultat scellé au journal Merkle

Données brutes machine-lisibles : /bench/index.json · run complet par tâche.

Pourquoi ce banc est crédible

  1. Appariement : chaque tâche est jouée par les deux bras, donc le delta de coût et de qualité est mesuré sur la même tâche — pas deux populations différentes.
  2. Corpus gelé + SHA-256 : la moindre modification du corpus change l'empreinte ; une reproduction échoue fail-closed si son corpus ne correspond pas à celui publié.
  3. Bornes anytime-valid : on peut relancer le banc à chaque tâche et s'arrêter dès qu'une borne exclut 0 — la garantie de couverture tient malgré le peeking (Waudby-Smith & Ramdas, 2024).
  4. Scellé : chaque run émet une empreinte dans le journal Merkle inviolable — le résultat n'est pas réécrivable après coup.

Reproduire

python moteur/chaserbench.py --dry        # harnais complet, 0 $
python moteur/chaserbench.py --api --seed 42   # run réel (garde-fou ≤ 0,50 $)
python moteur/chaserbench.py --api --attendu c35ce8ff…   # vérifie le corpus

Portée honnête (v1) : coût, qualité et latence sur tâches vérifiables en un tour. La réduction des tool calls est mesurée séparément par l'outil attester (jusqu'à −98,8 % sur des schémas verbeux) ; son intégration au banc (sessions agentiques appariées) est la version 2.