Le gain de coût de Chaser, mesuré comme un résultat de recherche : corpus gelé lié par une empreinte SHA-256, deux bras appariés (cascade Chaser vs modèle direct), et des bornes de confiance anytime-valid (empirical-Bernstein). Aucun chiffre n'est affirmé sans son intervalle.
| Métrique | Référence (Sonnet direct) | Chaser (cascade) |
|---|---|---|
| Coût total (30 tâches) | 0,1013 $ | 0,0433 $ |
| Réussite (oracle) | 30 / 30 | 29 / 30 |
| Latence médiane | 13,1 s | 11,8 s |
Gain de coût relatif apparié : moyenne 0,635, borne basse empirical-Bernstein
0,134 > 0 → la réduction de coût est statistiquement prouvée (~57 % moins cher
à tâche égale).
Écart de qualité (réf − Chaser) : 0,033, intervalle anytime-valid
[−0,47 ; +0,53] contenant 0 → qualité préservée.
Données brutes machine-lisibles : /bench/index.json · run complet par tâche.
python moteur/chaserbench.py --dry # harnais complet, 0 $ python moteur/chaserbench.py --api --seed 42 # run réel (garde-fou ≤ 0,50 $) python moteur/chaserbench.py --api --attendu c35ce8ff… # vérifie le corpus
Portée honnête (v1) : coût, qualité et latence sur tâches vérifiables en un tour. La
réduction des tool calls est mesurée séparément par l'outil attester (jusqu'à
−98,8 % sur des schémas verbeux) ; son intégration au banc (sessions agentiques appariées)
est la version 2.