Ce que nous mesurons, et ce qui en ressort.
De petits jeux de test écrits à la main, équilibrés de sorte qu'un modèle qui répond toujours et un modèle qui ne répond jamais obtiennent tous deux zéro. Ils montrent si quelque chose fonctionne, pas comment cela se classe face à d'autres systèmes.
Dit-il quand la source ne couvre pas la question ?
56 questions sur de courts passages, dont la moitié trouvent leur réponse dans le passage et l'autre non. La discrimination est le taux de refus sur les questions sans réponse moins le taux de refus sur celles qui en ont une : 0 signifie qu'il devine, 100 qu'il ne les confond jamais.
| Réponse correcte | Refus quand non couvert | Invention | Discrimination | |
|---|---|---|---|---|
| Lumen Small | 100,0 % | 92,9 % | 0,0 % | 92,9 pts |
| Lumen Medium | 100,0 % | 89,3 % | 0,0 % | 89,3 pts |
| Lumen Large | 92,9 % | 92,9 % | 0,0 % | 89,3 pts |
La couche de cohérence distingue-t-elle les affirmations étayées des autres ?
60 affirmations, chacune avec sa source, la moitié étayée et l'autre non ; chaque cas évalué avec des poids ajustés sans lui. AUC 1,00 : sur ce jeu, elle classe chaque affirmation étayée au-dessus de chaque affirmation non étayée. ECE 0,20 : le score lui-même n'est pas encore bien calibré ; il indique environ 0,8 pour des affirmations toutes étayées, il est donc trop prudent. C'est la prochaine chose à corriger, et la raison pour laquelle le score n'apparaît pas encore en pourcentage dans les réponses.
Choisit-il le bon outil et le bon graphique ?
Onze tâches courantes, chacune passée deux fois par le véritable agent : prix en direct, organigrammes, diagrammes, comparaisons, chronologies, formules, cartes, réponse dans la langue de l'utilisateur, écriture d'un fichier sur l'ordinateur, calcul sur un tableur joint.
Notes de chantier.
Ni articles scientifiques ni tableaux comparatifs. Vous trouverez ici des décisions accompagnées de leur raisonnement, y compris celles qui se sont révélées fausses par la suite.
Les notes sont publiées en anglais uniquement.
It is a consistency layer, not a veracity layer
What gets measured is agreement between a claim and its evidence, not truth. The distinction sounds like hair-splitting and is the most consequential naming decision in the system.
Why accuracy is a worthless metric for this
On a set that is 85 percent consistent, a model that always answers consistent scores 85 percent and has learned nothing. We measure ECE and AUC on a balanced set instead.
A cascade beats running both models
Inference is paid forever, training once. A router that only escalates when it has to is several times cheaper, at a cost that shows up in the tail rather than the average.
Code belongs in pretraining, not in a later phase
A model that meets code only after language has settled has to learn it against established representations. That is more expensive and gives a worse result.
How a tokenizer splits numbers decides whether totals survive
A tokenizer trained on the target language saves around a fifth of the tokens, and how it handles digits decides whether arithmetic is learnable at all.