Mesuré · 18 septembre 2026

Ce que nous mesurons, et ce qui en ressort.

De petits jeux de test écrits à la main, équilibrés de sorte qu'un modèle qui répond toujours et un modèle qui ne répond jamais obtiennent tous deux zéro. Ils montrent si quelque chose fonctionne, pas comment cela se classe face à d'autres systèmes.

Dit-il quand la source ne couvre pas la question ?

56 questions sur de courts passages, dont la moitié trouvent leur réponse dans le passage et l'autre non. La discrimination est le taux de refus sur les questions sans réponse moins le taux de refus sur celles qui en ont une : 0 signifie qu'il devine, 100 qu'il ne les confond jamais.

Réponse correcteRefus quand non couvertInventionDiscrimination
Lumen Small100,0 %92,9 %0,0 %92,9 pts
Lumen Medium100,0 %89,3 %0,0 %89,3 pts
Lumen Large92,9 %92,9 %0,0 %89,3 pts

La couche de cohérence distingue-t-elle les affirmations étayées des autres ?

60 affirmations, chacune avec sa source, la moitié étayée et l'autre non ; chaque cas évalué avec des poids ajustés sans lui. AUC 1,00 : sur ce jeu, elle classe chaque affirmation étayée au-dessus de chaque affirmation non étayée. ECE 0,20 : le score lui-même n'est pas encore bien calibré ; il indique environ 0,8 pour des affirmations toutes étayées, il est donc trop prudent. C'est la prochaine chose à corriger, et la raison pour laquelle le score n'apparaît pas encore en pourcentage dans les réponses.

Choisit-il le bon outil et le bon graphique ?

Onze tâches courantes, chacune passée deux fois par le véritable agent : prix en direct, organigrammes, diagrammes, comparaisons, chronologies, formules, cartes, réponse dans la langue de l'utilisateur, écriture d'un fichier sur l'ordinateur, calcul sur un tableur joint.

Lumen Small20 / 22
Lumen Medium22 / 22
Lumen Large22 / 22