Was wir messen, und was herauskam.
Kleine, von Hand geschriebene Testsets, so ausgewogen, dass ein Modell, das immer antwortet, und eines, das nie antwortet, beide null Punkte erreichen. Sie zeigen, ob etwas funktioniert, nicht, wie es im Vergleich zu anderen Systemen abschneidet.
Sagt es, wenn die Quelle die Frage nicht abdeckt?
56 Fragen zu kurzen Textstellen, die Hälfte davon durch die Stelle beantwortet, die andere Hälfte nicht. Die Trennschärfe ist die Ablehnungsquote bei unbeantwortbaren Fragen minus die Ablehnungsquote bei beantwortbaren: 0 heisst, es rät, 100 heisst, es verwechselt sie nie.
| Richtig beantwortet | Abgelehnt, wenn nicht belegt | Etwas erfunden | Trennschärfe | |
|---|---|---|---|---|
| Lumen Small | 100.0 % | 92.9 % | 0.0 % | 92.9 pp |
| Lumen Medium | 100.0 % | 89.3 % | 0.0 % | 89.3 pp |
| Lumen Large | 92.9 % | 92.9 % | 0.0 % | 89.3 pp |
Trennt die Konsistenzschicht belegte von unbelegten Aussagen?
60 Aussagen, jede mit ihrem Beleg, die Hälfte belegt und die Hälfte nicht; jeder Fall bewertet mit Gewichten, die ohne ihn angepasst wurden. AUC 1.00: Auf diesem Set stuft sie jede belegte Aussage höher ein als jede unbelegte. ECE 0.20: Der Wert selbst ist noch nicht gut kalibriert. Bei Aussagen, die alle belegt sind, sagt er etwa 0.8, er ist also zu vorsichtig. Das ist das Nächste, was wir beheben, und der Grund, weshalb der Wert in Antworten noch nicht als Prozentzahl erscheint.
Nimmt es das richtige Werkzeug und die richtige Grafik?
Elf alltägliche Aufgaben, jede zweimal durch den echten Agenten geschickt: aktuelle Preise, Organigramme, Diagramme, Vergleiche, Zeitachsen, Formeln, Karten, Antworten in der Sprache der Person, eine Datei auf dem Computer schreiben, mit einer angehängten Tabelle rechnen.
Notizen aus dem Bau.
Keine Papers und keine Vergleichstabellen. Hier stehen Entscheide mit ihrer Begründung, auch die, die sich später als falsch herausgestellt haben.
Die Notizen erscheinen nur auf Englisch.
It is a consistency layer, not a veracity layer
What gets measured is agreement between a claim and its evidence, not truth. The distinction sounds like hair-splitting and is the most consequential naming decision in the system.
Why accuracy is a worthless metric for this
On a set that is 85 percent consistent, a model that always answers consistent scores 85 percent and has learned nothing. We measure ECE and AUC on a balanced set instead.
A cascade beats running both models
Inference is paid forever, training once. A router that only escalates when it has to is several times cheaper, at a cost that shows up in the tail rather than the average.
Code belongs in pretraining, not in a later phase
A model that meets code only after language has settled has to learn it against established representations. That is more expensive and gives a worse result.
How a tokenizer splits numbers decides whether totals survive
A tokenizer trained on the target language saves around a fifth of the tokens, and how it handles digits decides whether arithmetic is learnable at all.