Gemessen · 18. September 2026

Was wir messen, und was herauskam.

Kleine, von Hand geschriebene Testsets, so ausgewogen, dass ein Modell, das immer antwortet, und eines, das nie antwortet, beide null Punkte erreichen. Sie zeigen, ob etwas funktioniert, nicht, wie es im Vergleich zu anderen Systemen abschneidet.

Sagt es, wenn die Quelle die Frage nicht abdeckt?

56 Fragen zu kurzen Textstellen, die Hälfte davon durch die Stelle beantwortet, die andere Hälfte nicht. Die Trennschärfe ist die Ablehnungsquote bei unbeantwortbaren Fragen minus die Ablehnungsquote bei beantwortbaren: 0 heisst, es rät, 100 heisst, es verwechselt sie nie.

Richtig beantwortetAbgelehnt, wenn nicht belegtEtwas erfundenTrennschärfe
Lumen Small100.0 %92.9 %0.0 %92.9 pp
Lumen Medium100.0 %89.3 %0.0 %89.3 pp
Lumen Large92.9 %92.9 %0.0 %89.3 pp

Trennt die Konsistenzschicht belegte von unbelegten Aussagen?

60 Aussagen, jede mit ihrem Beleg, die Hälfte belegt und die Hälfte nicht; jeder Fall bewertet mit Gewichten, die ohne ihn angepasst wurden. AUC 1.00: Auf diesem Set stuft sie jede belegte Aussage höher ein als jede unbelegte. ECE 0.20: Der Wert selbst ist noch nicht gut kalibriert. Bei Aussagen, die alle belegt sind, sagt er etwa 0.8, er ist also zu vorsichtig. Das ist das Nächste, was wir beheben, und der Grund, weshalb der Wert in Antworten noch nicht als Prozentzahl erscheint.

Nimmt es das richtige Werkzeug und die richtige Grafik?

Elf alltägliche Aufgaben, jede zweimal durch den echten Agenten geschickt: aktuelle Preise, Organigramme, Diagramme, Vergleiche, Zeitachsen, Formeln, Karten, Antworten in der Sprache der Person, eine Datei auf dem Computer schreiben, mit einer angehängten Tabelle rechnen.

Lumen Small20 / 22
Lumen Medium22 / 22
Lumen Large22 / 22