Deux familles, un seul comportement.
Les deux répondent par trois canaux : couvert par les sources, non couvert, ou contredit par elles. Ce qui les distingue, c'est à qui appartiennent les poids, et si ce jugement se forme après la réponse ou pendant qu'elle s'écrit.
Les deux portent le nom d'une unité de mesure, et ce n'est pas de la décoration. Le lumen mesure la lumière qui arrive vraiment, pas celle qu'on promet sur l'emballage d'une lampe. Et Gauss est le nom derrière les mathématiques de l'incertitude : une distribution sur laquelle on lit un degré de confiance, c'est-à-dire exactement ce que la seconde famille calcule à partir de son propre état caché.
Lumen
Les modèles qui répondent aujourd'hui. Chaque taille est un modèle à poids ouverts que nous ajustons et exploitons, avec la couche de cohérence placée devant lui comme étape externe : elle découpe la réponse en affirmations, confronte chacune aux sources effectivement récupérées pour ce tour et oriente le résultat vers l'un de trois canaux : couvert, non couvert, contredit. Le modèle de base ne voit jamais cette étape, et n'en a pas besoin.
- Trois tailles qui répondent en production aujourd'hui
- Le canal d'abstention se comporte de la même façon à chaque taille
- Calibrée sur un jeu équilibré, avec validation croisée
- La même couche décide si le modèle plus grand doit intervenir ou non
Gauss
La prochaine famille, et la raison d'être de l'entreprise. Entraînée à partir de zéro sur notre propre mélange de données plutôt qu'adaptée des poids de quelqu'un d'autre, avec la tête de cohérence intégrée à l'architecture au lieu d'être placée autour. Le score est ainsi calculé à partir de l'état caché du modèle, et non du texte auquel il s'est déjà engagé. Cette famille est en planification et dépend d'un financement. Ce qui existe aujourd'hui est une preuve fonctionnelle à petite échelle.
- Preuve à petite échelle : un modèle allemand de 1,16 milliard de paramètres, entraîné à partir de zéro
- Tête de cohérence de 525 445 paramètres, avec trois voies : langage, source, abstention
- Tokenizer propre de 56 000 entrées, conçu pour l'allemand plutôt qu'adapté après coup
- Chaque source d'entraînement consignée avec origine, licence, date et volume
| Caractéristique | Lumen | Gauss |
|---|---|---|
| Poids | Modèles de base à poids ouverts, ajustés et servis par nous | Les nôtres, entraînés à partir de zéro, chaque source consignée |
| Position de la couche | Autour du modèle, sur le chemin de la requête | Dans l'architecture, sur l'état caché |
| Tailles | Small, Medium et Large. Max en planification. | Small, Medium, Large - aucune pour l'instant |
| Où en est-on | En production, calibrée sur un jeu équilibré | Démontré à 1,16 milliard de paramètres, pas encore mesuré |
Trois tailles aujourd'hui, une quatrième en planification.
Ce qui les distingue, c'est ce dont elles se souviennent sans aide et la longueur du raisonnement qu'elles peuvent tenir. Ce qu'elles partagent, c'est la capacité de signaler qu'elles ne sont pas sûres.
Lumen Small
Rapide et économique. Réponses courtes, classification, reformulation, extraction. Le modèle derrière l'offre gratuite.
Texte
Lumen Medium
Le modèle de travail. Textes longs, code, documents et images dans la même conversation.
Texte, images, documents
Lumen Large
Pour les longs contextes et les raisonnements profonds, quand la réponse exige de garder beaucoup d'éléments en tête à la fois. Inclus dès Pro.
Texte, images, documents
Lumen Max Prévu
En planification. Le sommet de cette famille, pour les travaux où une mauvaise réponse coûte plus cher que la réponse elle-même.
Ce qui existe, et ce qui manque encore.
La prochaine famille n'est pas une diapositive. Un petit modèle a déjà été entraîné à partir de zéro, avec la tête de cohérence à l'intérieur et un canal d'abstention câblé de bout en bout. Ce qui manque, c'est l'échelle, et la mesure qui montrerait que la couche interne fonctionne aussi bien que la couche externe.
Un modèle de 1,16 milliard de paramètres, entraîné à partir de zéro
Vingt-quatre couches, dimension cachée 2048, notre propre tokenizer de 56 000 entrées conçu pour l'allemand plutôt qu'adapté après coup. Ajusté aux instructions, avec un projecteur de vision, et chaque source d'entraînement consignée avec origine, licence, date et volume.
La tête de cohérence, au cœur de l'architecture
525 445 paramètres, soit cinq centièmes de pour cent du modèle. Elle projette l'état caché et les vecteurs des sources dans un même espace à 128 dimensions, évalue leur accord et oriente vers le langage, la source ou l'abstention.
La mesure, et la puissance de calcul
La couche interne est entraînée mais pas calibrée : il n'existe ni ECE ni AUC pour elle, et nous n'en publierons pas tant qu'il n'y en aura pas. Et nous ne possédons pas de centre de données. Entraîner à une taille qui vaille la peine d'être servie demande une puissance de calcul que quelqu'un doit payer.
Deux espaces, et un troisième qui les vérifie.
Le langage et les sources sont tenus dans des espaces de représentation séparés. Ils sont reliés par un troisième espace dont le seul rôle est d'évaluer la fiabilité de ce lien.
Le produit saisit où les deux espaces concordent, la différence absolue où ils divergent, et les vecteurs bruts conservent ce qu'aucun des deux ne préserve.
V est un espace, pas un score
Un seul chiffre vous dit à quel point deux sources divergent. Un espace vous dit sur quoi. C'est ce qui rend la couche utile hors ligne : en regroupant les vecteurs, les modes d'échec récurrents du système apparaissent sous forme de groupes, plutôt que comme une longue liste de cas déroutants pris un par un.
Le canal d'abstention n'est pas optionnel
Quand les espaces se contredisent, la bonne réponse est : quelque chose ne va pas ici. Pas une moyenne de deux sources contradictoires : faire la moyenne d'une affirmation juste et d'une fausse produit une phrase fluide et subtilement fausse, et les erreurs subtiles sont plus difficiles à repérer que les évidentes.
La même couche décide du coût
La couche de cohérence sert aussi de routeur. Elle décide si la recherche doit seulement avoir lieu, et si une requête a besoin du plus grand modèle. Son propre coût reste sous un faible pourcentage à un chiffre du budget d'inférence, et c'est la seule raison pour laquelle elle peut se trouver sur le chemin de la requête.