Modèles

Deux familles, un seul comportement.

Les deux répondent par trois canaux : couvert par les sources, non couvert, ou contredit par elles. Ce qui les distingue, c'est à qui appartiennent les poids, et si ce jugement se forme après la réponse ou pendant qu'elle s'écrit.

Les deux portent le nom d'une unité de mesure, et ce n'est pas de la décoration. Le lumen mesure la lumière qui arrive vraiment, pas celle qu'on promet sur l'emballage d'une lampe. Et Gauss est le nom derrière les mathématiques de l'incertitude : une distribution sur laquelle on lit un degré de confiance, c'est-à-dire exactement ce que la seconde famille calcule à partir de son propre état caché.

LUMENLa couche se place devantune questionModèle à poids ouvertsajusté et exploité par nousCouche de cohérencelit les affirmations terminéescouvert · non couvert · contreditRÉPOND AUJOURD'HUIGAUSSLa couche est intégréeune questionNotre modèlepoids entraînés à partir de zéroTête de cohérencelit l'état cachécouvert · non couvert · contreditEN PLANIFICATION
Les trois mêmes canaux des deux côtés. Ce qui change, c'est le moment où le jugement se forme : une fois la réponse écrite, ou pendant qu'elle s'écrit.
Répond aujourd'hui

Lumen

Les modèles qui répondent aujourd'hui. Chaque taille est un modèle à poids ouverts que nous ajustons et exploitons, avec la couche de cohérence placée devant lui comme étape externe : elle découpe la réponse en affirmations, confronte chacune aux sources effectivement récupérées pour ce tour et oriente le résultat vers l'un de trois canaux : couvert, non couvert, contredit. Le modèle de base ne voit jamais cette étape, et n'en a pas besoin.

  • Trois tailles qui répondent en production aujourd'hui
  • Le canal d'abstention se comporte de la même façon à chaque taille
  • Calibrée sur un jeu équilibré, avec validation croisée
  • La même couche décide si le modèle plus grand doit intervenir ou non
En planification

Gauss

La prochaine famille, et la raison d'être de l'entreprise. Entraînée à partir de zéro sur notre propre mélange de données plutôt qu'adaptée des poids de quelqu'un d'autre, avec la tête de cohérence intégrée à l'architecture au lieu d'être placée autour. Le score est ainsi calculé à partir de l'état caché du modèle, et non du texte auquel il s'est déjà engagé. Cette famille est en planification et dépend d'un financement. Ce qui existe aujourd'hui est une preuve fonctionnelle à petite échelle.

  • Preuve à petite échelle : un modèle allemand de 1,16 milliard de paramètres, entraîné à partir de zéro
  • Tête de cohérence de 525 445 paramètres, avec trois voies : langage, source, abstention
  • Tokenizer propre de 56 000 entrées, conçu pour l'allemand plutôt qu'adapté après coup
  • Chaque source d'entraînement consignée avec origine, licence, date et volume
CaractéristiqueLumenGauss
PoidsModèles de base à poids ouverts, ajustés et servis par nousLes nôtres, entraînés à partir de zéro, chaque source consignée
Position de la coucheAutour du modèle, sur le chemin de la requêteDans l'architecture, sur l'état caché
TaillesSmall, Medium et Large. Max en planification.Small, Medium, Large - aucune pour l'instant
Où en est-onEn production, calibrée sur un jeu équilibréDémontré à 1,16 milliard de paramètres, pas encore mesuré
Lumen

Trois tailles aujourd'hui, une quatrième en planification.

Ce qui les distingue, c'est ce dont elles se souviennent sans aide et la longueur du raisonnement qu'elles peuvent tenir. Ce qu'elles partagent, c'est la capacité de signaler qu'elles ne sont pas sûres.

COÛT ET TEMPS D'ATTENTE →PROFONDEUR →Smallrépond en un clin d'œilMediumcelui du quotidienLargedès ProMaxen planificationtextetexte · images · fichierstexte · images · fichiers
Les trois tailles de Lumen. Un positionnement relatif, pas un benchmark. La courbe s'aplatit volontairement : au-delà d'un certain point, davantage de calcul apporte de moins en moins de profondeur, et c'est pourquoi le routeur envoie la plupart des questions au plus petit modèle.
Small

Lumen Small

Rapide et économique. Réponses courtes, classification, reformulation, extraction. Le modèle derrière l'offre gratuite.

Texte

Medium

Lumen Medium

Le modèle de travail. Textes longs, code, documents et images dans la même conversation.

Texte, images, documents

Large

Lumen Large

Pour les longs contextes et les raisonnements profonds, quand la réponse exige de garder beaucoup d'éléments en tête à la fois. Inclus dès Pro.

Texte, images, documents

Lumen Max Prévu

En planification. Le sommet de cette famille, pour les travaux où une mauvaise réponse coûte plus cher que la réponse elle-même.

Gauss

Ce qui existe, et ce qui manque encore.

La prochaine famille n'est pas une diapositive. Un petit modèle a déjà été entraîné à partir de zéro, avec la tête de cohérence à l'intérieur et un canal d'abstention câblé de bout en bout. Ce qui manque, c'est l'échelle, et la mesure qui montrerait que la couche interne fonctionne aussi bien que la couche externe.

Construit

Un modèle de 1,16 milliard de paramètres, entraîné à partir de zéro

Vingt-quatre couches, dimension cachée 2048, notre propre tokenizer de 56 000 entrées conçu pour l'allemand plutôt qu'adapté après coup. Ajusté aux instructions, avec un projecteur de vision, et chaque source d'entraînement consignée avec origine, licence, date et volume.

Construit

La tête de cohérence, au cœur de l'architecture

525 445 paramètres, soit cinq centièmes de pour cent du modèle. Elle projette l'état caché et les vecteurs des sources dans un même espace à 128 dimensions, évalue leur accord et oriente vers le langage, la source ou l'abstention.

Manque

La mesure, et la puissance de calcul

La couche interne est entraînée mais pas calibrée : il n'existe ni ECE ni AUC pour elle, et nous n'en publierons pas tant qu'il n'y en aura pas. Et nous ne possédons pas de centre de données. Entraîner à une taille qui vaille la peine d'être servie demande une puissance de calcul que quelqu'un doit payer.

Architecture

Deux espaces, et un troisième qui les vérifie.

Le langage et les sources sont tenus dans des espaces de représentation séparés. Ils sont reliés par un troisième espace dont le seul rôle est d'évaluer la fiabilité de ce lien.

ESPACE ALangage et raisonnementétat caché · d = 2048ESPACE BConnaissances et sourcesindex de recherche · d = 768ESPACE VCohérenceprojection orthogonale · d = 128αALangageréponse du modèleαBSourceréponse d'une sourceαAbstentionles deux divergent
Le couplage
v = MLP( [ u ⊙ w ; |u − w| ; u ; w ] )

Le produit saisit où les deux espaces concordent, la différence absolue où ils divergent, et les vecteurs bruts conservent ce qu'aucun des deux ne préserve.

V est un espace, pas un score

Un seul chiffre vous dit à quel point deux sources divergent. Un espace vous dit sur quoi. C'est ce qui rend la couche utile hors ligne : en regroupant les vecteurs, les modes d'échec récurrents du système apparaissent sous forme de groupes, plutôt que comme une longue liste de cas déroutants pris un par un.

Le canal d'abstention n'est pas optionnel

Quand les espaces se contredisent, la bonne réponse est : quelque chose ne va pas ici. Pas une moyenne de deux sources contradictoires : faire la moyenne d'une affirmation juste et d'une fausse produit une phrase fluide et subtilement fausse, et les erreurs subtiles sont plus difficiles à repérer que les évidentes.

La même couche décide du coût

La couche de cohérence sert aussi de routeur. Elle décide si la recherche doit seulement avoir lieu, et si une requête a besoin du plus grand modèle. Son propre coût reste sous un faible pourcentage à un chiffre du budget d'inférence, et c'est la seule raison pour laquelle elle peut se trouver sur le chemin de la requête.