Laboratoire de recherche · Efficience des modèles

Nous ne cherchons pas une IA
plus intelligente
mais une IA plus efficiente.

L'intelligence artificielle progresse aujourd'hui en dépensant davantage : plus de paramètres, plus de mémoire, plus de calcul, plus d'énergie. Symbioz explore l'autre direction — obtenir autant en dépensant beaucoup moins. Ce n'est pas un réglage de fin de projet, c'est notre seul objet de recherche.

0 de mémoire par token, aujourd'hui
0 moins que les références publiées
0 GPU grand public par expérience
0 point de qualité sacrifié
Efficience Mémoire d'inférence Octets par token Contexte long Réflexion latente Quantification Sobriété matérielle Résultats négatifs
Notre raison d'être

La course à la taille a un prix

Depuis dix ans, le progrès en intelligence artificielle suit une recette unique : agrandir. Plus de paramètres, plus de données, plus de silicium. Elle fonctionne — et elle a produit des systèmes remarquables. Mais elle a aussi un coût que l'on regarde peu.

Un modèle deux fois plus économe, c'est le même service rendu pour moitié moins de ressources — à chaque requête, pour toujours. À l'échelle où l'IA est utilisée aujourd'hui, un gain d'efficience pèse plus lourd qu'un point de performance de plus.

Symbioz travaille cette direction-là, et rien d'autre. Nous ne cherchons pas à battre qui que ce soit sur un classement de capacités. Nous cherchons à faire tenir la même chose dans beaucoup moins.

L'énergie

Chaque octet qu'un modèle n'a pas à garder est de la mémoire qu'on ne fabrique pas et du courant qu'on ne consomme pas — à chaque requête, indéfiniment.

L'accès

Entraîner et servir un très grand modèle est réservé à une poignée d'acteurs. Ce qui devient efficient redevient accessible à des équipes modestes.

L'autonomie

Un modèle qui tient sur une machine ordinaire peut tourner chez soi, hors ligne, sans confier ses données à qui que ce soit.

Nos axes

Six endroits où gagner en efficience

Une même question à chaque fois : peut-on obtenir le même résultat en dépensant moins ? Nous décrivons ici ce que nous cherchons et pourquoi — les détails d'architecture restent au laboratoire.

La portée utile

Un modèle qui « accepte » 128 000 tokens ne s'en sert pas pour autant. Annoncer une fenêtre coûte zéro ; s'en servir vraiment coûte cher. Nous mesurons la portée réelle, celle qu'on paie.

  • Où le modèle décroche pour de bon
  • Distinguer la fenêtre affichée de la portée utile
  • Aller plus loin sans payer plus

La réflexion silencieuse

Faire réfléchir un modèle coûte aujourd'hui des milliers de tokens écrits puis jetés. Et s'il se représentait la suite avant d'écrire, sans rien produire de visible ?

  • Anticiper plutôt que deviner mot à mot
  • Une réflexion qui ne se facture pas au token
  • Travaux exploratoires en cours

La précision juste nécessaire

Un modèle calcule avec bien plus de décimales qu'il n'en a besoin. Chacune coûte de la mémoire et de l'énergie. Nous descendons marche par marche, en mesurant ce qui se perd à chaque palier.

  • 16 bits, puis 8, puis 4
  • Ce qui se dégrade en premier, et sur quels textes
  • Le gain réel, pas le gain théorique

La part qui travaille

Dans un modèle entraîné, tout ne sert pas. Certains paramètres ne contribuent plus à rien mais coûtent autant que les autres. Nous cherchons à les compter, puis à ne plus les payer.

  • Mesurer la part réellement active
  • Ce qu'on peut retirer sans rien changer au résultat
  • Concevoir d'emblée sans ce poids mort

La contrainte matérielle

Tout ce que nous publions est entraîné et mesuré sur des GPU grand public, un seul à la fois. Ce n'est pas un handicap subi : c'est la contrainte qui force à trouver l'économie.

  • Un GPU par expérience, pas un centre de calcul
  • Des résultats qu'un labo modeste peut rejouer
  • L'efficience comme point de départ, pas comme rattrapage
Le nerf de la guerre

Où se mesure vraiment l'efficience

Pas dans le nombre de paramètres, celui qu'on affiche partout. Dans les octets que le modèle doit garder pour chaque token lu. En quatre étapes.

01

Le modèle lit

Chaque token lu laisse une trace que le modèle doit conserver pour la suite de sa réponse.

02

La trace s'accumule

Plus le texte est long, plus cette mémoire grossit — token après token, sans jamais se vider.

03

Le mur

Arrivée au bout de la mémoire disponible, cette trace fixe la vraie limite : elle plafonne le contexte et fait monter la facture.

04

L'efficience

Comprimer cette trace à 90 octets par token — et vérifier, texte par texte, que le modèle n'a rien perdu en route.

0 de mémoire par token dans notre modèle
0 pour une architecture ouverte de référence
0 GPU grand public par expérience
0 résultat annoncé sans protocole préenregistré
Comment nous travaillons

Décider avant de regarder

Chercher l'efficience rend particulièrement facile de se tromper soi-même : les gains qu'on traque sont petits, et un écart minuscule ressemble beaucoup à du bruit. Nous avons donc pris le parti inverse de l'intuition : les critères d'acceptation sont écrits, datés et figés avant le lancement de chaque expérience.

Ce que nous mesurons ensuite n'a plus droit à l'interprétation. Une idée séduisante qui tombe dans la zone grise est abandonnée — même si elle nous plaisait, même si elle avait coûté des semaines. La plupart de nos pistes finissent ainsi, et c'est le fonctionnement normal d'un laboratoire.

Une économie n'est un gain que si la qualité n'a pas bougé. C'est la moitié la moins spectaculaire de notre travail, et de loin la plus longue.

Préenregistrement

Seuils d'acceptation, critère d'arrêt et strates d'analyse sont fixés avant de lancer la moindre expérience.

Comparaison appariée

Deux architectures se comparent sur les mêmes textes, avec un intervalle de confiance, et le résultat est découpé par type de passage. Un gain moyen qui cache une perte locale n'est pas un gain.

Résultats négatifs

Les pistes abandonnées sont documentées aussi soigneusement que les réussites. Savoir quelle économie ne marche pas a une valeur.

Transparence

Ce que nous disons, ce que nous gardons

Autant l'annoncer clairement plutôt que de le laisser deviner.

Ce que nous publions

Les questions que nous nous posons, les raisons qui nous les font choisir, les économies que nous mesurons et les résultats que nous obtenons — y compris quand ils nous donnent tort. Les publications formelles viendront lorsque notre modèle de grande taille sera achevé ; d'ici là, ce site tient lieu de compte rendu.

Ce que nous gardons

Le détail des architectures, les recettes d'entraînement et les mécanismes internes restent au laboratoire. Nous communiquons sur le quoi et le pourquoi, pas sur le comment.

Ce que nous ne ferons pas

Pas de classement maison taillé pour nous avantager, pas de démonstration choisie après coup, pas d'économie annoncée sans dire ce qu'elle a coûté en qualité.

Le laboratoire

Petit, indépendant, et lent exprès

Symbioz est un laboratoire de recherche indépendant établi en France. Nous n'avons rien à vendre : ce site existe pour rendre compte de nos travaux, pas pour convertir un visiteur en client.

Nous travaillons sur des modèles volontairement compacts. Non pas faute de mieux, mais parce que c'est la bonne échelle pour étudier l'efficience : une idée qui n'apporte rien s'y voit immédiatement, là où un très grand modèle l'absorberait sans qu'on s'en aperçoive.

Les résultats obtenus à cette échelle sont ensuite réexaminés avant toute généralisation. Nous préférons une conclusion étroite et solide à une promesse large.

Une seule question

Obtenir autant en dépensant moins. Tout ce qui ne sert pas cette question sort du programme de recherche.

Indépendance

Aucun financement extérieur à satisfaire, donc aucune raison de forcer un résultat ou d'annoncer trop tôt.

Traçabilité

Chaque résultat publié renvoie à une expérience datée, à son protocole et à ses données de référence, archivés.

Contact

Vous travaillez sur des sujets proches ?

Nous lisons tout ce qui touche à l'efficience des modèles : compression de la mémoire d'inférence, quantification, évaluation honnête. Une remarque, une objection, un résultat qui contredit les nôtres : écrivez-nous.