Vous confiez une tâche un peu physique à une IA. Elle vous décrit la marche à suivre avec un aplomb parfait, puis elle se trompe dès que la situation bouge d'un cran. Le problème n'est pas son vocabulaire, c'est qu'elle n'a aucune idée de ce qui se passe quand un objet tombe, glisse ou bloque un passage. Les world models attaquent exactement ce trou.
Un world model (modèle de monde) est un système d'IA qui se construit une représentation interne de son environnement pour simuler ce qui va s'y produire. Là où un modèle de langage prédit le mot suivant, un world model prédit l'état suivant du monde : une trajectoire, un choc, la conséquence d'un geste. Voici comment ces modèles sont entraînés, qui les développe, où ils vont apparaître, et pourquoi ils inquiètent plus que les chatbots.
Un world model, ce n'est pas un LLM avec des yeux
Les grands modèles de langage comme ChatGPT, Claude ou Gemini ont avalé des quantités énormes de texte pour produire la suite de mots la plus plausible. C'est de la prédiction statistique appliquée au langage. L'illusion de compréhension tient au fait qu'ils ont lu assez de descriptions du monde pour en restituer une image cohérente.
Emmanuelle Guyot, Head of Data Science du groupe Hellowork, situe la frontière au bon endroit dans son entretien avec le Blog du Modérateur : un LLM s'arrête à l'étape de la description. Il sait que la phrase « l'objet tombe » suit la phrase « je lâche l'objet ». Il ne sait pas à quelle vitesse, ni s'il va rebondir.
Un world model, lui, apprend le comportement. Sa matière première n'est pas le texte mais l'image, la vidéo, le flux de capteurs. Son objectif n'est pas de parler du monde, mais d'en tirer des règles : la gravité, la causalité, la façon dont les objets et les situations évoluent dans le temps.
Ne confondez pas world model et générateur de vidéo. Un modèle comme Sora produit des images plausibles d'un monde. Un world model doit répondre à une question différente : si j'agis ici, que se passe-t-il ensuite ? La deuxième capacité ne découle pas de la première.
890 millions d'euros pour un pari sans produit
En mars 2026, la startup AMI Labs de Yann LeCun a levé près de 890 millions d'euros pour développer ce type de modèles. Avant cette opération, la société était valorisée 3 milliards d'euros. Yann LeCun défend une thèse simple : les LLM fabriquent du texte crédible, ils ne comprennent pas le monde physique.
Pour situer la somme : 890 millions levés sur une valorisation pré-opération de 3 milliards, cela représente environ 30 % de la valeur de l'entreprise émise en une seule fois. Pour une société qui ne vend encore aucun produit, l'ordre de grandeur dit surtout à quel point les investisseurs misent sur une rupture d'architecture, pas sur un chiffre d'affaires.
L'idée n'a pourtant rien de neuf. Jürgen Schmidhuber travaille sur des agents dotés d'une représentation interne de leur environnement depuis les années 1990. En 2018, avec David Ha, il publie l'article fondateur « World Models », où un agent apprend à conduire dans une simulation qu'il génère lui-même.
Comment on entraîne une machine à comprendre le monde
Yann LeCun s'inspire du développement humain. Un bébé n'apprend pas la physique dans un manuel : il observe, manipule, accumule des expériences sensorielles et en déduit des règles. Le principe d'entraînement reprend cette logique.
Concrètement, on montre au modèle des masses d'images, de vidéos et de situations, puis on lui demande d'anticiper ce qui vient ensuite. Sans annotation manuelle, précise Emmanuelle Guyot. À force de se tromper, le modèle apprend les conséquences des actions.
L'architecture décrite par Ha et Schmidhuber tient en trois briques, encore utilisée comme référence :
- un module de perception, qui compresse les images brutes en une représentation compacte ;
- une mémoire prédictive, qui apprend à passer d'un état au suivant ;
- un contrôleur, qui choisit l'action à partir de ces prédictions.
Le coût de cet apprentissage est le premier obstacle. Emmanuelle Guyot le souligne : ces modèles réclament beaucoup plus d'images et de vidéos qu'un LLM n'a besoin de texte. Et il faut fournir les bonnes situations, celles qui donnent accès à ce qui se passe physiquement.
Trois écoles, trois définitions du même mot
Aucun consensus n'existe sur la bonne façon de construire un world model, ni même sur ce qu'il doit savoir faire. Trois chercheurs incarnent trois réponses différentes.
| Chercheur | Sa définition d'un world model | L'analogie |
|---|---|---|
| Yann LeCun (AMI Labs) | Saisir la logique du monde, pas son apparence. Son architecture JEPA entraîne le modèle à prédire le sens d'une situation dans un espace abstrait, pour raisonner avant d'agir. | La carte mentale d'un joueur d'échecs |
| Fei-Fei Li (World Labs) | Percevoir le monde comme un espace en trois dimensions, dans lequel on se déplace, on observe les objets sous plusieurs angles et on comprend leurs relations spatiales. | Une reconstruction fidèle de la pièce |
| Demis Hassabis (Google DeepMind) | Un terrain d'entraînement. L'IA s'exerce dans un environnement virtuel, accumule les erreurs et les corrige sans conséquence réelle. | Le simulateur de vol d'un pilote |
L'approche de Yann LeCun a un nom technique qu'on croise partout dans les publications : JEPA, pour Joint-Embedding Predictive Architecture. Meta en a publié la version image, I-JEPA, puis des déclinaisons vidéo. Le pari : ignorer les détails inutiles comme les ombres ou les textures, pour ne prédire que la structure d'une scène.
Vous n'aurez pas de fenêtre de chat pour les world models
Les LLM répondent à des besoins universels : rédiger, résumer, dialoguer. N'importe qui ouvre ChatGPT et sait quoi en faire. Les world models servent à anticiper et à agir, deux usages beaucoup plus ciblés.
Emmanuelle Guyot ne croit donc pas à une mise à disposition grand public. Selon elle, ces modèles tourneront sous le capot, cachés dans des outils, des objets et des services. Un peu comme l'IA d'avant ChatGPT, qu'on utilisait sans jamais la voir.
Les terrains qu'elle cite se répartissent en deux familles :
- l'action dans le monde physique : robotique, véhicules autonomes, contrôle industriel ;
- les environnements immersifs : jeu vidéo, éducation, formation par simulation.
Ces terrains avancent, mais surtout en laboratoire et en pilote encadré. Cosmos, la plateforme de NVIDIA, sert d'environnement d'entraînement pour la robotique et la conduite autonome. Genie 3, présenté par Google DeepMind, génère des mondes jouables où les règles physiques tiennent. Aucun des deux n'est un produit qu'on installe le soir chez soi.
L'IA agentique, le vrai point de bascule
Un agent IA aujourd'hui, c'est un LLM à qui on décrit une suite d'étapes et qui les exécute avec des outils. Ça marche, mais son autonomie s'arrête vite : il ne se représente pas l'environnement dans lequel il agit, donc il ne sait pas ce que son action va casser.
Emmanuelle Guyot voit là l'apport le plus direct des world models pour les professionnels du digital. Le mode d'emploi change de nature : on donne un objectif, on décrit un environnement, et l'agent se débrouille. Il analyse, décide, agit.
Le saut est qualitatif. Un agent qui anticipe les effets de ses actions peut planifier, revenir en arrière, choisir la trajectoire la moins risquée. C'est une autre catégorie que les assistants actuels, dont l'autonomie tient surtout à la qualité de nos instructions. Si vous construisez déjà des agents, l'écart se mesure vite avec un outil comme n8n : notre formation aux automatisations et agents IA avec n8n couvre cette mécanique d'objectifs et de garde-fous. Côté modèles, l'agentivité progresse aussi chez les éditeurs de LLM, comme le montre le positionnement agentique de Claude Sonnet 5.
Ce qui devient risqué quand l'IA agit sans nous relire
Avec un LLM, l'humain reste dans la boucle par construction. Le modèle produit un texte, nous le lisons, nous décidons d'y croire ou pas. Cette interface de contrôle est gratuite : elle est le produit lui-même.
Emmanuelle Guyot pointe sa disparition partielle. Puisque l'objectif d'un world model est de décider et d'agir, il gagne une autonomie et une responsabilité que nous ne pourrons plus toujours vérifier. Une erreur de robot ou de véhicule n'est pas une hallucination qu'on corrige en relisant un paragraphe.
Le biais de confiance est le risque le plus sournois. Ces systèmes seront présentés comme des IA qui réfléchissent et qui comprennent le monde. Emmanuelle Guyot en tire la conséquence logique : nous leur ferons encore plus confiance qu'aux LLM, au moment précis où nous aurons moins de prise pour les contrôler.
Il y a un second point, moins discuté. Un modèle qui apprendrait non seulement la physique mais aussi les comportements humains, la psychologie et les croyances individuelles concentrerait une connaissance qu'aucune personne ne possède. Terrain idéal pour la manipulation et pour les atteintes à la vie privée.
LLM ou world models ? La question est mal posée
Emmanuelle Guyot ne croit pas au remplacement. Les LLM expliquent, dialoguent, font le lien avec l'humain. Les world models anticipent l'évolution d'une situation, raisonnent sur les conséquences, aident à planifier. Deux objectifs qui ne se recouvrent pas.
La tendance va vers la combinaison : un module qui comprend les consignes en langage naturel, un autre qui simule et planifie. NVIDIA a déjà pris cette direction avec Cosmos, qui associe un modèle de simulation du monde physique à un composant vision-langage chargé d'interpréter les instructions.
Pour Yann LeCun et d'autres chercheurs, les world models sont une étape vers l'intelligence artificielle générale, une IA capable de tout comprendre et de tout faire. Le chemin reste immense. Le plus long, d'après Emmanuelle Guyot, est de réunir les bonnes situations d'apprentissage : c'est le monde entier qu'il faudrait lister.
Ce que ça change concrètement pour vous, même en solo
Cessez de guetter une interface pour vous y intéresser. Il n'y aura pas de moment ChatGPT pour les world models. La rupture arrivera par les outils que vous utilisez déjà : un simulateur, un moteur de jeu, une brique de planification dans une plateforme d'automatisation. Suivez les notes de version de vos outils plutôt que les annonces de nouveaux chatbots.
Décrivez l'environnement de vos agents, pas seulement leurs étapes. C'est le geste qui prépare le terrain, et il paie déjà. Documentez ce que l'agent peut toucher, ce qui est interdit, ce qui se passe en cas d'échec. Le jour où un module de planification arrive dans votre stack, votre travail de description est déjà fait.
Mettez un point d'arrêt humain sur chaque action irréversible. Un envoi de mail à une liste, un paiement, une suppression de base : ces trois-là ne se rejouent pas. Plus vos automatisations gagnent en autonomie, plus cette validation manuelle vaut cher. C'est une ligne de configuration aujourd'hui, une catastrophe évitée plus tard.
Questions fréquentes sur les world models
Quelle est la différence entre un world model et un LLM ?
Un LLM prédit la suite la plus probable d'une séquence de texte. Il connaît les descriptions du monde, pas le monde. Un world model apprend à partir d'images, de vidéos et de flux de capteurs, et prédit l'état suivant d'une situation : une trajectoire, une collision, l'effet d'une action. Le premier parle, le second anticipe.
Les world models vont-ils remplacer ChatGPT ?
Non, selon Emmanuelle Guyot, Head of Data Science du groupe Hellowork : les deux approches poursuivent des objectifs trop différents. La direction prise par la recherche est la combinaison des deux, un module qui comprend le langage naturel et un module qui simule et planifie. NVIDIA suit déjà cette voie avec Cosmos.
Peut-on tester un world model soi-même ?
Pas comme on ouvre un chatbot. Les systèmes existants, tels Cosmos chez NVIDIA ou Genie 3 chez Google DeepMind, ciblent la recherche, la robotique et la conduite autonome, avec des accès encadrés. La plupart des déploiements dans le monde réel sont encore des prototypes ou des pilotes en environnement contrôlé.
Quel est le principal frein au développement des world models ?
Les données. Il faut réunir des exemples de situations qui montrent physiquement comment le monde se comporte, en volume très supérieur au texte qu'ingèrent les modèles de langage. Emmanuelle Guyot décrit ce travail comme le point le plus long : il faudrait lister tout ce qu'on veut faire comprendre au modèle, c'est-à-dire le monde entier.






