Rapport sur le modèle de la Fondation Humanoid
Humanoid Foundation Models
Les cerveaux sont en pleine reconstruction – des VLA aux modèles du monde prédictifs.
Les modèles du monde humanoïdes sont les nouveaux cerveaux de l’IA incarnée. Les systèmes qui transforment la perception en action passent des modèles vision-langage-action à des modèles du monde prédictifs, permettant à un robot d’imaginer les conséquences d’une action avant de l’exécuter.
Ce rapport cartographie cette transition de bout en bout, note de manière indépendante les 40 modèles de fondation qui comptent, et pose la question, sobrement : quand cette technologie sera-t-elle réellement fiable ?
Obtenir l’aperçu gratuit
Lisez le résumé exécutif et un extrait du répertoire Brain Score des 40 modèles avant d’acheter – livré dans votre boîte mail au format PDF.
Pourquoi la couche d’intelligence – et pourquoi maintenant
Le matériel se consolide ; la compétition ouverte porte désormais sur le “cerveau”. Le passage des VLA aux modèles du monde humanoïdes se joue en quelques mois, pas en années, et l’architecture qui l’emportera façonnera toute la pile technologique. Ce rapport vous explique ce qui change, qui est en tête, et ce que cela signifie – pour six publics.
Investisseurs et stratégie d’entreprise
Où va la vague de financement de 13,8 milliards de dollars, quelles architectures gagnent, et comment lire des valorisations calculées des années avant les revenus.
Ingénieurs en robotique et IA
Les quatre paradigmes architecturaux, la convergence Système 1 / Système 2, et pourquoi le secteur passe des VLA aux modèles du monde prédictifs.
Concepteurs de modèles de fondation
La barrière des données, les lois d’échelle pour les données incarnées, la simulation et le sim-to-real – et où les challengers ouverts comblent l’écart.
Fabricants et fournisseurs d’humanoïdes
Quel “cerveau” licencier ou construire, la réalité d’une pile scindée entre modèles occidentaux et corps chinois, et le calcul qui sous-tend le tout.
Équipes politiques et calcul
Contrôles à l’exportation, montée en puissance soutenue par l’État, et la géopolitique qui détermine qui entraîne et qui ne fait qu’assembler.
Quiconque mise sur l’IA incarnée
Une lecture indépendante et sobre des capacités, de la sécurité et du calendrier – ni un argumentaire promotionnel, ni un démontage à charge.
L’idée la plus enthousiasmante – et la moins aboutie
Les modèles du monde humanoïdes sont l’idée la plus enthousiasmante de l’apprentissage robotique – et la moins aboutie. Les avancées sont réelles : les architectures prédictives world-action font plus que doubler la généralisation par rapport aux références VLA, les politiques entraînées sur vidéo dominent désormais les benchmarks de manipulation, et les données incarnées commencent à montrer des lois d’échelle nettes.
Mais des démonstrations ne valent pas un déploiement. Une autonomie généraliste fiable et sans surveillance dans des environnements non structurés relève, selon notre scénario de base, d’une échéance 2028–2030 – freinée moins par les idées que par les derniers 10 % de fiabilité, la validation de la sécurité et l’écart entre le laboratoire et le terrain. L’équilibre probable est une pile scindée : des cerveaux occidentaux sur des corps chinois. La question n’est pas de savoir si les modèles du monde vont transformer l’IA incarnée, mais qui en contrôlera l’architecture, les données et le calcul le moment venu.
Les quatre paradigmes
Sous la bannière des “modèles du monde” se cachent quatre façons distinctes de générer une action. Le rapport les classe selon deux axes – contrôle discret ou continu, et si le modèle prédit ou non l’avenir – et montre pourquoi les systèmes les plus performants convergent vers une conception à deux vitesses.
Autorégressif
Émet des jetons d’action discrets, comme un modèle de langage. Simple et général, mais sans modèle explicite de l’évolution du monde.
Diffusion / flow matching
Génère des trajectoires d’action continues et fluides par débruitage. La base de la couche rapide “Système 1”, fonctionnant au-delà de 200 Hz.
Modèles du monde latents (JEPA)
Prédisent l’évolution de l’environnement dans un espace latent compact, permettant au robot de planifier face à un avenir imaginé plutôt qu’à des pixels bruts.
Modèles world-action (WAM)
Combinent contrôle continu et prédiction du monde – la recette la plus solide à ce jour, doublant plus que largement la généralisation par rapport aux références VLA.
Un verdict équilibré exige les deux colonnes
Ce rapport confronte les avancées réelles aux échecs non résolus, et date le tournant – afin que vous puissiez distinguer une véritable capacité d’une bonne démonstration.
Les avancées
Architectures prédictives, simulateurs génératifs et modèles de type JEPA qui permettent aux robots d’imaginer les conséquences avant d’agir.
Les échecs
Hallucinations, dérive, écart sim-to-real et nouveaux risques d’alignement – les raisons pour lesquelles le déploiement reste difficile.
Le calendrier
Benchmarks, points de bascule des coûts unitaires, et un scénario de base pour l’arrivée effective d’un généraliste fiable.
Ce que contient le rapport
Vingt-quatre chapitres et 16 figures – une référence complète sur les “cerveaux” des robots humanoïdes : les architectures, les acteurs, le calcul et la géopolitique qui les sous-tendent, et une lecture sobre des capacités, de la sécurité et du calendrier.
Fondations
- 01 – Repenser l’IA physique
- 02 – Des VLA aux modèles du monde
- 03 – À l’intérieur d’un modèle du monde
- 04 – Les quatre paradigmes architecturaux
- 05 – JEPA et les architectures prédictives
- 06 – Simulateurs de monde génératifs
- 07 – Lois d’échelle et la question des données
Les modèles et leurs créateurs
- 08 – Modèles de fondation I : la plateforme NVIDIA
- 09 – Modèles de fondation II : les challengers
- 10 – Les fabricants d’humanoïdes
- 11 – Données d’entraînement et la barrière des données
- 12 – Simulation et sim-to-real
Calcul et géopolitique
- 13 – Calcul et infrastructure
- 14 – États-Unis : innovation contre volume
- 15 – Chine : une montée en puissance soutenue par l’État
- 16 – Europe, Japon et Corée
- 17 – Géopolitique
Applications et évaluation
- 18 – Applications industrielles
- 19 – Robots domestiques et de service
- 20 – Benchmarks et évaluation
- 21 – Forces, faiblesses et sécurité
Perspectives
- 22 – Affaires et investissement
- 23 – Scénarios
- 24 – Plan d’action et la fenêtre 2026–2030
Le répertoire Brain Score
Les 40 modèles de fondation suivis par humanoid.guide – chacun noté de manière indépendante de 0 à 10 sur dix dimensions de capacité, pour comparer tout le secteur en un coup d’œil. Le jaune signifie que le modèle possède la compétence.
Locomotion
Corps entier
Bimanuel
Dextérité
Navigation
Raisonnement
Sim-to-real
Transfert d’incarnation
Temps réel
Long horizon16 figures, nettes dans le rapport
Chaque chapitre associe un récit approfondi aux cadres visuels que les équipes stratégie et ingénierie utilisent pour communiquer leurs conclusions en interne. Les aperçus ci-dessous sont volontairement flous – les versions complètes et lisibles, avec les données sous-jacentes, sont incluses dans le rapport.






Choisissez votre licence
Licence individuelle pour les analystes et ingénieurs indépendants. Licence entreprise pour les équipes stratégie, recherche et produit.
Licence individuelle
- Rapport complet de 100 pages (PDF)
- Les 24 chapitres et 16 figures
- Le répertoire Brain Score des 40 modèles
- Licence individuelle
- Mises à jour gratuites tout au long du cycle 2026
Licence entreprise
- Tout ce qui est inclus dans la licence individuelle
- Nombre illimité d’utilisateurs internes au sein d’une organisation
- Droit de citation dans les documents de stratégie internes
- Support par e-mail prioritaire
- Appel de briefing optionnel de 60 minutes avec les auteurs
En effectuant un achat, vous acceptez les conditions de la licence que vous choisissez. Des questions ? human@humanoid.guide
Questions fréquentes
- Qu’est-ce qu’un modèle du monde humanoïde, exactement ?
- Un modèle du monde humanoïde est un modèle de fondation qui apprend comment un environnement évolue, permettant à un robot de prédire – et d’imaginer – les conséquences d’une action avant de l’exécuter. Le rapport explique en quoi les modèles du monde humanoïdes diffèrent des modèles vision-langage-action (VLA), et pourquoi le secteur s’y oriente.
- À qui s’adresse ce rapport ?
- Aux investisseurs et équipes de stratégie d’entreprise, aux ingénieurs en robotique et en IA, aux concepteurs de modèles de fondation, ainsi qu’aux fabricants et fournisseurs d’humanoïdes évaluant la couche “cerveau” de la pile technologique.
- En quoi ce rapport diffère-t-il du Rapport de marché et du rapport sur la chaîne d’approvisionnement ?
- Le Rapport de marché et le rapport sur la chaîne d’approvisionnement couvrent l’ensemble du marché et le matériel. Ce rapport approfondit la couche d’intelligence – modèles du monde humanoïdes, VLA, architectures et acteurs, ainsi qu’un répertoire indépendant de 40 modèles.
- Qu’est-ce que le Brain Score ?
- La note éditoriale de 0 à 10 attribuée par humanoid.guide à chaque modèle sur dix capacités – locomotion, contrôle du corps entier, manipulation, navigation, raisonnement, sim-to-real, transfert d’incarnation, inférence en temps réel et planification à long horizon.
- Quelle est la méthodologie ?
- Le rapport synthétise les résultats publiés des modèles, les benchmarks et des sources primaires du secteur, chaque affirmation étant sourcée, avec un index complet des sources en annexe. Les Brain Scores sont des évaluations éditoriales propres à humanoid.guide.
- Sera-t-il mis à jour ?
- Oui – les acheteurs reçoivent des mises à jour gratuites tout au long du cycle 2026, à mesure que le paysage évolue.
- Puis-je obtenir un aperçu ?
- Oui – contactez-nous pour un échantillon ou un briefing.
Les cerveaux sont en cours de reconstruction – dès maintenant.
Comprenez les architectures, les acteurs et le calendrier avant que le secteur ne se consolide dans la fenêtre 2026–2030.
