Bericht zum humanoiden Grundmodell

Humanoid Foundation Models – World Models Report – humanoid.guide
humanoid.guide
Marktforschung
Foundation Models · Die Roboter-Gehirne

Humanoid Foundation Models

Die Gehirne werden neu gebaut – von VLAs zu prädiktiven Weltmodellen.

Soeben veröffentlicht · 2026

Humanoide Weltmodelle sind die neuen Gehirne verkörperter KI. Die Systeme, die Wahrnehmung in Handlung umsetzen, wandeln sich von Vision-Language-Action-Modellen zu prädiktiven Weltmodellen, die einem Roboter erlauben, sich die Folgen einer Handlung vorzustellen, bevor er sie ausführt.

Dieser Bericht bildet diesen Wandel lückenlos ab, bewertet unabhängig die 40 relevanten Foundation-Modelle und stellt die nüchterne Frage: Wann wird die Technologie tatsächlich zuverlässig sein?

100 Seiten · 24 Kapitel · 40 bewertete Modelle über 10 Fähigkeiten · 16 Abbildungen · Prognosen bis 2030
Titelbild des Humanoid World Models Reports
Humanoide Weltmodelle – ein Roboter stellt sich seine Umgebung vor, bevor er handelt
Kostenlose Vorschau

Kostenlose Vorschau erhalten

Lesen Sie die Zusammenfassung und einen Auszug aus dem 40-Modelle-Brain-Score-Verzeichnis, bevor Sie kaufen – als PDF direkt in Ihr Postfach.

$13.8B
Rekord-Risikokapital für Robotik 2025 – Humanoid-Investitionen in vier Jahren um das ~143-Fache gestiegen
Bericht Kap. 22, Branchen-Finanzierungsdaten
World-Action-Modelle übertreffen die Generalisierung von VLA-Baselines um mehr als das Doppelte (DreamZero 62,2 % vs. 27,4 %)
Bericht Kap. 8
~90% / 70%
Chinas Anteil an verkauften Humanoid-Einheiten und an der Komponenten-Lieferkette – “westliche Gehirne, chinesische Körper”
Bericht Kap. 15
2028–30
Basisszenario-Zeitfenster für zuverlässige, unbeaufsichtigte generalistische Autonomie
humanoid.guide-Basisszenario
Warum jetzt

Warum die Intelligenzschicht – und warum jetzt

Die Hardware konsolidiert sich; der offene Wettstreit gilt nun dem “Gehirn.” Der Wandel von VLAs zu humanoiden Weltmodellen vollzieht sich in Monaten, nicht Jahren, und die Architektur, die gewinnt, wird den gesamten Stack prägen. Dieser Bericht zeigt Ihnen, was sich ändert, wer vorn liegt und was das bedeutet – für sechs Zielgruppen.

Investoren & Unternehmensstrategie

Wohin die 13,8-Milliarden-Dollar-Finanzierungswelle fließt, welche Architekturen gewinnen, und wie man Bewertungen liest, die Jahre vor dem Umsatz eingepreist werden.

Robotik- & KI-Ingenieure

Die vier Architektur-Paradigmen, die Konvergenz von System 1 und System 2, und warum sich das Feld von VLAs zu prädiktiven Weltmodellen bewegt.

Foundation-Model-Entwickler

Der Datengraben, Skalierungsgesetze für verkörperte Daten, Simulation und Sim-to-Real – und wo die offenen Herausforderer aufholen.

Humanoid-Hersteller & Zulieferer

Welches “Gehirn” man lizenzieren oder selbst bauen sollte, die Split-Stack-Realität westlicher Modelle auf chinesischen Körpern, und die Rechenleistung dahinter.

Politik- & Compute-Teams

Exportkontrollen, staatlich geförderte Skalierung, und die Geopolitik, die entscheidet, wer trainiert und wer nur zusammenbaut.

Alle, die auf verkörperte KI setzen

Eine unabhängige, nüchterne Einschätzung von Fähigkeiten, Sicherheit und Timing – kein Hype-Reel und keine Zerlegung.

Der zentrale Befund

Die spannendste Idee – und die am wenigsten ausgereifte

Humanoide Weltmodelle sind die spannendste Idee im Robot Learning – und die am wenigsten ausgereifte. Die Fortschritte sind real: Prädiktive World-Action-Architekturen übertreffen die Generalisierung von VLA-Baselines um mehr als das Doppelte, videotrainierte Policies führen inzwischen Manipulations-Benchmarks an, und verkörperte Daten zeigen erste saubere Skalierungsgesetze.

Doch Demos sind kein Einsatz im Feld. Zuverlässige, unbeaufsichtigte generalistische Autonomie in unstrukturierten Umgebungen ist nach unserem Basisszenario ein Thema für 2028–2030 – begrenzt weniger durch Ideen als durch die letzten 10 % an Zuverlässigkeit, Sicherheitsvalidierung und die Lücke zwischen Labor und Feldeinsatz. Das wahrscheinliche Gleichgewicht ist ein Split-Stack: westliche Gehirne auf chinesischen Körpern. Die Frage ist nicht, ob Weltmodelle verkörperte KI umgestalten werden – sondern wer die Architektur, die Daten und die Rechenleistung kontrolliert, wenn es so weit ist.

Innerhalb der Architektur

Die vier Paradigmen

Unter dem Banner “Weltmodelle” verbergen sich vier unterschiedliche Wege, eine Handlung zu erzeugen. Der Bericht ordnet sie entlang zweier Achsen – diskrete vs. kontinuierliche Steuerung, und ob das Modell die Zukunft überhaupt vorhersagt – und zeigt, warum die stärksten Systeme auf ein Zwei-Geschwindigkeiten-Design zusteuern.

1

Autoregressiv

Erzeugt diskrete Aktions-Tokens wie ein Sprachmodell. Einfach und allgemein, aber ohne explizites Modell davon, wie sich die Welt verändert.

2

Diffusion / Flow Matching

Erzeugt glatte, kontinuierliche Aktionstrajektorien durch Entrauschen. Die Basis der schnellen “System-1”-Schicht, die mit über 200 Hz läuft.

3

Latente Weltmodelle (JEPA)

Sagen voraus, wie sich die Umgebung in einem kompakten latenten Raum entwickelt, sodass ein Roboter gegen eine imaginierte Zukunft planen kann statt gegen rohe Pixel.

4

World-Action-Modelle (WAM)

Kombinieren kontinuierliche Steuerung mit Weltvorhersage – bislang das stärkste Rezept, mit mehr als der doppelten Generalisierung gegenüber VLA-Baselines.

Die Konvergenz: Das Feld etabliert ein System-1/System-2-Muster – ein langsamer 7–34B-Reasoner legt einen latenten Plan fest, während eine schnelle Diffusion-Policy die Regelschleife mit ~200 Hz schließt. Das Weltmodell liefert zunehmend das prädiktive Fundament, das die langsame Hälfte erst lohnend macht. Es gibt keine einzelne “humanoide Weltmodell”-Architektur; das erfolgreiche Rezept mischt Paradigmen.
Ein faires Urteil

Ein faires Urteil braucht beide Spalten

Dieser Bericht stellt die echten Fortschritte den ungelösten Problemen gegenüber und datiert die Wende – damit Sie echte Fähigkeit von einer guten Demo unterscheiden können.

Die Fortschritte

Prädiktive Architekturen, generative Simulatoren und JEPA-artige Modelle, die Robotern erlauben, Konsequenzen vor dem Handeln zu imaginieren.

Die Schwachstellen

Halluzinationen, Drift, die Sim-to-Real-Lücke und neue Alignment-Risiken – die Gründe, warum der reale Einsatz noch schwierig ist.

Der Zeitplan

Benchmarks, Stückkosten-Wendepunkte und ein Basisszenario dafür, wann ein zuverlässiger Generalist tatsächlich ankommt.

Der Inhalt

Was im Bericht steckt

Vierundzwanzig Kapitel und 16 Abbildungen – ein vollständiges Nachschlagewerk zu den “Gehirnen” humanoider Roboter: die Architekturen, die Akteure, die Rechenleistung und Geopolitik dahinter, sowie eine nüchterne Einschätzung von Fähigkeit, Sicherheit und Timing.

Teil I

Grundlagen

  • 01 – Physical AI neu gedacht
  • 02 – Von VLAs zu Weltmodellen
  • 03 – Im Inneren eines Weltmodells
  • 04 – Die vier Architektur-Paradigmen
  • 05 – JEPA und die prädiktiven Architekturen
  • 06 – Generative Weltsimulatoren
  • 07 – Skalierungsgesetze und die Datenfrage
Teil II

Die Modelle und ihre Hersteller

  • 08 – Foundation-Modelle I: NVIDIAs Plattform
  • 09 – Foundation-Modelle II: Die Herausforderer
  • 10 – Die Humanoid-Hersteller
  • 11 – Trainingsdaten und der Datengraben
  • 12 – Simulation und Sim-to-Real
Teil III

Rechenleistung und Geopolitik

  • 13 – Rechenleistung und Infrastruktur
  • 14 – USA: Innovation versus Volumen
  • 15 – China: Staatlich geförderte Skalierung
  • 16 – Europa, Japan und Korea
  • 17 – Geopolitik
Teil IV

Anwendungen und Bewertung

  • 18 – Industrielle Anwendungen
  • 19 – Haushalts- und Serviceroboter
  • 20 – Benchmarks und Bewertung
  • 21 – Stärken, Schwächen und Sicherheit
Teil V

Ausblick

  • 22 – Geschäft und Investitionen
  • 23 – Szenarien
  • 24 – Playbook und das Zeitfenster 2026–2030

Das Brain-Score-Verzeichnis

Alle 40 von humanoid.guide erfassten Foundation-Modelle – jedes unabhängig auf einer Skala von 0–10 über zehn Fähigkeitsdimensionen bewertet, sodass Sie das gesamte Feld auf einen Blick vergleichen können. Gelb bedeutet, dass das Modell diese Fähigkeit besitzt.

FortbewegungFortbewegung
GanzkörperGanzkörper
BeidhändigBeidhändig
GeschicklichkeitGeschicklichkeit
NavigationNavigation
SchlussfolgernSchlussfolgern
Sim-to-RealSim-to-Real
Embodiment-TransferEmbodiment-Transfer
EchtzeitEchtzeit
LangfristplanungLangfristplanung
Die Abbildungen

16 Abbildungen, scharf im Bericht

Jedes Kapitel verbindet eine ausführliche Darstellung mit den visuellen Frameworks, die Strategie- und Engineering-Teams intern zur Vermittlung von Ergebnissen nutzen. Die folgenden Vorschauen sind absichtlich unscharf – die vollständigen, lesbaren Versionen samt zugrunde liegender Daten sind im Bericht enthalten.

Abbildung 2.1 – Der Trade-off zwischen Geschwindigkeit und Generalisierung
Abbildung 2.1 – Der Trade-off zwischen Geschwindigkeit und Generalisierung
Abbildung 4.1 – Die vier Architektur-Paradigmen
Abbildung 4.1 – Die vier Architektur-Paradigmen
Abbildung 8.1 – World-Action-Modelle vs. VLA-Baselines
Abbildung 8.1 – World-Action-Modelle vs. VLA-Baselines
Abbildung 21.1 – Weltmodelle vs. VLAs über sechs Fähigkeiten
Abbildung 21.1 – Weltmodelle vs. VLAs über sechs Fähigkeiten
Abbildung 22.1 – Robotik-Risikokapital nach Jahr
Abbildung 22.1 – Robotik-Risikokapital nach Jahr
Abbildung 23.1 – Drei (plus eins) Szenarien entlang der Achsen KI-Fortschritt × Hardware
Abbildung 23.1 – Drei (plus eins) Szenarien entlang der Achsen KI-Fortschritt × Hardware
Bericht erhalten

Wählen Sie Ihre Lizenz

Einzelplatzlizenz für einzelne Analysten und Ingenieure. Unternehmenslizenz für Strategie-, Forschungs- und Produktteams.

Einzelplatzlizenz

$390
Einmaliger Kauf · PDF sofort verfügbar
  • Vollständiger 100-seitiger Bericht (PDF)
  • Alle 24 Kapitel & 16 Abbildungen
  • Das 40-Modelle-Brain-Score-Verzeichnis
  • Einzelplatzlizenz
  • Kostenlose Updates während des gesamten Zyklus 2026
Einzellizenz kaufen →

Unternehmenslizenz

$1,590
Einmaliger Kauf · Interne Verteilungsrechte
  • Alles aus der Einzelplatzlizenz
  • Unbegrenzt viele interne Nutzer in einer Organisation
  • Zitierrecht in internen Strategiedokumenten
  • Bevorzugter E-Mail-Support
  • Optionaler 60-minütiger Briefing-Call mit den Autoren
Unternehmenslizenz kaufen →
Die gezeigten Preise sind der empfohlene Startwert (analog zum Marktbericht, ~4-facher Multiplikator von Einzel- zu Unternehmenslizenz). Leicht anpassbar.
Fragen

Häufig gestellte Fragen

Was genau ist ein humanoides Weltmodell?
Ein humanoides Weltmodell ist ein Foundation-Modell, das lernt, wie sich eine Umgebung verändert, sodass ein Roboter die Folgen einer Handlung vorhersagen – und sich vorstellen – kann, bevor er sie ausführt. Der Bericht erklärt, wie sich humanoide Weltmodelle von Vision-Language-Action-Modellen (VLA) unterscheiden, und warum sich das Feld in diese Richtung bewegt.
Für wen ist der Bericht gedacht?
Investoren und Unternehmensstrategie-Teams, Robotik- und KI-Ingenieure, Foundation-Model-Entwickler sowie Humanoid-Hersteller und Zulieferer, die die “Gehirn”-Schicht des Stacks bewerten.
Wie unterscheidet sich das vom Marktbericht und vom Lieferketten-Bericht?
Der Marktbericht und der Lieferketten-Bericht decken den gesamten Markt und die Hardware ab. Dieser Bericht geht tief in die Intelligenzschicht – humanoide Weltmodelle, VLAs, die Architekturen und Akteure sowie ein unabhängiges Verzeichnis von 40 Modellen.
Was ist der Brain Score?
Die redaktionelle 0–10-Bewertung jedes Modells durch humanoid.guide über zehn Fähigkeiten hinweg – Fortbewegung, Ganzkörpersteuerung, Manipulation, Navigation, Schlussfolgern, Sim-to-Real, Embodiment-Transfer, Echtzeit-Inferenz und Langfristplanung.
Was ist die Methodik?
Der Bericht fasst veröffentlichte Modellergebnisse, Benchmarks und primäre Branchenquellen zusammen, wobei jede Aussage belegt ist und ein vollständiger Quellenindex im Anhang enthalten ist. Brain Scores sind redaktionelle Eigenbewertungen von humanoid.guide.
Wird er aktualisiert?
Ja – Käufer erhalten während des gesamten Zyklus 2026 kostenlose Updates, während sich das Feld weiterentwickelt.
Kann ich eine Vorschau erhalten?
Ja – nehmen Sie Kontakt auf für ein Muster oder ein Briefing.
Das nächste Plattform-Rennen

Die Gehirne werden gerade jetzt neu gebaut.

Verstehen Sie die Architekturen, die Akteure und den Zeitplan, bevor sich das Feld im Zeitfenster 2026–2030 konsolidiert.

humanoid.guide
Foundation Models · World Models Report 2026
Über diesen Bericht Humanoid Foundation Models – der World Models Report 2026 ist eine unabhängige, datenbasierte Studie zur Intelligenzschicht der humanoiden Robotik von humanoid.guide. Er fasst veröffentlichte Modellergebnisse, Benchmarks und primäre Branchenquellen zusammen, wobei jede Aussage belegt ist; Brain Scores sind redaktionelle 0–10-Eigenbewertungen von humanoid.guide. Einzelplatz- und Unternehmenslizenzen sind oben erhältlich. Entdecken Sie unsere gesamte Forschung auf humanoid.guide.

Neu! Marktbericht 2026 für humanoide Roboter

198 Seiten exklusiver Einblicke von globalen Robotik-Experten — Finanzierungstrends, technologische Herausforderungen, führende Hersteller, Veränderungen in der Lieferkette sowie Umfragen und Prognosen zu künftigen humanoiden Anwendungen.

Aaron Saunders
Mit Einblicken von Aaron Saunders, ehemaliger CTO von Boston Dynamics,
jetzt Google DeepMind
Bericht herunterladen
Neuer Bericht

Die Lieferkette für humanoide Roboter

Lieferantenstrategie und Marktpositionierung 2026–2027

Bericht herunterladen