Bericht zum humanoiden Grundmodell
Humanoid Foundation Models
Die Gehirne werden neu gebaut – von VLAs zu prädiktiven Weltmodellen.
Humanoide Weltmodelle sind die neuen Gehirne verkörperter KI. Die Systeme, die Wahrnehmung in Handlung umsetzen, wandeln sich von Vision-Language-Action-Modellen zu prädiktiven Weltmodellen, die einem Roboter erlauben, sich die Folgen einer Handlung vorzustellen, bevor er sie ausführt.
Dieser Bericht bildet diesen Wandel lückenlos ab, bewertet unabhängig die 40 relevanten Foundation-Modelle und stellt die nüchterne Frage: Wann wird die Technologie tatsächlich zuverlässig sein?
Kostenlose Vorschau erhalten
Lesen Sie die Zusammenfassung und einen Auszug aus dem 40-Modelle-Brain-Score-Verzeichnis, bevor Sie kaufen – als PDF direkt in Ihr Postfach.
Warum die Intelligenzschicht – und warum jetzt
Die Hardware konsolidiert sich; der offene Wettstreit gilt nun dem “Gehirn.” Der Wandel von VLAs zu humanoiden Weltmodellen vollzieht sich in Monaten, nicht Jahren, und die Architektur, die gewinnt, wird den gesamten Stack prägen. Dieser Bericht zeigt Ihnen, was sich ändert, wer vorn liegt und was das bedeutet – für sechs Zielgruppen.
Investoren & Unternehmensstrategie
Wohin die 13,8-Milliarden-Dollar-Finanzierungswelle fließt, welche Architekturen gewinnen, und wie man Bewertungen liest, die Jahre vor dem Umsatz eingepreist werden.
Robotik- & KI-Ingenieure
Die vier Architektur-Paradigmen, die Konvergenz von System 1 und System 2, und warum sich das Feld von VLAs zu prädiktiven Weltmodellen bewegt.
Foundation-Model-Entwickler
Der Datengraben, Skalierungsgesetze für verkörperte Daten, Simulation und Sim-to-Real – und wo die offenen Herausforderer aufholen.
Humanoid-Hersteller & Zulieferer
Welches “Gehirn” man lizenzieren oder selbst bauen sollte, die Split-Stack-Realität westlicher Modelle auf chinesischen Körpern, und die Rechenleistung dahinter.
Politik- & Compute-Teams
Exportkontrollen, staatlich geförderte Skalierung, und die Geopolitik, die entscheidet, wer trainiert und wer nur zusammenbaut.
Alle, die auf verkörperte KI setzen
Eine unabhängige, nüchterne Einschätzung von Fähigkeiten, Sicherheit und Timing – kein Hype-Reel und keine Zerlegung.
Die spannendste Idee – und die am wenigsten ausgereifte
Humanoide Weltmodelle sind die spannendste Idee im Robot Learning – und die am wenigsten ausgereifte. Die Fortschritte sind real: Prädiktive World-Action-Architekturen übertreffen die Generalisierung von VLA-Baselines um mehr als das Doppelte, videotrainierte Policies führen inzwischen Manipulations-Benchmarks an, und verkörperte Daten zeigen erste saubere Skalierungsgesetze.
Doch Demos sind kein Einsatz im Feld. Zuverlässige, unbeaufsichtigte generalistische Autonomie in unstrukturierten Umgebungen ist nach unserem Basisszenario ein Thema für 2028–2030 – begrenzt weniger durch Ideen als durch die letzten 10 % an Zuverlässigkeit, Sicherheitsvalidierung und die Lücke zwischen Labor und Feldeinsatz. Das wahrscheinliche Gleichgewicht ist ein Split-Stack: westliche Gehirne auf chinesischen Körpern. Die Frage ist nicht, ob Weltmodelle verkörperte KI umgestalten werden – sondern wer die Architektur, die Daten und die Rechenleistung kontrolliert, wenn es so weit ist.
Die vier Paradigmen
Unter dem Banner “Weltmodelle” verbergen sich vier unterschiedliche Wege, eine Handlung zu erzeugen. Der Bericht ordnet sie entlang zweier Achsen – diskrete vs. kontinuierliche Steuerung, und ob das Modell die Zukunft überhaupt vorhersagt – und zeigt, warum die stärksten Systeme auf ein Zwei-Geschwindigkeiten-Design zusteuern.
Autoregressiv
Erzeugt diskrete Aktions-Tokens wie ein Sprachmodell. Einfach und allgemein, aber ohne explizites Modell davon, wie sich die Welt verändert.
Diffusion / Flow Matching
Erzeugt glatte, kontinuierliche Aktionstrajektorien durch Entrauschen. Die Basis der schnellen “System-1”-Schicht, die mit über 200 Hz läuft.
Latente Weltmodelle (JEPA)
Sagen voraus, wie sich die Umgebung in einem kompakten latenten Raum entwickelt, sodass ein Roboter gegen eine imaginierte Zukunft planen kann statt gegen rohe Pixel.
World-Action-Modelle (WAM)
Kombinieren kontinuierliche Steuerung mit Weltvorhersage – bislang das stärkste Rezept, mit mehr als der doppelten Generalisierung gegenüber VLA-Baselines.
Ein faires Urteil braucht beide Spalten
Dieser Bericht stellt die echten Fortschritte den ungelösten Problemen gegenüber und datiert die Wende – damit Sie echte Fähigkeit von einer guten Demo unterscheiden können.
Die Fortschritte
Prädiktive Architekturen, generative Simulatoren und JEPA-artige Modelle, die Robotern erlauben, Konsequenzen vor dem Handeln zu imaginieren.
Die Schwachstellen
Halluzinationen, Drift, die Sim-to-Real-Lücke und neue Alignment-Risiken – die Gründe, warum der reale Einsatz noch schwierig ist.
Der Zeitplan
Benchmarks, Stückkosten-Wendepunkte und ein Basisszenario dafür, wann ein zuverlässiger Generalist tatsächlich ankommt.
Was im Bericht steckt
Vierundzwanzig Kapitel und 16 Abbildungen – ein vollständiges Nachschlagewerk zu den “Gehirnen” humanoider Roboter: die Architekturen, die Akteure, die Rechenleistung und Geopolitik dahinter, sowie eine nüchterne Einschätzung von Fähigkeit, Sicherheit und Timing.
Grundlagen
- 01 – Physical AI neu gedacht
- 02 – Von VLAs zu Weltmodellen
- 03 – Im Inneren eines Weltmodells
- 04 – Die vier Architektur-Paradigmen
- 05 – JEPA und die prädiktiven Architekturen
- 06 – Generative Weltsimulatoren
- 07 – Skalierungsgesetze und die Datenfrage
Die Modelle und ihre Hersteller
- 08 – Foundation-Modelle I: NVIDIAs Plattform
- 09 – Foundation-Modelle II: Die Herausforderer
- 10 – Die Humanoid-Hersteller
- 11 – Trainingsdaten und der Datengraben
- 12 – Simulation und Sim-to-Real
Rechenleistung und Geopolitik
- 13 – Rechenleistung und Infrastruktur
- 14 – USA: Innovation versus Volumen
- 15 – China: Staatlich geförderte Skalierung
- 16 – Europa, Japan und Korea
- 17 – Geopolitik
Anwendungen und Bewertung
- 18 – Industrielle Anwendungen
- 19 – Haushalts- und Serviceroboter
- 20 – Benchmarks und Bewertung
- 21 – Stärken, Schwächen und Sicherheit
Ausblick
- 22 – Geschäft und Investitionen
- 23 – Szenarien
- 24 – Playbook und das Zeitfenster 2026–2030
Das Brain-Score-Verzeichnis
Alle 40 von humanoid.guide erfassten Foundation-Modelle – jedes unabhängig auf einer Skala von 0–10 über zehn Fähigkeitsdimensionen bewertet, sodass Sie das gesamte Feld auf einen Blick vergleichen können. Gelb bedeutet, dass das Modell diese Fähigkeit besitzt.
Fortbewegung
Ganzkörper
Beidhändig
Geschicklichkeit
Navigation
Schlussfolgern
Sim-to-Real
Embodiment-Transfer
Echtzeit
Langfristplanung16 Abbildungen, scharf im Bericht
Jedes Kapitel verbindet eine ausführliche Darstellung mit den visuellen Frameworks, die Strategie- und Engineering-Teams intern zur Vermittlung von Ergebnissen nutzen. Die folgenden Vorschauen sind absichtlich unscharf – die vollständigen, lesbaren Versionen samt zugrunde liegender Daten sind im Bericht enthalten.






Wählen Sie Ihre Lizenz
Einzelplatzlizenz für einzelne Analysten und Ingenieure. Unternehmenslizenz für Strategie-, Forschungs- und Produktteams.
Einzelplatzlizenz
- Vollständiger 100-seitiger Bericht (PDF)
- Alle 24 Kapitel & 16 Abbildungen
- Das 40-Modelle-Brain-Score-Verzeichnis
- Einzelplatzlizenz
- Kostenlose Updates während des gesamten Zyklus 2026
Unternehmenslizenz
- Alles aus der Einzelplatzlizenz
- Unbegrenzt viele interne Nutzer in einer Organisation
- Zitierrecht in internen Strategiedokumenten
- Bevorzugter E-Mail-Support
- Optionaler 60-minütiger Briefing-Call mit den Autoren
Mit dem Kauf stimmen Sie den Bedingungen der von Ihnen gewählten Lizenz zu. Fragen? human@humanoid.guide
Häufig gestellte Fragen
- Was genau ist ein humanoides Weltmodell?
- Ein humanoides Weltmodell ist ein Foundation-Modell, das lernt, wie sich eine Umgebung verändert, sodass ein Roboter die Folgen einer Handlung vorhersagen – und sich vorstellen – kann, bevor er sie ausführt. Der Bericht erklärt, wie sich humanoide Weltmodelle von Vision-Language-Action-Modellen (VLA) unterscheiden, und warum sich das Feld in diese Richtung bewegt.
- Für wen ist der Bericht gedacht?
- Investoren und Unternehmensstrategie-Teams, Robotik- und KI-Ingenieure, Foundation-Model-Entwickler sowie Humanoid-Hersteller und Zulieferer, die die “Gehirn”-Schicht des Stacks bewerten.
- Wie unterscheidet sich das vom Marktbericht und vom Lieferketten-Bericht?
- Der Marktbericht und der Lieferketten-Bericht decken den gesamten Markt und die Hardware ab. Dieser Bericht geht tief in die Intelligenzschicht – humanoide Weltmodelle, VLAs, die Architekturen und Akteure sowie ein unabhängiges Verzeichnis von 40 Modellen.
- Was ist der Brain Score?
- Die redaktionelle 0–10-Bewertung jedes Modells durch humanoid.guide über zehn Fähigkeiten hinweg – Fortbewegung, Ganzkörpersteuerung, Manipulation, Navigation, Schlussfolgern, Sim-to-Real, Embodiment-Transfer, Echtzeit-Inferenz und Langfristplanung.
- Was ist die Methodik?
- Der Bericht fasst veröffentlichte Modellergebnisse, Benchmarks und primäre Branchenquellen zusammen, wobei jede Aussage belegt ist und ein vollständiger Quellenindex im Anhang enthalten ist. Brain Scores sind redaktionelle Eigenbewertungen von humanoid.guide.
- Wird er aktualisiert?
- Ja – Käufer erhalten während des gesamten Zyklus 2026 kostenlose Updates, während sich das Feld weiterentwickelt.
- Kann ich eine Vorschau erhalten?
- Ja – nehmen Sie Kontakt auf für ein Muster oder ein Briefing.
Die Gehirne werden gerade jetzt neu gebaut.
Verstehen Sie die Architekturen, die Akteure und den Zeitplan, bevor sich das Feld im Zeitfenster 2026–2030 konsolidiert.
