《类人机器人基础模型报告》
Humanoid Foundation Models
大脑正在被重新构建——从VLA到预测式世界模型。
人形机器人世界模型是具身智能的全新大脑。将感知转化为行动的系统,正从视觉-语言-动作模型转向预测式世界模型——让机器人在行动之前就能“想象”该行动可能带来的后果。
本报告从头到尾梳理这一转变,独立评测了40个具有重要意义的基础模型,并冷静地追问:这项技术究竟何时才能真正做到可靠。
获取免费预览
购买前,先阅读执行摘要,并抢先浏览40个模型Brain Score目录的样本内容——以PDF形式发送至您的邮箱。
为什么是智能层——为什么是现在
硬件正在走向整合,而如今真正开放的竞争在于“大脑”。从VLA到人形机器人世界模型的转变,是以“月”而非“年”为单位发生的,最终胜出的架构将决定整个技术栈的走向。本报告将为六类读者说明正在发生的变化、谁走在前面,以及这一切究竟意味着什么。
投资者与企业战略部门
138亿美元融资热潮正流向何处,哪些架构正在胜出,以及如何解读那些提前数年为营收定价的估值。
机器人与AI工程师
四大架构范式、System 1与System 2的融合趋势,以及该领域为何正从VLA转向预测式世界模型。
基础模型开发者
数据护城河、具身数据的缩放定律、仿真与仿真到现实迁移——以及开源挑战者正在哪些方面缩小差距。
人形机器人厂商与供应商
该授权使用还是自研“大脑”,西方模型搭载中国身体这一分裂式技术栈的现实,以及支撑这一切的算力基础。
政策与算力团队
出口管制、国家支持的规模化扩张,以及决定谁能训练、谁只能组装的地缘政治格局。
押注具身智能的所有人
一份独立而冷静的能力、安全性与时间线解读——既非炒作宣传,也非片面批判。
最令人兴奋的构想——也是最不成熟的构想
人形机器人世界模型是机器人学习领域最令人兴奋的构想,同时也是最不成熟的构想。这些进展是真实存在的:预测式的世界-动作架构泛化能力较VLA基线提升逾一倍,基于视频训练的策略如今已在操作类基准测试中名列前茅,具身数据也开始展现出清晰的缩放定律。
但演示不等于实际部署。按照我们的基准情景,在非结构化环境中实现可靠、无人值守的通用自主能力,大约要等到2028至2030年——制约因素与其说是理念不足,不如说是最后10%的可靠性、安全性验证,以及从实验室到实际场景之间的鸿沟。较可能出现的均衡状态是一种分裂式技术栈:西方大脑搭载在中国制造的身体之上。真正的问题不在于世界模型是否会重塑具身智能,而在于当那一天到来时,究竟由谁掌控其架构、数据与算力。
四大范式
在“世界模型”这一旗号之下,实际存在四种截然不同的动作生成方式。本报告依据两个维度对其进行分类——离散控制与连续控制之分,以及模型是否真正预测未来——并说明为何最强的系统正趋向于一种“双速”设计。
自回归式
像语言模型一样输出离散的动作token。简单且通用,但缺乏对世界将如何变化的显式建模。
扩散模型 / 流匹配
通过去噪生成平滑、连续的动作轨迹。是运行频率超过200Hz的快速“System 1”层的基础。
潜在世界模型(JEPA)
在紧凑的潜在空间中预测环境将如何演变,使机器人能够针对“想象中的未来”而非原始像素进行规划。
世界-动作模型(WAM)
将连续控制与世界预测相结合——目前为止最有效的方案,泛化能力较VLA基线提升逾一倍以上。
公正的评判需要兼顾两方面
本报告将真实的进展与尚未解决的失败案例并列呈现,并为这一转折点标注时间——帮助您分辨真正的能力与仅仅是一场精彩的演示。
进展所在
预测式架构、生成式模拟器,以及能让机器人在行动前先“想象”后果的JEPA类模型。
失败所在
幻觉、漂移、仿真到现实的差距,以及新出现的对齐风险——这些正是实际部署仍然困难的原因。
时间线
基准测试、单位成本交叉点,以及关于可靠通用模型究竟何时真正到来的基准情景。
报告内容一览
24章正文与16幅图表——一份关于人形机器人“大脑”的完整参考资料:涵盖架构、主要参与者、背后的算力与地缘政治,以及对能力、安全性与时间线的冷静解读。
基础篇
- 01 – 重塑物理AI
- 02 – 从VLA到世界模型
- 03 – 世界模型内部解析
- 04 – 四大架构范式
- 05 – JEPA与预测式架构
- 06 – 生成式世界模拟器
- 07 – 缩放定律与数据问题
模型与厂商
- 08 – 基础模型I:NVIDIA的平台
- 09 – 基础模型II:挑战者们
- 10 – 人形机器人制造商
- 11 – 训练数据与数据护城河
- 12 – 仿真与仿真到现实迁移
算力与地缘政治
- 13 – 算力与基础设施
- 14 – 美国:创新对规模
- 15 – 中国:国家支持的规模化
- 16 – 欧洲、日本与韩国
- 17 – 地缘政治
应用与评测
- 18 – 工业应用
- 19 – 家用与服务机器人
- 20 – 基准测试与评估
- 21 – 优势、短板与安全性
展望
- 22 – 商业与投资
- 23 – 情景展望
- 24 – 行动指南与2026–2030关键窗口期
Brain Score 目录
humanoid.guide 持续追踪的全部40个基础模型——每个模型均在十项能力维度上独立评分(0至10分),让您一目了然地纵览整个行业。黄色代表该模型具备此项能力。
移动
全身控制
双手协同
精细操作
导航
推理
仿真到现实
跨本体迁移
实时性
长时程规划16幅清晰图表,尽在报告之中
每一章都将深入的论述与战略、工程团队用于内部沟通研究结论的可视化框架相结合。以下预览图特意做了模糊处理——完整、清晰并附带底层数据的版本将随报告一并提供。






常见问题解答
- 人形机器人世界模型究竟是什么?
- 人形机器人世界模型是一种基础模型,它学习环境如何变化,从而使机器人能够在行动之前预测——并“想象”——该行动可能带来的后果。报告解释了人形机器人世界模型与视觉-语言-动作(VLA)模型的区别,以及该领域为何正朝这一方向转变。
- 这份报告适合哪些读者?
- 适合投资者与企业战略团队、机器人与AI工程师、基础模型开发者,以及正在评估技术栈“大脑”层的人形机器人厂商与供应商。
- 这与Market Report和Supply Chain报告有何不同?
- Market Report 与 Supply Chain报告 涵盖整个市场与硬件层面。本报告则深入探讨智能层——人形机器人世界模型、VLA、相关架构与参与者,并提供一份独立的40个模型目录。
- 什么是Brain Score?
- 这是humanoid.guide对每个模型在移动、全身控制、操作、导航、推理、仿真到现实、跨本体迁移、实时推理与长时程规划这十项能力上给出的0至10分编辑评分。
- 研究方法是什么?
- 本报告综合了已公开的模型结果、基准测试数据及一手行业资料,每一项论断均标注出处,并在附录中提供完整的引用索引。Brain Score为humanoid.guide自主给出的编辑评分。
- 报告会更新吗?
- 会——购买者可在2026年周期内,随着行业格局的变化免费获得更新。
- 可以获取预览版吗?
- 可以——如需样章或简报,请联系我们。
