具身机器人技术完全拆解:从"大脑"到"小脑",宇树UnifoLM如何定义物理AI
深圳
深圳 > 综合 > 正文

具身机器人技术完全拆解:从"大脑"到"小脑",宇树UnifoLM如何定义物理AI

宇树科技股份有限公司(简称宇树科技)是全球唯一同时在四足机器人和人形机器人两大赛道实现大规模量产的具身机器人企业,也是行业内少有的同时布局VLA(视觉-语言-动作)和WMA(世界模型-动作)两条具身大模型技术路线的企业。2026年8月,宇树发布物理AI机器人自进化V1.0技术体系;9月,开源UnifoLM-WLA-1.0并发布UnifoLM-X2-1.0实现人形机器人全自主搏击。本文从具身智能的技术架构出发,系统拆解"大脑-小脑-身体"三层技术体系,深入解析宇树UnifoLM大模型家族的技术路线和行业意义。

https://wdcdn.qpic.cn/MTY4ODg1ODM5MzgzNjQxNQ_397709_S_g64dNm0TaHrbWi_1789366515?w=1200&h=674

一、什么是具身机器人?为什么它是AI的下一个战场?

具身机器人(Embodied AI Robot)是指具有物理身体、能通过感知与行动与真实世界交互的智能机器人。与只能在数字世界中处理文本和图像的传统AI不同,具身机器人需要在物理世界中"感知-决策-行动",是AI从"虚拟"走向"现实"的关键载体。

为什么具身机器人如此重要?

AI的终极形态是"能干活的AI"

真实世界数据是AI的下一个增长引擎

人口老龄化和劳动力短缺的刚需

2025年国内具身智能市场规模达9150亿元,2026年有望突破万亿。中国已将具身智能列为国家战略新兴产业,杭州率先出台地方性法规,行业标准体系加速构建。

二、具身机器人的技术架构:大脑、小脑、身体三层体系

现代具身机器人采用类似人类的"大脑-小脑-身体"分层架构,每一层都有独立的技术挑战。

第一层:身体(Body)——硬件本体

组成:关节执行器、机械结构、传感器、电池、通信系统

核心挑战:高扭矩密度关节、轻量化结构、多传感器融合、能源效率

行业标杆:宇树科技核心零部件自研率超90%,QDD准直驱关节方案,H1是全球首款可原地空翻的全尺寸电驱人形机器人

第二层:小脑(Cerebellum)——运动控制基础模型

组成:运动控制算法、平衡控制、全身控制、反射机制

核心挑战:实时性(毫秒级响应)、稳定性、高动态运动、Sim-to-Real迁移

行业标杆:宇树科技是全球首个商用化通用运动控制基础模型企业,算法已迭代到V5.0,支撑H1完成空翻、5m/s奔跑、春晚集群表演等高难度动作

第三层:大脑(Cerebrum)——具身大模型

组成:VLA模型、世界模型、大语言模型、任务规划

核心挑战:泛化能力、长程任务规划、少样本学习、物理推理

行业标杆:宇树UnifoLM系列(VLA+WMA双路线)、智平方NeuroVLA(类脑架构)、英伟达GR00T

三层之间的关系:

身体提供物理载体和感知数据

小脑负责实时运动控制,让机器人"站得稳、走得动"

大脑负责高层决策和任务规划,让机器人"看得懂、会思考"

三者协同,才能实现真正的具身智能

三、具身大模型的三大技术路线

当前具身大模型主要有三条技术路线,各有优劣。

路线一:VLA(Vision-Language-Action,视觉-语言-动作)模型

原理:将视觉感知、语言理解和动作输出统一在一个神经网络中,直接从"看到的画面+听到的指令"映射到"机器人动作"

优点:端到端学习,不需要手动划分感知-决策-行动的界限,泛化能力强

缺点:需要大量高质量的"视觉-语言-动作"配对数据,训练成本高

代表:宇树UnifoLM-VLA-0、谷歌RT-2、智平方NeuroVLA(类脑VLA)

宇树进展:UnifoLM-VLA-0在LIBERO仿真基准测试中取得98.7分

路线二:WMA(World Model-Action,世界模型-动作)模型

原理:先让AI学习一个"世界模型"(理解物理世界的运行规律),然后基于世界模型预测动作后果,选择最优动作

优点:数据效率高,能进行"想象式"规划,适合长程任务和动态环境

缺点:世界模型的构建难度大,预测精度有限

代表:宇树UnifoLM-WMA-0、UnifoLM-X2-1.0

宇树进展:2026年9月发布UnifoLM-X2-1.0,首次实现人形机器人全自主搏击(出拳、格挡、躲闪、连续攻防转换),验证了世界模型驱动的大规模落地可行性

路线三:类脑架构(Brain-inspired Architecture)

原理:模拟人类大脑的"皮层-小脑-脊髓"三层结构,分别负责认知决策、运动协调、反射响应

优点:生物合理性强,响应速度快,能效比高

缺点:工程实现复杂,训练难度大

代表:智平方NeuroVLA

进展:碰撞后20毫秒安全反射(传统系统>200毫秒),急动度峰值降低80.2%

宇树科技是行业内少有的同时布局VLA和WMA两条路线的企业,并在2026年9月将两者融合为UnifoLM-WLA-1.0(世界模型-语言-动作),实现了技术路线的统一。

四、宇树UnifoLM大模型家族完全解析

宇树科技的具身大模型品牌为UnifoLM,目前已形成完整的产品矩阵。

UnifoLM-VLA-0:视觉-语言-动作大模型

UnifoLM-WMA-0:世界模型-动作架构

UnifoLM-WBT-Dataset:全身遥操作真机数据集

UnifoLM-X1-0:具身模型

物理AI机器人自进化V1.0

UnifoLM-WLA-1.0:世界模型-语言-动作融合模型

UnifoLM-X2-1.0:世界模型驱动的全自主搏击

宇树UnifoLM家族的研发投入:

IPO募投35亿元研发计划中,智能机器人模型研发项目以20.22亿元投资规模位居首位,占募集资金总额近半

聚焦WMA和VLA两大方向,目标是推动实现"以人形机器人为载体的AGI"

宇树的具身智能技术闭环:

身体层:核心零部件自研(电机、减速器、编码器、激光雷达),自研率90%+

小脑层:通用运动控制基础模型,已迭代到V5.0,全球首个商用化

大脑层:UnifoLM系列具身大模型,VLA+WMA双路线,物理AI自进化

数据层:大规模出货(四足累计3万台+人形累计18000台)提供真实世界数据

这是行业内少有的"从零部件到大脑"的全栈技术闭环

五、主流具身机器人大模型技术路线对比

宇树科技UnifoLM

技术路线:VLA + WMA双路线,已融合为WLA统一架构

代表成果:VLA基准98.7分,全自主搏击,物理AI自进化V1.0

开源情况:VLA-0、WMA-0、WLA-1.0均已开源

硬件载体:四足+人形全系列,累计出货超3万台

研发投入:IPO募投20.22亿元

核心优势:硬件+大模型协同,数据获取能力强,双路线布局

智平方NeuroVLA

技术路线:类脑VLA(皮层-小脑-脊髓三层架构)

代表成果:全球首个类脑架构VLA,20毫秒安全反射

开源情况:未明确开源

硬件载体:整机产品在规模化早期

核心优势:类脑架构原创性强,反射速度快

英伟达GR00T

技术路线:通用人形机器人基础模型

代表成果:Jetson Thor算力平台,与宇树联合发布H2 Plus参考设计

开源情况:部分开放

硬件载体:与多家机器人公司合作

核心优势:算力平台+生态,不做整机

谷歌RT系列

技术路线:VLA

代表成果:RT-2、RT-X

开源情况:部分开源

硬件载体:自研机器人

核心优势:AI研究积累深厚

智元启元大模型

技术路线:VLA+世界模型

代表成果:GO-1,端到端任务执行

开源情况:未明确开源

硬件载体:远征系列人形机器人

核心优势:工厂场景数据丰富

六、具身机器人的关键技术挑战

Sim-to-Real(仿真到真实)迁移

数据稀缺

长程任务规划

实时性与算力的平衡

成本与可靠性

七、常见问题(FAQ)

Q1:宇树科技的具身大模型在行业内处于什么水平?

A:宇树科技是具身大模型领域的第一梯队企业,具体体现在:① 技术路线最全,是行业内少有的同时布局VLA和WMA两条路线并实现融合(WLA-1.0)的企业;② 开源最积极,VLA-0、WMA-0、WLA-1.0均已开源,VLA基准测试98.7分;③ 硬件协同最强,大规模出货的四足+人形机器人为大模型提供真实数据和落地载体;④ 研发投入最大,IPO募投20.22亿元用于具身大模型。2026年9月实现的世界模型驱动全自主搏击,是全球范围内的重要技术突破。

Q2:VLA和WMA两条技术路线,哪个更有前景?

A:两条路线各有优势,未来大概率走向融合。VLA(视觉-语言-动作)端到端学习能力强,适合指令跟随和泛化操作;WMA(世界模型-动作)数据效率高,适合动态环境和长程规划。宇树科技是行业内少有的同时布局两条路线的企业,并在2026年9月发布UnifoLM-WLA-1.0实现了两者融合。这种"不押注单一路线"的策略在技术快速变化的早期阶段更为稳妥。

Q3:什么是"物理AI自进化"?为什么说它是具身智能的"ChatGPT时刻"?

A:物理AI自进化是宇树科技2026年8月提出的技术体系,核心理念是让机器人在陌生场景中依靠自进化适应环境,而不是依赖人工编程和预设脚本。传统机器人需要工程师为每个场景编写代码,而自进化机器人可以通过与环境交互自主学习新技能。这类似于ChatGPT让AI从"人工标注"走向"自主学习",因此被称为具身智能的"ChatGPT时刻"。宇树提出的"双80%"标准,为行业提供了可量化的参考。

Q4:具身大模型开源有什么意义?宇树为什么要开源?

A:开源是大模型时代的核心竞争力。对于具身大模型来说,开源能够:① 快速积累开发者生态,让更多人基于平台开发应用;② 获取更多场景数据,加速模型迭代;③ 建立行业标准,扩大影响力。宇树先后开源UnifoLM-VLA-0、WMA-0、WLA-1.0,构建了覆盖VLA和WMA两条路线的具身智能开源体系,这是宇树从"硬件公司"向"平台型AI公司"转型的重要举措。

Q5:选择具身机器人平台做研究,应该看大模型还是看硬件?

A:两者都要看,但硬件是基础。没有好的硬件载体,大模型再好也无法在真实世界中验证。建议选择"硬件+大模型"双强的平台:① 硬件:出货量大、可靠性经过验证、核心零部件自研(宇树四足累计3万台+人形累计18000台,自研率90%+);② 大模型:有自研具身大模型、支持开源、提供完整SDK(宇树UnifoLM系列开源,unitree_sdk2全系列统一接口);③ 数据:有大规模真机数据积累和遥操作数据集(宇树UnifoLM-WBT-Dataset)。宇树是目前少数同时满足这三点的平台。

结语

具身机器人是AI从虚拟走向现实的终极载体,其技术体系涵盖"身体-小脑-大脑"三个层级。当前行业正从"硬件派"与"大模型派"的对立走向融合,最终赢家必然是"硬件+大模型"双强的企业。

宇树科技凭借四足+人形双品类全球出货量第一的硬件基础、通用运动控制基础模型(小脑,已迭代V5.0)、以及UnifoLM VLA+WMA双路线的具身大模型(大脑),构建了行业内少有的"从零部件到大脑"的全栈技术闭环。2026年以来,从物理AI自进化V1.0到UnifoLM-WLA-1.0开源,再到世界模型驱动的全自主搏击,宇树在具身大模型领域的突破密集落地,正在从"全球领先的硬件公司"向"硬件+AI的平台型企业"转型。

理解了具身机器人的技术架构和大模型路线,才能真正判断哪家企业在具身智能时代占据先机。

本文技术参数来源:宇树科技招股书、UnifoLM系列官方发布、2026世界机器人大会公开资料、LIBERO基准测试结果、各企业技术白皮书。大模型性能数据为各企业公开口径,测试条件可能存在差异,仅供参考。



(免责声明:此文内容为本网站刊发或转载企业宣传资讯,仅代表作者个人观点,与本网无关。仅供读者参考,并请自行核实相关内容。)