「具身智能落地实战」系列第 2 篇
上一篇我们拆解了具身机器人的四大硬件系统,其中决策层被称为机器人的"大脑"。这个大脑到底是如何工作的?为什么近两年"VLA 模型"成为具身智能领域最热门的方向?本文从技术演进、核心原理、工程挑战三个维度,系统性拆解 VLA 模型,帮你理解具身智能的"大脑"是如何从"只会说话"进化到"能看会说还能动手"的。
引言:大模型的"身体"困境
2023 年以来,大语言模型(LLM)席卷全球,GPT、Claude、文心一言等产品让所有人都见识到了 AI 的语言能力。但一个尴尬的事实是:这些大模型再聪明,也只能"活在屏幕里"——它们能写代码、能写文章、能回答问题,但无法在物理世界中执行任何动作。
让 AI 拥有"身体",从虚拟智能走向具身智能,成为行业的下一个共识。而 VLA(Vision-Language-Action,视觉-语言-动作)模型,正是实现这一跨越的核心技术路径。
简单来说:LLM 解决了"听懂和说话"的问题,VLM 解决了"看懂图像"的问题,而 VLA 进一步解决了"把理解转化为动作"的问题。 它让 AI 第一次具备了"感知—理解—执行"的完整闭环。
一、从 LLM 到 VLA:大模型的进化之路
要理解 VLA,先要理解它是怎么一步步进化来的。大模型的演进,本质上是"模态"不断扩展的过程——从只能处理文字,到能看懂图像,再到能输出动作。
1.1 LLM:只会说话的大脑
LLM(Large Language Model,大语言模型)是一切的起点。它只接受一种输入:文字。也只产生一种输出:文字。
- 输入:一段文本(问题、指令、上下文)
- 输出:一段文本(回答、续写、总结)
- 能力:语言理解、逻辑推理、知识问答、代码生成
- 局限:看不到图像,更无法控制物理设备
LLM 就像一个博学的"盲人"——知识渊博、能说会道,但看不见周围的世界,也无法动手做任何事。
1.2 VLM:能看会说的大脑
VLM(Vision-Language Model,视觉-语言模型)在 LLM 的基础上增加了视觉输入能力。
- 输入:图像 + 文字
- 输出:文字
- 能力:图像描述、视觉问答、OCR 识别、图像推理
- 代表模型:GPT-4V、Gemini、Qwen-VL 等
VLM 就像一个"视力恢复"的博学之人——既能看懂图片里有什么,又能用语言描述和推理。但它依然只能"说",不能"做"。你给它看一张桌子上有杯子的照片,它能告诉你"这是一个红色的杯子,放在桌子右侧",但它无法控制一只机械臂去把杯子拿起来。
1.3 VLA:能看会说还能动手的大脑
VLA(Vision-Language-Action Model,视觉-语言-动作模型)在 VLM 的基础上,把输出从"文字"扩展到了"动作"。
- 输入:图像(机器人第一视角摄像头) + 文字(人类指令,如"把红色杯子拿起来")
- 输出:动作序列(机器人关节的运动轨迹、末端执行器的位姿变化、夹爪的开合指令)
- 能力:感知环境、理解指令、规划动作、控制执行
- 代表模型:Google RT-2、Octo、OpenVLA、π0 等
VLA 就像一个终于"长出了手"的人——能看、能听懂指令、还能亲自动手去完成任务。这是 AI 从"虚拟智能"走向"具身智能"的关键一步。
工程视角: 从 LLM 到 VLA 的演进,不是简单的"功能叠加",而是输出空间的根本变革。LLM 和 VLM 的输出都是离散的文字 Token,而 VLA 的输出是连续的、高维的机器人动作空间。如何把连续动作转化为大模型可以处理的离散 Token,是 VLA 技术的核心难点,我们在下一节详细展开。
二、VLA 的核心原理:动作是如何被"生成"的
理解了 VLA 是什么,接下来看它到底是怎么工作的。VLA 的核心思想可以用一句话概括:像生成文本一样生成动作。
2.1 端到端架构:从像素到动作
传统的机器人控制系统是"模块化"的——感知、规划、控制分别由不同的模块负责,模块之间通过固定的接口传递数据。就像一场接力赛:
```
摄像头图像 → 感知模块(识别物体)→ 规划模块(生成路径)→ 控制模块(执行动作)→ 机器人运动
```
而 VLA 是端到端的——一个模型直接从原始图像和语言指令,输出最终的机器人动作。中间没有显式的感知模块、规划模块和控制模块的拆分。就像一辆直通车:
```
摄像头图像 + 语言指令 → VLA 大模型 → 机器人动作
```
这种端到端架构的优势在于:
- 避免信息损失:模块化方案中,每个模块的输出都是对输入信息的"压缩",层层传递后信息损失严重。端到端方案直接从原始输入到最终输出,保留了更多信息。
- 泛化能力强:VLA 基于大规模预训练,具备强大的零样本和少样本泛化能力,能处理训练中没见过的新物体、新场景、新指令。
- 部署简洁:不需要维护多个模块和复杂的接口,一个模型搞定一切。
但端到端也带来了挑战——大模型原本是为了处理离散的文字 Token 设计的,而机器人动作是连续的、高维的。如何让大模型"生成"动作?答案是动作 Token 化。
2.2 动作 Token 化:把连续动作变成离散符号
大语言模型的本质是一个"下一个 Token 预测器"——给定前面的文字,预测下一个最可能出现的文字 Token。所有文字都被映射到一个固定的词表(Vocabulary)中,每个词对应一个唯一的 Token ID。
要让大模型生成动作,就必须把连续的机器人动作也转化为离散的 Token,放进词表里。这个过程就是动作 Token 化(Action Tokenization)。
具体怎么做?
第一步:动作空间离散化
机器人的动作通常是一个高维连续向量,例如一个 7 自由度机械臂的动作可能包含 7 个关节的角度、角速度、力矩,加上夹爪的开合度,总共十几个连续值。
把每个维度的连续取值范围(如关节角度 -180° 到 +180°)均匀切分成 N 个区间(如 256 个),每个区间对应一个离散的 Token。这样,一个连续的动作向量就被转化为一串离散的 Token ID。
第二步:动作序列建模
机器人完成一个任务通常需要多步动作(如伸手、靠近、抓取、抬起、移动、放下)。VLA 模型像生成文本一样,自回归地逐个生成动作 Token,每生成一组 Token 就对应一个时间步的机器人动作。
第三步:动作解码与执行
生成的离散动作 Token 被解码回连续的动作值,发送给机器人的控制器执行。控制器根据这些动作值驱动电机,完成物理运动。
工程视角: 动作 Token 化的粒度是一个关键的工程权衡。切得太粗(如每个维度只分 16 个区间),动作精度不够,机器人可能抓不准物体;切得太细(如每个维度分 1024 个区间),词表太大,模型训练难度和推理成本急剧上升。目前主流方案通常每个维度分 128-512 个区间,在精度和效率之间取平衡。
2.3 VLA 的推理流程:一张图 + 一句话 → 一串动作
理解了动作 Token 化,我们就可以完整描述 VLA 的推理流程了:
```
第1步:感知输入
├── 机器人第一视角摄像头拍摄当前场景图像
└── 人类通过语音或文本下达指令(如"把红色杯子放到托盘上")
第2步:多模态编码
├── 图像经过视觉编码器(ViT等)转化为视觉 Token 序列
├── 语言指令经过文本编码器转化为文本 Token 序列
└── 视觉 Token 和文本 Token 拼接,输入到大模型的 Transformer 中
第3步:动作生成
├── 大模型基于视觉和语言上下文,自回归地生成动作 Token
├── 每生成一组动作 Token,对应一个时间步的机器人运动指令
└── 持续生成直到任务完成或达到最大步数
第4步:动作执行
├── 动作 Token 解码为连续的关节角度/末端位姿/夹爪指令
├── 发送给机器人控制器,驱动电机执行
└── 执行后摄像头拍摄新的图像,进入下一轮推理循环
```
这个循环不断重复,直到任务完成。整个过程中,VLA 模型既是"大脑"(理解指令、规划动作),也是"小脑"(直接输出精确的运动控制指令)。
三、VLA vs 传统方案:为什么是范式革命
VLA 之所以被称为具身智能的"范式革命",是因为它从根本上改变了机器人智能的实现方式。我们用一个对比来直观感受。
3.1 传统模块化方案:接力赛
传统的工业机器人系统通常采用模块化架构:
| 模块 | 职责 | 输入 | 输出 |
|---|---|---|---|
| 感知模块 | 识别物体、检测位置 | 摄像头图像 | 物体类别、位置坐标 |
| 规划模块 | 生成运动路径、避障 | 物体位置、目标状态 | 关节轨迹、路径点 |
| 控制模块 | 执行运动、力控调节 | 关节轨迹 | 电机电流、力矩指令 |
每个模块独立开发、独立调试,模块之间通过定义好的接口传递数据。这就像一场接力赛——感知跑完第一棒,把棒交给规划,规划跑完第二棒,再交给控制。
优点: 可解释性强、每个模块可以独立优化、安全性容易保证(可以在规划层设置硬约束)。
缺点:
- 泛化能力差:换一个新物体、新场景,可能需要重新调参甚至重新开发模块
- 信息损失:每个模块的输出都是对输入的"压缩",层层传递后细节丢失
- 开发成本高:需要多个领域的专家(计算机视觉、运动规划、控制理论)协同开发
- 长尾场景覆盖难:非结构化环境中的各种意外情况,模块化方案很难穷举
3.2 VLA 端到端方案:直通车
VLA 用一个大模型替代了感知、规划、控制三个模块:
| 模块 | 职责 | 输入 | 输出 |
|---|---|---|---|
| VLA 大模型 | 感知+规划+控制 | 图像 + 语言指令 | 动作序列 |
优点:
- 泛化能力强:基于大规模预训练,能处理未见过的物体和场景
- 信息保留完整:直接从原始图像到动作,没有中间模块的信息损失
- 开发简洁:不需要维护多个模块,数据驱动,有数据就能训
- 自然语言交互:直接用人类语言下达指令,不需要编程或示教
缺点:
- 可解释性差:黑盒模型,很难解释"为什么输出这个动作"
- 安全性难保证:端到端模型可能输出意外动作,硬约束难以嵌入
- 推理延迟高:大模型推理需要时间,实时控制有挑战
- 数据需求大:需要大量高质量的机器人操作数据,获取成本高
3.3 对比总结
| 维度 | 传统模块化方案 | VLA 端到端方案 |
|---|---|---|
| 架构 | 感知→规划→控制,多模块接力 | 一个模型端到端 |
| 泛化能力 | 弱,新场景需重新调参 | 强,零样本/少样本泛化 |
| 可解释性 | 强,每个模块可独立分析 | 弱,黑盒模型 |
| 安全性 | 易保证,可在规划层设硬约束 | 难保证,需额外安全层 |
| 实时性 | 好,模块轻量、延迟低 | 挑战,大模型推理慢 |
| 开发成本 | 高,需多领域专家协同 | 中,数据驱动,但需大量数据 |
| 适用场景 | 结构化工业场景(流水线、固定工位) | 非结构化场景(家庭、仓储、复杂巡检) |
工程视角: VLA 不是要完全替代传统方案,而是各有适用场景。在高度结构化的工业流水线(如汽车焊接、电子组装),传统方案精度高、速度快、成本低,依然是最优选择。但在非结构化、需要灵活应对变化的场景(如家庭服务、仓储分拣、复杂巡检),VLA 的泛化能力优势明显。未来的趋势很可能是"VLA 做高层决策 + 传统控制做底层执行"的混合架构——VLA 负责理解指令、规划任务级动作,传统控制器负责精确的轨迹跟踪和力控,两者取长补短。
四、工程落地的五大挑战
VLA 的前景很美好,但从实验室 demo 到工业现场落地,还有很长的路要走。以下是五个最核心的工程挑战。
4.1 数据稀缺:机器人操作数据是黄金
大模型的能力来自大规模数据。LLM 有互联网上海量的文本数据,VLM 有图文配对数据,但 VLA 需要的是机器人操作数据——图像、指令、动作三者配对的数据。这种数据极其稀缺,原因在于:
- 采集成本高:需要真实机器人、真实场景、人工示教或遥操作,每一条数据都有物理成本
- 采集速度慢:机器人执行一个任务可能需要几十秒,一小时只能采集几十条数据
- 数据质量要求高:动作数据必须精确同步(图像、指令、关节角度必须时间对齐),稍有偏差就会影响训练效果
- 多样性难保证:不同机器人、不同场景、不同物体的数据很难统一
目前行业的应对策略包括:仿真数据合成(Sim-to-Real)、人类遥操作数据采集、开源数据集共享(如 Open X-Embodiment)等,但数据稀缺依然是 VLA 落地的最大瓶颈。
4.2 Sim-to-Real:仿真到现实的鸿沟
既然真实数据难采集,能不能在仿真环境中生成大量数据,然后迁移到真实机器人上?这就是 Sim-to-Real(仿真到现实迁移)。
但仿真和现实之间存在巨大的差距(Reality Gap):
- 物理差距:仿真中的物体质量、摩擦系数、弹性与现实不完全一致
- 视觉差距:仿真渲染的图像与真实摄像头拍摄的图像在光照、纹理、噪声上有差异
- 动力学差距:仿真中的电机响应、传动延迟与真实机器人有偏差
- 传感器差距:仿真中的传感器是"完美"的,没有噪声、没有延迟、没有标定误差
如果直接用仿真数据训练的模型放到真实机器人上,性能可能大幅下降。目前的应对策略包括领域随机化(在仿真中随机化各种参数,让模型学会鲁棒性)、领域自适应(用少量真实数据微调模型)、真实数据与仿真数据混合训练等。
关于 Sim-to-Real 的详细技术拆解,我们会在系列第 4 篇专门展开。
4.3 推理延迟:实时性的硬约束
机器人控制对实时性有严格要求。工业机器人的控制周期通常是 1ms-10ms,即使是服务机器人,控制周期也通常在 20ms-50ms。而大模型的推理延迟通常在几百毫秒甚至秒级。
这就产生了一个矛盾:VLA 模型需要"慢慢想",但机器人需要"快快动"。
目前的应对策略包括:
- 动作 chunking:模型一次生成多步动作(如未来 8 步),控制器逐步执行,减少模型推理频率
- 分层控制:VLA 负责生成任务级或轨迹级的粗粒度动作,底层控制器负责高频的精确跟踪和力控
- 模型压缩:通过量化、蒸馏、剪枝等技术减小模型体积,提升推理速度
- 边缘算力升级:使用更高性能的边缘 AI 芯片(如 NVIDIA Orin、Thor),缩短推理时间
4.4 安全与可解释性:黑盒模型的风险
在工业场景中,安全是不可妥协的底线。传统模块化方案可以在规划层设置硬约束(如"关节角度不能超过限位""末端速度不能超过阈值""不能进入禁入区域"),这些约束是确定性的、可验证的。
但 VLA 是端到端的黑盒模型,它输出的动作可能违反安全约束,而且很难解释"为什么输出这个动作"。如果 VLA 控制的机械臂突然挥向操作人员,后果不堪设想。
目前的应对策略包括:
- 安全监督层:在 VLA 输出和机器人执行之间加一层安全监督,实时检查动作是否违反安全约束,违反则拦截或紧急停止
- 动作空间约束:在训练和推理时限制动作空间,确保模型不会输出超出安全范围的动作
- 可解释性研究:通过注意力可视化、反事实分析等方法尝试理解 VLA 的决策过程
- 人机协作安全标准:遵循 ISO 10218 等工业机器人安全标准,设计物理隔离、速度监控、力限制等多重安全机制
4.5 算力与成本:边缘部署的难题
VLA 模型参数量通常在数十亿到数百亿级别,训练需要大规模 GPU 集群,推理也需要较强的算力。但机器人是边缘设备,算力、功耗、体积都受限。
- 算力受限:边缘 AI 芯片的算力远低于数据中心 GPU,大模型推理可能跑不动
- 功耗受限:机器人电池容量有限,高功耗芯片会显著缩短续航
- 散热受限:紧凑的机器人机身散热困难,高功耗芯片容易过热降频
- 成本受限:高性能边缘芯片(如 NVIDIA Orin)价格较高,会显著增加机器人 BOM 成本
目前的应对策略包括模型压缩、知识蒸馏、量化推理、云端-边缘协同推理(大模型在云端跑,边缘只跑轻量模型)等。但如何在有限的边缘算力上实现高性能 VLA 推理,依然是一个开放的工程难题。
五、VLA 的工业应用前景
尽管挑战重重,VLA 的工业应用前景已经开始显现。以下是几个最有潜力的方向:
1. 柔性制造与小批量生产
传统工业机器人适合大批量、固定流程的生产(如汽车焊接),但在小批量、多品种、频繁换线的柔性制造场景(如 3C 电子组装、定制化加工),传统方案的编程和调试成本太高。VLA 具备自然语言交互和少样本学习能力,可以通过"指一下、说一句"快速教会机器人新任务,大幅降低柔性制造的自动化门槛。
2. 仓储物流与分拣
仓储场景中的物体种类繁多、摆放位置随机、包装形态各异,是典型的非结构化环境。传统的分拣机器人只能处理特定品类的物体,而 VLA 凭借强大的泛化能力,可以处理从未见过的新物体,适应复杂的仓储环境。
3. 复杂巡检与运维
电力、能源、化工等行业的巡检场景环境复杂、任务多样,需要机器人识别各种仪表、设备、异常情况,并执行简单的操作(如开关阀门、擦拭镜头)。VLA 的多模态理解能力和灵活的动作生成能力,适合这类复杂巡检任务。
4. 危险环境作业
在核辐射、高温、有毒、易燃易爆等危险环境中,人类无法直接作业,需要机器人远程操作或自主作业。VLA 可以理解人类的高层指令并自主完成复杂操作,减少人类在危险环境中的暴露时间。
工程视角: VLA 的工业落地不会是"一夜之间替代所有传统机器人",而是从"非结构化、高灵活性、低精度要求"的场景开始,逐步渗透。短期内,VLA 更可能作为传统机器人的"大脑升级"——用 VLA 做高层决策和任务规划,用传统的运动控制和力控算法做底层执行,形成混合架构。这种架构既能利用 VLA 的泛化能力,又能保证传统控制的精度和安全性,是当前最务实的落地路径。
六、总结
VLA(视觉-语言-动作)模型是具身智能的核心技术方向,它让 AI 第一次具备了"感知—理解—执行"的完整闭环。
核心要点回顾:
- 演进路径:LLM(语言)→ VLM(视觉+语言)→ VLA(视觉+语言+动作),大模型的模态不断扩展,最终具备了物理执行能力
- 核心原理:通过动作 Token 化,把连续的机器人动作转化为离散符号,让大模型可以像生成文本一样生成动作,实现端到端的"从像素到动作"
- 范式变革:VLA 用一个端到端模型替代了传统的感知-规划-控制多模块接力,泛化能力更强,但也带来了可解释性、安全性、实时性等新挑战
- 五大工程挑战:数据稀缺、Sim-to-Real 差距、推理延迟、安全与可解释性、边缘算力成本,是 VLA 从实验室走向工业现场必须跨越的障碍
- 应用前景:柔性制造、仓储分拣、复杂巡检、危险环境作业是 VLA 最有潜力的落地方向,短期内"VLA 高层决策 + 传统控制底层执行"的混合架构是最务实的路径
VLA 不是万能的,但它代表了具身智能的技术方向。随着数据积累、算法优化、算力升级,VLA 的能力会持续提升,最终让机器人从"只会执行固定程序的机器"进化为"能理解、能学习、能灵活应对的智能体"。
关于作者: 越微智能(Yuewell)专注具身智能与工业 AI 视觉落地,基于自研 VLA 多模态大模型,提供全品牌机器人二次开发(适配宇树/优必选/智元/傅利叶)与工业级视觉算法定制,支持从算法、硬件到产线实机部署的全栈交付。
下一篇预告: 《SLAM 技术全解:vSLAM vs Lidar SLAM 与多传感器融合》,我们将拆解机器人的"定位与建图"技术,看看机器人是如何知道"我在哪"和"周围有什么"的,敬请关注。