具身智能与VLA

VLA 模型深度解析:从 LLM/VLM 到 VLA,具身智能的大脑如何工作

「具身智能落地实战」系列第 2 篇
上一篇我们拆解了具身机器人的四大硬件系统,其中决策层被称为机器人的"大脑"。这个大脑到底是如何工作的?为什么近两年"VLA 模型"成为具身智能领域最热门的方向?本文从技术演进、核心原理、工程挑战三个维度,系统性拆解 VLA 模型,帮你理解具身智能的"大脑"是如何从"只会说话"进化到"能看会说还能动手"的。


引言:大模型的"身体"困境

2023 年以来,大语言模型(LLM)席卷全球,GPT、Claude、文心一言等产品让所有人都见识到了 AI 的语言能力。但一个尴尬的事实是:这些大模型再聪明,也只能"活在屏幕里"——它们能写代码、能写文章、能回答问题,但无法在物理世界中执行任何动作。

让 AI 拥有"身体",从虚拟智能走向具身智能,成为行业的下一个共识。而 VLA(Vision-Language-Action,视觉-语言-动作)模型,正是实现这一跨越的核心技术路径。

简单来说:LLM 解决了"听懂和说话"的问题,VLM 解决了"看懂图像"的问题,而 VLA 进一步解决了"把理解转化为动作"的问题。 它让 AI 第一次具备了"感知—理解—执行"的完整闭环。


一、从 LLM 到 VLA:大模型的进化之路

要理解 VLA,先要理解它是怎么一步步进化来的。大模型的演进,本质上是"模态"不断扩展的过程——从只能处理文字,到能看懂图像,再到能输出动作。

1.1 LLM:只会说话的大脑

LLM(Large Language Model,大语言模型)是一切的起点。它只接受一种输入:文字。也只产生一种输出:文字。

  • 输入:一段文本(问题、指令、上下文)
  • 输出:一段文本(回答、续写、总结)
  • 能力:语言理解、逻辑推理、知识问答、代码生成
  • 局限:看不到图像,更无法控制物理设备

LLM 就像一个博学的"盲人"——知识渊博、能说会道,但看不见周围的世界,也无法动手做任何事。

1.2 VLM:能看会说的大脑

VLM(Vision-Language Model,视觉-语言模型)在 LLM 的基础上增加了视觉输入能力。

  • 输入:图像 + 文字
  • 输出:文字
  • 能力:图像描述、视觉问答、OCR 识别、图像推理
  • 代表模型:GPT-4V、Gemini、Qwen-VL 等

VLM 就像一个"视力恢复"的博学之人——既能看懂图片里有什么,又能用语言描述和推理。但它依然只能"说",不能"做"。你给它看一张桌子上有杯子的照片,它能告诉你"这是一个红色的杯子,放在桌子右侧",但它无法控制一只机械臂去把杯子拿起来。

1.3 VLA:能看会说还能动手的大脑

VLA(Vision-Language-Action Model,视觉-语言-动作模型)在 VLM 的基础上,把输出从"文字"扩展到了"动作"。

  • 输入:图像(机器人第一视角摄像头) + 文字(人类指令,如"把红色杯子拿起来")
  • 输出:动作序列(机器人关节的运动轨迹、末端执行器的位姿变化、夹爪的开合指令)
  • 能力:感知环境、理解指令、规划动作、控制执行
  • 代表模型:Google RT-2、Octo、OpenVLA、π0 等

VLA 就像一个终于"长出了手"的人——能看、能听懂指令、还能亲自动手去完成任务。这是 AI 从"虚拟智能"走向"具身智能"的关键一步。

工程视角: 从 LLM 到 VLA 的演进,不是简单的"功能叠加",而是输出空间的根本变革。LLM 和 VLM 的输出都是离散的文字 Token,而 VLA 的输出是连续的、高维的机器人动作空间。如何把连续动作转化为大模型可以处理的离散 Token,是 VLA 技术的核心难点,我们在下一节详细展开。


二、VLA 的核心原理:动作是如何被"生成"的

理解了 VLA 是什么,接下来看它到底是怎么工作的。VLA 的核心思想可以用一句话概括:像生成文本一样生成动作。

2.1 端到端架构:从像素到动作

传统的机器人控制系统是"模块化"的——感知、规划、控制分别由不同的模块负责,模块之间通过固定的接口传递数据。就像一场接力赛:

```

摄像头图像 → 感知模块(识别物体)→ 规划模块(生成路径)→ 控制模块(执行动作)→ 机器人运动

```

而 VLA 是端到端的——一个模型直接从原始图像和语言指令,输出最终的机器人动作。中间没有显式的感知模块、规划模块和控制模块的拆分。就像一辆直通车:

```

摄像头图像 + 语言指令 → VLA 大模型 → 机器人动作

```

这种端到端架构的优势在于:

  • 避免信息损失:模块化方案中,每个模块的输出都是对输入信息的"压缩",层层传递后信息损失严重。端到端方案直接从原始输入到最终输出,保留了更多信息。
  • 泛化能力强:VLA 基于大规模预训练,具备强大的零样本和少样本泛化能力,能处理训练中没见过的新物体、新场景、新指令。
  • 部署简洁:不需要维护多个模块和复杂的接口,一个模型搞定一切。

但端到端也带来了挑战——大模型原本是为了处理离散的文字 Token 设计的,而机器人动作是连续的、高维的。如何让大模型"生成"动作?答案是动作 Token 化。

2.2 动作 Token 化:把连续动作变成离散符号

大语言模型的本质是一个"下一个 Token 预测器"——给定前面的文字,预测下一个最可能出现的文字 Token。所有文字都被映射到一个固定的词表(Vocabulary)中,每个词对应一个唯一的 Token ID。

要让大模型生成动作,就必须把连续的机器人动作也转化为离散的 Token,放进词表里。这个过程就是动作 Token 化(Action Tokenization)

具体怎么做?

第一步:动作空间离散化

机器人的动作通常是一个高维连续向量,例如一个 7 自由度机械臂的动作可能包含 7 个关节的角度、角速度、力矩,加上夹爪的开合度,总共十几个连续值。

把每个维度的连续取值范围(如关节角度 -180° 到 +180°)均匀切分成 N 个区间(如 256 个),每个区间对应一个离散的 Token。这样,一个连续的动作向量就被转化为一串离散的 Token ID。

第二步:动作序列建模

机器人完成一个任务通常需要多步动作(如伸手、靠近、抓取、抬起、移动、放下)。VLA 模型像生成文本一样,自回归地逐个生成动作 Token,每生成一组 Token 就对应一个时间步的机器人动作。

第三步:动作解码与执行

生成的离散动作 Token 被解码回连续的动作值,发送给机器人的控制器执行。控制器根据这些动作值驱动电机,完成物理运动。

工程视角: 动作 Token 化的粒度是一个关键的工程权衡。切得太粗(如每个维度只分 16 个区间),动作精度不够,机器人可能抓不准物体;切得太细(如每个维度分 1024 个区间),词表太大,模型训练难度和推理成本急剧上升。目前主流方案通常每个维度分 128-512 个区间,在精度和效率之间取平衡。

2.3 VLA 的推理流程:一张图 + 一句话 → 一串动作

理解了动作 Token 化,我们就可以完整描述 VLA 的推理流程了:

```

第1步:感知输入

├── 机器人第一视角摄像头拍摄当前场景图像

└── 人类通过语音或文本下达指令(如"把红色杯子放到托盘上")

第2步:多模态编码

├── 图像经过视觉编码器(ViT等)转化为视觉 Token 序列

├── 语言指令经过文本编码器转化为文本 Token 序列

└── 视觉 Token 和文本 Token 拼接,输入到大模型的 Transformer 中

第3步:动作生成

├── 大模型基于视觉和语言上下文,自回归地生成动作 Token

├── 每生成一组动作 Token,对应一个时间步的机器人运动指令

└── 持续生成直到任务完成或达到最大步数

第4步:动作执行

├── 动作 Token 解码为连续的关节角度/末端位姿/夹爪指令

├── 发送给机器人控制器,驱动电机执行

└── 执行后摄像头拍摄新的图像,进入下一轮推理循环

```

这个循环不断重复,直到任务完成。整个过程中,VLA 模型既是"大脑"(理解指令、规划动作),也是"小脑"(直接输出精确的运动控制指令)。


三、VLA vs 传统方案:为什么是范式革命

VLA 之所以被称为具身智能的"范式革命",是因为它从根本上改变了机器人智能的实现方式。我们用一个对比来直观感受。

3.1 传统模块化方案:接力赛

传统的工业机器人系统通常采用模块化架构:

模块职责输入输出
感知模块识别物体、检测位置摄像头图像物体类别、位置坐标
规划模块生成运动路径、避障物体位置、目标状态关节轨迹、路径点
控制模块执行运动、力控调节关节轨迹电机电流、力矩指令

每个模块独立开发、独立调试,模块之间通过定义好的接口传递数据。这就像一场接力赛——感知跑完第一棒,把棒交给规划,规划跑完第二棒,再交给控制。

优点: 可解释性强、每个模块可以独立优化、安全性容易保证(可以在规划层设置硬约束)。

缺点:

  • 泛化能力差:换一个新物体、新场景,可能需要重新调参甚至重新开发模块
  • 信息损失:每个模块的输出都是对输入的"压缩",层层传递后细节丢失
  • 开发成本高:需要多个领域的专家(计算机视觉、运动规划、控制理论)协同开发
  • 长尾场景覆盖难:非结构化环境中的各种意外情况,模块化方案很难穷举

3.2 VLA 端到端方案:直通车

VLA 用一个大模型替代了感知、规划、控制三个模块:

模块职责输入输出
VLA 大模型感知+规划+控制图像 + 语言指令动作序列

优点:

  • 泛化能力强:基于大规模预训练,能处理未见过的物体和场景
  • 信息保留完整:直接从原始图像到动作,没有中间模块的信息损失
  • 开发简洁:不需要维护多个模块,数据驱动,有数据就能训
  • 自然语言交互:直接用人类语言下达指令,不需要编程或示教

缺点:

  • 可解释性差:黑盒模型,很难解释"为什么输出这个动作"
  • 安全性难保证:端到端模型可能输出意外动作,硬约束难以嵌入
  • 推理延迟高:大模型推理需要时间,实时控制有挑战
  • 数据需求大:需要大量高质量的机器人操作数据,获取成本高

3.3 对比总结

维度传统模块化方案VLA 端到端方案
架构感知→规划→控制,多模块接力一个模型端到端
泛化能力弱,新场景需重新调参强,零样本/少样本泛化
可解释性强,每个模块可独立分析弱,黑盒模型
安全性易保证,可在规划层设硬约束难保证,需额外安全层
实时性好,模块轻量、延迟低挑战,大模型推理慢
开发成本高,需多领域专家协同中,数据驱动,但需大量数据
适用场景结构化工业场景(流水线、固定工位)非结构化场景(家庭、仓储、复杂巡检)

工程视角: VLA 不是要完全替代传统方案,而是各有适用场景。在高度结构化的工业流水线(如汽车焊接、电子组装),传统方案精度高、速度快、成本低,依然是最优选择。但在非结构化、需要灵活应对变化的场景(如家庭服务、仓储分拣、复杂巡检),VLA 的泛化能力优势明显。未来的趋势很可能是"VLA 做高层决策 + 传统控制做底层执行"的混合架构——VLA 负责理解指令、规划任务级动作,传统控制器负责精确的轨迹跟踪和力控,两者取长补短。


四、工程落地的五大挑战

VLA 的前景很美好,但从实验室 demo 到工业现场落地,还有很长的路要走。以下是五个最核心的工程挑战。

4.1 数据稀缺:机器人操作数据是黄金

大模型的能力来自大规模数据。LLM 有互联网上海量的文本数据,VLM 有图文配对数据,但 VLA 需要的是机器人操作数据——图像、指令、动作三者配对的数据。这种数据极其稀缺,原因在于:

  • 采集成本高:需要真实机器人、真实场景、人工示教或遥操作,每一条数据都有物理成本
  • 采集速度慢:机器人执行一个任务可能需要几十秒,一小时只能采集几十条数据
  • 数据质量要求高:动作数据必须精确同步(图像、指令、关节角度必须时间对齐),稍有偏差就会影响训练效果
  • 多样性难保证:不同机器人、不同场景、不同物体的数据很难统一

目前行业的应对策略包括:仿真数据合成(Sim-to-Real)、人类遥操作数据采集、开源数据集共享(如 Open X-Embodiment)等,但数据稀缺依然是 VLA 落地的最大瓶颈。

4.2 Sim-to-Real:仿真到现实的鸿沟

既然真实数据难采集,能不能在仿真环境中生成大量数据,然后迁移到真实机器人上?这就是 Sim-to-Real(仿真到现实迁移)。

但仿真和现实之间存在巨大的差距(Reality Gap):

  • 物理差距:仿真中的物体质量、摩擦系数、弹性与现实不完全一致
  • 视觉差距:仿真渲染的图像与真实摄像头拍摄的图像在光照、纹理、噪声上有差异
  • 动力学差距:仿真中的电机响应、传动延迟与真实机器人有偏差
  • 传感器差距:仿真中的传感器是"完美"的,没有噪声、没有延迟、没有标定误差

如果直接用仿真数据训练的模型放到真实机器人上,性能可能大幅下降。目前的应对策略包括领域随机化(在仿真中随机化各种参数,让模型学会鲁棒性)、领域自适应(用少量真实数据微调模型)、真实数据与仿真数据混合训练等。

关于 Sim-to-Real 的详细技术拆解,我们会在系列第 4 篇专门展开。

4.3 推理延迟:实时性的硬约束

机器人控制对实时性有严格要求。工业机器人的控制周期通常是 1ms-10ms,即使是服务机器人,控制周期也通常在 20ms-50ms。而大模型的推理延迟通常在几百毫秒甚至秒级。

这就产生了一个矛盾:VLA 模型需要"慢慢想",但机器人需要"快快动"。

目前的应对策略包括:

  • 动作 chunking:模型一次生成多步动作(如未来 8 步),控制器逐步执行,减少模型推理频率
  • 分层控制:VLA 负责生成任务级或轨迹级的粗粒度动作,底层控制器负责高频的精确跟踪和力控
  • 模型压缩:通过量化、蒸馏、剪枝等技术减小模型体积,提升推理速度
  • 边缘算力升级:使用更高性能的边缘 AI 芯片(如 NVIDIA Orin、Thor),缩短推理时间

4.4 安全与可解释性:黑盒模型的风险

在工业场景中,安全是不可妥协的底线。传统模块化方案可以在规划层设置硬约束(如"关节角度不能超过限位""末端速度不能超过阈值""不能进入禁入区域"),这些约束是确定性的、可验证的。

但 VLA 是端到端的黑盒模型,它输出的动作可能违反安全约束,而且很难解释"为什么输出这个动作"。如果 VLA 控制的机械臂突然挥向操作人员,后果不堪设想。

目前的应对策略包括:

  • 安全监督层:在 VLA 输出和机器人执行之间加一层安全监督,实时检查动作是否违反安全约束,违反则拦截或紧急停止
  • 动作空间约束:在训练和推理时限制动作空间,确保模型不会输出超出安全范围的动作
  • 可解释性研究:通过注意力可视化、反事实分析等方法尝试理解 VLA 的决策过程
  • 人机协作安全标准:遵循 ISO 10218 等工业机器人安全标准,设计物理隔离、速度监控、力限制等多重安全机制

4.5 算力与成本:边缘部署的难题

VLA 模型参数量通常在数十亿到数百亿级别,训练需要大规模 GPU 集群,推理也需要较强的算力。但机器人是边缘设备,算力、功耗、体积都受限。

  • 算力受限:边缘 AI 芯片的算力远低于数据中心 GPU,大模型推理可能跑不动
  • 功耗受限:机器人电池容量有限,高功耗芯片会显著缩短续航
  • 散热受限:紧凑的机器人机身散热困难,高功耗芯片容易过热降频
  • 成本受限:高性能边缘芯片(如 NVIDIA Orin)价格较高,会显著增加机器人 BOM 成本

目前的应对策略包括模型压缩、知识蒸馏、量化推理、云端-边缘协同推理(大模型在云端跑,边缘只跑轻量模型)等。但如何在有限的边缘算力上实现高性能 VLA 推理,依然是一个开放的工程难题。


五、VLA 的工业应用前景

尽管挑战重重,VLA 的工业应用前景已经开始显现。以下是几个最有潜力的方向:

1. 柔性制造与小批量生产

传统工业机器人适合大批量、固定流程的生产(如汽车焊接),但在小批量、多品种、频繁换线的柔性制造场景(如 3C 电子组装、定制化加工),传统方案的编程和调试成本太高。VLA 具备自然语言交互和少样本学习能力,可以通过"指一下、说一句"快速教会机器人新任务,大幅降低柔性制造的自动化门槛。

2. 仓储物流与分拣

仓储场景中的物体种类繁多、摆放位置随机、包装形态各异,是典型的非结构化环境。传统的分拣机器人只能处理特定品类的物体,而 VLA 凭借强大的泛化能力,可以处理从未见过的新物体,适应复杂的仓储环境。

3. 复杂巡检与运维

电力、能源、化工等行业的巡检场景环境复杂、任务多样,需要机器人识别各种仪表、设备、异常情况,并执行简单的操作(如开关阀门、擦拭镜头)。VLA 的多模态理解能力和灵活的动作生成能力,适合这类复杂巡检任务。

4. 危险环境作业

在核辐射、高温、有毒、易燃易爆等危险环境中,人类无法直接作业,需要机器人远程操作或自主作业。VLA 可以理解人类的高层指令并自主完成复杂操作,减少人类在危险环境中的暴露时间。

工程视角: VLA 的工业落地不会是"一夜之间替代所有传统机器人",而是从"非结构化、高灵活性、低精度要求"的场景开始,逐步渗透。短期内,VLA 更可能作为传统机器人的"大脑升级"——用 VLA 做高层决策和任务规划,用传统的运动控制和力控算法做底层执行,形成混合架构。这种架构既能利用 VLA 的泛化能力,又能保证传统控制的精度和安全性,是当前最务实的落地路径。


六、总结

VLA(视觉-语言-动作)模型是具身智能的核心技术方向,它让 AI 第一次具备了"感知—理解—执行"的完整闭环。

核心要点回顾:

  1. 演进路径:LLM(语言)→ VLM(视觉+语言)→ VLA(视觉+语言+动作),大模型的模态不断扩展,最终具备了物理执行能力
  2. 核心原理:通过动作 Token 化,把连续的机器人动作转化为离散符号,让大模型可以像生成文本一样生成动作,实现端到端的"从像素到动作"
  3. 范式变革:VLA 用一个端到端模型替代了传统的感知-规划-控制多模块接力,泛化能力更强,但也带来了可解释性、安全性、实时性等新挑战
  4. 五大工程挑战:数据稀缺、Sim-to-Real 差距、推理延迟、安全与可解释性、边缘算力成本,是 VLA 从实验室走向工业现场必须跨越的障碍
  5. 应用前景:柔性制造、仓储分拣、复杂巡检、危险环境作业是 VLA 最有潜力的落地方向,短期内"VLA 高层决策 + 传统控制底层执行"的混合架构是最务实的路径

VLA 不是万能的,但它代表了具身智能的技术方向。随着数据积累、算法优化、算力升级,VLA 的能力会持续提升,最终让机器人从"只会执行固定程序的机器"进化为"能理解、能学习、能灵活应对的智能体"。


关于作者: 越微智能(Yuewell)专注具身智能与工业 AI 视觉落地,基于自研 VLA 多模态大模型,提供全品牌机器人二次开发(适配宇树/优必选/智元/傅利叶)与工业级视觉算法定制,支持从算法、硬件到产线实机部署的全栈交付。
下一篇预告: 《SLAM 技术全解:vSLAM vs Lidar SLAM 与多传感器融合》,我们将拆解机器人的"定位与建图"技术,看看机器人是如何知道"我在哪"和"周围有什么"的,敬请关注。