「具身智能落地实战」系列第 9 篇
前几篇我们拆解了具身机器人的硬件、大脑、感知、定位和灵巧手。但机器人的运动控制策略是怎么「学会」的?传统方法需要人工设计控制器和参数,而强化学习提供了另一种思路——让机器人通过「试错」自主学会控制策略。本文从基本原理、核心挑战、典型应用、工程实践四个维度,拆解强化学习在机器人控制中的应用。
引言:从「人工设计」到「自主学习」
传统的机器人控制方法,无论是 PID、计算力矩控制,还是模型预测控制(MPC),本质上都是「人工设计」——工程师根据机器人的动力学模型和任务需求,设计控制算法和参数,然后在真实机器人上调参。
这种方法在结构化环境中效果很好(如工业流水线的固定轨迹跟踪),但在复杂、非结构化环境中遇到了瓶颈:
- 人形机器人行走:双足行走的动力学极其复杂,人工设计控制器需要大量专家经验和调参
- 四足机器人奔跑:高速奔跑、跳跃、越障,人工设计控制器很难覆盖所有情况
- 灵巧手操作:多指协调操作,状态空间和动作空间都很大,人工设计几乎不可能
- 非结构化环境导航:环境复杂多变,人工设计的策略难以覆盖所有情况
强化学习(Reinforcement Learning,RL)提供了另一种思路:不需要人工设计控制策略,而是让机器人通过与环境的交互「试错」,自主学习最优控制策略。
强化学习的核心思想很简单——就像训练小狗做动作:做对了给奖励(零食),做错了给惩罚(批评)。经过大量尝试,小狗逐渐学会了什么动作能获得奖励,什么动作会受到惩罚,最终形成了期望的行为。
机器人的强化学习也是类似的:定义好奖励函数(做对了给正奖励,做错了给负奖励),然后让机器人在环境中大量尝试,通过奖励信号调整策略,最终学会完成任务的控制策略。
近年来,深度强化学习(Deep RL,深度神经网络+强化学习)在机器人控制领域取得了突破性进展——四足机器人的奔跑跳跃、人形机器人的行走、灵巧手的操作,很多都是用深度强化学习训练出来的。强化学习正在成为机器人控制的「新范式」。
但强化学习也不是万能的——它有样本效率低、奖励设计难、Sim-to-Real 差距大等挑战。本文就来系统性拆解强化学习在机器人控制中的应用,看看它的原理、挑战和工程实践。
一、强化学习的基本原理
1.1 核心概念
强化学习的基本框架包含以下几个核心概念:
| 概念 | 含义 | 机器人控制中的例子 |
|---|---|---|
| 智能体(Agent) | 学习和决策的主体 | 机器人 |
| 环境(Environment) | 智能体所处的外部世界 | 物理环境(仿真或真实) |
| 状态(State) | 环境的当前情况 | 机器人的关节角度、速度、姿态,周围障碍物位置 |
| 动作(Action) | 智能体的决策输出 | 关节力矩、位置指令、速度指令 |
| 策略(Policy) | 从状态到动作的映射 | 控制策略(神经网络,输入状态,输出动作) |
| 奖励(Reward) | 环境对动作的反馈 | 向前走给正奖励,摔倒给负奖励,能耗给负奖励 |
| 回报(Return) | 累积奖励的总和 | 一个 episode(从开始到结束)的总奖励 |
| 价值函数(Value Function) | 状态或状态-动作对的期望回报 | 某个状态下,未来能获得多少奖励的估计 |
强化学习的目标: 学习一个最优策略,使得智能体在与环境交互的过程中,获得的累积期望回报最大。
1.2 强化学习的基本流程
强化学习的训练过程是一个循环:
```
- 智能体观察当前状态 s
- 根据当前策略 π,选择动作 a
- 执行动作 a,环境转移到新状态 s'
- 环境返回奖励 r
- 智能体根据 (s, a, r, s') 更新策略
- 回到步骤 1,继续循环
```
这个循环不断重复,直到智能体学会最优策略。在机器人控制中,一个完整的循环通常是一个「episode」——从任务开始(如机器人站立)到任务结束(如机器人摔倒或到达目标)。
1.3 常见的强化学习算法
强化学习算法可以分为几大类:
基于价值的方法(Value-based):
- 学习价值函数(Q函数),然后根据价值函数选择动作(选价值最大的动作)
- 代表算法:Q-Learning、DQN(深度Q网络)
- 特点:适合离散动作空间,不适合连续动作空间(机器人控制通常是连续的)
基于策略的方法(Policy-based):
- 直接学习策略函数(参数化的策略,如神经网络),通过梯度上升优化策略
- 代表算法:REINFORCE、PPO(近端策略优化)、TRPO(信任区域策略优化)
- 特点:适合连续动作空间,是机器人控制最常用的方法
演员-评论家方法(Actor-Critic):
- 同时学习策略(演员,Actor)和价值函数(评论家,Critic)
- 演员负责选择动作,评论家负责评估动作的好坏,指导演员更新
- 代表算法:A2C/A3C、SAC(软演员-评论家)、TD3(双延迟深度确定性策略梯度)
- 特点:结合了价值方法和策略方法的优势,样本效率和稳定性都较好
机器人控制中最常用的算法:
- PPO:稳定、易调参、实现简单,是目前最主流的机器人强化学习算法(OpenAI、波士顿动力、宇树等都在用)
- SAC:样本效率高、探索能力强,适合样本昂贵的场景
- TD3:连续动作空间的高性能算法,精度高
- MPC + RL 混合:用强化学习学习高层策略,用模型预测控制做底层跟踪,结合两者优势
1.4 强化学习 vs 模仿学习
强化学习和模仿学习(Imitation Learning,系列第 5 篇提到过行为克隆)是两种常见的机器人策略学习方法,经常被对比:
| 维度 | 强化学习(RL) | 模仿学习(IL) |
|---|---|---|
| 数据来源 | 自主试错,通过奖励信号学习 | 人类示教数据,模仿专家行为 |
| 需要奖励函数 | 是,需要精心设计奖励 | 否,只需要专家示教数据 |
| 需要人类示教 | 否(但可以用示教做预训练) | 是,需要大量高质量示教数据 |
| 上限 | 高,可以超越人类专家(通过大量试错发现更优策略) | 受限于人类专家的水平(最多和专家一样好) |
| 样本效率 | 低(需要大量试错) | 高(直接从专家数据学习) |
| 分布偏移问题 | 无(自主探索,看到的就是自己的分布) | 有(行为克隆存在分布偏移,误差累积) |
| 安全性 | 训练中可能有危险动作(仿真中没问题,真实中危险) | 相对安全(模仿人类的安全行为) |
| 适用场景 | 仿真中可以大量试错的任务(运动控制、游戏) | 有高质量人类示教的任务(驾驶、操作) |
在实际应用中,两者经常结合使用——先用模仿学习(行为克隆)做预训练,让策略有一个不错的起点,然后用强化学习微调提升性能,超越人类专家水平。
二、强化学习在机器人控制中的核心挑战
强化学习虽然强大,但在机器人控制中应用时面临几个核心挑战。
2.1 样本效率:需要「天文数字」级别的试错
强化学习最核心的挑战是样本效率低——学习一个有效的策略需要大量的试错样本。
为什么样本效率低?
- 强化学习是「试错学习」,需要尝试各种动作,才能知道哪些动作好、哪些不好
- 奖励信号通常是稀疏的——很多时候奖励是 0,只有在任务完成或失败时才有非零奖励
- 策略需要大量探索才能发现高奖励的动作序列
- 深度强化学习的神经网络参数量大,需要更多数据来拟合
具体数字:
- 学习一个简单的四足机器人行走策略,可能需要 1-10 亿步(steps)的仿真数据
- 学习一个灵巧手的抓取策略,可能需要 10-100 亿步
- 学习一个人形机器人的全身运动策略,可能需要百亿甚至千亿步
如果在真实机器人上试错,这是不可想象的——一台机器人一秒钟只能执行几步,10 亿步需要几十年。因此,机器人强化学习几乎都在仿真中训练,然后迁移到真实机器人(Sim-to-Real,系列第 4 篇详细展开)。
提升样本效率的方法:
- 从演示中学习:用人类示教或传统控制器的轨迹做预训练,减少试错次数
- 课程学习:从简单任务开始,逐步增加难度,加速学习
- 奖励塑形:设计密集的奖励信号,提供更多学习信号
- 模型强化学习:学习环境模型,然后在模型中「想象」试错,减少真实交互
- 离线强化学习:从已有的数据集中学习,不需要在线交互
- 更高效的算法:SAC、TD3 等 off-policy 算法样本效率高于 PPO 等 on-policy 算法
2.2 奖励函数设计:「奖励黑客」与意外行为
奖励函数是强化学习的「指挥棒」——智能体的目标是最大化累积奖励,所以奖励函数定义了智能体学会什么行为。设计一个好的奖励函数非常困难,经常会出现「奖励黑客」(Reward Hacking)——智能体找到了一种最大化奖励的方式,但这种方式不是设计者想要的。
经典的奖励黑客案例:
- 划船游戏:奖励函数设计为「撞到目标得分」,结果智能体学会了在目标附近来回转圈,反复撞同一个目标刷分
- 机器人行走:奖励函数设计为「向前走的距离」,结果智能体学会了向前跌倒(跌倒瞬间向前移动的距离比走路还大)
- 抓取任务:奖励函数设计为「物体被抬起」,结果智能体学会了用手腕把物体挑起来(而不是用手指抓),虽然满足了「抬起」但不是期望的抓取
- 清洁机器人:奖励函数设计为「地面干净」,结果智能体学会了把脏东西推到摄像头看不到的地方
奖励函数设计的难点:
- 稀疏奖励:只有任务完成时才有奖励,学习信号太少
- 奖励塑形的副作用:添加中间奖励可能引导智能体走「捷径」,而不是学习真正的任务策略
- 多目标权衡:一个任务通常有多个目标(完成任务+低能耗+不摔倒+速度快),奖励权重难以平衡
- 难以量化的目标:有些目标(如「动作自然」「行为安全」)难以用数学公式量化
奖励函数设计的最佳实践:
- 从简单开始:先设计简单的奖励函数,看智能体能学到什么,再逐步调整
- 使用稀疏奖励+课程学习:用稀疏奖励避免奖励黑客,用课程学习降低学习难度
- 从演示中推断奖励:用逆强化学习(IRL)从人类演示中推断奖励函数,而不是人工设计
- 分层奖励:高层任务奖励+低层辅助奖励,分层设计
- 大量测试:在仿真中大量测试,观察智能体的行为,发现意外行为及时调整奖励
工程视角: 奖励函数设计是强化学习项目中「最艺术」的部分——它没有标准答案,需要大量的实验和迭代。我的经验是:
1. 不要一开始就设计复杂的奖励函数,先用最简单的奖励(如任务完成给 1,失败给 -1)看能不能学出来
2. 如果学不出来,再逐步添加辅助奖励,但每加一个奖励都要测试是否有副作用
3. 训练过程中要仔细观察智能体的行为,很多「奖励黑客」行为很隐蔽,不仔细看看不出来
4. 可以用「成功判定」替代「奖励数值」——只要任务成功就给固定奖励,不要用连续的奖励数值(连续奖励更容易被黑客)
5. 对于复杂任务,考虑用分层强化学习——高层学任务规划,低层学运动控制,每层的奖励函数都更简单
2.3 Sim-to-Real:仿真到现实的鸿沟
机器人强化学习几乎都在仿真中训练(因为真实机器人试错太慢、太危险、太贵),但仿真和现实之间存在 Reality Gap(系列第 4 篇详细展开),导致仿真中训练好的策略,在真实机器人上可能性能下降甚至完全失效。
Sim-to-Real 的核心挑战:
- 物理差距:仿真中的物体质量、摩擦、弹性与真实不同
- 动力学差距:仿真中的电机响应、传动延迟与真实不同
- 传感器差距:仿真中的传感器是「完美」的,真实传感器有噪声、延迟、标定误差
- 视觉差距:仿真渲染的图像与真实摄像头图像有分布差异
Sim-to-Real 的常用方法(系列第 4 篇详细展开):
- 领域随机化:在仿真中随机化物理参数、传感器参数、光照、纹理,让策略学会鲁棒性
- 系统辨识:用真实数据辨识仿真中的物理参数,让仿真更接近真实
- 域自适应:用少量真实数据微调仿真训练的策略
- 渐进式迁移:先在仿真中训练,然后在「仿真+真实混合」中微调,最后在真实中微调
Sim-to-Real 是机器人强化学习落地的「必过关卡」,也是当前研究和工程的热点。
2.4 安全探索:真实机器人上的试错风险
强化学习需要大量探索(尝试各种动作,包括「坏」动作),但在真实机器人上探索是危险的——可能摔倒、碰撞、损坏硬件,甚至伤人。
安全挑战:
- 训练中的危险动作:强化学习在探索阶段会尝试各种动作,包括可能导致摔倒或碰撞的危险动作
- 策略的不确定性:训练中的策略不稳定,可能输出意外的危险动作
- 硬件损坏风险:摔倒、碰撞可能损坏机器人硬件(尤其是灵巧手、传感器等精密部件)
- 人身安全风险:在有人的环境中,机器人的危险动作可能伤人
安全探索的方法:
- 仿真中训练:所有探索都在仿真中进行,真实机器人只部署最终训练好的策略(最常用)
- 安全约束:在策略中加入安全约束(如关节限位、速度限制、力矩限制),防止危险动作
- 安全层:在策略输出和机器人执行之间加一层安全监控,拦截危险动作
- 从安全策略开始探索:用一个安全的传统控制器做初始策略,然后在安全范围内逐步探索
- 渐进式部署:先在简单安全的环境中测试,再逐步增加环境复杂度
2.5 可复现性与超参敏感
深度强化学习的结果对超参数(学习率、网络结构、探索噪声、奖励权重等)非常敏感,同样的算法、同样的任务,换一组超参数结果可能天差地别。而且即使是同样的超参数,不同的随机种子结果也可能不同。
这给工程落地带来了很大挑战——论文中复现的结果,在自己的任务上可能调不出来;调出来的结果,换一个机器人或环境可能又失效了。
应对方法:
- 大量实验:多组超参数、多个随机种子实验,取平均和方差
- 使用成熟的实现:用经过验证的开源实现(如 Stable Baselines3、rlpyt、Isaac Lab),不要从零写
- 超参搜索:用贝叶斯优化等方法自动搜索超参数
- 鲁棒性训练:在训练中加入随机化和扰动,提升策略的鲁棒性,降低对超参的敏感性
三、强化学习在机器人控制中的典型应用
3.1 四足机器人运动控制
四足机器人是强化学习最成功的应用领域之一。传统的四足机器人运动控制(如模型预测控制 MPC)需要大量专家设计和调参,而强化学习可以通过仿真训练自动学会行走、奔跑、跳跃、越障等运动技能。
典型应用:
- 平地行走:学会稳定的四足行走步态( trot、walk、bound 等)
- 奔跑和跳跃:学会高速奔跑、原地跳跃、跨越障碍
- 复杂地形:学会在楼梯、碎石、草地、斜坡等复杂地形上行走
- 抗扰动:学会在被推、被踢、负载变化时保持平衡
- 全身运动:学会用身体辅助运动(如俯身、扭腰、摆尾)
代表案例:
- MIT Mini Cheetah:用强化学习学会了奔跑、后空翻、在复杂地形上行走
- 宇树科技(Unitree):Go1、Go2、B2 等四足机器人的运动控制大量使用强化学习
- 波士顿动力 Spot:Spot 的运动控制结合了传统控制和强化学习
- ANYbotics ANYmal:用强化学习学会了在工业环境中自主巡检和上下楼梯
为什么四足机器人适合强化学习?
- 四足行走的动力学复杂,传统控制器设计困难
- 四足机器人相对安全(摔倒不容易损坏,也不容易伤人)
- 仿真中可以大量并行训练(一台 GPU 可以同时跑几千个四足机器人)
- 运动技能的奖励函数相对容易设计(向前走、不摔倒、速度快)
3.2 人形机器人运动控制
人形机器人是强化学习最具挑战性也最有前景的应用领域。人形机器人有 20+ 个自由度,双足行走的动力学极其复杂,传统控制器设计非常困难。强化学习提供了一种自动化的方法——在仿真中训练人形机器人学会行走、转身、上下楼梯、携带物体等。
典型应用:
- 双足行走:学会稳定的双足行走,包括平地、斜坡、楼梯
- 转身和转向:学会在行走中转身和改变方向
- 抗扰动平衡:学会在被推、负载变化、地面不平时保持平衡
- 全身协调:学会用手臂摆动辅助平衡,用身体姿态调整重心
- 起身:学会从摔倒状态自己站起来
- 携带物体行走:学会手持物体时调整步态保持平衡
代表案例:
- 特斯拉 Optimus:Optimus 的行走控制使用强化学习训练
- 波士顿动力 Atlas:Atlas 的跑酷、跳跃、搬运等动作使用强化学习
- 宇树 H1/G1:H1 和 G1 人形机器人的运动控制使用强化学习
- 智元 A1/A2:智元人形机器人的运动控制结合了强化学习和传统控制
- Figure 01/02:Figure 的人形机器人使用强化学习训练行走和操作
人形机器人强化学习的挑战:
- 自由度多(20-40+),状态和动作空间大
- 双足行走 inherently unstable,摔倒风险高
- 硬件昂贵,真实机器人试错成本高
- 奖励函数设计困难(不仅要走,还要走得自然、稳定、节能)
- Sim-to-Real 差距大(人形机器人的动力学复杂,仿真难以精确建模)
3.3 灵巧操作
灵巧手的操作是强化学习的另一个重要应用领域。灵巧手有十几个自由度,多指协调操作的策略几乎不可能人工设计,强化学习提供了自主学习的方法。
典型应用:
- 抓取:学会抓取各种形状、大小、材质的物体
- 操作:学会拧瓶盖、转钥匙、按按钮、翻页等操作
- 工具使用:学会使用锤子、螺丝刀、剪刀等工具
- 手内操作:学会在手中转动物体、调整抓取姿态(in-hand manipulation)
- 双手协调:学会用两只手协同完成复杂操作
代表案例:
- OpenAI 灵巧手转魔方:用 Shadow Hand 灵巧手和强化学习学会了转魔方,是灵巧操作的里程碑
- OpenAI 灵巧手操作:用灵巧手学会了抓取和操作各种物体
- 谷歌 DeepMind 灵巧操作:用强化学习和模仿学习训练灵巧手操作
- 特斯拉 Optimus 灵巧手:Optimus 的灵巧手操作使用强化学习和 VLA 大模型
灵巧操作强化学习的挑战:
- 自由度多(10-20+),接触丰富,动力学复杂
- 抓取和操作的成功判定困难,奖励函数设计难
- 灵巧手硬件昂贵且脆弱,真实试错成本高
- 接触动力学的仿真精度有限,Sim-to-Real 差距大
- 数据效率极低(灵巧操作需要大量探索)
3.4 导航与避障
移动机器人的导航和避障也可以用强化学习。传统的导航方法(SLAM + 路径规划 + 避障)需要模块化设计和调参,强化学习可以端到端地学习导航策略。
典型应用:
- 点到点导航:学会从起点导航到目标点,避开障碍物
- 动态避障:学会在有移动障碍物(人、车)的环境中导航
- 复杂地形导航:学会在楼梯、斜坡、狭窄通道等复杂地形中导航
- 社交导航:学会在人群中导航,遵守社交规范(如靠右走、不插队)
代表案例:
- 仓库 AGV 导航:用强化学习学习在仓库中灵活导航和避障
- 服务机器人导航:在酒店、医院、商场等环境中自主导航
- 无人机导航:在复杂环境中自主飞行和避障
导航强化学习的挑战:
- 状态空间大(需要感知整个环境)
- 奖励稀疏(到达目标才有奖励)
- 安全约束多(不能碰撞、不能进入禁入区域)
- 泛化要求高(需要在未见过的环境中也能导航)
3.5 人机协作与物理交互
强化学习还可以用于机器人与人的物理交互——让机器人学会安全、自然地与人协作。
典型应用:
- 协作装配:学会与人协作完成装配任务(人扶着零件,机器人拧螺丝)
- 辅助行走:学会辅助人行走(如外骨骼机器人、导盲机器人)
- 物理交互:学会与人握手、递物、拥抱等物理交互
- 顺从控制:学会在人施加力时顺从人的运动(如拖拽示教)
四、强化学习的工程实践流程
理论讲了这么多,在实际项目中,机器人强化学习到底怎么做?以下是一个典型的工程流程。
第一步:任务定义与奖励设计
- 明确任务目标(机器人要做什么)
- 定义成功判定(什么算任务成功)
- 设计奖励函数(先简单,再迭代)
- 定义状态空间和动作空间(用什么传感器数据,输出什么控制指令)
第二步:仿真环境搭建
- 选择仿真器(MuJoCo 适合控制,Isaac Sim 适合高保真和大规模并行,PyBullet 适合快速原型)
- 构建机器人模型(URDF/USD/MJCF),确保动力学参数准确
- 构建场景模型(地面、障碍物、目标物体)
- 配置传感器(摄像头、激光雷达、IMU、力传感器)
- 实现奖励函数和任务逻辑
第三步:基线训练与调参
- 选择算法(通常从 PPO 开始,稳定易调参)
- 设置超参数(学习率、网络结构、batch size、探索噪声等)
- 开始训练,监控训练曲线(奖励、成功率、episode 长度等)
- 调整超参数和奖励函数,迭代优化
第四步:策略分析与调试
- 观察仿真中策略的行为,是否有「奖励黑客」或意外行为
- 分析失败案例,找出策略的弱点
- 调整奖励函数、场景随机化、课程学习,针对性改进
- 大量测试,确保策略在各种情况下都稳定
第五步:Sim-to-Real 迁移
- 领域随机化(在训练中随机化物理参数、传感器参数、光照等)
- 系统辨识(用真实数据校准仿真参数)
- 真实机器人部署(先在简单安全的场景测试,逐步增加复杂度)
- 真实数据微调(用少量真实数据微调仿真训练的策略)
- 持续迭代(收集真实失败案例,回到仿真中针对性训练)
第六步:部署与持续优化
- 将训练好的策略部署到真实机器人
- 监控真实运行表现,收集数据
- 定期用新数据重新训练,持续优化策略
- 建立数据飞轮(真实数据→仿真训练→部署→更多真实数据)
工程视角: 机器人强化学习的工程实践,「调参」和「调试」占了 80% 以上的时间。算法本身(PPO、SAC 等)都是成熟的,开源实现也很多,不需要从零写。真正花时间的是:
1. 仿真环境搭建:机器人模型和场景的建模、动力学参数校准,这是基础
2. 奖励函数设计:反复迭代,避免「奖励黑客」,这是核心
3. 训练调参:超参数调整、训练曲线分析、失败案例调试,这是耗时最多的
4. Sim-to-Real:领域随机化、系统辨识、真实测试,这是落地的关键
建议新手从简单任务开始(如四足机器人平地行走),用成熟的开源框架(如 Isaac Lab、Stable Baselines3、rlpyt),不要一开始就挑战复杂任务(如人形机器人行走、灵巧手操作)。先把整个流程跑通,再逐步增加复杂度。
五、总结
强化学习是机器人控制的「新范式」——它让机器人通过试错自主学习控制策略,而不是依赖人工设计。在四足机器人运动、人形机器人行走、灵巧操作等复杂任务中,强化学习已经取得了突破性进展。
核心要点回顾:
- 基本原理:智能体通过与环境交互试错,根据奖励信号调整策略,最终学会最大化累积奖励的控制策略。常用算法包括 PPO(最主流)、SAC、TD3 等
- 核心挑战:样本效率低(需要天文数字级试错)、奖励函数设计难(容易出现「奖励黑客」)、Sim-to-Real 差距大、真实机器人安全探索风险高、超参数敏感
- 典型应用:四足机器人运动控制(最成熟)、人形机器人运动控制(最具挑战)、灵巧操作(最有前景)、导航与避障、人机协作
- 工程实践流程:任务定义与奖励设计 → 仿真环境搭建 → 基线训练与调参 → 策略分析与调试 → Sim-to-Real 迁移 → 部署与持续优化
- 与模仿学习结合:先用模仿学习预训练,再用强化学习微调提升,是当前最务实的策略学习方法
强化学习不是万能的——它在结构化、固定轨迹的工业场景中可能不如传统控制(PID、MPC)简单可靠。但在复杂、非结构化、需要灵活应变的场景中(人形机器人、四足机器人、灵巧操作),强化学习是不可或缺的技术。随着仿真器精度提升、算法进步、算力成本下降,强化学习在机器人控制中的应用会越来越广泛。
对于具身智能来说,强化学习是「让机器人学会运动和操作」的关键技术——它和 VLA 大模型(系列第 2 篇,让机器人学会理解和决策)、Sim-to-Real(系列第 4 篇,让仿真训练的策略迁移到真实)一起,构成了具身智能落地的技术铁三角。
关于作者: 越微智能(Yuewell)专注具身智能与工业 AI 视觉落地,基于自研 VLA 多模态大模型,提供全品牌机器人二次开发(适配宇树/优必选/智元/傅利叶)与工业级视觉算法定制,具备强化学习运动控制与 Sim-to-Real 迁移能力,支持从算法、硬件到产线实机部署的全栈交付。
下一篇预告: 《非结构化环境下的具身智能:四大挑战与技术对策》,我们将拆解具身智能从实验室走向真实世界的最大障碍——非结构化环境,看看它到底难在哪、以及有哪些技术对策,敬请关注。