专栏

什么是 VLA(Vision-Language-Action)?工作机制、与 VLM 的区别及代表模型

  • 专栏

VLA(Vision-Language-Action,视觉—语言—动作)是一种将视觉、语言与动作统一处理,目标是让机器人实现“看懂并行动”的具身智能代表性方法。它不仅理解文本和图像,还能生成机器人的动作。不过,VLA 模型本身并不能保证安全,实际应用仍需独立的安全控制与风险评估。

本文系统介绍 VLA 的基本要素与工作机制、它与 VLM 的区别、传统方法的局限,以及 RT-1、RT-2、π0 等代表性模型、应用场景、课题与未来展望。

VLA(Vision-Language-Action)概述

VLA 是一种多模态模型或架构:同时接收摄像头等视觉信息与人的自然语言指令,并直接输出机器人应执行的动作。其关键不在于“用文字回答理解结果”,而在于“用动作给出结果”。

例如,当接到“拿起桌上的瓶子”这一指令时,VLA 会结合瓶子的位置、周边障碍物和抓取难度,将任务转化为机械臂轨迹与抓取时机等具体操作。视觉与语言并非分别处理,而是以生成动作所需的形式进行整合。

VLA 的目标,是让机器人从针对每项任务精细编程的“专用设备”,进一步走向即使环境与指令发生变化也能灵活应对的“通用设备”。面对现场不可避免的例外情况,能够根据环境变化和模糊要求做出不易失效的判断十分重要。

VLA 受到关注的原因:具身智能与机器人通用化

过去机器人难以普及的重要原因之一,是环境或产品稍有变化就需要重新调整,使导入和运维成本不断增加。传统的定制式方法适合固定产线,但在多品种现场或人与机器人共处的环境中,面对大量“预料之外”的情况容易达到极限。

近年来,基于大规模图像与语言数据训练的基础模型快速发展,开始能够借助“语义”理解未见过的物体与情境。VLA 可视为把这类知识连接到物理世界动作的一种尝试。在具身智能中,只有完成感知、判断和行动,才能真正产生价值。

VLA 的三个要素:Vision/Language/Action

VLA 由 Vision(环境感知)、Language(语义理解与推理)和 Action(规划与控制)三个相互联动的要素构成。Vision 获取事实,Language 整理意图与约束,Action 将其转化为现实中可执行的动作。

三者统一后,机器人可以根据现场情况把抽象指令具体化。例如,“小心搬运”不仅意味着降低速度,还可能意味着避开容易碰撞的路径,或改为双手抓取。任何一个环节不足都可能造成失效:视觉弱会误认现实,语言弱会遗漏意图与安全约束,动作弱则即使理解正确也无法达到所需精度。

Vision:识别环境

Vision 通过摄像头、深度传感器或 LiDAR 等观察外界,不仅识别物体类别,还需掌握位置关系、状态和危险因素。实际运行中,多帧历史通常比单张图像更重要,因为人员靠近、物体滚动或照明变化等动态信息需要从时间序列中判断。

对未知物体的鲁棒性同样关键。现场经常出现训练数据中没有的物体、污渍、反射和遮挡。相比完美分类,稳定提取“是否可抓取、是否易滑、是否易损”等操作所需属性更有价值。

Language:理解并赋予指令含义

Language 层用于解释人的指令与任务意图,并把现场情况整理为可用于推理和判断的“含义”。语言不仅用于对话,也作为机器人制定计划的内部表达。

借助这一层,“尽快”“有危险就停止”“不要洒出”等抽象指令可以转化为动作方针和约束,包括调整优先级,以及“若有危险则中断并报告”等条件分支。

消除歧义是实际应用的关键。如果“把那个拿来”中的“那个”可能指多个对象,系统需要决定是通过推理选择,还是先提出确认问题。由于带着误解行动可能引发事故,因此语言理解应与置信度判断和确认策略配套设计。

Action:规划并执行动作

Action 将视觉信息和指令中得到的任务意图转换为机器人的具体动作。现实中的机器人以关节角度、速度、抓取力等连续量运动,因此不仅要处理“做什么”,还要处理“如何动作”。

动作表达大致有两种方式:一种把动作离散化为 token,便于学习、推理和实时控制;另一种直接生成连续分布,更适合灵巧、平滑的动作和精细调整。

安全停止与故障保护不能只交给 VLA 模型,而应依据相关安全标准,作为独立的控制和监视功能进行设计。工业机器人需要结合 ISO 10218-1:2025/ISO 10218-2:2025 等要求,在检测到人员接近或碰撞风险时采取减速、停止等风险降低措施。VLA 可以生成动作候选,但安全性由整个系统共同实现。

VLA 的工作机制:从输入到动作生成

可以把 VLA 理解为“观测→解释与推理→策略输出→执行→反馈”的连续流程。系统通过传感器观察环境并接收指令,综合二者决定此时应做什么、如何做,执行后再观察结果并更新判断。其重点不是静态的一次性输入输出,而是在执行中持续修正。

在实现上,VLA 通常包括将视觉信息转化为嵌入表示的编码器、处理语言指令的表示层、整合二者的基础模型或策略,以及动作输出部分。不同模型的构成并不相同,各部分也未必完全分离。一体化训练到什么程度、哪些任务交给既有控制系统,会直接影响系统设计。

推理延迟和控制周期也不可忽视。识别与推理越慢,机器人越难跟随周围变化,只能扩大安全余量。因此,模型能力与实时性的平衡是 VLA 工程化的重要条件。

视觉信息处理

首先,Vision Encoder 将传感器输入转换为嵌入表示,用于表达物体、场景及其关系。重点并不是输出分类标签本身,而是不要丢失后续动作决策所需的特征。

在实际任务中,输入多帧历史有助于捕捉对象移动、他人经过或抓取对象轻微倾斜等变化。为降低计算量,也会采用重要区域提取和特征 token 化,只把操作对象、危险区域等对决策有效的信息压缩后传给后续处理。

语言解释与推理

随后,通过 Language Encoder 或 LLM 表示用户指令,并与视觉嵌入对齐,进行依赖现场情境的推理。这里不仅要理解文字,还要补充“在当前环境中实现该指令需要哪些条件”。

典型处理包括消除歧义和分解目标。例如,“整理一下”必须先明确对象范围、放置规则与优先级。系统可以选择基于合理假设继续,或转为提问确认。把“易碎物要轻拿轻放”“有人靠近时停止”等约束反映到动作规划中,也有助于提高安全性。

动作规划与控制(策略输出)

Action Decoder 或策略根据已对齐的表示生成动作。输出形式需符合机器人的控制指令,可以是离散 token,也可以是连续值分布。

难点在于把任务规划连接到运动控制。即便高层目标是“拿起杯子”,也可能因路径、姿态或抓取力等底层条件而失败。无论采用端到端输出,还是分为“粗略计划→精细控制”的分层结构,两者的连接质量都会左右成功率。

执行后,系统根据新的观测继续循环并补偿偏差。抓取位置略有偏离或对象发生移动等微小误差不可避免,因此通常应按以观测更新为前提的闭环控制进行设计。

VLA 与 VLM(Vision-Language Model)的区别

VLM 主要处理视觉与语言之间的对应、理解和生成,例如看图说明或回答问题。VLA 则进一步输出机器人在现实世界中执行的动作。换言之,VLM 是“理解引擎”,VLA 是“把理解转换为动作的引擎”。

即使 VLM 很强,如果不能满足现实中的可达范围、避碰、抓取力和时延等约束,动作仍无法成立。不过,VLM 从大规模图像与文本中获得的概念知识和常识,是 VLA 应对未知物体与新指令的重要基础。如何把这些知识安全地落实到控制系统,是 VLA 设计的差异化要点。

传统机器人控制的局限:规则与任务专用学习

基于规则或任务专用学习的方法在条件固定时表现稳定,但对现场变化较弱。照明改变、桌面杂乱或对象略有差异,都可能破坏识别和抓取的前提。

此外,每项任务往往都需要单独设计和收集数据。拣选、包装、检测、搬运各自独立,使“新增一项能力”常常等同于重新实施一个项目。对于“尽快”“小心”“有危险就停止”等人的意图,规则越写越多也会产生大量例外。VLA 以语言为核心,在同一框架内处理现场情况与意图,旨在提高复用性。

代表性的 VLA 模型

VLA 研究发展迅速,不同模型在动作表达、基础模型利用方式和训练数据方面各有特点。RT-1 偏向以真实机器人数据实现实时控制,RT-2 把从网络规模数据获得的知识迁移到机器人,π0 则侧重连续动作的精细性与多样数据整合。具体选择取决于任务、安全要求、计算资源和数据采集能力。

RT-1

RT-1 是一种基于 Transformer 的研究模型,输入机器人摄像头图像与语言指令,输出离散化动作。它用真实机器人采集的多任务数据训练单一模型,并验证了对未知任务和环境的泛化能力。

RT-1 采用压缩视觉特征等方法,展示了在真实设备闭环控制中运行的结构。离散化便于实时推理,但与动作表达能力存在权衡;在需要连续精细操作的任务中,token 粒度和与控制系统的连接可能成为难点。

RT-2

RT-2 强调把在网络规模数据上预训练的 VLM 知识迁移到机器人控制,使机器人能够借助图像和语言知识理解实际接触较少的概念。

其特点是把动作按与文本 token 相同的形式处理,在保留 VLM“预测下一个 token”框架的同时,把机器人动作序列加入预测对象,并用网络图文数据和机器人轨迹数据共同微调。该方法有助于应对未见物体和新表达,但“具有知识”不等于“能够精确抓取”,控制端的安全设计与评估仍不可少。

π0

π0 是把预训练 VLM 与通过 flow matching 生成连续动作块的“action expert”结合起来的研究模型。它以连续表达处理离散动作 token 难以表示的平滑动作与细微调整。

该模型采用 cross-embodiment 学习,整合多种机器人和多样操作数据,并使用包含公开数据在内的大规模真实机器人数据进行预训练。论文评估了叠衣服、整理桌面和组装盒子等复杂连续任务,但这些结果来自研究环境,并不保证在任意现场或未经验证的机器人上取得相同性能。

VLA 的应用场景

VLA 的优势在于,即使指令改变也能在同一框架中应对。以语言作为接口,现场人员可以更容易地更新作业条件。但在应用评估时,需要明确自主化的范围。完全自主越高,安全设计和验证越困难,因此通常可先从有人监视的半自主运行或危险区域由人介入开始。

成功标准也不应只是“能够动作”,而应是“质量、安全和重复性得到保证”。VLA 具有通用性的吸引力,但现场价值最终取决于质量基准和异常处理设计。

工业应用:制造与物流

在制造和物流领域,VLA 可用于拣选、分拣、装配、检测和搬运。品种多、指令和优先级经常变化的现场,更能体现通过语言更新作业条件的优势。

例如,可通过语言指令给出“这个箱子易碎,要慢一点”“优先处理带红色标签的物品”等条件。不过,实际可覆盖的范围取决于训练数据、机器人配置、控制系统与安全约束。在人机协作环境中,停止判断往往比速度更重要,需要在推理层明确安全约束并可靠地传递给动作生成部分。

日常生活支持:智能家居与服务机器人

日常生活中可设想用于收纳、寻找物品、简单家务和看护辅助。家庭环境通常比工厂更杂乱、物品种类更多,因此对通用能力的要求更高。

面对“放回平时的架子”“放到不碍事的地方”等模糊要求,机器人应根据家庭规则进行对话确认,而不是擅自解释。持续使用摄像头还涉及隐私,需要在数据保存范围、是否向外发送、端侧处理与权限管理等方面进行完整的运维设计。

VLA 的课题与未来展望

VLA 要进入实际应用阶段,仍需解决数据、评估、安全和泛化等研究与工程课题。仅仅“聪明”并不足以在现实世界运行,数据不足、评估困难、安全要求和未知情境相互影响,不能只靠改进模型解决。

尤其需要重视失败处理。机器人失败可能造成物品损坏甚至人身风险,因此不仅要降低失败率,还要设计成在可能失败时能够停止、请求帮助并说明情况。未来,除了基础模型性能提升,数据共享机制、标准化基准和系统安全方法也需要同步完善。

训练数据与评估:现实世界数据不足

真实机器人数据采集成本高、数量不足,而且传感器或机体不同,即使相同任务的数据分布也会改变。应对方法包括混合使用仿真与真实数据、建设共享数据集,以及标准化数据采集流程。

仿真难以完全再现现实中的摩擦、柔性物体和照明变化,如何缩小差距是重要的工程能力。评估也不能只看单一成功率,还需衡量安全停止是否恰当、面对误解指令时的行为、重复性以及对环境变化的耐受性。

安全性与对齐:误动作和风险管理

安全性是 VLA 的首要课题。由于误识别和误解无法完全消除,系统必须在接近危险时可靠地减速和停止。面对“把它扔下去”“用力拉”等指令,也可能需要拒绝或再次确认。

语言控制既便利,也可能成为误操作或滥用的入口,因此权限设计、监视、日志和验证不可或缺。系统若能简洁说明为什么停止、为什么选择某个对象,也有助于提高现场信任并推动改进循环。

泛化能力与长尾问题

VLA 容易在未知物体、未知布局和例外事件等长尾情境中失败。现实世界的事故往往来自“例外”,因此最坏情况下的行为比平均性能更重要。

一种方向是分布外检测:发现未见过的情况时,不勉强继续,而是停止并转为确认或人工介入。另一种方向是对话与技能分解,把任务拆成较小技能并在需要时提问。未来,在线适应和工具使用等也将使泛化能力更多由“系统整体”而非“单一模型”实现。

关于 VLA 的常见问题

问:VLA 和 VLM 应先学习哪一个?
如果目标是机器人控制,应学习 VLA;但视觉与语言对齐、表示学习等 VLM 知识是重要基础。实际工程通常是在理解 VLM 后,再把动作表达和安全设计纳入 VLA 系统。

问:VLA 需要哪些传感器?
所需输入取决于模型与任务。通常除摄像头图像外,还会使用关节角等机器人状态,并按用途组合深度传感器或力传感器。抓取和接触作业中,加入视觉以外的信息有助于补充状态估计。

问:VLA 能实现多大程度的自主化?
研究演示看似具有较高自主性,但现场对安全和质量要求更严格,从有人监视的半自主运行开始更为现实。先限定自主范围,再根据日志和失败分析逐步扩展,是较稳妥的路径。

问:导入难度高吗?
相比模型选择,数据采集、评估、安全设计和运维流程往往更具决定性。预先规定“失败时如何停止”“人员如何介入”,可以降低上线后的风险。

总结

VLA(Vision-Language-Action)把 Vision、Language 和 Action 统一起来:通过视觉掌握情况,用语言整理意图和约束,再以动作影响现实世界。它与 VLM 的重要区别在于,VLA 不止于理解,还包括机器人控制。

RT-1 从真实机器人数据学习离散动作,RT-2 将网络图文知识迁移到机器人控制,π0 则组合 VLM 与基于 flow matching 的连续动作输出。VLA 有望用于制造、物流和生活支持,但必须针对具体任务评估其适用性并设计安全机制。

现实世界数据不足、评估困难、安全性和长尾问题仍是重要课题。随着模型能力提升,以及数据和评估标准化、包含故障保护的运维设计逐步完善,VLA 将有望从研究进一步走向实际应用。

相关专栏与解决方案案例

要让机器人在现实环境中稳定运行,除了由 AI 理解指令,还需要测量和评估机械状态及停止后的行为。相关中文专栏和解决方案案例上线后,将从本文补充链接。