机器人如何走向通用?Arm技术负责人提到了“智能层”

Source

机器人正以肉眼可见的速度进化,比如它们的奔跑速度远比去年更快。但一个始终存在的卡点是,它们如何实现真正的泛化能力,进入各类真实场景来完成真实任务。

在北京融科资讯中心,我们见到了Arm 物理 AI 机器人技术研究全球负责人 Federico Pecora。他有超过15年横跨产业与学术界的经验,曾领导亚马逊机器人的应用科学团队,更早则在瑞典厄勒布鲁大学任教。其研究,聚焦于打造稳健、通用的机器人智能系统。

针对机器人的通用性,Pecora提出了四个需要特别注意的问题。他告诉硅星人,这些问题不可以单独拆解,需要作为一个整体共同推进。在这四个问题之上,他还提出了名为“智能层”的概念,并指出,这是实现机器人泛化能力过程中尚未补齐的关键环节。

在Pecora看来,物理AI的天花板并不完全取决于AGI是否成熟,只要补齐“根据场景协调、编排、组合各项能力”的中间层,即便AGI没有完全落地,一个灵活的、可以自适应的物理AI智能体,也有机会实现。

机器人需要自由组合skill

Pecora用了一个简单的购物场景,来解释机器人能力泛化面临的真正挑战。

假设用户带着一台人形机器人进入一家陌生超市,并告诉机器人:“推辆购物车跟着我,我去挑选蔬菜,你去取一袋10公斤的大米,我们稍后在乳制品区会合。”虽然这个任务看似日常,却要求机器人同时理解用户意图、识别环境、规划路线、寻找目标物体、操作购物车,并在过程中不断调整自身行为。

今天的AI已经逐渐掌握了其中的单项能力。视觉模型能够识别物体,大语言模型能够理解语义和常识,机器人系统也已经能够完成导航、抓取等任务。但当进入真实世界,需要这些能力共同完成一个开放环境中的任务时,问题开始变得复杂了。

机器人推动购物车之后,要处理的不只是自身运动,而是“机器人+购物车”的整体状态;当购物车装上大米,重量增加会改变惯性和制动距离,机器人还需要实时调整运动策略;而在陌生超市中,它也不能依赖提前制作好的地图,更需要结合视觉感知和已有知识,来完成自主导航。

如何把不同技能组合起来,尤其是让机器人自主完成这种组合,难上加难。这也是物理AI与数字世界AI的重要区别。

数字世界中的Agent虽然也会通过工具改变任务状态,但这种变化通常发生在可控的软件环境中。机器人面对的则是真实物理世界,每一个动作都会改变后续决策条件:拿起一个东西会改变自身状态,移动到新的位置会改变空间关系,与人交互还会引入新的安全约束。

所以,即便机器人掌握越来越多Skill,并不等于已经具备了通用能力。

从产业发展趋势来看,机器人泛化能力可分为三个阶段。第一阶段是跨对象泛化,机器人能够在同一任务流程中处理不同类型的对象;第二阶段是多任务智能,统一智能平台能够根据任务需求切换不同能力组合;第三阶段则是系统级自适应,这时,机器人可以根据环境变化自主调整,而无需重新开发、训练或部署系统。

真正推动机器人规模化落地的,正是从多任务智能走向系统级自适应的过程。

过去,机器人进入一个新的工厂、新的仓库或者新的应用场景,往往需要工程团队重新采集数据、调整模型、优化控制策略、配置系统。未来,如果机器人能够理解任务,并自主组合已有能力完成适配,部署成本就可能显著下降。

“智能层”成关键缺口

把自适应能力拆开,出现了四个关键问题。

首先是能力如何实现。机器人无法依靠单一模型完成所有任务,而是需要为不同环节匹配合适的模型、策略、规划器和控制器。

其次是不同能力如何在运行过程中持续协同。真实世界中的工作负载具有不同时间尺度,机器人要根据不同的时序要求,对模型、策略、规划和控制进行系统化组合。

第三是能力如何映射到计算资源。响应能力、自主决策和安全性要求大量智能计算在机器人本地完成,而这需要将计算任务与共享状态合理部署在 CPU、AI 加速器、边缘端和云端。

最后则是能力如何管控。行业需要关注的不只是碰撞规避、速度限制和力控制等基础安全问题,还包括空间与时间规则、任务偏好以及特定场景下的行为规范等更高层次约束。

在Pecora看来,要回答以上问题,一个能够动态组装、调度、部署和管控机器人各项能力的智能层,必不可少。

这是Arm正在研究的方向。事实上,除了Arm,其他巨头也在展开类似的探索。

Google DeepMind近期推出的Gemini Robotics系列,体现了一种越来越明显的分层思路。他们让更高层的具身推理模型负责理解环境、拆解任务、调用工具,并判断任务是否完成,再由更具体的机器人模型来执行动作。

英伟达的路线则更加偏向完整机器人基础设施。在GR00T机器人基础模型之外,英伟达同时构建了包括仿真平台、数据生成、世界模型和端侧计算在内的完整技术体系。GR00T N1采用“双系统”设计,高层视觉语言模型负责理解环境和任务,低层模型负责生成实时动作。

虽然具体技术路线有所差异,但趋势一致:大家都在想办法更好地组织不同层级的智能。

而一旦“智能层”成为机器人系统的重要组成部分,它可能反过来影响底层计算架构。因为机器人软件架构的变化,会改变系统对算力、实时性、功耗和安全性的需求。

机器人需要同时运行持续性的视觉感知、高层推理、高频动作控制以及安全系统,计算架构必须能够应对更加复杂的任务调度,并满足计算开销更高的控制需求。

进一步来看,未来计算平台可能还要支持不同机器人之间能力的复用与组合。“无论是人形机器人、移动机器人,还是其他形态的机器人,开发者都希望能够基于同一套基础平台构建应用,而不必在每一代芯片、每一种计算架构或每一个新产品上重复投入大量适配工作。”

Arm过往在计算架构和生态上的积累,有机会在这一过程中体现价值。通过覆盖传感器、实时控制、AI计算、边缘计算到云基础设施的完整计算生态,Arm 可以为机器人提供统一的计算基础,帮开发者在不同硬件平台之间复用软件、高效调度工作负载,并支持机器人“大脑”与“小脑”的协同运行。

Federico提到,Arm通过提供 ISA 一致性(ISA parity)等能力,让开发者能够基于统一架构完成软件开发,并更容易将相关能力迁移到边缘侧和终端机器人平台。

不过如何真正实现智能层上的突破还要继续摸索。Arm目前并没有宣布一个具体的“智能层”产品,他们更多是在研究未来机器人能力如何组合,并与机器人制造商、传感器厂商、控制器厂商以及半导体企业合作,推动计算架构和工具链演进。

从这个角度看,智能层的实现需要物理AI产业各方协作。当它逐渐走向成熟,物理AI便更有机会从Demo,走向真正的规模化应用。