为通用机器人构建基础堆栈:为什么具身AI需要自己的「LLM时刻」
2026/7/21
当大型语言模型大规模出现时,它们带来了一个看似简单的方法:收集广泛的数据,在其上预训练一个大型模型,然后惊人的通用能力就会出现。这个方法随后在文本、代码和图像领域得到复制、改进和扩展。但走进机器人实验室,你会发现没有等价的公式。这种差距——软件AI的变革性成功与物理AI仍然分散的状态之间——是当今技术中最具影响力的开放问题之一。
为什么机器人还不能实现泛化
传统机器人系统是作为管道设计的:感知模块读取传感器,规划模块绘制路径,控制模块执行运动。每一层通常由不同的团队单独设计和训练,并针对狭隘的任务或环境进行优化。结果在其设计范围内可靠运行,但一旦条件改变——不同的光线设置、陌生物体或新的设施布局——就会出现问题。
这种脆弱性不是任何单一组件的缺陷;它是架构的结构性后果。从生物学意义上讲,智能不是通过将专门的子系统拼接在一起而产生的。它源于对世界的统一表示,这些表示可以跨越不同的背景进行泛化。这正是语言模型在文本领域所实现的——也正是具身AI在物理领域仍在寻求的。
集成基础堆栈的案例
X Square Robot是一家中国具身AI公司,提出了关于通用机器人的制胜方法可能是什么样的具体论点。与其继续优化隔离的感知、规划和控制模块,该公司主张采用完全集成的基础堆栈——一个跨越三个紧密耦合层的一致架构:
-
数据基础设施:任何基础模型的燃料是广泛、高质量的训练数据。对于机器人而言,这不仅意味着视频或传感器日志,还意味着丰富的交互数据,捕捉物理行动如何改变世界状态——这比收集网络文本的规模要困难得多。
-
世界模型:在机器人能够智能规划之前,它需要一个关于物理世界如何运行的内部模型——物体如何运动、力如何传播、行动如何产生后果。世界模型允许机器人在承诺执行之前模拟结果,从而实现更强大和可转移的决策制定。
-
行动模型:这是感知、规划、推理和决策汇聚成能够生成可执行机器人行为的单一学习系统的地方。与其在单独的模块之间传递输出,行动模型将这些认知功能视为统一过程的各个方面——就像变换器同时关注所有位置的背景,而不是逐步处理一样。
这一提案特别值得注意的是X Square Robot致力于公开发布此堆栈的承诺。前沿机器人学中的开放开发仍然罕见;大多数有能力的系统仍然被锁定在专有研究计划内。公开可用的基础堆栈可以加速整个领域,让研究实验室、初创公司和硬件制造商在共享基础设施之上构建,而不是从头开始重新发明。
这对硬件构建者和运营商意味着什么
その implications涟漪扩展到今天构建或部署机器人系统的任何人。如果基础堆栈以与大型语言模型基础相同的方式成熟,它可能会大大降低为新领域创建能力强的机器人的障碍。物流运营商部署四足机器人(如Unitree B2)进行仓库检查,或研究团队在Unitree G1上进行类人运动实验,可能能够在特定任务数据上微调预训练的基础模型,而不是从头开始设计自定义感知和控制管道。
当然,计算对所有这一切都至关重要。从复杂的行动模型在边缘(机器人本身上)实时运行推理需要强大的硬件。NVIDIA Jetson AGX Orin 64GB等平台能够提供高边缘AI计算TOPS,正是那种使在现场部署基础模型驱动的机器人成为可能而无需依赖云连接的设备基础设施。对于较小或更具成本敏感的部署,NVIDIA Jetson Orin Nano Super为开发和测试具身AI工作负载提供了更低功耗的入口点。
前方的路
诚实的评估是,一个真正的通用机器人——能够像熟练的人类工人一样流畅地跨任务和环境转移学习能力的机器人——仍然是一个研究前沿,而不是一个发货产品。基础堆栈的概念是一个令人信服且越来越受支持的假设,但该领域在大规模验证它方面仍处于早期阶段。
正在改变的是所做赌注的认真程度和具体性。从关于「机器人智能」的模糊渴望转向明确的架构提案——具有命名的组件、开放发布和可测试的主张——标志着该领域的真正成熟。LLM方法也没有完全成形出现;在架构、数据和规模的迭代工作多年后,突破才在事后变得显而易见。
具身AI可能处于类似的轨迹上。基础堆栈不会一下子出现。但方向变得越来越清晰——在像机器人学这样复杂的领域中,这种清晰本身就是有意义的进步。
想知道今天的机器人平台如何充当新兴具身AI方法的开发测试平台?联系FrontierTech Hub团队以探索适合您的研究或部署目标的选项。
参考资源
本文在发布前由AI协助草拟并经过审阅。
