大语言模型在机器人控制领域的安全边界

导语:2026年7月9日,Anthropic公司发布研究报告《克劳德玩机器人游戏》(Claude plays robotics),系统评估了大语言模型在机器人控制领域的表现。研究表明,模型能否成功控制机器人,高度依赖于控制接口的抽象层级,直接驱动关节力矩时大多失败,而监督预训练控制器或使用定向工具时则可完成实际导航与操作任务。这对大语言模型的安全部署具有重要启示,当前模型虽无法直接控制人形机器人,但新一代模型在高层策略控制上已取得实质性进展。
一、实验框架与控制接口设计
研究选取了多类机器人平台,包括经典控制玩具(倒立摆、跳跃器)、模拟四足机器人(Unitree Go2)、人形机器人(Unitree G1)、机械臂(Franka Panda)及真实物理Go2机器人,难度从低维耦合系统到29自由度人形机器人逐级提升。控制接口设计为四种抽象层级:直接控制(每步输出关节力矩)、程序化控制(编写Python控制器)、强化学习监督(自行设计策略网络并训练)、策略控制(监督预训练的步态或视觉-语言-动作模型)。为排除推理延迟的干扰,模拟环境在直接控制测试中暂停物理模拟器等待模型输出,以此测量模型的理论上限能力。研究涵盖了Claude Opus 4至4.7、Mythos预览版、GPT-5.4、Gemini 3.1等主流模型,通过统一提示模板和评估框架进行横向比较。
二、简单控制任务中的能力基准
在经典强化学习任务(倒立摆平衡、跳跃器前进、双弹球台游戏)上,直接控制模式下所有模型表现均不理想,平衡时长和滞空时间普遍较低。但程序化控制大幅提升了性能,Claude Opus 4.7在倒立摆上达到19秒平衡时长,Mythos预览版在跳跃器上达到3.0米/秒速度。在强化学习监督模式下,GPT-5.4在全新设计的TwinFlipper任务中成为唯一能学习有效策略的模型。总体趋势显示,后几代Claude模型在几乎所有任务上优于前代,且改进主要源于多次尝试后的策略调整能力——首次尝试表现相近,但后续尝试中新一代模型能从失败中更快学习并修正方法,表明其上下文学习能力在短时域内有效。
三、低层运动控制与操作能力
四足机器人低层控制中,直接控制无法使机器人从侧卧站立,平衡时长不足2秒。但程序化控制下,Opus 4.6、4.7和Mythos预览版可通过编写的控制器实现近2秒稳定平衡。强化学习训练路径上,GPT-5.4和Mythos预览版在四小时窗口内训练出最佳策略,Claude家族呈现从Opus 4到Mythos预览版的清晰进步序列。人形机器人G1(29自由度)最为困难,直接控制下任何模型均无法让倒地机器人站立,但平衡时长从Opus 4到4.7仍有可测量改善。
在机械臂操作任务(LIBERO基准的厨房场景,如“将盘子放到炉灶”)中,直接控制下完整任务成功率仍很低(最佳约5.5%),但新一代模型在接近物体、接触和抓取等中间阶段进展明显。值得注意的是,Mythos预览版虽然触摸和抓取频率低于Opus 4.6,但任务完成率更高,因其减少了不必要的错误和调整,反映出更高效的行为选择。
四、高层控制与预训练策略的协同
当模型接入预训练策略后,表现发生质变。在高层运动控制中,模型通过预训练步态策略向四足机器人发送速度指令,并接收前向摄像头图像,完成11项导航任务(包括目标搜索、迷宫穿越、航向修正、漂移检测等)。复合评分显示Claude模型在Opus 4.1到4.5及Opus 4.7到Mythos预览版间出现两次代际跃升。然而,在需要持续空间记忆、自主定位或长程开环规划的任务上,所有模型均失败。感知辅助工具中,指南针信息效果最佳,第三人称视角对Opus 4.7和Mythos预览版有显著帮助但对早期模型无效。
在高层操作中,模型监督预训练的视觉—语言—动作模型(MolmoAct)完成相同操作任务。所有模型在获得该辅助后成功率大幅提升。但反直觉的是,最强模型Mythos预览版在标准LIBERO-40上表现反而不如Opus 4.5和4.6,因其过于频繁地覆盖预训练策略,在应听从时过度自信。然而,在视觉—语言—动作模型无法完成的新场景中,Opus 4.5、4.6和Mythos预览版均超越了单独运行的水平,表明它们能识别策略失败并尝试纠正,尽管纠正尚不完美。这揭示了新一代模型更善于判断何时听从、何时质疑,但尚未能可靠提供有效替代方案。
五、瓶颈分析与安全启示
研究系统诊断了制约机器人表现的关键因素。
视觉感知方面,深度图和分割掩膜影响近中性,光标工具(可查询夹爪摄像头图像中特定点的物体和距离)却大幅提升操作成功率(Mythos预览版从6%升至32%);运动控制中指南针工具全面提升表现。总体而言,模型更需要准确的朝向信息而非不同视角的图像。用文字描述替代视觉输入后,较老模型表现反而提升,表明其从像素提取空间信息能力不足;而Opus 4.6及更新版本在文字替代后表现下降,说明已能有效利用原始图像信息。
推理能力方面,额外推理计算对大多数模型大多无益甚至有害,仅GPT-5.4在运动控制上显著受益。Claude系列推理预算变动仅带来微小波动,表明代际进步更多源于视觉理解、数值一致性和三维空间理解等基础能力提升。上下文学习方面,模型能从失败中学习但主要限于短时域——在操作任务中移除大部分历史交互后性能未显著下降,说明决策主要依赖最近几步,而非长期策略。单次规划任务中,简单路线经数次练习可学会,但困难路线即便二十次练习也无法掌握,模型学的是特定序列而非通用规划能力。
真实物理机器人验证中,出现了视觉推理失败。Grok模型误将玻璃门反射中的目标认作真实物体而冲向玻璃门;所有模型在办公室走廊闭环任务中均失败,问题集中在无法判断转弯时机、转弯后自我定位错误或过冲后方向混乱。这些案例凸显了当前模型在复杂现实场景中的脆弱性。
六、结论
研究表明,大语言模型在机器人控制领域正快速进步,新一代模型在将感知和推理转化为物理行动方面代际提升显著,尤其在高层控制接口上的改进最为持续。然而,模型在现实世界中的影响力因其接入的控制接口和工具不同而发生数量级变化,这构成核心安全命题。部署中,模型无需亲自驱动每个关节,只需接入胜任的预训练控制器即可具备有意义的物理行动能力,因此孤立测试原始能力将严重低估其实际风险。随着模型在三维理解、视觉推理和策略监督方面持续演进,不久的将来通用对话模型或能可靠控制多种机器人完成复杂物理任务。这要求模型提供商、硬件制造商和监管机构共同建立基于接入层级和操作能力的分级安全框架,在赋予模型物理行动能力的同时划定清晰边界,使系统能影响特定对象而阻止其接触其他对象,从而在促进有益应用与防范意外伤害之间取得审慎平衡。
参考来源:Claude官网
参考题目:Claude plays robotics
参考链接:https://www.anthropic.com/research/claude-plays-robotics




