研究人员让 OpenAI GPT-6 Astra 驾驶 Toyota Corolla 去 In-N-Out
These Researchers Made AI Drive a Toyota Corolla to Get In-N-Out
三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。
文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。
Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 是 一家名为 Axiom 的初创公司的三名 AI 工程师,最近他们午餐想吃 In-N-Out Burger。
不过,他们并不打算自己开车。他们坐在 Bay Area 这家餐厅得来速车道附近的一辆 2024 Toyota Corolla 里,打开一台笔记本电脑,让 OpenAI 的 GPT-6 Astra 来掌舵。他们把一个聊天界面连接到一台服务器,而这台服务器连接着几台安装在挡风玻璃上的摄像头以及汽车的电动助力转向系统。一名安全驾驶员把一只脚悬在刹车上方,以防万一。
这个通常被用来生成文本、代码以及偶尔生成图像的 AI 模型,缓慢但稳妥地把车开到了取餐窗口,让他们能拿到食物。
“也许 AGI 终究已经来了,”其中一名工程师评论道。他指的是通用人工智能,也就是那种被大肆吹捧的、机器能够匹敌人类智能的理念。
当然,自动驾驶汽车并不是什么新鲜事,但它们通常由专门为这项任务训练和设计的算法来操作。在这个案例中,操作来自一个设计用于输出文本的模型,而且是即时发生的,三人事先没有对它进行任何指导。这个快餐店小把戏以及若干其他实验表明,基于语言的 AI 模型正开始获得对物理世界的一种初步但有用的理解。
尽管三人的午餐出行中没有发生任何明显令人担忧的事情,但他们承认,让一个通用模型掌控一块高速移动、重达两吨的钢铁,是一项高风险的尝试。随着物理理解能力提升,我们可能会看到 AI 模型以令人印象深刻——也许也很危险——的新方式触及现实世界。
走向物理世界
如今最聪明的模型极其擅长回答复杂问题,甚至能自主执行一些虚拟任务,但它们的能力往往局限于计算机和互联网的世界。把这些模型带到现实世界中,它们很快就会不知所措。尽管有人声称 AGI 已经到来,但 AI 公司显然把物理推理视为 AI 尚未攻克的前沿领域。
一些研究人员已经离开大公司,创办了专注于解决物理推理问题的初创公司。Andrew Dai 是其中一家名为 Elorian AI 的公司的 CEO,此前曾在 Google DeepMind 担任研究员。他说,更好的视觉推理能力将为 AI 开启许多新的应用,比如能够理解餐厅食客是否享受用餐体验的系统,或能够在家庭中运作的机器人。Dai 表示,机器人技术是检验物理推理能力的关键案例。“这对机器人技术相当关键,”他说。“没有这一点,你很难真正想象家用机器人。”
Elorian 和为大型 AI 实验室提供训练数据的公司 Scale AI 最近开发了一个新的基准测试 Humanity’s Sixth Sense,用于衡量模型理解物理场景的能力。
“大多数视觉 AI 研究都关乎感知,”参与开发该基准测试的 Scale AI 研究科学家 Xingang Guo 说。“我们想问的是,一个模型究竟需要具备什么,才能像人一样不假思索地凭直觉理解一个场景。”
对 Ramabadran、Mahns 和 Gessler 来说,他们在 Axiom 工作之外完成的 In-N-Out 项目的目标,是衡量模型在混乱的现实世界中能够运行得多好。
他们是在某个周末一起消磨时间时,萌生出测试模型驾驶技能的想法的。他们注意到,像 Astra 这样的模型能够构建复杂的 3D 模拟,于是想知道,这是否也意味着模型具备在现实世界中导航的能力。
Ramabadran 告诉我:“我们都生活在湾区,也经常接触 Tesla 和 Waymo,所以这或许起了一定作用。”
这些工程师先尝试测试 SpaceXAI 的 Grok,之后又试验了 OpenAI 和 Anthropic 的最新模型。起初,模型拒绝接管车辆——它们会返回类似“我可以帮助解读道路图像,但无法向实体汽车发出运动指令”这样的回复。但经过一些谨慎的提示后,它们可以被诱导着更进一步。当模型开始驾驶时,三人都惊呆了。
这些工程师表示,大型 AI 公司似乎正专注于提升其最新模型的空间推理能力,但他们怀疑这意味着这些公司实际上是在训练模型驾驶汽车。他们说,模型的车辆操控能力很可能是在专注于 3D 推理的训练过程中自然显现的。Mahns 告诉我:“这可能就像是单纯扩大模型多模态能力后产生的一种涌现能力。”他指的是如今用于训练模型的图像、视频和 3D 模型等输入。
不过,三人推出的一项名为 DrivingBench 的新车辆驾驶基准测试表明,这些模型距离通过驾驶考试仍有很长的路要走。该基准测试衡量模型绕着一个设置在停车场中的简单路线行驶的能力。只有 Astra 能够完成这条路线——而且速度非常慢。Claude Fable 5.1 完成了其中 45 percent 的路程,而 Grok 只完成了 11 percent。
Ramabadran 表示,最新的模型似乎能够针对错误进行调整;显然,它们适应了汽车的控制方式,并实时改进了驾驶表现。他说:“这些模型确实像是在根据自己的错误进行调整或开展上下文学习,并学会如何更好地操控。”GPT,来掌舵吧。
这是 Will Knight 的 AI Lab 新闻简报的本期内容。阅读往期简报 请点击这里。
来源:Wired · AI · wired.com