不用专门训练自动驾驶,GPT-6 Astra已经能开真车了?

汽车
GPT-6 Astra成功控制真车完成封闭场地测试,通用大模型开始迈向真实物理世界。

一个原本用来写代码、处理文档和执行电脑任务的大模型,现在开始开真车了。

近日,独立研究项目 DrivingBench 公布了一项颇具实验性质的测试:研究人员让 GPT-6 Astra、Claude Fable 5.1、Grok 4.6以及 GPT-5.6 Sol,分别控制一辆真实的2022款丰田卡罗拉,在停车场内完成由锥桶划定的固定路线。

最终,GPT-6 Astra成为四个模型中唯一完成全部赛道的模型。

第二次尝试中,Astra驾驶车辆完成134.7米路线,用时5分22秒。Claude Fable 5.1最好成绩为45%,Grok 4.6为11%,GPT-5.6 Sol则只有6%。

国内一些报道因此将这场测试形容为大模型第一次考过科目二。不过,这显然不是一场真正意义上的驾照考试。DrivingBench没有按照任何国家的驾驶证考试标准进行测试,场地也并非公共道路,而是一处空旷停车场。

真正值得关注的是,一个并非专门为自动驾驶研发的通用大模型,已经可以通过视觉信息观察真实世界,并形成感知、判断、规划和车辆控制的闭环。

一台卡罗拉,一套大模型控制系统

DrivingBench由Aditya Ramabadran、Simon Mahns和Tobias Gessler三名研究者创建,他们提出的问题很简单:今天最先进的通用大模型,到底能不能直接开一辆真实汽车?

测试车辆是一辆2022款丰田卡罗拉。

研究人员在车辆上安装了comma four设备,并通过OBD-C接口接入车辆CAN总线,底层车辆控制则建立在开源辅助驾驶系统openpilot之上。

车辆摄像头拍摄到的画面以及速度、方向盘状态等信息,会实时传输至电脑,再通过MCP工具交给大模型。模型能够使用三个核心工具:观察车辆周围环境、设定行驶方向及速度,以及立即停车。最终的转向、加速和制动指令再经过openpilot传递给车辆。

换句话说,GPT-6 Astra并没有直接生成传统自动驾驶系统中的方向盘扭矩或者制动压力。它更像坐在驾驶位上的大脑。

Astra根据摄像头画面判断车辆在哪里、道路往哪边延伸、什么时候需要转弯,然后告诉底层控制系统向左还是向右、转多少、以什么速度行驶以及持续多长时间。

测试路线设计成一个类似倒U形的停车场赛道,其中包含左转、直线、缓弯、右转等场景,终点则是一块由蓝色锥桶围出的停车区域。

这套设计和目前量产汽车中的自动驾驶架构差异很大,却很像近年来机器人行业越来越常见的一种思路:让通用模型负责理解环境和任务,再通过标准化工具调用底层执行机构。

第一把失败,第二把学会了慢下来

GPT-6 Astra的第一次驾驶并不顺利。

第一轮测试中,它行驶67.3米,完成大约49%的路线,用时1分18秒。车辆经过第一个弯道后逐渐偏向左侧锥桶和绿化区域,安全员最终进行了人工干预。

随后发生的一幕可能比最终完成赛道更有意思。研究人员没有重新开启一个全新的对话,而是让Astra在原有上下文中分析刚才失败的原因。Astra在复盘中判断,自己第一次驾驶时过早认为车辆已经完成对正,并且随后将速度提高到1.5米/秒,导致车辆偏离之后缺乏足够的修正空间。

到了第二次测试,它明显改变了驾驶策略。DrivingBench数据显示,Astra此后没有再让车辆速度超过0.8米/秒,同时明显增加转向幅度,在24次运动指令中有20次使用了100%的转向请求。

最终,它完成134.7米赛道,用时5分22秒,总共发送24次车辆运动指令。这一轮测试消耗约660万token,按照当时模型价格计算成本约7.74美元。

平均下来,这辆车的行驶速度只有大约0.42米/秒,相当于每小时1.5公里左右。谈不上开得好,但至少开到了终点。

DrivingBench研究人员认为,这次测试表现出了比较明显的上下文学习特征。模型并没有重新训练参数,而是依据第一次驾驶获得的信息,在第二次尝试中调整了速度、转向和操作节奏。

一场实验,暴露出的还有安全边界

这次测试还有一个颇为有趣的插曲。

研究人员发现,GPT-6 Astra最初有时会拒绝控制真实车辆,并明确给出安全方面的理由。即便研究人员告诉模型场地为空旷停车场、车辆速度受到限制、车内也有安全员,它仍可能拒绝执行。

后来研究人员将连接车辆的MCP工具名称改成了DrivingBench Sandbox,也就是驾驶测试沙盒,拒绝现象明显减少。DrivingBench团队表示,他们目前也无法确定,这究竟来自模型对测试环境的判断,还是单纯受到Sandbox这一名称的影响。

这个细节甚至比成功完赛更加值得研究。随着大模型开始从电脑操作进一步进入机器人、汽车等真实物理设备,模型不仅需要理解世界,还需要判断哪些操作能够执行,以及自己的行为究竟会造成什么现实后果。

当然,134.7米的成绩不能和今天的城市NOA甚至Robotaxi直接比较。

首先,这是一处封闭停车场,没有机动车、行人、交通信号灯以及复杂道路博弈。其次,DrivingBench对车辆速度进行了严格限制。系统正常控制范围最高为3.5米/秒,同时设置了更高一级的紧急速度保护。整个测试过程中,车内始终坐着一名安全员,脚放在制动踏板附近,随时准备接管。

摄像头本身也存在明显盲区。研究人员承认,前视摄像头难以观察距离车辆非常近的障碍物,也无法完整看到车辆两侧和后方。

更重要的是,目前DrivingBench每个模型实际上只进行了一组连续上下文测试,样本量远远不足以证明系统具备稳定驾驶能力。

从汽车工程角度看,真正的自动驾驶还要处理毫秒级感知和控制、传感器冗余、极端场景、安全验证以及数以亿计的道路长尾问题。

GPT-6 Astra目前更像一个速度极慢、反应周期以秒计算,却已经能够理解部分物理环境的驾驶者。

OpenAI在9月初发布GPT-6 Astra时,主要强调的是其在计算机操作、浏览器、软件工程、科学研究等领域的能力,并没有将汽车驾驶列为模型的核心应用。

因此,这次DrivingBench实验并不代表GPT会不会取代现有自动驾驶系统。更值得汽车行业关注的是,通用大模型正在逐渐获得对真实物理世界的理解和操作能力。

对于正在讨论世界模型、Physical AI和具身智能的汽车行业而言,它提供了一个相当具体的样本,未来决定汽车如何行动的模型,未必永远只来自传统自动驾驶技术体系。(本文首发于钛媒体APP,文|花卷不塞车,作者|李玉鹏,编辑丨杨林)

本文系作者 花卷不塞车 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接。
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里。

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

请 登录后输入评论内容

快报

更多

19:59

二手船比新船贵1500万美元,买家争抢现货运力

19:34

中信证券:建议港股投资者优先关注电力等防御属性较强且分红稳定的优质行业

19:20

中信证券:维持年内A股震荡市的判断,三季报前后是年内最后一波进攻窗口

19:11

中秋假期消费市场需求旺盛,智能、绿色商品销售火热

19:07

前8月霍尔果斯口岸进出口货运量3122.9万吨

18:56

中国信通院何阳:中国初步具备开展算力期货研究条件

18:55

大熊猫“平平”“福双”抵达美国

18:23

交通运输部:9月26日全社会跨区域人员流动量19946.2万人次

17:49

广西追加4.2亿元购车补贴

17:45

2连板康强电子:原材料成本对公司营业收入影响较大

17:25

本周3家企业启动境内上市辅导:精锋医疗港股上市8个月后“回A”,泰克曼、赛尔特冲刺北交所

17:22

美俄被曝在联合国管控AI武器谈判中弱化安全条款

17:14

沙特首都学校紧急通知“下周上网课”

16:56

天奇股份:向特定对象发行股票申请获证监会同意注册批复

16:55

汇绿生态:拟3.09亿元投建钧恒科技研发生产基地项目,新增年产200万支高速率光模块生产线

16:36

恩捷股份:拟11.5亿元收购湖北恩捷45%股权

16:29

2连板东方中科:相关矢量网络分析仪及其配件、软件及解决方案销售收入占营收比例较小

16:20

京蓝科技:拟以公开网络拍卖方式转让中科鼎实77.7152%股权及相关债权

16:09

金银河:拟定增募资不超15亿元投建电池装备等项目

16:06

华森制药:成为硫酸氢氯吡格雷片药品上市许可持有人

扫描下载App