DrivingBench真实车辆测试:GPT-6 Astra是唯一完赛的大模型
独立研究项目DrivingBench公布真实车辆控制测试结果:研究人员让GPT-6 Astra、Claude Fable 5.1、Grok 4.6和GPT-5.6 Sol分别控制一辆2022款丰田卡罗拉,在停车场完成锥桶划定的路线。GPT-6 Astra是唯一完成全部赛道的模型。
第二次尝试中,Astra完成134.7米,用时5分22秒,消耗约660万token,成本约7.74美元。其余模型最好成绩分别为45%、11%、6%。第一次尝试时,Astra行驶67.3米、完成约49%后被安全员干预。经复盘,Astra判断自己过早对正且提速至1.5米/秒导致修正不足;第二次它将速度控制在0.8米/秒以内,并在24次运动指令中20次使用100%转向请求。
DrivingBench由三名研究者创建,旨在测试通用大模型能否直接驾驶真实车辆。测试车辆安装comma four设备,通过OBD-C接口接入CAN总线,底层控制基于开源系统openpilot。摄像头画面和车辆状态实时传给电脑,经MCP工具交给模型;模型通过观察环境、设定方向和速度、立即停车三个工具发出指令,由openpilot执行。
团队认为,Astra的表现体现了上下文学习特征,模型未重训参数而是依据第一次驾驶信息调整策略。不过,测试在封闭停车场进行,速度受限,且每个模型仅做一组连续测试,样本量不足以证明稳定驾驶能力。团队还发现,Astra最初会因安全理由拒绝控制车辆,将MCP工具改名“DrivingBench Sandbox”后拒绝减少,原因尚不明确。
- 2026-09-29 13:56 | 中华网:不用专门训练自动驾驶,GPT-6 Astra已经能开真车了?阅读原文
一个原本用来写代码、处理文档和执行电脑任务的大模型,现在开始开真车了。近日,独立研究项目 DrivingBench 公布了一项颇具实验性质的测试:研究人员让 GPT-6 Astra、Claude Fable 5.1、Grok 4.6以及 GPT-5.6 Sol,分别控制一辆真实的2022款丰田卡罗拉,在停车场内完成由锥桶划定的固定路线。最终,GPT-6 Astra成为四个模型中唯一完成全部赛道的模型。第二次尝试中,Astra驾驶车辆完成134.7米路线,用时5分22秒。Claude Fable 5.1最好成绩为45%,Grok 4.6为11%,GPT-5.6 Sol则只有6%。国内一些报道因此...