独立研究项目 DrivingBench 进行了实车测试,通用大模型 GPT-6 Astra 通过视觉反馈与工具调用,成功控制丰田卡罗拉在封闭停车场内跑完全程。这证明通用大模型正逐步具备在物理世界实现闭环控制的潜力。
一个原本用于编程、文档处理和日常任务的通用大模型,如今开始开真车了。
近日,独立研究项目 DrivingBench 公布了一项探索性测试:研究人员让 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 以及 GPT-5.6 Sol 控制一辆真实的 2022 款丰田卡罗拉,尝试在由锥桶划定的停车场封闭赛道中行驶。
最终,GPT-6 Astra 成为参测模型中唯一跑完全程的模型。

在第二次测试中,Astra 耗时 5 分 22 秒完成了 134.7 米的赛道。相比之下,Claude Fable 5.1 的最好成绩为完成 45% 的路线,Grok 4.6 为 11%,GPT-5.6 Sol 仅跑完 6%。
这场测试并非严格意义上的驾照考试,场地是无行人的空旷停车场,规则也未参照官方标准。但这项测试证明:一个未经专门自动驾驶训练的通用多模态大模型,已能仅凭视觉信号理解物理世界,并完成感知、决策、规划到车辆执行的闭环。
DrivingBench 由三位独立研究者创建,旨在探究当下顶尖的通用模型是否已具备直接操控现实汽车的能力。

测试团队在一辆 2022 款卡罗拉上加装了 comma four 设备,经由 OBD-C 接口连接车辆 CAN 总线,底层驱动则依赖开源辅助驾驶系统 openpilot。
车外摄像头采集的图像、车速及方向盘转角等状态信息会实时推送到主控电脑,并借助 MCP 协议向大模型提供工具调用接口。模型被赋予三个权限:

模型本身并不输出底层扭矩或制动压力,而是作为高层决策大脑。Astra 观察图像、评估自车相对位置与路径走向,随后下发转向幅度、目标车速等离散指令,最终由 openpilot 转换为物理执行。
这种分层控制更贴近当下具身智能机器人的开发思路:上层通用模型负责场景认知与高阶规划,底层传统控制器负责动作执行。
GPT-6 Astra 的初试并不顺利。首轮测试进行到 67.3 米(约总程 49%)时,车辆在首个弯道后偏向左侧绿化区,安全员随即人工介入接管。
与以往独立测试不同,研究团队未清空上下文,而是让 Astra 在同一对话中复盘失败原因。Astra 分析后指出,自己在尚未完全回正时过早加速至 1.5 米/秒,导致偏离轨迹后缺乏修正时间。

进入第二轮尝试后,Astra 明显改变了驾驶逻辑。它将速度严格限制在 0.8 米/秒以内(全赛道平均车速仅约 0.42 米/秒),并在 24 次转向控制中有 20 次果断打满方向。
整轮驾驶共调用 24 次控制指令,消耗约 660 万 Token,按公开 API 价格折算单次成本约 7.74 美元。模型未调整底层权重,仅依靠上下文学习便完成了行车策略的自我纠正。
测试中还出现了一个值得玩味的插曲:GPT-6 Astra 最初频繁拒绝控制实车,并给出了明确的安全顾虑。即便提示词中反复强调现场为空旷封闭场地且配备安全员,模型依然拒绝下发运动指令。
直到研究人员将 MCP 接口名称由物理操控命名改为“DrivingBench Sandbox”(沙盒)后,拒绝行为才大幅减少。这反映出随着模型能力延伸至物理设备,模型内置的安全对齐机制在判断虚拟测试与真实风险时仍存在模糊地带。

当前测试表现离商用自动驾驶仍有巨大鸿沟。测试环境高度受限,前视单目摄像头存在大面积近身与侧后方盲区,模型的推理延迟也长达数秒,无法应对公共道路上的毫米级实时博弈与长尾极端工况。
但这场实验展现了通用 Physical AI 的雏形。未来车辆与机器人的行为控制中枢,或许不一定局限于专用的端到端小模型,通用智能体理解物理空间并下达决策的路径已经初现端倪。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断