行业动态Wired AI
来源时间 本站刊期
这些研究人员让 AI 驾驶一辆丰田卡罗拉去 In-N-Out
These Researchers Made AI Drive a Toyota Corolla to Get In-N-Out
GPT、Claude、Grok真车实测GPT唯一成功,但案例太少别当普遍能力。
判断
把语言模型接进车辆控制的团队,现在该把 DrivingBench 的完赛结果降级为待复现线索:先补足每模型多轮成绩和脱离提示的自主性,再决定是否把真车控制链路纳入选型。
依据
三位 Axiom 的 AI 工程师 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 说,他们想测模型在混乱真实世界里的操作能力;Mahns 把车技归因于多模态规模扩大后出现的 emergent capability(涌现能力)。做法是把聊天界面接到服务器,服务器再连挡风玻璃摄像头和车辆电动助力转向,安全员脚放刹车上。模型起初拒绝发运动指令,经提示才接手。他们自建的 DrivingBench(车辆驾驶基准测试)在停车场简单赛道测驾驶:只有 GPT-6 Astra 完赛,且很慢;Claude Fable 5.1 走完 45 percent,Grok 只走完 11 percent。
- Claude Fable 5.145 percent
- Grok11 percent
没写清 材料没说 DrivingBench 每个模型跑了几轮、是否只跑同一条停车场路线,也没说 45 percent 和 11 percent 是在几次尝试里取的最好值还是平均值。
下一步 下一步可核对三人是否公开 DrivingBench 的逐轮记录与提示次数,并看 Astra 在多轮无提示下是否仍唯一完赛。