跳到正文

行业动态Wired AI

来源时间 本站刊期

这些研究人员让 AI 驾驶一辆丰田卡罗拉去 In-N-Out

These Researchers Made AI Drive a Toyota Corolla to Get In-N-Out

GPT、Claude、Grok真车实测GPT唯一成功,但案例太少别当普遍能力。

判断

把语言模型接进车辆控制的团队,现在该把 DrivingBench 的完赛结果降级为待复现线索:先补足每模型多轮成绩和脱离提示的自主性,再决定是否把真车控制链路纳入选型。

依据

三位 Axiom 的 AI 工程师 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 说,他们想测模型在混乱真实世界里的操作能力;Mahns 把车技归因于多模态规模扩大后出现的 emergent capability(涌现能力)。做法是把聊天界面接到服务器,服务器再连挡风玻璃摄像头和车辆电动助力转向,安全员脚放刹车上。模型起初拒绝发运动指令,经提示才接手。他们自建的 DrivingBench(车辆驾驶基准测试)在停车场简单赛道测驾驶:只有 GPT-6 Astra 完赛,且很慢;Claude Fable 5.1 走完 45 percent,Grok 只走完 11 percent。

  • Claude Fable 5.145 percent
  • Grok11 percent
DrivingBench 完成度:Claude Fable 5.1 为 45 percent,Grok 为 11 percent。

没写清 材料没说 DrivingBench 每个模型跑了几轮、是否只跑同一条停车场路线,也没说 45 percent 和 11 percent 是在几次尝试里取的最好值还是平均值。

下一步 下一步可核对三人是否公开 DrivingBench 的逐轮记录与提示次数,并看 Astra 在多轮无提示下是否仍唯一完赛。

本期其他新闻

  1. 行业动态

    引用本·阿弗莱克

    Simon Willison

  2. 行业动态

    用 Amazon Quick 和 Amazon Bedrock 重新思考 RAG 的访问控制

    AWS Machine Learning Blog

  3. 行业动态

    Surface RTX Spark Dev Box 开放预购,售价 $5,999

    The Verge AI

  4. 行业动态

    超越节省的工时:为 Agentic 自动化构建商业论证

    AWS Machine Learning Blog

  5. AI工具

    微软正让 Copilot 对 Windows 和你的文件拥有更多控制权

    The Verge AI

  6. 精选深读

    新的 ChatGPT 更重展示而非讲述

    Wired AI

  7. 精选深读

    面向边缘的多模态开放 d1 决策模型

    Hugging Face