跳到正文

2026年08月17日AI 版

5 条 · 3 个来源

头版

行业动态Simon Willison

引用 Dario Amodei
Anthropic CEO公开质疑自身模型能力上限,取舍间凸显行业评测焦虑。

Amodei 这句话把 Anthropic 的公关预算和路线图排序摆到同一张桌上:他等于亲手否掉自家「讲好故事」的选项,把重建信任的偿付日押在能交付的成果上,代价是短期舆论继续走差也得认。

展开全文

依据

Anthropic 首席执行官 Dario Amodei 在 2026年8月16日 的一段话里,由 Simon Willison 收集:他认为公众对 AI 的负面观感,主因不是 AI 领袖反复警告风险,而是一场持续数十年的信任危机——普通人不信公司、政府与科技业,默认它们随时在算计自己。他同时替批评者划了靶子:包括 Anthropic 在内的 AI 公司至今没兑现「让世界受益」的大承诺,这是公司自己的账。机制在此:若信任缺失源于动机被怀疑,任何带正面叙事的投放都会被读成欺骗,他说「AI 能治癌」已是陈词滥调,唯一有效的是真的治癌。信任只能靠可验证的结果重建,成本因此从市场部转到研发与兑现周期——投放花钱即可,兑现要押上时间。

没写清 Amodei 没给「兑现」的判据:由谁裁定、用哪个指标、多久算数,材料里都没有,所以无法替他补一条时间表。

下一步 看 Anthropic 下一次重大发布是否附上可被外部第三方复核的交付结果,而不只是基准分数与效果宣称。

AI工具

2

  1. AI工具Simon Willison

    CORS Chat
    CORS 限制虽繁琐,但也为浏览器安全兜底,此项目或许能简化开发调试。

    对本地跑 LM Studio 或临时接 OpenRouter 的开发者,这改变的是「调试还要不要另写一层后端代理」这个决定——单人调通可以先走浏览器直连,代价是 bearer token 留在页面里,谁在这台机器上打开这个页面,谁就承担这份暴露面。

    展开全文

    依据

    Simon Willison 说,他在 2026年8月15日当天用 GPT-5.6-Sol xhigh 做了 CORS Chat,本意是测 Qwen 3.8 27B 在 LM Studio 里的表现,跑在 M5 MacBook Pro 和 NVIDIA DGX Spark 上。CORS(跨源资源共享,Cross-Origin Resource Sharing)是浏览器判断一个页面能否读取另一个源响应的规则:服务端不主动声明放行,前端就拿不到响应体,这正是本地模型调试通常要另起一层代理的原因。LM Studio 加 --cors 会补上放行头,OpenRouter 本身允许浏览器直连,他把两条都试通了。对话与配置存在浏览器本地,可导出为粘贴用的 JSON;另有一个细节,它认出正在生成的 SVG,在 token 还在流式输出时就把图画出来。对照数字:他站内 cors 标签 30 篇、openrouter 32 篇、lm-studio 23 篇,说明这类浏览器直连调试此前并不集中。

    • cors 标签30 篇
    • openrouter 标签32 篇
    • lm-studio 标签23 篇
    Simon Willison 站内三个相关标签的文章数对比。

    没写清 材料没写浏览器直连时 bearer token 存于何处、能否被同源脚本或已安装的浏览器扩展读到。

    下一步 可核对的下一步:LM Studio 以 --cors 启动后,浏览器直连与本地代理分别请求同一端点,返回的响应头与内容是否一致。

  2. AI工具Ahead of AI

    从零开始构建 AI 文本检测器
    自己造检测器,比商用更懂局限,但成本高且更新慢。

    它把「怎么知道这段文字会不会被判成 AI」这个决定交回写作者自己:与其只信商用接口给出的分,不如本地训一个 0–100 分的分类器,把分数当成润色时的约束条件;代价是这套东西得自己维护,模型一换代就要重训。

    展开全文

    依据

    Sebastian Raschka(Ahead of AI,2026年8月15日)说,Substack 新上线的 AI 检测功能让他想到把这套过程拆开讲:微调一个 DistilBERT(一种小型文本分类模型)作分类器,输出 0–100 分。他特意声明,这个分数是分类器在自身训练分布下对「AI 生成」这一类的估计概率,不能读成「这段文字真是 AI 写的」的概率。接着他把检测器当 verifier(验证器)接进 RLVR——可验证奖励强化学习,即用能自动判对错的分数当奖励信号——反过来训练小语言模型写出躲过检测的文本。他自己把这事定性为猫鼠游戏:检测器学到某个特征,下一代模型可以不带这个特征,检测器就得重训;他还预告会出现 false positive,也就是把人类写的文字判成 AI。全文只写方法与目标,说方法「类似」Pangram(他推测 Substack 用的就是它),没有给出准确率、误报率或任何成本数字。

    1. 构建数据集
      喂训练数据
    2. 微调 DistilBERT 分类器
      输出 0–100 分
    3. 本地部署评分 API 与 UI
      当验证器
    4. 接进 RLVR 训练规避模型
    这个项目从造数据到反过来训练规避检测模型的四步顺序

    没写清 材料没给准确率、误报率和训练/推理开销,所以自建与商用谁更准、谁更贵,这里不能替它补上结论。

    下一步 等仓库和本地 UI 放出后,拿一篇 2023 年前自己写的旧文跑一次,看它的 AI 分是不是 0。

精选深读

2

  1. 精选深读Simon Willison

    Qwen 3.8 27B 非常出色,但它默认会过度思考
    Qwen3.8 27B 能力虽强,默认推理过长拖慢实用,需调参享效率。

    在笔电或 DGX Spark 上部署 Qwen 3.8 27B 的人,第一步应把 reasoning_effort 从出厂默认的 xhigh 改到 low 或关闭,只在确实需要多步深挖的任务上再往上调。代价是复杂推理要让出部分深度,换回来的是简单任务不再被自己的思考过程吃光上下文和时间。

    展开全文

    依据

    Simon Willison 在 8月16日的博文里把 xhigh 默认称作「a hilarious default」,并明说这不是跑这个模型的好方式,尤其在消费级硬件上;他的建议是先跑 low,甚至完全不推理。机制在 Qwen 官方支持的 reasoning_effort(推理力度)参数上:xhigh 面向需要彻底分析的复杂任务,medium 在准确率与速度之间取舍,low 优先速度与成本。代价有实测对照:同一张「鹈鹕骑单车」SVG 提示词,xhigh 下花了 21 分钟,用掉 22,276 个推理 token,才产出 3,223 个输出 token;关掉推理后单次共 3,715 个 token、137 秒。更早的症状是 LM Studio 默认 8,192 token 的上下文(token 是模型处理文本的最小单位)被推理填满,加载到 262,144 上限才消失。他跑的是 17GB 的 Q4_K_M 量化版本(quantized,把权重压到约 4 位精度以缩小体积),硬件是 128GB M5 Max MacBook Pro 与 NVIDIA DGX Spark。

    • 默认 xhigh 推理 token22,276
    • 默认 xhigh 耗时21 分钟
    • 关闭推理总 token3,715
    • 关闭推理耗时137 秒
    同一张鹈鹕骑单车 SVG 提示词,默认 xhigh 与关闭推理的耗时和 token 对照

    没写清 材料里只有 Qwen 自报的基准,说它相对 Qwen 3.6 27B 和闭源的 Qwen 3.7-Plus 有提升,独立基准还没出;medium 档在同一提示词下的耗时与 token 数也没有,所以无法替它判断改到哪一档最划算。

    下一步 等独立基准公布 Qwen 3.8 27B 的分数,或自己用同一张鹈鹕 SVG 提示词跑一遍 medium 档,记下分钟数和 token 数,再决定默认档位。

  2. 精选深读Interconnects

    GLM-5.3:中国实验室如何跟上前沿
    追赶前沿不靠蒸馏,GLM-5.3的路径值得拆解,但别忽略算力代价。

    评估开源权重替代方案的工程团队,可以把 GLM-5.3 放进与闭源前沿模型同批试用的候选名单。但预算表要从「参数规模」改成「后训练算力消耗」来算。

    展开全文

    依据

    Nathan Lambert 在 Interconnects 里引了 Z.ai 博客的开头一句:「Scaling post-training is all we did for GLM-5.3」,即基座模型与 GLM-5.2 完全相同,只把后训练(post-training,预训练之后做对齐与强化学习的阶段)大幅拉长。他给的机制是:RL(reinforcement learning,强化学习)环境、任务和算力没法像蒸馏(distillation,从更强模型里提取输出与推理轨迹)那样被顺手拿走。可对照的数字是 GLM-5.3 约 750B 参数、只有 Kimi K3 的三分之一,却在多个 agentic coding(智能体编程)基准上超过 Kimi K3,部分超过 Claude Fable 5 或 GPT-5.6-Sol。Z.ai 这条线从 2019 年建队、2021 年 3 月放出 GLM 起就没断过,Lambert 因此不把蒸馏当成主因。

    • GLM-5.3 参数~750B
    • Kimi K3 参数GLM-5.3 约为其三分之一
    GLM-5.3 用约 750B 参数对标体量更大的 Kimi K3

    没写清 材料没给 GLM-5.3 这轮后训练实际烧掉的算力(GPU 小时或成本),所以无法替它算出这条路径的复制代价。

    下一步 两周后 Hugging Face 上的开放权重是否按期发布。