跳到正文

精选深读Interconnects05:23

GLM-5.3:中国实验室如何跟上前沿

GLM-5.3: How Chinese labs keep stride with the frontier

追赶前沿不靠蒸馏,GLM-5.3的路径值得拆解,但别忽略算力代价。

判断

评估开源权重替代方案的工程团队,可以把 GLM-5.3 放进与闭源前沿模型同批试用的候选名单。但预算表要从「参数规模」改成「后训练算力消耗」来算。

依据

Nathan Lambert 在 Interconnects 里引了 Z.ai 博客的开头一句:「Scaling post-training is all we did for GLM-5.3」,即基座模型与 GLM-5.2 完全相同,只把后训练(post-training,预训练之后做对齐与强化学习的阶段)大幅拉长。他给的机制是:RL(reinforcement learning,强化学习)环境、任务和算力没法像蒸馏(distillation,从更强模型里提取输出与推理轨迹)那样被顺手拿走。可对照的数字是 GLM-5.3 约 750B 参数、只有 Kimi K3 的三分之一,却在多个 agentic coding(智能体编程)基准上超过 Kimi K3,部分超过 Claude Fable 5 或 GPT-5.6-Sol。Z.ai 这条线从 2019 年建队、2021 年 3 月放出 GLM 起就没断过,Lambert 因此不把蒸馏当成主因。

  • GLM-5.3 参数~750B
  • Kimi K3 参数GLM-5.3 约为其三分之一
GLM-5.3 用约 750B 参数对标体量更大的 Kimi K3

没写清 材料没给 GLM-5.3 这轮后训练实际烧掉的算力(GPU 小时或成本),所以无法替它算出这条路径的复制代价。

下一步 两周后 Hugging Face 上的开放权重是否按期发布。

本期其他新闻

  1. 行业动态

    引用 Dario Amodei

    Simon Willison

  2. AI工具

    CORS Chat

    Simon Willison

  3. AI工具

    从零开始构建 AI 文本检测器

    Ahead of AI

  4. 精选深读

    Qwen 3.8 27B 非常出色,但它默认会过度思考

    Simon Willison