跳到正文

精选深读Hugging Face08:00

在100个GRPO步骤中微调350M模型以获得更好的结构化输出

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

百步GRPO微调350M模型,效率亮点但需验证任务适用性。

判断

打算把结构化输出接进下游解析的团队,可先在免费 Colab 上花一次 100 步 GRPO 微调 350M,再决定要不要换更大模型;但 29.7% 的通过率意味着多数请求仍需解析兜底,别撤。

依据

作者 Leonie Monigatti、Ben Burtenshaw、Sergio Paniego 在 Hugging Face 发布这套配方:用 TRL(Hugging Face 的强化学习训练库)对 LFM2.5-350M 做 GRPO(Group Relative Policy Optimization,组相对策略优化,按同一提示下多条回答的相对好坏给奖励)微调,约 500 条样本、100 步,跑得动免费档 Colab 或 Kaggle GPU;评测走 IFStruct(检验输出能否被解析、是否符合 schema 的基准)。机制上是任务特定微调带来的提升,不是换更大的模型。对照数字:基础模型 452/2000 通过(22.6%),微调后 29.7%;基础模型按格式 JSON 18.0%、YAML 27.2%,按结构 wrapper key 28.5%、bare list 16.6%,最差的 test__recipe 只有 4.3%;平均延迟 1453ms,失败里 7228 次是 required field missing(该给的必填字段没给)。

  • 微调前整体通过率22.6%
  • 微调后整体通过率29.7%
  • 基础模型 JSON18.0%
  • 基础模型 YAML27.2%
整体通过率 22.6% 到 29.7%,同一基础模型上 JSON 低于 YAML

没写清 材料只给微调后的整体 29.7%,没有按 JSON、YAML 或实体类型拆开,所以无法判断哪条支线真的涨了。

下一步 等作者放出 GRPO 版的 results/ 结果文件,核对 JSON 与 YAML 各自从 18.0% 和 27.2% 涨到多少。

本期其他新闻

  1. 行业动态

    前线防御者的黎明:10亿美元保护关键服务

    OpenAI

  2. 行业动态

    Legora使用GPT-6 Astra在几分钟内审阅了41份文档

    OpenAI

  3. 行业动态

    Playco使用GPT-6 Astra将游戏原型制作中的手动修复减少50%

    OpenAI

  4. 精选深读

    推出WeatherNext 3,我们最先进、最准确的全球天气AI模型

    Google DeepMind

  5. 精选深读

    推出Gemini 3.8 Flash和3.8 Flash Cyber

    Google DeepMind

  6. 精选深读

    NeoMME:一种高效的多模态原生和多语言编码器

    Hugging Face