精选深读Hugging Face08:00
在100个GRPO步骤中微调350M模型以获得更好的结构化输出
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
百步GRPO微调350M模型,效率亮点但需验证任务适用性。
判断
打算把结构化输出接进下游解析的团队,可先在免费 Colab 上花一次 100 步 GRPO 微调 350M,再决定要不要换更大模型;但 29.7% 的通过率意味着多数请求仍需解析兜底,别撤。
依据
作者 Leonie Monigatti、Ben Burtenshaw、Sergio Paniego 在 Hugging Face 发布这套配方:用 TRL(Hugging Face 的强化学习训练库)对 LFM2.5-350M 做 GRPO(Group Relative Policy Optimization,组相对策略优化,按同一提示下多条回答的相对好坏给奖励)微调,约 500 条样本、100 步,跑得动免费档 Colab 或 Kaggle GPU;评测走 IFStruct(检验输出能否被解析、是否符合 schema 的基准)。机制上是任务特定微调带来的提升,不是换更大的模型。对照数字:基础模型 452/2000 通过(22.6%),微调后 29.7%;基础模型按格式 JSON 18.0%、YAML 27.2%,按结构 wrapper key 28.5%、bare list 16.6%,最差的 test__recipe 只有 4.3%;平均延迟 1453ms,失败里 7228 次是 required field missing(该给的必填字段没给)。
- 微调前整体通过率22.6%
- 微调后整体通过率29.7%
- 基础模型 JSON18.0%
- 基础模型 YAML27.2%
没写清 材料只给微调后的整体 29.7%,没有按 JSON、YAML 或实体类型拆开,所以无法判断哪条支线真的涨了。
下一步 等作者放出 GRPO 版的 results/ 结果文件,核对 JSON 与 YAML 各自从 18.0% 和 27.2% 涨到多少。