行业动态AWS Machine Learning Blog
来源时间 本站刊期
在 Amazon SageMaker AI 上用多轮 RL 微调搜索 Agent
Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
小搜索Agent用多轮RL微调后,检索质量与可靠性提升。
判断
如果团队曾因小模型多轮检索不稳而改用前沿模型,这条把采购/技术选型改成:在 Amazon SageMaker AI 上用多轮强化学习微调小模型,把工具与环境知识教进模型,再决定是否还用前沿模型兜底。
依据
AWS Machine Learning Blog 的 Huibin Shen、Pooja Karadgi、Sifei Li 和 Lorenzo Stella 在 2026年10月2日 的文章里说,搜索 Agent 要在多轮交互中自主决定搜什么、用哪条检索策略、何时停止,并根据已检索内容调整下一轮。机制难点是基础模型不预先知道你的工具和环境:提示小模型,多轮行为很少可靠;提示前沿模型,往往可用,但延迟和成本更高。作者给出的第三条路是微调,把工具和环境直接教给小模型,目标是小模型的速度与成本,加上原本要靠前沿模型才有的可靠性;标题中的 multi-turn RL(多轮强化学习,reinforcement learning)就是这条微调路径。文中还提到传统 SFT(监督微调,supervised fine-tuning)依赖专家演示。
- 用户提问接收任务
- 决定搜什么发起检索
- 选检索策略返回内容
- 读取检索结果判断是否继续
- 决定停止或继续
没写清 材料没有给出多轮强化学习微调前后的检索准确率、延迟或成本对照数字,无法判断相对前沿模型省了多少。
下一步 下一步核对 AWS 博文后续是否公开训练脚本、评测数据集,以及 SFT 与多轮 RL 的对照结果。