跳到正文

行业动态AWS Machine Learning Blog

来源时间 本站刊期

在 Amazon SageMaker AI 上用多轮 RL 微调搜索 Agent

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI

小搜索Agent用多轮RL微调后,检索质量与可靠性提升。

判断

如果团队曾因小模型多轮检索不稳而改用前沿模型,这条把采购/技术选型改成:在 Amazon SageMaker AI 上用多轮强化学习微调小模型,把工具与环境知识教进模型,再决定是否还用前沿模型兜底。

依据

AWS Machine Learning Blog 的 Huibin Shen、Pooja Karadgi、Sifei Li 和 Lorenzo Stella 在 2026年10月2日 的文章里说,搜索 Agent 要在多轮交互中自主决定搜什么、用哪条检索策略、何时停止,并根据已检索内容调整下一轮。机制难点是基础模型不预先知道你的工具和环境:提示小模型,多轮行为很少可靠;提示前沿模型,往往可用,但延迟和成本更高。作者给出的第三条路是微调,把工具和环境直接教给小模型,目标是小模型的速度与成本,加上原本要靠前沿模型才有的可靠性;标题中的 multi-turn RL(多轮强化学习,reinforcement learning)就是这条微调路径。文中还提到传统 SFT(监督微调,supervised fine-tuning)依赖专家演示。

  1. 用户提问
    接收任务
  2. 决定搜什么
    发起检索
  3. 选检索策略
    返回内容
  4. 读取检索结果
    判断是否继续
  5. 决定停止或继续
搜索Agent在多轮交互中的循环:先决定搜什么、再选检索策略,读结果后决定停止或继续。

没写清 材料没有给出多轮强化学习微调前后的检索准确率、延迟或成本对照数字,无法判断相对前沿模型省了多少。

下一步 下一步核对 AWS 博文后续是否公开训练脚本、评测数据集,以及 SFT 与多轮 RL 的对照结果。

本期其他新闻

  1. 行业动态

    Apple 将限制 Mac 磁盘访问,因 AI Agent 风险“大幅”增加

    The Verge AI

  2. 行业动态

    这些 AI 专家想要公开进行高风险研究

    Wired AI

  3. 行业动态

    用自主 AI 重新定义企业智能

    MIT Technology Review AI

  4. AI工具

    Meta 开源代码,让你制作 Muse AI 设备

    The Verge AI

  5. AI工具

    使用 Amazon Quick 和 Adjudicated Query 模式对数千份租约进行合规扫描

    AWS Machine Learning Blog

  6. AI工具

    用 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全的 Web Search

    AWS Machine Learning Blog

  7. 精选深读

    GPT-6 系列模型指南

    OpenAI

  8. 精选深读

    开源 AstaBrief,Asta 中的快速报告生成模型

    Hugging Face