跳到正文

AI工具Hugging Face01:16

使用Strands Agents、LeRobot和Hugging Face存储桶,在一个地方记录、训练和部署

Record, train, and deploy from one place with Strands Agents, LeRobot, and Hugging Face Storage Buckets

软硬件一体方案简化机器人开发,但样机未公布精度与成本,先观望。

判断

做具身数据采集的团队要决定:是否把「录制—训练—回灌」的中转层从本地磁盘换成 Storage Bucket。省下的是每天重传全量录像和训练前把数据集拷到 GPU 的字节,付出的代价是放弃版本化带来的回滚点。

依据

亚马逊的 Sundar Raghavan 等五位作者在 Hugging Face 博文(2026年8月13日)里把这条回路压进一个 agent:同一个 Robot() 先录 LeRobotDataset,经 sync_dataset_to_bucket 同步进 Storage Bucket,再用 stream_dataset 流式读回训练,最后把 checkpoint 部署回硬件,磁盘上的格式始终是 LeRobot 原样。机制是 Storage Bucket 为 Xet 支撑的可变、非版本化对象存储,和数据集同在 hf:// 命名空间、共用同一个 hf CLI,配合字节级去重(byte-level deduplication,指每次同步只上传内容发生变化的字节),把「每天跑一遍」从重复搬全量变成增量。可对照的规模是 LeRobot 格式已被 90,000+ 数据集与模型、8,000+ 发布者使用,按该格式录的数据不必转换就能被现有工具读。取舍压在版本控制上:bucket 可变且不版本化,覆盖写没有回滚点,团队要么在外层自己留副本,要么接受丢掉历史批次,这也是把中转层搬上 Hub 时要先认下的账。

  • 采用该格式的数据集与模型90,000+
  • 发布者8,000+
LeRobot 数据格式在 Hugging Face Hub 上的采用规模。

没写清 材料未给出增量同步相对全量上传实测省下的字节数,所以「省多少」不能替它补上。

下一步 跑一遍 examples/notebooks/05_streaming_data_loop.ipynb,记录一次同步实际上传的字节数与流式训练耗时,再决定是否值得放弃版本化。

本期其他新闻

  1. 行业动态

    开放模型现状:2026年夏季观察

    Hugging Face

  2. AI工具

    不要分类。要幻觉!

    Simon Willison

  3. 精选深读

    GLM-5.3:中国实验室如何跟上前沿步伐

    Interconnects

  4. 精选深读

    推出Gemini 3.7 Flash

    Google DeepMind

  5. 精选深读

    GPT-5.6构建者指南

    OpenAI