跳到正文

AI工具Simon Willison05:54

不要分类。要幻觉!

Don't classify. Hallucinate!

分类任务易饱和,生成式幻觉反成灵活工具,但代价是结果不可控。

判断

做博客、商品目录这类标签体系的人,现在要决定是否停止把全量标签塞进提示词让模型做分类选择题,改成先让模型自由生成候选,再用向量嵌入回落到已有标签。这样换来的是对长尾和未见标签的灵活覆盖,但代价是每一次映射都要自己验错。

依据

Simon Willison 在 2026年8月14日的链接博客里说,他博客有 1,856 个标签,一次喂给 LLM(大语言模型)再问“哪些标签匹配”可能太多。Doug Turnbull 的办法是:先让模型不看已有词表,直接输出它认为合适的标签;再用 vector embeddings(向量嵌入)对已有语料做比对,找出与模型“想象”标签最接近的具体标签。材料里的示例提示还要求先给模型看标签形状,例如“Furniture / Living Room Furniture / Coffee Tables & End Tables / Coffee Tables”,再让它对查询“brown coffee table”生成分类。机制上,分类被拆成自由生成候选和检索落到已有词表两步,因此模型不必在 1,856 个标签里一次做闭集选择。

  • ai2,247
  • generative-ai1,992
  • llms1,958
  • embeddings61
Simon Willison 博客四个标签的计数对照,高频标签在千级、embeddings 在两位数。

没写清 材料没有给出自由生成候选再经向量检索后落到已有标签的准确率、延迟或成本,也没说与直接分类相比错配多少,因此不能替它判定这套方法更优。

下一步 下一步可拿一小批已有标签的内容,让同一模型自由生成标签,再记录向量检索落到 1,856 个标签中的命中率和人工纠正数。

本期其他新闻

  1. 行业动态

    开放模型现状:2026年夏季观察

    Hugging Face

  2. AI工具

    使用Strands Agents、LeRobot和Hugging Face存储桶,在一个地方记录、训练和部署

    Hugging Face

  3. 精选深读

    GLM-5.3:中国实验室如何跟上前沿步伐

    Interconnects

  4. 精选深读

    推出Gemini 3.7 Flash

    Google DeepMind

  5. 精选深读

    GPT-5.6构建者指南

    OpenAI