跳到正文

2026年09月02日AI 版

7 条 · 4 个来源

头版

行业动态Simon Willison

Claude的新系统提示词确实不想重现歌曲歌词
系统提示词强约束版权,这限制创作自由,却保障合规。

Anthropic 在 Claude 消费端提示词里把歌词与版权角色从可生成目标改成拒绝并转向分析;代价是误拒和创作体验受损,收益是降低 Sony/Warner 诉讼下的版权风险。

展开全文

依据

Simon Willison 对比 Fable 5 与 Fable 5.1 的系统提示词(system prompt,即模型行为约束文本),指出新增不复制歌词、诗歌、书籍段落,也不绘制已知角色或商标。Anthropic 的模型页把 Haiku 4.5 的 2025年10月15日原版与 2026年1月18日更新版并置,方便看差异。机制上,Claude 一旦在会话中拒绝某请求,后续更窄或改写版本也继续拒绝,并改为描述或分析;判断作品是否受保护时依据自身所知日期,不确定就拒绝。材料还提到 Sony Music Publishing 和 Warner Chappell 正因训练数据起诉 Anthropic,而该条款在消息曝光后数天内加入。这等于把生成能力边界转成产品合规闸门:越能识别版权内容,正常创作越容易被误伤,拒答成本由普通用户承担。

  1. 判断作品版权状态
    确认受保护
  2. 拒绝复现请求
    同一会话
  3. 持续拒绝改写或拆句
    提供替代
  4. 改为描述或分析
Claude 对受版权保护歌词/角色的拒绝与替代流程

没写清 材料没给误拒率、正常创作请求被拦截比例,也没说用户能否申诉误判。

下一步 下一步查 Fable 5.1 之后版本的提示词差异,看歌词与角色条款是否保留、放宽,或是否新增误判处理说明。

行业动态

2

  1. 行业动态Simon Willison

    引用Tarn Adams
    开发者自述取舍,创作自由比商业成功更重要,适合反思产品迭代。

    这条引用让做模拟类游戏的人重新决定:是把规则驱动的行为包装成「AI」去换融资与话题,还是像 Tarn Adams 一样只叫它「行为」。他选了后者,代价是让出这个词当前默认附带的模型光环。

    展开全文

    依据

    Dwarf Fortress 共同作者 Tarn Adams 说,字母被人拿走了,他现在只能谈 dwarf behavior(矮人行为),连 dwarf AI 都谈不了,因为「它不存在」。机制上,Dwarf Fortress 的矮人由规则和状态机(state machine,指按条件在既定状态之间切换的写法)驱动,行为可以逐条查、逐条改,不是从数据里学出来的权重。同一页并列的还有 GPT-6 Sol、GPT-6 Luna 这类标题,那里的 AI 指模型与推理,跟 Adams 说的规则系统不是一回事。取舍在于:留着「AI」这两个字母,等于接受它默认指模型,行为出问题只能归因到训练数据或算力;Adams 把它让出去,换来的是每个怪行为都能追到某一条规则。

    没写清 材料只给出「它不存在」这句否定,没说明 Dwarf Fortress 里矮人行为由哪些规则或代码结构生成,所以这个否定覆盖多大范围无法核对。

    下一步 下一次可核对的是 Adams 或 Bay 12 的公开发言与更新说明里,是否仍回避「AI」一词,还是改回用它描述矮人。

  2. 行业动态OpenAI

    AI原生公司如何将工作流转化为运营能力
    三个案例佐证AI原生转型路径,但企业需权衡投入与组织适配。

    这份案例集要管理层在采购 AI(人工智能)工具之前先回答一个排序问题:流程标准化与数据基础是前置条件,还是可以边用边补。OpenAI 挑的三个案例都站在前置这一边,选边用边补的团队会把返工成本压在流程重构环节。

    展开全文

    依据

    OpenAI 以 Basis、Clay 和 Exa Labs 三家为案例,分别落在客户入职、账户管理和开发者集成三类流程上,给出的共性做法是让 AI 代理(AI agent,即能自主执行多步任务的模型程序)嵌入核心业务流程,而不是当孤立工具用。机制在这里:代理要跑通,前提是流程本身能被拆成稳定步骤、数据能被代理读取,所以顺序是先理流程、再理数据、最后才轮到选工具。代价由谁付也很清楚——需要流程重构与变革管理能力的团队才付得起,材料自己写明,流程标准化程度低或数据基础薄弱的企业效果可能受限。因此这不是工具选型问题,而是投入顺序问题:先补流程的组织拿到的是复利,跳过这步的组织等于把代理装进没整理过的流程,最可能先卡在数据适配那一步。

    没写清 材料没有给出三个案例各自的投入金额、部署周期或收益口径,所以无法判断哪类规模、哪个行业的企业照做真的划算。

    下一步 可核对的下一步是 OpenAI 是否公开 Basis、Clay 或 Exa Labs 任一案例的部署周期与成本口径。

AI工具

1

  1. AI工具OpenAI

    ATV Big Air Tour借助ChatGPT将3天工作缩短为3小时
    3天缩至3小时,营销效率收益明显,但依赖提示词质量需人审。

    这条决定的是小团队营销排期按天还是按小时排:ATV Big Air Tour 把原本3天的素材制作压到3小时,交付节奏变了,但前提是先把审核岗定下来,否则省出的时间会被返工吃掉。

    展开全文

    依据

    OpenAI 案例里的说法是:ATV Big Air Tour 用 ChatGPT Work 做营销素材,原本3天的活压到3小时,商品照片在15分钟内转成库存网站页面。机制在于生成式AI(按指令产出文案、图像等新内容的模型)接手批量、重复的文案与设计任务,人从执行位挪到提示词(给模型的输入指令)与审核位,所以省下的是执行工时而不是判断工时。案例自己也把代价写在明处:输出质量取决于提示词质量,输入不精准就可能偏离品牌调性甚至出事实错误,需要人工校正;复杂创意和战略决策仍要专业判断;小团队还要额外承担工具成本和学习曲线。换句话说,3天到3小时换来的是吞吐,不是免审;对照数字只有这两组加一个15分钟,其余效率来源未被拆开。

    • 素材制作(改造前)3天
    • 素材制作(用 ChatGPT Work)3小时
    • 商品照片转库存网站15分钟
    同一批营销素材的时间对照:改造前3天,之后3小时,商品照片转站15分钟。

    没写清 材料没说这3小时里人工审核占多少、提示词通常要改几轮,也没给错误率或返工比例。

    下一步 等 OpenAI 或 ATV Big Air Tour 公布这类素材的人工审核工时与返工数据,再判断3小时是否含审核。

精选深读

3

  1. 精选深读Hugging Face

    在Confluent上利用IBM时间序列模型实现实时智能
    当流平台集成IBM时序模型,实时预测落地,但需考量部署成本。

    这改变的是做需求计划、反欺诈和工艺工程的人该不该停用额外库存、额外余量给长尾序列兜底,先让流上的一条线交给时序基础模型跑通。

    展开全文

    依据

    IBM 与 Confluent 的联合作者(Nicholas Fuller、Sean Falconer、Ayhan Sebin 等)在 9月2日 的文章里说:IBM Granite 时序基础模型(time series foundation model,TSFM,先用大量信号训一次、能泛化到没见过的序列)已在 Confluent Cloud 上 Early Access,从 Flink 调用,跑在数据本来就在流动的位置,Confluent Platform 随后补上本地与混合部署。机制在于过去是每条序列一个定制模型、每条要数月专家工时,于是团队只给「钱在的那几百条」建模,其余拿额外库存、额外余量、额外容差兜底,等窗口关了才动手——这笔边际就是没人能预测的决策成本,每个周期付一次。Flink 按序列键管状态并容错,模型要的历史不用另建数据存储,也不用每次调用打一次数据库。作者给的对照数字是:这些模型背后 44M+ 下载,生产力提升 5 到 10 倍,每一点精度值数百万。

    1. 产线信号按秒采样
      喂入窗口
    2. Flink 按序列管状态
      带历史调用
    3. Granite 预测与检测
      短缺点或漂移
    4. 下游系统执行动作
    从现场信号到下游动作的流式链路

    没写清 材料没给 Early Access 的定价、吞吐上限和名额时长,所以部署成本这一项不能替它算。

    下一步 等 Confluent Platform 版本落地时,核对官方是否同时公布计费方式与可承载的序列规模。

  2. 精选深读Google DeepMind

    推出基于Gemini的智能体视频理解
    视频理解转向行动决策,但实时交互延迟仍是落地瓶颈。

    决定长视频分析算力预算的团队,现在可以把「固定抽帧」换成让模型自己扫描,但只该先切在离线批处理上;一旦放进实时交互,省下的 token 换不来延迟上限,这笔账由盯端到端延迟的那个人付。

    展开全文

    依据

    Google DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 在 2026年9月1日的发布里说,新功能把模型的原生视频工具接进推理:静态处理按固定帧率(frames per second,即每秒取帧数,默认 1 FPS)整段吞视频,智能体视频理解则让模型自己搜索、扫描、回看目标片段,覆盖画面、音频和转写文本。官方给的对照数字是 token 消耗最多降 88%、分析成本最多降 66%、准确率最多升 7%,长视频(10 分钟教程到 90 分钟讲座、数小时录像)收益最大。取舍就在这里:88% 和 66% 都是「最高」值,也就是最好个案,而静态处理虽然贵,每段视频要喂多少帧是事先可算的;换成动态扫描后,扫描次数由模型临场决定,成本与耗时从固定值变成浮动值,实时交互那一步就没有可对外承诺的上限。启用方式是把 API 配置设为 agentic,在 Google AI Studio 或 Gemini Enterprise Agent Platform 生效。

    • token 消耗最高降 88%
    • 分析成本最高降 66%
    • 准确率最高升 7%
    Gemini 智能体视频理解官方给出的三项对照数字

    没写清 材料没有给动态扫描的单次耗时或端到端延迟数字,也没有扫描次数上限,所以无法替它判断实时交互能否达标。

    下一步 在同一段 90 分钟录像上分别跑 static 与 agentic 配置,记录 token 用量与端到端耗时。

  3. 精选深读Hugging Face

    BenchMIRT:LLM基准测试到底在衡量什么?
    基准测试衡量标准存疑,选型需谨慎,避免被榜单误导。

    评测和选型负责人不能再把 BBQ、WMDP 等安全基准的总分直接当成安全能力信号;要决定是否为这些榜单做题目(prompt)级拆题,否则会为推理能力买单却误判安全行为。

    展开全文

    依据

    AllenAI 的 Kyle Wiggers 称,BenchMIRT 在题目(prompt)级审计大型语言模型(LLM)基准,并公开技术报告、数据和代码。它借用心理测量学里的 Item Response Theory(IRT,项目反应理论)——用答题模式估计能力——再扩展成 multidimensional IRT(MIRT,多维项目反应理论),把同一批题上的多种能力拆开。它在 100 个 LLM、16 个基准、超过 34K 道题上训练,未被告知基准标签,却独立恢复出 safety(安全)和 general reasoning(通用推理)两个主导维度,换一次分析仍出现。机制上,BBQ 原测社会偏见、常被归入安全,但这里更贴近 general reasoning;WMDP 测生物、化学、网络安全等危险双重用途知识,也更强关联 general reasoning,且 general reasoning 越强 WMDP 分数越低,因为拒绝或答不出危险知识才算期望回答;HarmBench 的标准与情境题更贴 safety,版权题更贴 general reasoning。把这类题平均成一个分数,会让选型方误把推理难度当成安全表现。

    • LLM 数100
    • 基准数16
    • 问题数超过 34K
    • 主导维度2
    BenchMIRT 审计规模:100 个 LLM、16 个基准、超过 34K 道题,并恢复出 2 个主导维度。

    没写清 材料没给 BBQ、WMDP、HarmBench 各题在两个维度上的载荷值,也没说这些归属会不会随模型版本或题目改写而漂移,因此不能替它补出具体阈值。

    下一步 下一步可下载 AllenAI 的 BenchMIRT 数据集,核对 BBQ 与 WMDP 的维度载荷,并复跑同一批 100 个 LLM,看 safety/general reasoning 归属是否复现。