头条 · AI 版Simon Willison
Claude的新系统提示词确实不想重现歌曲歌词
Claude's new system prompt really doesn't want to reproduce song lyrics
系统提示词强约束版权,这限制创作自由,却保障合规。
周三 · 2026年09月02日
Crypto 版当天未出刊,不用往期内容顶替——这份组合就是这天实际发布的全部。
头条 · AI 版Simon Willison
Claude's new system prompt really doesn't want to reproduce song lyrics
系统提示词强约束版权,这限制创作自由,却保障合规。
引用Tarn Adams
开发者自述取舍,创作自由比商业成功更重要,适合反思产品迭代。
行业动态Simon Willison
AI原生公司如何将工作流转化为运营能力
行业动态OpenAI
ATV Big Air Tour借助ChatGPT将3天工作缩短为3小时
AI工具OpenAI
在Confluent上利用IBM时间序列模型实现实时智能
精选深读Hugging Face
精选深读Google DeepMind
推出基于Gemini的智能体视频理解视频理解转向行动决策,但实时交互延迟仍是落地瓶颈。
决定长视频分析算力预算的团队,现在可以把「固定抽帧」换成让模型自己扫描,但只该先切在离线批处理上;一旦放进实时交互,省下的 token 换不来延迟上限,这笔账由盯端到端延迟的那个人付。
依据
Google DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 在 2026年9月1日的发布里说,新功能把模型的原生视频工具接进推理:静态处理按固定帧率(frames per second,即每秒取帧数,默认 1 FPS)整段吞视频,智能体视频理解则让模型自己搜索、扫描、回看目标片段,覆盖画面、音频和转写文本。官方给的对照数字是 token 消耗最多降 88%、分析成本最多降 66%、准确率最多升 7%,长视频(10 分钟教程到 90 分钟讲座、数小时录像)收益最大。取舍就在这里:88% 和 66% 都是「最高」值,也就是最好个案,而静态处理虽然贵,每段视频要喂多少帧是事先可算的;换成动态扫描后,扫描次数由模型临场决定,成本与耗时从固定值变成浮动值,实时交互那一步就没有可对外承诺的上限。启用方式是把 API 配置设为 agentic,在 Google AI Studio 或 Gemini Enterprise Agent Platform 生效。
没写清 材料没有给动态扫描的单次耗时或端到端延迟数字,也没有扫描次数上限,所以无法替它判断实时交互能否达标。
下一步 在同一段 90 分钟录像上分别跑 static 与 agentic 配置,记录 token 用量与端到端耗时。
精选深读Hugging Face
BenchMIRT:LLM基准测试到底在衡量什么?基准测试衡量标准存疑,选型需谨慎,避免被榜单误导。
评测和选型负责人不能再把 BBQ、WMDP 等安全基准的总分直接当成安全能力信号;要决定是否为这些榜单做题目(prompt)级拆题,否则会为推理能力买单却误判安全行为。
依据
AllenAI 的 Kyle Wiggers 称,BenchMIRT 在题目(prompt)级审计大型语言模型(LLM)基准,并公开技术报告、数据和代码。它借用心理测量学里的 Item Response Theory(IRT,项目反应理论)——用答题模式估计能力——再扩展成 multidimensional IRT(MIRT,多维项目反应理论),把同一批题上的多种能力拆开。它在 100 个 LLM、16 个基准、超过 34K 道题上训练,未被告知基准标签,却独立恢复出 safety(安全)和 general reasoning(通用推理)两个主导维度,换一次分析仍出现。机制上,BBQ 原测社会偏见、常被归入安全,但这里更贴近 general reasoning;WMDP 测生物、化学、网络安全等危险双重用途知识,也更强关联 general reasoning,且 general reasoning 越强 WMDP 分数越低,因为拒绝或答不出危险知识才算期望回答;HarmBench 的标准与情境题更贴 safety,版权题更贴 general reasoning。把这类题平均成一个分数,会让选型方误把推理难度当成安全表现。
没写清 材料没给 BBQ、WMDP、HarmBench 各题在两个维度上的载荷值,也没说这些归属会不会随模型版本或题目改写而漂移,因此不能替它补出具体阈值。
下一步 下一步可下载 AllenAI 的 BenchMIRT 数据集,核对 BBQ 与 WMDP 的维度载荷,并复跑同一批 100 个 LLM,看 safety/general reasoning 归属是否复现。