行业动态OpenAI19:00
网络关键能力时代下的模型开发节奏
Pacing model development in an era of cyber-critical capabilities
OpenAI为前沿模型加安全锁,暂缓激进迭代,适用于高风险AI部署前的评估。
判断
准备把前沿模型接入网络防御或关键基础设施的团队,应把发布节奏改成“先过对抗性测试再上线”;若评估覆盖不到突现能力,就主动推迟,而不是按原定日期发。
依据
OpenAI称,将针对前沿模型强化监控、对齐(alignment,让模型行为符合人类意图)与安全措施,并据此调整开发节奏。机制是:当能力接近网络关键阈值(cyber-critical,足以显著改变网络攻防成本的水平)时,部署前必须经过更严格评估,这会拖慢新模型发布。材料给出的对照是“创新速度受限”换“降低滥用风险”,适用对象为网络攻击或关键基础设施等高风险场景。其限制也明确:评估有效性依赖对抗性测试(adversarial testing,用攻击样本检验模型)的全面性,且可能无法完全预见未来能力突现。
没写清 材料没说更严格评估的具体门槛、测试项目、通过标准,也没说新模型可能被推迟多久。
下一步 下一步可核对 OpenAI 后续模型卡或系统卡是否披露网络关键能力的评估门槛与放行结论。