IT时代网8月8日消息,OpenAI披露,内部评估与外部专家复核指向同一个结论:即将推出的Astra模型,在智能体编程和网络安全两个方向上出现了明显跃升。按照该公司自己制定的《准备框架》,Astra被划入“关键”风险级别,这是其模型序列中头一个在网络安全维度触及该等级的产品。
那么“关键”意味着什么?框架里写得很直白,满足任意一条即可触线。一是无需人类干预,模型能在多个经过安全加固的真实关键系统中,自行识别并写出涵盖各严重等级的零日漏洞利用程序。二是只给出高层级的战略目标,模型就能针对加固目标自主构想并实施一整套端到端的网络攻击。
OpenAI特别澄清了一点,Astra尚未发布,此前针对某开源模型托管平台的网络攻击事件与它无关。
围绕这款模型,公司列出了一串管控动作。对高能力模型及配套研发活动收紧安全控制,包括设置隔离测试环境、限制网络与工具访问权限、加强模型权重的保护与加密、追加监控与检测能力,并让相关流程在沙箱中运行;凡是达不到上述强化标准的Astra相关内部活动,一律暂停。
针对Astra的所有智能体应用——训练阶段和评估阶段都算在内——公司部署了覆盖高风险行为与对齐失效的全局监控,同时通过审查模型思维链来拦截高风险操作。此外,OpenAI表示正在与相关政府机构以及指定的AI安全组织合作测试该模型,并向第三方测试伙伴提供推荐的安全控制规范,确保更高风险的评估与工作负载能在受控状态下运行。
首席执行官萨姆·奥尔特曼随后表态称,Astra性能强劲,公司正在全力推进它的公开发布。他说,把顶尖模型攥在少数人手里从来不是个好策略,只是考虑到它在网络安全方面的能力,还需要一点时间把风险兜住,希望大家不用等太久。
一款模型强到让开发方自己先踩刹车,这种场景在过去并不多见。
注:本文中包含AI辅助创作的内容。