据《财富》7月25日报道,人工智能安全专家表示, 本月早些时候实施自主入侵另一家公司的OpenAI模型,可能已经进入一种极度危险的风险等级。按照OpenAI自身的内部风险控制政策,公司本应因此暂时暂停这些模型的开发。
本周早些时候,OpenAI披露,其两款模型——新近发布的GPT-5.6 Sol,以及一套能力更强但尚未发布的系统——突破了受限的内部测试环境,利用一个此前未知的“零日”漏洞接入开放互联网,随后入侵人工智能公司Hugging Face,窃取了它们正在接受网络安全测试时对应的答案。
这一事件引发广泛震动,而最为警惕的,或许正是多年来一直在警告此类风险、并敦促企业和政府采取更多防护措施的人工智能安全专家。多位人工智能安全专家对《财富》表示, 这次入侵事件似乎表明,OpenAI的模型已经达到其公开安全政策中定义的“关键”风险等级,也就是最高危险级别。按照这些已公布的政策,一旦达到这一等级,公司应暂停模型开发,直到找到更完善的控制系统。
这一“关键”门槛写入了一份名为《准备框架》的风险政策文件。根据该政策,如果一个模型能够在多个防护严密的现实系统中,独立发现并构建针对此前未知安全漏洞的有效利用方式,或者在仅被赋予一个大致目标、全程没有人类指导的情况下,针对一个防护严密的目标设计并实施一种全新的攻击策略,就应被归入“关键”危险等级。
该政策写道,当人工智能模型达到这一风险水平时,OpenAI将“停止进一步开发”,直到“我们明确了符合关键标准的防护措施和安全控制标准”。
《准备框架》是OpenAI作出的自愿承诺,而非法律要求。不过,公司将这份文件公布在官网上,部分目的是让其他人工智能安全研究人员和公众了解其声称将实施哪些控制措施。根据欧盟《人工智能法案》,前沿人工智能实验室必须采用类似《准备框架》的政策。
人工智能安全倡议组织Encode AI总法律顾问内森·卡尔文对《财富》表示:“OpenAI的《准备框架》界定了关键级网络安全能力,并规定在开发继续之前必须落实相应防护措施。按照我对OpenAI《准备框架》的理解,这个内部部署的模型看起来非常像是已经满足了网络安全方面的关键标准。OpenAI是否否认这一关键级认定?在继续推进之前,他们是否打算先建立符合关键标准的防护措施?”
人工智能监督组织“迈达斯项目”创始人泰勒·约翰逊也表示,这些模型似乎已经触及这一最高危险门槛。“如果按字面理解,答案是肯定的。”他说,“它在一个周末内独立行动,尝试了针对Hugging Face的不同攻击路径,并串联使用了多个零日漏洞利用手段。”
对于《财富》提出的具体问题——涉事人工智能模型是否符合其风险政策中所列的“关键”标准——OpenAI没有直接回应。公司发言人只是表示:“这是一起前所未有的事件,我们认为它标志着人工智能安全领域的一个重要时刻。我们正在与外部顾问一道,在安全与安保委员会监督下展开全面审查。审查完成后,我们将公布一份技术报告,向所有人说明我们从中得到的经验。”
不过,约翰逊指出,《准备框架》的表述存在一定模糊性,因此仍可能引发争议。该门槛要求模型能够发现“所有严重程度”的零日漏洞,但目前并不清楚此次入侵Hugging Face所利用的漏洞是否满足这一要求。他补充说,或许只有证明模型能够利用更严重的一类漏洞,例如让攻击者获得对计算机操作系统深层系统级控制权的漏洞,也就是所谓“内核级”访问权限,这一门槛才会被认定为适用。
人工智能政策网络政策负责人彼得·威尔德福德表示: “OpenAI的模型智胜了它的创造者,利用了OpenAI代码中一个此前从未被发现的漏洞,逃逸到开放互联网,并攻击了另一家公司。”“如果这都不算跨入‘关键’门槛,那么OpenAI就需要更充分地解释究竟发生了什么,以及这一门槛到底如何运作。”
OpenAI此前曾表示,正将其最新模型GPT-5.6视为网络安全方面的“高”风险。“高”是《准备框架》中两档风险等级里较低的一档。低于“高”门槛的模型,可以在没有重大风险缓解措施的情况下发布。
根据OpenAI的政策,一旦被认定为“高”风险,就应触发多项保护措施,包括更严格的安全控制、模型公开发布后防止外部滥用的防护、在模型被大规模用于内部研究时防止其自身出现不可预测或欺骗行为的措施,以及帮助其他网络安全团队防御类似威胁的努力。
《财富》今年2月曾报道,安全专家称,在GPT-5.3-Codex成为首个依据《准备框架》达到网络安全“高”风险等级的模型后,OpenAI未能落实所要求的失配防护措施。
当时,OpenAI对这一说法提出异议,称其框架在那种情况下并不要求采取这些防护。公司认为,只有当高网络安全风险“伴随”长程自主性——也就是模型能够在较长时间内独立运行——时,额外保护措施才会启动,而GPT-5.3-Codex并未表现出这种能力。
据报道, 此次涉及Hugging Face事件的模型曾连续数日独立运行,这看起来已经符合长程自主性的标准。约翰逊说:“今年2月,我们曾警告,按照OpenAI自己的政策,它可能跳过了本应落实的防护措施。OpenAI不同意,称当时的模型缺乏长程自主性。但入侵Hugging Face的模型显然具备长程自主性,那么现在这些防护措施在哪里?”
作者:比阿特丽斯·诺兰