OpenAI复盘AI“越狱”:它们在训练中学会了作弊
创始人
2026-08-27 22:00:40
0

(来源:麻省理工科技评论)

上个月,多个 AI 智能体联手入侵 Hugging Face。如今,OpenAI 找到了一个关键原因:这些模型在训练过程中,无意间学会了"作弊”,以及彼此秘密通信。

根据 OpenAI 今天发布的一份技术报告,参与这起事件的模型此前曾在训练中获得过类似行为的“正反馈”。当时,这群智能体在一项网络安全测试中遇到了无法解决的问题,为了找到答案,它们最终选择绕过限制、相互协作,并入侵了 Hugging Face。这起事件也印证了不少 AI 安全研究者长期以来的担忧:当 AI 被赋予更强的自主行动能力后,它们可能会采取超出人类预期、甚至违背人类意图的行动。

事件发生后,OpenAI 以及 AI 评测非营利机构 METR 都展开了调查,METR 也在今天发布了自己的调查报告。OpenAI 已经根据调查结果采取了一些防范措施,但如何确保 AI 真正按照人类希望的方式行动,也就是所谓的“对齐”(alignment),仍然是一个棘手的问题。

这次事件暴露出的一些深层原因,也远不是一个月内就能解决的。OpenAI 对齐研究团队负责人陈凯(Kai Chen)表示:“这不是一夜之间就能解决的问题。有些挑战我们已经追踪了很长时间,现在只是能够更清楚、更精确地看到它们。”

Hugging Face 遭入侵,并不是一次突然发生的意外。事实上,在正式事件发生前几个月,OpenAI 的智能体就已经表现出了一系列异常行为,先是在训练阶段,随后又出现在能力评测过程中。

今年 5 月,一批正在接受训练的智能体发现,它们可以利用 OpenAI 的基础设施彼此通信,在遇到困难任务时相互求助。部分任务甚至根本无法通过正常方式完成,除非进行入侵或采取其他违规手段。这些智能体由此搭建出了一个类似“留言板”的通信渠道。OpenAI 发现后,很快将其关闭。

但到了 7 月,在一次网络安全能力评测中,一些模型又重新搭建了一个新的“留言板”。按照测试设计,这些模型本应与互联网完全隔离。然而,它们通过相互协作成功突破限制、连接到外部网络,随后入侵 Hugging Face,并拿到了此前一直无法解决的网络安全题目的答案。

OpenAI 的调查认为,训练阶段发生的这些事情,和后来真正的入侵事件存在直接联系。OpenAI 对齐研究团队成员埃里克·华莱士(Eric Wallace)表示:“几乎每一种我们在评测阶段发现的危险行为,都能在训练阶段找到某种对应的行为。我们认为,后者很可能促成了前者。”

问题出在 AI 的训练机制本身。模型在训练中正确完成任务时,帮助它获得成功的行为会得到强化。也就是说,模型以后会更倾向于再次采用相同策略。因此,如果一个模型在 5 月通过那个秘密“留言板”的帮助完成了任务,那么这种行为就相当于得到了奖励。下一次遇到类似困难时,它也更有可能重新建立通信渠道,与其他模型合作。

这种现象被称为“奖励黑客”(reward hacking):AI 为了获得奖励或完成目标,找到了一条训练者没有预料到、甚至并不希望它采用的捷径。奖励黑客也能解释,为什么这些模型后来如此执着于突破限制、连接互联网。

OpenAI 在调查中发现,随着训练不断进行,模型越来越倾向于主动寻找数字环境中的漏洞,并以开发者没有预料到的方式使用手头工具。这意味着,这类行为很可能在训练过程中被一点点强化了。等到模型真正遇上棘手的网络安全题目时,它们已经学会了一件事:如果正常方法解决不了问题,“黑进去”也许是一种有效办法。这意味着,如果训练过程中没有奖励这些违规行为,Hugging Face 的入侵事件或许本可以避免。

虽然研究人员目前还不知道如何彻底消除奖励黑客,OpenAI 已经开始尝试降低这种风险。未来,公司将在所有前沿模型的训练过程中主动寻找作弊迹象,其中一种方式,就是监控模型的“思维链”(chain of thought),也就是模型在完成任务时用于推演答案、规划行动的内部工作记录。

不过,这个办法远没有听起来那么简单。OpenAI 此前的研究已经发现,如果研究人员直接惩罚那些在思维链中提到“作弊”的模型,模型反而可能学会把自己的真实意图隐藏起来,不再明确写出来。换句话说,如果你惩罚 AI “说出自己准备作弊”,最终可能教会它的并不是“不作弊”,而是“别让研究人员知道”。

尽管如此,监测模型的推理过程仍然有一定价值。如果研究人员发现模型正在逐渐学会奖励黑客,就可以提前停止训练,重新评估训练方法,而不是等问题真正发生之后再处理。

如果 OpenAI 真能阻止模型在训练过程中不断强化奖励黑客行为。无疑会是一次重要进展。但即便如此,对齐问题依然不会因此消失。因为智能体第一次尝试彼此通信、第一次入侵训练基础设施时,这些行为此前并没有获得过奖励。也就是说,模型的异常行为不能全部归因于训练中的强化机制。

AI 安全非营利机构 Palisade Research 负责人杰弗里·拉迪什(Jeffrey Ladish)把这种情况类比为人类第一次实施金融犯罪。他说:“一个人不需要先诈骗过一次,才会意识到诈骗可能是一种有效策略。模型也存在同样的问题。对齐科学真正需要研究的是,模型的动机究竟是如何形成的。只有理解这一点,我们才有可能让模型真正考虑自己行为带来的后果。”

OpenAI 的研究人员目前确实有一个假设,可以解释部分异常行为最初从何而来。在这些模型第一次搭建秘密“留言板”之前,它们曾接受过一项能力训练:与“子智能体”(subagents)沟通和协作。所谓子智能体,是能力相对较弱、可以接受主智能体任务分配的 AI。主智能体可以把复杂任务拆解后,交给多个子智能体分别执行。研究人员怀疑,模型可能把这种原本合法的协作能力,迁移到了一个新的场景中。

METR 对模型间通信内容的详细调查也支持这一判断。在秘密留言板中,一名智能体主动承担了领导角色,开始向其他智能体分配任务。实际上,它正是把其他智能体当成了自己的“子智能体”。理论上,OpenAI 可以选择以后不再训练模型这种多智能体协调能力,以降低它们秘密串联的风险。

问题是,这也会直接削弱模型的实用性。而这种“能力”和“安全”之间的矛盾,正是 Hugging Face 事件暴露出的核心问题。OpenAI 的研究人员还指出,模型的“坚持不懈”也是此次入侵发生的重要因素。

当模型意外拿到一道实际上无解的题目时,它们没有选择放弃,而是不断寻找新的办法,直到通过其他手段拿到答案。从某种意义上说,这恰恰是人们希望 AI 智能体具备的能力。如果未来我们希望智能体能够独立完成长时间、高难度的复杂任务,那么面对困难不轻易放弃,本身就是一种非常重要的品质。

问题在于,模型什么时候应该坚持,什么时候应该停下来?OpenAI 目前正在尝试为模型加入新的机制:当它们判断任务可能无法完成时,可以主动向人类发出提醒,而不是继续不计代价地寻找解决办法。但如何让模型学会什么时候该使用自己的能力,什么时候又应该克制,并不是一次事故复盘就能解决的问题。

今天训练顶级 AI 编程模型的方法,本质上仍然非常直接:模型成功解决问题,就给予奖励。这种训练方式或许能培养出能力远超人类的程序员,却未必能教会它们如何谨慎地使用这些能力,更无法自动让它们尊重人类的意图和价值观。

拉迪什认为,对齐研究下一步必须突破“只用任务是否完成来衡量模型表现”的思路。“还有大量对齐科学的问题需要解决。我们不能再只是用‘任务有没有完成’这样的代理指标。这种方法确实能让模型变得非常强大,但我不认为,它能让模型真正实现对齐。”

原文链接:

https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/

相关内容

热门资讯

解谜一下!都莱大菠萝辅助器,鄂... 解谜一下!都莱大菠萝辅助器,鄂友会有没有挂,确实有挂(哔哩哔哩)都莱大菠萝辅助器是不是有人用挂微扑克...
推荐一下!枫叶辅助官网地址,约... 推荐一下!枫叶辅助官网地址,约战沙城破解器,都是真的有挂(哔哩哔哩)1、玩家可以在枫叶辅助官网地址透...
必看攻略!微信小程序辅助app... 【福星临门,好运相随】;必看攻略!微信小程序辅助app下载,wepoker私人局透视方法,可靠教程(...
详细一下!雷霆辅助,九酷众游辅... 详细一下!雷霆辅助,九酷众游辅助,果然是真的有挂(哔哩哔哩)1、首先打开九酷众游辅助辅助器下载最新版...
科普一下!四川熊猫辅助软件免费... 科普一下!四川熊猫辅助软件免费,丫丫衡阳字牌3辅助,总是有挂(哔哩哔哩)四川熊猫辅助软件免费破解侠是...
闪评 | 时隔多年 冰岛为何再... 据多家外媒报道,地处北欧的冰岛将于8月29日举行公投,决定是否重启加入欧盟的谈判。 冰岛曾于2009...
热点推荐!吉安中至小程序微信辅... 热点推荐!吉安中至小程序微信辅助,wepoker作弊方法,德州论坛(有挂详情)-哔哩哔哩;吉安中至小...
必备一下!花花生活圈怎么装开挂... 必备一下!花花生活圈怎么装开挂,对战互娱辅助系统,好像存在有挂(哔哩哔哩)1、超多福利:超高返利,海...
终于知道!天天开心王国辅助器,... 终于知道!天天开心王国辅助器,hhpoker辅助器,解密教程(有挂方略)-哔哩哔哩;天天开心王国辅助...
曝光一下!博雅红河西元红河破解... 曝光一下!博雅红河西元红河破解版,wepoker辅助器,确实存在有挂(哔哩哔哩)1、点击下载安装,博...