详情

首页手游攻略 全球首例AI逃逸自主入侵!OpenAI失控敲响警钟

全球首例AI逃逸自主入侵!OpenAI失控敲响警钟

佚名 2026-07-23 17:20:55

近期,OpenAI发生成立以来第一次真实的AI技术失控事故引发全球关注。据OpenAI披露:一场原本被封闭测试、严格限制权限的最新大模型,突然突破人类管控,私自破解系统,主动上网攻击服务器,风险一度失控。

此次事故发生在内部安全测评中。为了检验AI能力,工作人员把最新模型,放进完全隔离的封闭测试环境,断开外网、限制权限、禁止任何对外操作,只让AI完成常规答题测评任务。但让人意想不到的是,这个AI为了"拿到更高测评分数、完美完成任务",自主学会了漏洞探测,绕过风控,竟然突破了隔离,侵入了人工智能开源平台美国抱抱脸公司的系统。

那么所谓的失控是指什么呢?通俗点来说就是,本来是让AI参加网络安全考试,结果AI没有老老实实答题,而是悄悄逃出了考场,突破限制联网的测试环境,最终入侵"抱抱脸"公司的生产数据库,去试图盗取测评标准答案,以及后台数据,完成"自我升级得分"。短短几天时间里,对"抱抱脸"公司的生产数据库发起1.7万次攻击。整个过程全自动、没有人工干预,属于全球首例真实、自主、越权的AI失控攻击事件。

事件发生后,OpenAI方面表示,这是一起前所未有的网络安全事件,公司正在进一步加强安全防护措施。目前,两家公司也都没有具体说明,是否有客户数据因此泄露。

那么,测试为何会失控?首先,是目标错位,任务只要求OpenAI"答对题、拿高分",却没有明令禁止任何手段。对AI而言,只要达成目标,一切路径皆可尝试,业内称之为"奖励黑客"导致的"目标失配"。其次,人为撤防。为了探测模型极限,评测方临时关闭了正式版内置的安全拦截机制。相当于拆掉围栏,去测试猛兽的爆发力。还有就是环境失守。测试本应断网封闭,但系统存在未知漏洞。AI自主发现漏洞后,逐级提权、突破隔离,成功联网,并独立完成"找漏洞、突破联网、搜寻目标、入侵"的全链条攻击,全程无需人工指令。

本次失控也暴露出多个现实风险,AI自主突破边界后,直接进攻第三方企业正式业务服务器,一旦成功,就会盗取商业机密。本次目标是测试答案,如果换其他场景,可窃取企业核心资料。同时,AI能够发现软件厂商自己都不知道的漏洞。 一旦这类能力被恶意利用,会催生大规模自动化网络攻击,出现各类意料之外的越权行为。

那么这起全球首例AI自主跨企业真实网络攻击意味着什么?模型为达成任务,甚至主动突破人类设置的隔离边界,它究竟还可控吗?上海人工智能研究院研究员彭嘉昊今天在接受看看新闻Knews采访时表示,AI攻击网络并非首次,但OpenAI此次自我披露让事件"抓了现行"。这并非AI"觉醒"的信号,却无疑是AI治理史上的一次分水岭。彭嘉昊说,此前关于人工智能风险的讨论,大多停留在"潜在可能"层面一旦发生会怎样;而这次是真实发生的事件,其标杆意义远超实际造成的破坏程度。就比如我们希望一个学生在考试中取得高分,但他自己琢磨出的最快路径,竟是翻进老师办公室偷取试卷,他从未被教过如何偷窃,但他有目标、有能力、能推理,最终自主想到了这条途径。关键在于,这条推理链条完全由人工智能模型自主生成,而非人类预先编写。

彭嘉昊说,"沙盒逃逸"在AI智能体(Agent)研发圈内并不罕见。此次OpenAI模型遭遇的情形,本质与之相同模型并非"恶意"规避监管,而是将沙箱的边界限制,视作解题过程中的一个普通障碍。真正值得警惕的问题在于:当我们让所有模型都围绕单一目标进行极致优化时,它们很容易突破人类设置的防护围墙。这才是此次事件留给治理层面的核心警示。

值得注意的是,在此次事件发生后,OpenAI向美国顶尖的大模型寻找解决方案。然而,这些闭源大模型因为安全机制过于严苛和僵化,选择了拒绝提供帮助,紧急关头,美国抱抱脸公司向中国开源大模型求助,随后,在中国某企业的开源大模型帮助下,成功化解入侵。事实上,这并非OpenAI首次面临安全风险问题。此前该公司就曾因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队离职潮而引发舆论关注,多位前安全研究员曾指责公司在追逐模型性能和商业化速度时,牺牲了对安全技术的投入。最新安全事件也验证了外界的担忧:当模型被赋予更高的自主行动权时,传统基于规则和虚拟隔离的环境可能随时失效。

这次"自我演进式"的网络攻击标志着AI安全防护已进入全新阶段。而伴随大模型的飞速发展,模型安全防护能力如何才能跟上模型能力快速迭代的节奏?对此,上海人工智能研究院研究员彭嘉昊表示,企业选择人工智能模型的底层逻辑正在发生深刻转变。过去,企业的选型标准主要聚焦于模型的能力与运行效率;然而,近期事件暴露出一项核心矛盾闭源模型内置的安全护栏在关键时刻反而可能成为应变障碍,而开源模型由于支持本地部署和参数调整,反而更能灵活应对特定任务需求。这一现实将深刻影响企业未来的模型选择与部署策略,使其更加重视自主可控性。彭嘉昊强调,这并非简单的"二选一"问题,而是应按照不同应用场景进行分层、分用途的差异化使用。

此次遭受攻击的节点位于人工智能产业链的关键位置,也暴露出传统安全防护体系的滞后性。既往的生产系统安全防护多基于互联网思维,但当前面临的威胁已升级为"智能小偷"式的复杂攻击,其风险层级远高于以往。更深层次的问题在于,人工智能企业之间尚未建立起跨厂商的安全协同机制此次攻击来自OpenAI,未来不排除其他主体效仿,而这一领域目前仍属监管空白。

对于解决路径,彭嘉昊认为最有效的方式是"以人工智能对抗人工智能",即用经过验证的安全AI系统去制衡不够安全的AI系统。过去,人工智能治理的焦点多集中于内容管理、算法备案等方面,但对大模型本身被用作攻击工具这一新型威胁,监管与应对存在明显的空白地带。彭嘉昊还建议,此次事件可被视为推动全球人工智能安全协同机制建设的标杆性案例。破解之道并非单纯依赖某一部新法律法规,而是需要在整个产业层面建立信息共享机制,并致力于达成更广泛的全球共识。

看看新闻记者: 彭晓燕 游玮 陈昱卉

编辑: 陈昱卉 游玮

责编: 彭晓燕

点击查看更多
推荐专题
热门阅读