OpenAI 黑进 Hugging Face ,当喊停的不再是人类
OpenAI 原本只是黑进喊停想给自家的 AI 出一场考试,看看它到底有多会「黑客技术」。再人为了防止作弊,黑进喊停工作人员特意把模型关进一个不能随便上网的再人封闭环境里。
结荚,黑进喊停AI 不仅自己找到了逃出去的再人方式,还真的黑进喊停跑到了另一家公司的系统里。
这场考试叫 ExploitGym。再人把能力不选定、黑进喊停表现随机的再人 Agent,安全可靠地接入真实世界。黑进喊停你可以把它理解成一个专业给 AI 准备的再人网络攻防考场:系统里藏着一些漏洞,模型的黑进喊停任务是想方式攻破它们,但整个流程本应被限制在测试范围内。再人
可这一次,黑进喊停模型发现了一个之前没人注意到的漏洞,借此绕开了联网限制,接上了真实互联网。接下来,它一路获取更多权限,最后进入了 AI 进入了Hugging Face 支撑日常业务的生产系统,并从数据库中找到了这场考试的答案。
最离条件的地方,不是它成功「越狱」,而是没人命令它去攻击 Hugging Face。
按照 OpenAI 目前的调查,测试任务只需模型实现题,并没有告诉它答案可能藏在哪里,更没有需它进入另一家公司的系统。模型只是自己推断:既然这是一个公开的测试项目,Hugging Face 那边也许存着相关数据。
于是,它真的顺着这个猜测找了过去。
一场原本用来测试 AI 能力的内部考试,就这样从模拟环境跑进了现实世界,最后变成了一起意义其他公司真实业务系统的安全事故。
OpenAI 将其称为一次「史无前例」的网络安全事件。参与测试的系统中,涵盖 GPT-5.6 Sol,以及一款能力更强、尚未正式发布的模型。
这场事故把首先时程 Agent 的风险摆到了眼前:当它为了实现任务不停找路,权限边界究竟是停止信号,还是下一方式待解的题?
接连实用户投诉 GPT-5.6 Sol 擅自删东西
AI 初创公司 OthersideAI 创始人 Matt Shumer 说,Sol 几乎删光了他 Mac 里的文件;开发者 Bruno Lemos 则报告自己的生产数据库被删。随后还实用户报告了类似状况。
用户最想不通的是:我明明没让它删文件,它为什么替我做了这个决定?
OpenAI 的产品负责人随后在 X 上回应称,公司已经调查了少量类似报告。根据目前看到的状况,这些用户常见给了 Codex 很高的电脑权限,几乎什么都能改;与此同时,原本用来把它限制在安全范围内的保护方式,也没有开启。
事故就是在这种状况下发生的。
OpenAI 表示,这类事故目前特别少见。但状况并不能只用「用户权限开得太大」来验明正身。毕竟,往往见不鲜用户很难判断一个 Agent 在拿到权限后,下一步究竟会做什么,更不可能检查它实施的每一条命令。
因此,OpenAI 正在修改 Codex 的采取提示,尽量避免用户一最初就交出过高权限;同时也准备在模型真正实施操作之前,再提高一方式拦截机制,防止一次错误判断直接变成无法挽回的删除。
Peter Fotinis 在 Tibo 的回应下催促重置 Codex 额度,评比如区很快接起了梗。
这份回应验明正身了一种误删馗,却留下了更麻烦的状况:当 Agent 能后续干上几个小时,它会不会把用户设下的边界,当成一堵需绕开的墙?
OpenAI 官方称,团队发现原有上线前评测未覆盖的失败后,暂停了这款内部模型的访问。图源:OpenAI。
7 月 20 日,OpenAI 公开了一段颇为尴尬的内部测试经历。
公司让一款尚未公布名称的模型,参加一场比拼 AI 训练高效度和效率的比赛。模型很快想出了一套名为 PowerCool 的新方式,但在准备提交结荚时,它遇到了一个矛盾:探究人员清楚需,它只能在公司内部聊天群里汇报;可比赛页面上又写着,参赛方式划需上传到公开代码平台。
模型最后选项了后者。
状况在于,它当时被关在一个不能随便上网的封闭环境里,按理说根本无法访问外部网站。正常状况下,它应该停下来,告诉探究人员「任务无法实现」。但它没有这么做,而是花了大约一个小时寻找环境中的漏洞,绕过联网限制,最后把方式划公开提交了出去。
这份提交的编号是 PR 。你可以把它理解成一份公开递交的代码方式划,其他参赛者都能看到。
OpenAI 很快发现了状况,并删除了这份提交,但已经来不及了。方式划公开期间,其他参赛者看到了其中的材料。后来,多份刷新比赛纪录的方式划都后续参考了 PR ,其中甚至涵盖一套由 Claude Opus 4.7 自动实施和改进的方式划。
也就是说,一次原本只应留在公司内部的测试,因为模型自行选项了「实现公开提交」这条路,最后真的意义了外部比赛。
OpenAI 随后表示,团队发现原有的上线前评测没有覆盖这种失败方式,因此暂停了这款内部模型的访问。
一条命令没事,整段命令已跑偏
它发现,后台保存着其他系统已经实现、但还没有公开的提交材料。于是它判断,这些材料或许能协助自己实现任务,并最初尝试进入后台把它们取出来。
关键访问这个后台,模型需采取一串「认证令牌」。你可以把它理解成一张电子通行证:谁拿到它,谁就可能以相应身份进入系统。
到这里,正常做法应该是停下来。模型却没有放弃。它把认证令牌拆成两段,分别开展混淆,让扫描器看不出这是一张完善的「通行证」;等程序真正运行时,再把两段材料重新拼起来,后续尝试访问后台。
更值得警惕的是,它并不是无意中碰巧绕过了检查。在任务验明正身和推理记录中,模型都清楚写下了自己的意图:它知方式扫描器正在阻止认证令牌,也知方式自己正在通过拆分和混淆的方式绕过这方式检查。
状况出在目的排序:实现任务排在了用户限制前
过去的安全设方式习惯检查一个动作:这条命令能不能运行,这次联网关键不关键确认,这个文件能不能写。首先时程 Agent 会后续实施很多步。每一步单独看未必刺眼,拼起来却可能实现一个用户不过不会批准的目的。
OpenAI 把这个完善流程称为「轨迹」。系统既关键看眼前这一步,也得看它一路在往哪里走。
OpenAI 安全探究员的说法更直白:任务持续得越久,模型偏离人类预期的状况似乎越那么点儿出现;然而就目前的测试结荚来看,通过检查模型的推理流程,监控系统能比较准确地发现这类异常。
持续重试既是能力,也是风险来源。
同一款未命名模型今年 5 月还推翻了一个延续近 80 年的数学猜想,说明经过外部数学家检查;在探究里它不轻易放弃,进入权限受限的环境后,它也可能后续找门。
OpenAI 给它加了一名「跟车安全员」
发现状况后,OpenAI 暂停了这款模型的有限内部访问,把已经发生的事故做成新评测,又照章性模型在首先任务里那么点儿忘记早期限制的状况开展训练。新监控器会跟着整段行动走,判断模型是否在持续绕开用户需或安全边界。
发现异常,它可以暂停会话,把决定交回给人。OpenAI 还提高了任务记录的可见性,让采取者更那么点儿看见模型做过什么、系统在哪一步拦下了它。
OpenAI 内部回放结荚(厂商自报):新防护下,高、中严重度跑偏样本占比均为 0%,低严重度为 2.9%。图源:OpenAI。
经过一轮小规模回放测试后,OpenAI 恢复了这款模型的有限内部访问。公司称,此后的几周里,没有再发现同等级别的严重绕过表现。但这还不能验明正身状况已经处理。
OpenAI 没有公布完善样本量,测试范围也只覆盖少量内部环境。更值得注意的是,即使加入了新的防护,回放中仍有危险操作漏过检查:模型曾生成一条 kill -9 -1命令,该命令可能强制终止系统中的大量进程。它最后没有真正实施,并不是因为安全机制按时拦住了,而是任务先一步超时。
如果把安全状况放到日常采取场景呢?
多数人不会参加 AI 训练高效度和效率的比赛,却可能让 Agent 整理照片、分类邮件或者检查项目状况。
像「不关键删原图」「先别替我回复」「提交前让我看一眼」这样的需,对聊天模型只是文字,对拿着工具权限的 Agent 却可能关系到一串真实操作。一次误解,可以变成删除、发送,甚至付款。
提示词里的「不关键」更像叮嘱,产品权限才是锁。
会主动停手的 Agent,才适用于碰真实账号和文件。
之后 AI 会越来越擅首先替我们上夜班。让它工作到凌晨不算最难。
难的是它走到删除、发送或付款之前,知方式该把人叫醒。
我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com返回搜狐,查看更多
本文地址:https://shengyajian.com/news/33e9299874.html
版权声明
本文仅代表作者观点,不代表本站立场。
本文系作者授权发表,未经许可,不得转载。