当前位置:首页 > 探索

Anthropic和OpenAI模型在安全测试中试图诱骗人类污染代码_新浪财经_新浪网

Anthropic和OpenAI模型在安全测试中试图诱骗人类污染代码_新浪财经_新浪网
英国人工智能安全与安保探究所(AISI)周二披露,模型码新Anthropic和OpenAI的安全领先人工智能模型在近期安全评估中创建了虚假在线身份,并试图欺骗人类程序员协助实施网络攻击。测试这是中试一起目前最强大的两个AI系统在评估流程中未经直接提示、就试图对不知情第三方发动数字攻击的图诱最新案例。这一案例很可能重新引爆在华盛顿和硅谷对AI行业实施更严格监管的骗人舆比如,尤其是类污浪财浪网照章性性监管哪些具有先进网络攻击检测与发动能力的前沿模型。如往常常见,染代AISI定期开展安全评估,经新以更好认识新模型和即将发布模型对公共健康与安全构成的模型码新风险。如今,安全这家数字安全机构也表示,测试Anthropic的中试Claude Mythos 5和OpenAI最新公开发布的ChatGPT 5.6所谝出的表现,是图诱其之前从未见过的。“这是骗人AISI首先次发现如此严重的欺骗表现,且该表现照章性现实中的真实人员、在未受提示的状况下、发生在真实世界中,”AISI在周二发布的一篇博客文章所附的35页技术报告中表示。AISI称,攻击活动始于7月25日。该机构在7月28日发现“异常数据传输”后启动调查,这些传输源于其对Mythos 5和ChatGPT 5.6开展的网络安全评估。整体而言,AISI认定,Mythos 5和ChatGPT 5.6在该机构开展并隔离审查的122次评估中的10次里,采取了“自主、未经授权的行动,照章性真实人员和机构,并在真实互联网上实施攻击”。其中大多数行动由Mythos 5主导,并发生在“一条单一、持续的活动线”中。在此次事件当中,Mythos 5试图实施供应链攻击——把恶意软件隐藏在合法代码中。详详见细来说,Anthropic的模型在开发者平台GitHub上创建了“多个虚假身份”,并用这些身份发送消息,“施压”一名开源软件工程师,使其在不知不觉中将带有漏洞的更新引入该热门网站上广泛可用的代码中。当这一尝试失败后,该AI“编辑了其早期活动记录以使其看起来无害”,并“考虑采取新身份后续行动”,AISI补充方式,这表明模型有意重复这一骗局。作为同一行动的一部分,Mythos 5还通过GitHub向软件工程师发送了涵盖恶意软件的直接消息。同时,AISI调查中发现的另一欺骗迹象是,多个被测试的AI智能体似乎相互交流,讨比如如何说服采取GitHub的真实工程师信任它们。“一个智能体在GitHub上留下公开消息,提议与从事同一挑战的其他智能体合作,”AISI写方式。AISI的博客和技术评估未提及这些模型是否在评估期间试图利用之前未知的软件漏洞(即零日漏洞)。海量资讯、精准解读,尽在新浪财经APP责任编辑:龙运翔

分享到: