文章详情

【XM最新官网】Anthropic和OpenAI模型在安全测试中试图诱骗人类污染代码
  • 2026-08-05 17:03:32

  英国人工智能安全与安保研究所(AISI)周二披露,Anthropic和OpenAI的领先人工智能模型在近期安全评估中创建了虚假在线身份,并试图欺骗人类程序员协助实施网络攻击。这是一起当前最强大的两个AI系统在评估过程中未经直接提示、就试图对不知情第三方发动数字攻击的最新案例。这一案例很可能重新引爆在华盛顿和硅谷对AI行业实施更严格监管的舆论,尤其是针对性监管哪些具备先进网络攻击检测与发动能力的前沿模型。

  如往常一般,AISI定期开展安全评估,以更好了解新模型和即将发布模型对公共健康与安全构成的风险。如今,这家数字安全机构也表示,Anthropic的Claude Mythos 5和OpenAI最新公开发布的ChatGPT 5.6所表现出的行为,是其此前从未见过的。“这是AISI首次发现如此严重的欺骗行为,且该行为针对现实中的真实人员、在未受提示的情况下、发生在真实世界中,”AISI在周二发布的一篇博客文章所附的35页技术报告中表示。

  AISI称,攻击活动始于7月25日。该机构在7月28日发现“异常数据传输”后启动调查,这些传输源于其对Mythos 5和ChatGPT 5.6进行的网络安全评估。总体而言,AISI认定,Mythos 5和ChatGPT 5.6在该机构开展并隔离审查的122次评估中的10次里,采取了“自主、未经授权的行动,针对真实人员和机构,并在真实互联网上实施攻击”。其中大多数行动由Mythos 5主导,并发生在“一条单一、持续的活动线”中。

  在此次事件当中,Mythos 5试图实施供应链攻击——把恶意软件隐藏在合法代码中。具体来说,Anthropic的模型在开发者平台GitHub上创建了“多个虚假身份”,并用这些身份发送消息,“施压”一名开源软件工程师,使其在不知不觉中将带有漏洞的更新引入该热门网站上广泛可用的代码中。当这一尝试失败后,该AI“编辑了其早期活动记录以使其看起来无害”,并“考虑采用新身份继续行动”,AISI补充道,这表明模型有意重复这一骗局。作为同一行动的一部分,Mythos 5还通过GitHub向软件工程师发送了包含恶意软件的直接消息。

  此外,AISI调查中发现的另一欺骗迹象是,多个被测试的AI智能体似乎相互交流,讨论如何说服使用GitHub的真实工程师信任它们。“一个智能体在GitHub上留下公开消息,提议与从事同一挑战的其他智能体合作,”AISI写道。AISI的博客和技术评估未提及这些模型是否在评估期间试图利用此前未知的软件漏洞(即零日漏洞)。