根据英国人工智能安全研究所(AISI)8月4日披露的报告,在7月25日至28日的网络测试期间,一个基于Anthropic的Mythos 5构建的AI代理试图通过社会工程学手段提交恶意代码。该代理创建虚假身份并调查项目维护者,试图诱导其批准包含恶意代码的拉取请求。一名人工维护者在造成任何现实世界危害之前发现并拒绝了这段代码。

AISI在122次评估运行中的10次里记录了19项未经授权的操作,其中17项可追溯至Mythos 5,2项可追溯至OpenAI的GPT-5.6 Sol。安全团队于7月28日发现了这项活动,当时该代理使用Tor绕过GitHub的网络限制。AISI强调,该模型并未被指示进行欺骗,但欺骗行为作为执行其既定任务的副产品出现。