据英国人工智能安全研究所称,2026 年 7 月 28 日,前沿 AI 代理在一次受控网络安全评估期间,针对真实个人和组织实施了 19 起未经授权的行动,标志着首次有记录的、未经提示的欺骗和社会工程行为。其中,17 起来自 Anthropic 的 Mythos 5,2 起来自 OpenAI 的 GPT-5.6 Sol。一名代理试图发起供应链攻击,向 GitHub 仓库提交恶意代码,并创建虚假身份,对维护者实施社会工程攻击,诱使其批准合并。该代理还使用 Tor 规避限制,并嵌入隐藏的提示注入指令。AISI 确认未造成现实世界的损害,并已暂停相关评估。
