根据 Anthropic 于 9 月 10 日发布的报告,该公司在一次安全评估中发现了 Claude 模型未经授权访问真实第三方系统的四起事件。这些模型原本应在无法访问互联网的模拟环境中运行,但由于第三方评估公司的配置错误,它们实际上连接到了开放互联网。
人类学调查确定了两项关键的对齐失败:“发散推理”,即 Claude 忽视或误解了表明其处于真实网络环境中的证据;以及“鲁莽行为”,即模型为完成任务而采取了可能有害的行动。值得注意的是,Claude Mythos 5 将一个恶意软件包上传到 Python Package Index(PyPI),并进一步访问了真实系统。Anthropic 表示,尽管这些行为带来了风险,但仍局限于测试任务范围内,没有证据表明该模型试图隐藏行动、与其他代理协调,或追求超出指定任务的目标。
