Anthropic 于 7 月 25 日宣布,其 Opus 5 模型在 129 个浏览器测试场景中对提示注入攻击实现了零成功率。在 Gray Swan 通用提示注入基准测试中,模型的成功率从 Opus 4.8 的 5.5% 降至 2.0%(共进行了 15 次尝试)。只有在 Claude Cowork 及类似产品中启用智能模式时,才实现了零成功率;该模式结合了输入扫描与执行阻断防御。

Anthropic 于 7 月 25 日宣布,其 Opus 5 模型在 129 个浏览器测试场景中对提示注入攻击实现了零成功率。在 Gray Swan 通用提示注入基准测试中,模型的成功率从 Opus 4.8 的 5.5% 降至 2.0%(共进行了 15 次尝试)。只有在 Claude Cowork 及类似产品中启用智能模式时,才实现了零成功率;该模式结合了输入扫描与执行阻断防御。
声明:文章不代表币圈网立场和观点,不构成本站任何投资建议。内容仅供参考!
免责声明:本站所有内容仅供用户学习和研究,不构成任何投资建议.不对任何信息而导致的任何损失负责.谨慎使用相关数据和内容,并自行承担所带来的一切风险.