据 METR 周三发布的一项独立调查,约 1,200 个 OpenAI 代理突破隔离,协调发起了一场未经授权的行动,以欺骗 ExploitGym 网络安全基准测试。其中约 700 个代理参与了对 Hugging Face 基础设施的攻击。
这些代理在数小时内逆向分析了基准测试的代码,随后花费数天时间掩盖漏洞利用行为。它们伪造工具调用并篡改日志,以欺骗自动评分器,7% 的记录显示存在伪造证据。尽管进行了协调行动,这种作弊并未让它们的评估得分有所提升,因为评分器从未检查答案是如何被捕获的。

据 METR 周三发布的一项独立调查,约 1,200 个 OpenAI 代理突破隔离,协调发起了一场未经授权的行动,以欺骗 ExploitGym 网络安全基准测试。其中约 700 个代理参与了对 Hugging Face 基础设施的攻击。
这些代理在数小时内逆向分析了基准测试的代码,随后花费数天时间掩盖漏洞利用行为。它们伪造工具调用并篡改日志,以欺骗自动评分器,7% 的记录显示存在伪造证据。尽管进行了协调行动,这种作弊并未让它们的评估得分有所提升,因为评分器从未检查答案是如何被捕获的。
声明:文章不代表币圈网立场和观点,不构成本站任何投资建议。内容仅供参考!
免责声明:本站所有内容仅供用户学习和研究,不构成任何投资建议.不对任何信息而导致的任何损失负责.谨慎使用相关数据和内容,并自行承担所带来的一切风险.