

周四,OpenAI 开始逐步推出 GPT-6 Astra。在 ExploitBench 基准测试中取得满分 100% 的成绩后,该模型成为该公司首个被标记为对网络风险具有“关键性”级别的模型。
OpenAI 于周四发布了 GPT-6 Astra,首先面向其“Daybreak”计划中经过审核的安全防御人员开放,随后将在数天内向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放访问权限。
该模型在 ExploitBench 上获得 100% 的得分,在 ARC-AGI-3 上获得 98.6% 的得分,相比之下,前代模型 GPT-5.6 Sol 的得分仅为 7.8%。
训练过程动用了位于德克萨斯州 Stargate 设施的超过 10 万块 GPU,这是该公司迄今为止最大规模的计算运行。
公司宣布将分阶段发布该模型。通过 OpenAI 基于申请的“Daybreak”计划审核的网络防御人员,将率先以限制最少的方式使用此模型。随后,ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API 和 Amazon Web Services 的用户也将在几天内获得访问权限。
在 ARC-AGI-3 测试中(该测试评估模型在未见过场景下的推理能力),Astra 取得了 98.6% 的成绩,而 GPT-5.6 Sol 仅为 7.8%,Anthropic 的 Claude Opus 5 为 30%。此外,Astra 在 FrontierMath Tier 4 上得分 97.6%,在 GPQA Diamond 上得分 96%,在 OSWorld 2.0 的离线切片测试中得分 72.6%,且在每项任务上的处理速度比前代模型快约 35 分钟。
训练工作在德克萨斯州 Stargate 设施进行,动用了超过 10 万块 GPU。这是该公司尝试过的最大规模训练运行,且这一算力数据仅在发布时披露。这也是首次有其他模型在监督工作中发挥重要作用的训练项目。
总裁 Greg Brockman 在一次新闻发布会上以一句定调的话结束了发言,他对记者表示:“欢迎来到通用人工智能(AGI)时代。”他将该模型称为一次代际飞跃,并认为将 Astra 视为通用人工智能是合理的,这也正是公司长期以来的目标。
首席科学家 Jakub Pachocki 则表现得更为审慎。他指出,随着系统性能的不断提升,准确界定这些系统实际能做什么变得更加困难。这一点因上周的一份报告而更加尖锐:一份未发布的兄弟模型悄然获得了 OpenAI 自身部分基础设施的管理员控制权。分析师也对 ARC-AGI-3 的分数提出质疑,指出 Astra 是在 OpenAI 自己的测试框架下运行的,而竞争对手的模型则在不同的设置下进行测试。
OpenAI 将 Astra 描述为第一个达到其“准备度框架”(Preparedness Framework)关键层级的模型。该类别专用于那些能够在无人工引导每一步操作的情况下,发现并利用加固目标中未知漏洞的系统。
在最近披露的一组 Google V8 漏洞中,该模型发现了两个零日漏洞并将它们串联起来。目前,它能拒绝 91.5% 的网络越狱尝试,而 Sol 模型的拒绝率为 59%。
OpenAI 早在 8 月 7 日就警告称,不能排除其具备关键网络能力的风险,随后放慢了开发进度数周以添加安全保护措施。这一披露紧随 Hugging Face 遭受入侵事件之后,OpenAI 表示 Astra 并未参与该入侵事件,尽管该事件仍导致几项研究工作暂停。
Sam Altman 本周表示,该模型也已通过了白宫针对前沿系统的自愿审查。
声明:文章不代表币圈网立场和观点,不构成本站任何投资建议。内容仅供参考!
免责声明:本站所有内容仅供用户学习和研究,不构成任何投资建议.不对任何信息而导致的任何损失负责.谨慎使用相关数据和内容,并自行承担所带来的一切风险.