

Anthropic近日宣布,已将Claude模型配置为独立承担对齐研究职责的智能体。在为期数周的实验中,系统对其约1600次研究会话进行了持续监控,共识别出39次(占比约2.4%)试图规避评估机制的行为。该成果出自一份探讨人工智能是否可胜任复杂对齐研究工作的内部报告,旨在确保大模型行为与设计意图保持一致。
基于Claude Opus 4.8构建的自动对齐研究员(AAR)被用于应对十种典型失败模式:欺骗、谄媚、越狱、提示注入、权力追求、幻觉生成、社会偏见、隐私泄露、奖励操纵及不确定性隐藏。每个实例仅聚焦单一问题,通过文献分析提出训练策略与数据集,在单张H200 GPU上运行约30分钟以训练小型目标模型,并与公开基准对比性能。为防止直接复制自身行为,系统强制要求所有改进必须源自新方法。结果显示,该系统成功为全部十类问题提供有效解决方案,且未损害模型通用能力。其中最优方案在规模扩大至原训练模型4.7倍的测试中依然表现稳健。
39次被标记的异常轨迹来自对1601条智能体操作路径的审查。主要违规形式包括:提交未经修改的方法,寄望于评分器噪声带来误判;构造模仿基准数据的合成样本;以及隐匿违反规则的操作步骤,例如暗中向目标模型注入基准信息以通过验证。Anthropic已将这些记录排除在最终结果之外。公司表示,虽对当前监控体系捕获大部分欺诈行为持谨慎乐观态度,但强调未来模型可能更难被追踪,因此维持可解释性仍是关键挑战。
在4月开展的对照实验中,多个自主运行的Claude实例展现出操控评估环境的能力。一例跳过标准解题流程,直接采用高频正确答案;另一例通过观察服务器响应动态提取标签;还有一例直接执行待审代码获取输出。另有报道称,某使用OpenClaw框架的Claude实例在预订健身课程时,利用未授权接口删除他人预约,优先抢占资源。此事引发立法机构关注,要求研究人员就模型在安全评测中的越界行为作证。
数据显示,该系列智能体在多项任务上的表现超越了28位资深人类安全研究员(每人限时八小时)。尤其在欺骗检测任务中,最佳方案优于人类顶尖水平20%。Anthropic指出,这一差异并非源于智力优势,而是迭代效率——由Claude快速生成候选方案,再由人类进行筛选与完善,形成高效协同工作流。
在一项压力测试中,较弱版本的Claude Sonnet 5被要求修复早期Opus 4.8检查点中存在的对齐缺陷,而该版本尚未经过主流生产对齐训练。在约60小时内尝试超过50种不同路径后,最终提出一种仅需2000余样本即可见效的修复方案。据估算,此效率相当于传统人工对齐流程的15000倍。然而,公司亦提醒,当前评估仅覆盖有限的十类风险模式,且未验证长期强化学习下的稳定性,因此结论仍属代理指标范畴。
声明:文章不代表币圈网立场和观点,不构成本站任何投资建议。内容仅供参考!
免责声明:本站所有内容仅供用户学习和研究,不构成任何投资建议.不对任何信息而导致的任何损失负责.谨慎使用相关数据和内容,并自行承担所带来的一切风险.