OpenAI GPT-6 Astra 发布,首次达到“关键”级网络安全能力门槛

浏览32次 点赞0次 收藏0次

9 月 4 日消息,当地时间 9 月 3 日,OpenAI 宣布推出新一代 GPT-6 Astra 模型,这是该公司迄今为止最强大、部署最广泛的大语言模型。

据介绍,Astra 是 OpenAI 旗下首个达到其“准备框架”(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。

据 OpenAI 介绍,Astra 在网络安全能力上实现了显著跃升。在提供适当工具和访问权限的情况下,该模型能够在无人指导的条件下,发现许多防护严密的系统中此前未知的安全漏洞,并开发新的利用方式。

针对网络安全能力提升,OpenAI 进一步加强了 GPT-6 Astra 的安全防护,包括强化内部开发和部署环境隔离、加密模型检查点,以及对完整运行轨迹进行统一监控。

OpenAI 还引入了在内部使用前必须通过的阻断式对齐评估流程,并针对模型可能因滥用或自身偏差采取有害网络操作的风险增加防护措施。

与 GPT-5.6 Sol 相比,GPT-6 Astra 的抗越狱能力也有所提升。OpenAI 称,该模型通过新的鲁棒性(指模型在面对被破坏的、异常的、有恶意的输入时,能否做到“临危不乱”)安全训练技术,在较长运行轨迹中的表现同样更加稳定。

在具体应用场景中,Astra 在面对提示词注入攻击的鲁棒性显著优于 GPT-5.6 Sol,在真实浏览和专业计算机环境中的不对齐及潜在破坏性行为(如未经授权的交易、数据丢失、过度访问或规避控制)也大幅减少。此外,Astra 在高风险场景中的响应更为安全,且在 18 岁以下用户的年龄适配安全边界应用上更为一致。

注:提示词注入攻击(Prompt Injection)是指通过特定输入诱导 AI 系统偏离原有指令或安全约束的攻击方式。

OpenAI 表示,公司通过离线测试,以及内部和外部越狱测试与修复计划,对 GPT-6 Astra 进行了验证。针对被标记为潜在高风险的用户,模型还接受了更保守拒答边界方面的训练。

此外,OpenAI 采用回归测试确保 GPT-6 Astra 能够抵御此前测试阶段发现的越狱方式,并使用最新的内部自动化红队攻击模型进行了新一轮测试。

在模型对齐方面,OpenAI 称 GPT-6 Astra 相较 GPT-5.6 Sol 也有所改进,涉及预训练数据构成以及强化学习阶段的评估机制。

根据 OpenAI 公布的一组对齐评估结果,GPT-6 Astra 在遵守安全与安全边界、以及保持在获授权范围内执行任务方面表现更好。

OpenAI 还利用超过 5.4 万项内部 Codex 任务开展部署模拟。在这项测试中,GPT-6 Astra 被标记为高严重程度失配行为的次数约为 GPT-5.6 Sol 的一半。

OpenAI 同时扩大了失配监控系统的部署范围,将其加入 GPT-6 Astra 对外部署过程中涉及工具调用的推理流程。该监控系统需要消耗大量计算资源,其架构与 OpenAI 内部使用的监控方案相似。

不过,OpenAI 也指出,GPT-6 Astra 的可监控性较 GPT-5.6 Sol 有所下降。相关研究显示,Astra 更有能力控制自身思维链(CoT),并且更不容易在其中留下可能暴露问题的信息。

在对抗性测试中,OpenAI 要求模型主动规避监控,发现 GPT-6 Astra 在评估中故意降低表现时可以保持不被发现;在执行部分破坏性任务时,它有时也能够规避内部监控。

OpenAI 称,目前尚未发现 GPT-6 Astra 存在思维链隐写推理的证据,即通过普通且看似无关的文本隐藏推理信息。因此,现阶段观察到的规避风险可能主要局限于较低难度的推理任务。

OpenAI 强调,这些结果主要来自要求模型主动规避监控的对抗性评估,而整体对齐测试仍显示,GPT-6 Astra 违反安全限制的可能性低于 GPT-5.6 Sol。

OpenAI 表示,公司将继续研究上述趋势及其对模型可监控性的影响,并把保持和利用思维链监控能力作为相关研究计划的核心目标。同时,公司认为,仅依靠检查模型思维链并不足以完成对齐审计,还需要发展其他审计技术。

在浏览和办公环境中,GPT-6 Astra 同样针对提示注入进行了强化。OpenAI 在真实浏览及专业计算机环境中测试发现,该模型执行未授权交易、造成数据丢失、过度访问权限或绕过控制措施等潜在破坏性行为的可能性低于 GPT-5.6 Sol。

在智能体场景中,GPT-6 Astra 处理高风险请求时也更加谨慎。例如,对于涉及暴力攻击策划或实施欺诈的请求,其行为安全性均有所提升。

OpenAI 最后表示,GPT-6 Astra 在来自实际生产环境及人工红队测试的高风险请求中,相较 GPT-5.6 Sol 能够更安全地完成允许处理的任务,同时减少对无害请求的不必要拒答。

OpenAI 首席科学家 Jakub Pachocki 在 9 月 3 日上午的简报会上表示:“随着模型能力增强,准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升,我们的方法仍然足够有效,因为智能的进步并不能保证对齐的进步。”

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯