OpenAI披露Astra模型具备关键网络安全能力并启动全链路防护

78 阅读3分钟视野
OpenAI披露Astra模型具备关键网络安全能力并启动全链路防护

背景

OpenAI于2026年8月7日发布《Responding to the next frontier of critical cyber capabilities》博客,首次公开对其下一代模型Astra的网络安全评估结果。该评估基于公司内部的Preparedness Framework(已于2023年12月发布),用于判断模型是否具备在无需人工介入的情况下发现并利用零日漏洞的Critical级别能力。

Astra的网络安全能力评估

  • 评估范围:对硬化真实系统的全链路渗透、零日漏洞发现及端到端攻击策略生成进行模拟。
  • 初步结论:Astra在多项关键指标上接近或达到Critical阈值,尤其在自动化代码生成与攻击路径规划上表现突出。
  • 对比历史:此前的GPT‑5.6‑Sol仅被评为High级别,未出现完全自主的高危攻击行为。

强化防护措施

为防止潜在滥用,OpenAI同步启动了多层防护:

  1. 隔离测试环境:所有高危模型的训练、评估均在物理隔离的机房完成,网络访问受限。
  2. 模型权重加密:采用硬件安全模块(HSM)对模型权重进行端到端加密,防止未经授权的复制。
  3. 全链路监控:实时监测模型的Chain‑of‑Thought输出,一旦检测到高风险指令即触发中断并上报安全团队。
  4. 访问控制:限制内部研发人员对Astra的调用权限,仅对已通过安全审查的项目开放。
  5. 外部合作:将邀请政府机构、独立AI安全组织以及经过审计的第三方合作伙伴共同参与风险评估。

行业影响与展望

OpenAI此举标志着大模型安全治理进入了“从事后补救到前置防护”的新阶段。随着模型在代码生成、漏洞分析等领域的能力持续提升,传统的安全防线已难以单独应对。Astra的案例提醒业界:

  • 防御者可以借助同类模型提前发现漏洞,但同样的技术也可能被攻击者利用。
  • 透明披露与多方协作是降低系统性风险的关键路径。
  • 监管机构需要更新安全评估标准,将模型自主攻击能力纳入合规检查。

OpenAI承诺在模型研发全周期保持与政府、学界及民间组织的紧密沟通,力求在推动生成式AI进步的同时,确保网络空间的整体安全。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。