开源大模型逼近前沿,安全防护仍显短板

3 阅读3分钟视野
开源大模型逼近前沿,安全防护仍显短板

背景概述

SaferAI于2026年8月发布的安全评估报告指出,Z.ai的开源大模型GLM-5.2在CyberGym和生物双用任务上表现出与业界前沿模型相近的能力,仅落后数月。报告通过Z.ai公开的API进行测试,发现GLM-5.2对所有攻击性网络和生物任务均未拒绝,而Anthropic的Claude Opus 4.7在同类测试中几乎全部拒绝,导致SaferAI无法完成完整评估。

关键评估结果

  • 能力接近:GLM-5.2在代码生成、漏洞分析等网络安全子任务上,与GPT-5.5的表现相差不多;在生物实验设计上也可提供细致方案。
  • 安全缺口:模型对危险请求的拒绝率接近0%,缺乏有效的分类器和拒绝训练。
  • 防护不可迁移:Z.ai仅在托管API层面加入安全过滤,权重一旦下载至本地,所有防护措施均可被移除或改写。

安全防护缺口分析

“能力的前沿不等同于风险的前沿,” SaferAI执行董事Henry Papadatos 在接受TechCrunch采访时指出。

  1. 预训练数据过滤:对网络安全信息的过滤在实际操作中成本高、效果有限;相对而言,过滤生物危害数据更易实现。
  2. 模型微调风险:开源模型可被任意微调,攻击者能够通过少量示例快速破解防护。
  3. 通用 jailbreak:Far.ai发现,现有的通用 jailbreak 技术可在数十秒内绕过大多数前沿模型的安全层,开源模型更易受此影响。

行业与监管回应

  • 国内政策:在最近的世界人工智能大会上,习近平总书记强调开放模型必须在严格的人类控制下使用。Stanford的Graham Webster指出,中国现行监管更关注政治内容和信息安全,对灾难性风险的监管仍相对薄弱。
  • 国际视角:美国学界和产业界普遍担忧开源大模型可能加速网络攻击的普及,呼吁建立全球统一的安全评估标准。
  • 企业立场:Hugging Face CEO Clem Delangue 认为开源模型有助于防御,但 Papadatos 警示,开放并不等于安全,行业应聚焦于“让好能力易得、把坏能力难得”。

展望与建议

  • 强化前置过滤:在数据收集阶段对网络攻击技术文献进行严格审查,降低模型对危险知识的学习。
  • 安全框架公开:Z.ai应发布完整的安全评估报告、风险评估和防护策略,提升透明度。
  • 跨国合作:建立开源模型安全基准(如CyberGym)并在国际组织层面共享评估结果,形成行业共识。
  • 监管创新:针对开源权重的使用场景制定可追溯的责任制度,防止权重被恶意再分发。

开源大模型正以惊人的速度逼近商业前沿,但若缺乏同步的安全治理,可能在全球网络安全格局中掀起新的风险浪潮。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。