Sakana AI推出Fugu-Cyber 安全编排模型在CyberGym获86.9%成绩
•1 阅读•4分钟•应用
Sakana AIFugu-CyberCyberGymCTI-REALM
•1 阅读•4分钟•应用
模型概览
Sakana AI在其Fugu编排体系中新增了第三条安全专用端点——Fugu‑Cyber(模型 ID:fugu-cyber-v1.0)。该模型并非全新前沿大模型,而是基于已发布的Fugu orchestration模型,通过安全任务微调形成的专用入口。自2026年6月发布Fugu平台以来,Sakana 将安全推理能力进一步封装为可即插即用的API。
基准评测
-
CyberGym(UC Berkeley)
- 评测范围:1507 个真实漏洞,188 个 OSS‑Fuzz 项目。
- 任务:在未修补代码库中生成可触发漏洞的 PoC,并在修补后不再触发。
- 成绩:86.9% 成功率,略高于 GPT‑5.5‑Cyber(85.6%)和 Claude Mythos Preview(83.1%)。
-
CTI‑REALM(Microsoft)
- 评测范围:37 份公开威胁报告,涉及 MITRE ATT&CK 技术、KQL 查询与 Sigma 规则生成。
- 任务:将情报映射为检测规则,覆盖 Linux、AKS 与 Azure 云环境。
- 成绩:72.1%(轨迹奖励),高于 Microsoft 官方公布的 Claude 系列 0.624‑0.685 区间。
需要注意,CTI‑REALM 的分数是 0‑1 轨迹奖励,Sakana 将其称为“成功率”,实际意义略有差异。
编排机制
Fugu 系列本质上是 语言模型驱动的编排层:
- 查询 → Thinker 生成任务拆解。
- Worker 群组执行子任务(代码审计、PoC 生成、情报关联等)。
- Verifier 对候选结果进行安全校验,只有通过验证的输出才会返回。
该架构在两篇 ICLR 2026 论文(TRINITY 与 Conductor)中有详细描述,Verifier 在安全场景下尤为关键——它确保任何漏洞或检测规则在提交前均经过专门子模型的复核。路由细节为专有技术,外部不可见。
使用门槛与定价
- 访问审批:需填写用途说明并经人工审核,严格限制在防御性安全场景。
- 使用政策:更新的 Acceptable Usage Policy 明令禁止攻击性或非法用途。
- 计费模型:Token Plan 计费,输入 Token $6/百万,输出 $36/百万,缓存 $0.60/百万;超过 272K Token 上下文后费用翻倍,整体比 Fugu‑Ultra 多 20% 溢价。
- 地域限制:目前不向欧盟/EEA 提供服务,正在推进 GDPR 合规。
行业意义与展望
Fugu‑Cyber 的发布展示了 模型编排 + 专业子模型 的安全落地路径。相比单一大模型直接生成 PoC,编排体系在可信度与可审计性上具备天然优势。尽管当前成绩仍基于自报且缺乏第三方复现,但已在公开基准上逼近或超越业界领先模型。未来若开放更多子模型的可视化路由,或提供可复现的评测基准,Fugu‑Cyber 有望成为企业安全团队的“AI 助手”,推动从漏洞发现到检测规则全链路的自动化。
关键要点
- Fugu‑Cyber 为安全专用编排端点,非全新前沿模型。
- 在 CyberGym 与 CTI‑REALM 两大基准上分别取得 86.9% 与 72.1% 的自报成绩。
- 采用 Thinker‑Worker‑Verifier 三层编排,Verifier 为安全验证核心。
- 访问需人工审批,遵守防御性 AUP,仅在 Token Plan 下计费,欧盟地区暂不可用。
随着安全需求的持续增长,基于编排的专用模型有望在行业内形成新的竞争格局。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。