Cantina 发布 Apex Flash 1 开源模型,专注软件安全调查与漏洞验证
Cantina Security 与 Yeta 联手推出 Apex Flash 1,这是一款基于 GLM‑5.3‑Flash 的开源权重模型,能够读取代码、调用工具、生成利用代码并验证效果,在 60 项隐蔽漏洞任务中取得 66.7% 的成功率。

Cantina Security 与 Yeta 联手宣布推出 Apex Flash 1,这是一款专为软件安全调查与漏洞验证而调优的强化学习后训练模型,底层基于 GLM‑5.3‑Flash 架构,并以“专注工作者”身份提供给更高层的代理系统调用,实现代码解析、工具调度、利用代码生成以及实时效果验证等完整流程。
模型的参数规模约为 3213 亿,但采用稀疏激活技术,每次生成仅激活约 180 亿参数,从而在保持强大表达能力的同时显著降低计算开销。尽管模型权重已公开发布,所需的显存和算力仍然高于普通消费级硬件,只有配备相应的服务器或云端算力资源才能顺畅运行。
评估方法与实验设置
Cantina 选取了 20 起未公开的真实漏洞案例,衍生出 60 项具体任务,对 Apex Flash 1 进行系统化评估。这些任务覆盖三种调查视角:引导式白盒、聚焦白盒以及聚焦黑盒,并在配备最终状态验证器的隔离目标环境中执行,以确保利用代码的实际影响能够被准确捕获。
在 60 项任务中,模型成功完成了 40 项,首次尝试的 pass@1 率达到 66.7%。与此同时,Cantina 报告每项任务的平均计算成本仅为 2.38 美元,说明稀疏激活在大规模模型上的高效性得以体现。
作为对照实验,未经任何安全调优的原始 GLM‑5.3‑Flash 在同样任务集上完成 36 项,单任务成本升至 4.56 美元;而 Anthropic 的 Claude Opus 5.5 完成 43 项,但每任务成本高达 74.68 美元。Cantina 明确这些数据来源于内部评估,尚未接受第三方独立验证。
推荐的使用模式
官方建议通过 Codex 代理框架部署 Apex Flash 1,将其视为在更广泛监督代理指导下工作的专用工作者,以降低纯粹无监督端到端安全自动化可能带来的误判风险。
当前公开的评估仅聚焦于基于文本的安全任务,模型在图像或视频等多模态输入上的处理能力尚未纳入基准测试,因而不应将该结果外推至多模态场景。
许可协议与法律责任
Apex Flash 1 采用 MIT 许可证发布,允许用户自由使用、修改以及再分发模型及其代码。但 Cantina 强调,使用者必须自行承担获取合法授权、在沙箱环境中运行模型、对模型输出进行人工审查以及防止在未授权系统上进行攻击性使用的全部法律与伦理责任。
- 在 Hugging Face 提供开源权重检查点
- 稀疏激活降低每 token 计算量
- 在 60 项隐蔽漏洞任务中 pass@1 为 66.7%
- 每任务平均成本 2.38 美元
- 推荐通过 Codex 代理框架集成
Cantina 同时发布了两个检查点:一个是标准模型,另一个是实验性的 “abliterated” 变体,后者在拒绝行为上做了特殊调整。官方明确说明,已公布的评估仅针对标准检查点进行,abliterated 版本尚未完成任何基准测试。
总体来看,Apex Flash 1 标志着开源高容量模型在软件安全领域的关键突破,能够帮助安全研究人员自动化重复性的调查步骤,显著提升漏洞分析效率,但仍需人工监督以完成更高层次的策略决策。
对于中国的企业和研究机构而言,Apex Flash 1 的实际价值尤为突出:团队可以将其作为插件工作者嵌入现有的安全流水线,利用其代码解析、工具调用和利用片段生成能力,以相对低廉的每任务成本加速漏洞分流和概念验证。
在配合监督代理并严格进行沙箱化后,企业能够在遵守国内外法律法规和伦理标准的前提下,显著提升安全响应速度和质量,为业务连续性提供更坚实的技术保障。
信息来源
- Can an Open Model Do Security Research? Cantina’s Apex Flash 1 Solves 40 of 60 Held-Out Bug TasksMarkTechPost · 2026年10月4日
- cantina-security/apex-flash-1Hugging Face · 2026年10月3日



