Cantina 推出 Apex Flash 1:開放權重模型加速軟體安全調查
Cantina Security 與 Yeta 公布 Apex Flash 1,基於 GLM‑5.3‑Flash 的開放權重強化學習模型,能讀取程式碼、呼叫工具、產生漏洞利用並驗證效果,在 60 項保留測試任務中取得 66.7% 成功率。

Cantina Security 與 Yeta 共同宣佈推出 Apex Flash 1,這是一個針對軟體安全調查特別調校的 GLM‑5.3‑Flash 架構的強化學習後訓練模型。該模型被定位為「聚焦工作者」,可由更高層的代理呼叫,執行程式碼分析、工具呼叫、漏洞利用產生與即時驗證等具體步驟。
底層架構約有 3213 億個參數,但得益於稀疏激活,每個 token 僅啟用約 180 億參數。雖然開放權重已公開,但仍需大量記憶體資源,對於缺乏相應基礎建設的低階硬體並不適用。
評估方法與結果
Cantina 在一套精選的 60 項任務上對 Apex Flash 1 進行測試,這些任務取自 20 個未公開的漏洞案例,並分為導引式白箱、聚焦式白箱與聚焦式黑箱三種調查視角,每項任務均在配備最終狀態驗證器的隔離環境中執行,以確認利用效果。
模型在 60 項任務中成功完成 40 項,首次嘗試的 pass@1 率為 66.7%。Cantina 報告每項任務的平均計算成本為 2.38 美元,顯示出即使參數規模龐大,稀疏激活仍能保持效能。
作為對照,Cantina 自己的測試顯示未經調整的基礎 GLM‑5.3‑Flash 模型在相同任務中解決 36 項,成本為每任務 4.56 美元;而 Anthropic 的 Claude Opus 5.5 解決 43 項,但成本高達每任務 74.68 美元。Cantina 強調這些數據僅來源於內部評估,尚未經第三方驗證。
建議使用模式
開發者建議透過 Codex 代理框架部署 Apex Flash 1,將其視為在更廣泛監督代理指導下運作的專業工作者,以降低無監督端對端安全自動化的風險。
公開評估僅聚焦於文字為主的安全任務。Apex Flash 1 仍保有影像或影片處理能力,但未列入基準測試,結果不應外推至多模態情境。
授權與法律責任
Apex Flash 1 以 MIT 授權釋出,允許廣泛的使用、修改與散布。但 Cantina 強調使用者必須自行確保取得合法授權、將模型置於沙箱環境、對輸出進行人工審核,並防止在未獲許可的系統上進行任何攻擊性使用。
- 開放權重檢查點可於 Hugging Face 取得
- 稀疏激活降低每 token 計算量
- 在 60 項保留漏洞任務中取得 66.7% 的 Pass@1
- 每項任務平均成本 2.38 美元
- 建議透過 Codex 代理框架整合
目前提供兩個不同的檢查點:標準模型與一個實驗性的「削弱」衍生版,後者會改變拒絕行為。Cantina 明確說明,已公布的評估僅適用於標準檢查點;削弱版尚未進行基準測試。
總體而言,Apex Flash 1 是向開源、高容量模型邁進的重要一步,能協助安全研究人員自動化重複性的調查步驟,同時仍需人工監督以作出策略決策。
對於中文使用的企業而言,實際影響相當明顯:團隊可將 Apex Flash 1 作為外掛工作者整合進既有的安全流水線,利用其解析程式碼、執行分析工具與產生漏洞利用片段的能力,且每項任務成本適中。透過與監督代理及嚴格的沙箱機制結合,企業能加速漏洞分流與概念驗證的產出,同時遵守法律與倫理標準。
未來發展與限制
Cantina 表示將持續優化稀疏激活機制,降低硬體門檻,同時計畫針對多模態安全任務推出專屬基準,期望在未來一年內提供更完整的測試套件與第三方驗證報告,以提升模型在產業中的可信度與可採用性。
資料來源
- Can an Open Model Do Security Research? Cantina’s Apex Flash 1 Solves 40 of 60 Held-Out Bug TasksMarkTechPost · 2026年10月4日
- cantina-security/apex-flash-1Hugging Face · 2026年10月3日



