CantinaがApex Flash 1を発表、ソフトウェアセキュリティ調査向けオープンウェイトモデル
Cantina SecurityとYetaは、コード解析やツール実行、エクスプロイト作成と効果検証が可能な、GLM‑5.3‑Flashベースのオープンウェイト強化学習モデルApex Flash 1を公開し、60件のバグタスクで66.7%の成功率を達成した。

Cantina SecurityはYetaと共同で、ソフトウェアセキュリティ調査に特化した強化学習後学習モデルApex Flash 1をリリースした。このモデルは「フォーカスドワーカー」として位置付けられ、上位エージェントから呼び出されてコード分析、ツール呼び出し、エクスプロイト生成、ライブ検証といった具体的な作業を実行できる。
基盤となるアーキテクチャは約321.3 億パラメータを持つが、スパース活性化によりトークンあたり約18 億パラメータしか使用しない。オープンウェイトは公開されているものの、依然として大容量メモリを必要とし、適切なインフラなしでは低スペックハードウェアに不向きである。
評価手法と結果
Cantinaは、20件の未公開脆弱性ケースから抽出した60のタスクでApex Flash 1を評価した。タスクはガイド付きホワイトボックス、フォーカスドホワイトボックス、フォーカスドブラックボックスの3つの視点に分け、最終状態検証器を備えた隔離環境で実行された。
モデルは60タスク中40タスクで成功し、初回試行のPass@1率は66.7%となった。計算コストはタスクあたり平均2.38ドルで、パラメータ数の大きさにもかかわらずスパース活性化の効率が反映されている。
参考までに、ベースのGLM‑5.3‑Flashは60タスク中36タスクを解決しタスクあたり4.56ドル、AnthropicのClaude Opus 5.5は43タスクを解決したがコストはタスクあたり74.68ドルに達した。これらの数値はCantina内部の評価に基づくもので、外部の独立検証は行われていないことが明記されている。
推奨使用パターン
開発者は、Codexエージェントハーネス経由でApex Flash 1をデプロイし、上位の監督エージェントの指示下で動作させることを推奨している。この方式は、無監督のエンドツーエンド自動化に伴うリスクを軽減することを目的としている。
公開評価はテキストベースのセキュリティタスクに限定されており、画像や動画の処理能力はベンチマークに含まれていない。そのため、マルチモーダルシナリオへの適用は慎重に判断すべきである。
ライセンスと法的責任
Apex Flash 1はMITライセンスで提供され、使用、改変、再配布の自由が広く認められている。ただし、利用者は法的許可の取得、モデルのサンドボックス化、出力の人間レビュー、許可されたシステム以外での攻撃的利用の防止など、全ての責任を負う必要があるとCantinaは強調している。
- オープンウェイトチェックポイントはHugging Faceで入手可能
- スパース活性化でトークン単位の計算量が削減
- 60件の未公開バグタスクでPass@1 66.7%達成
- タスクあたり平均コストは2.38ドル
- Codexエージェントハーネス経由での統合を推奨
配布されているチェックポイントは2種類あり、標準モデルと拒否動作を変更した実験的な「アブリテレート」バージョンがある。公開評価は標準チェックポイントのみを対象としており、アブリテレート版はベンチマークされていないことが明記されている。
総じて、Apex Flash 1はオープンソースかつ高容量モデルとして、セキュリティ研究者が繰り返し作業を自動化する上で重要な一歩となる。ただし、戦略的な意思決定には依然として人間の監督が不可欠である。
日本の組織にとっての実務的なインパクトは明確である。Apex Flash 1を既存のセキュリティパイプラインにプラグインワーカーとして組み込むことで、コード解析やツール実行、エクスプロイト片の生成を低コストで実行できる。上位エージェントと厳格なサンドボックス環境を組み合わせることで、脆弱性の一次評価や概念実証の作成を迅速化しつつ、法的・倫理的基準を遵守できる。
出典
- Can an Open Model Do Security Research? Cantina’s Apex Flash 1 Solves 40 of 60 Held-Out Bug TasksMarkTechPost · 2026年10月4日
- cantina-security/apex-flash-1Hugging Face · 2026年10月3日



