Cantina lance Apex Flash 1, modèle à poids ouvert pour investigations ciblées en cybersécurité
Cantina Security et Yeta dévoilent Apex Flash 1, un modèle d’apprentissage par renforcement basé sur GLM‑5.3‑Flash capable d’analyser du code, d’exécuter des outils, de créer des exploits et de vérifier leurs effets, avec un taux de succès de 66,7 % sur un ensemble de tâches de bugs réservé.

Cantina Security, en partenariat avec Yeta, a annoncé la sortie d’Apex Flash 1, une post‑formation par apprentissage par renforcement de l’architecture GLM‑5.3‑Flash spécialement ajustée aux investigations en cybersécurité. Le modèle se veut un « travailleur ciblé » pouvant être sollicité par un agent de niveau supérieur pour réaliser des étapes concrètes comme l’analyse de code, l’invocation d’outils, la génération d’exploits et la vérification en temps réel.
L’architecture sous‑jacente comporte environ 321,3 milliards de paramètres, mais seuls 18 milliards sont activés par token grâce à une activation parcellaire. Bien que les poids ouverts soient publiquement disponibles, ils requièrent d’importantes ressources mémoire, rendant le modèle inadapté aux matériels peu puissants sans infrastructure adéquate.
Méthodologie d’évaluation et résultats
Cantina a évalué Apex Flash 1 sur une suite soigneusement sélectionnée de 60 tâches issues de 20 cas de vulnérabilités retenus. Les tâches étaient réparties en trois vues d’investigation : boîte blanche guidée, boîte blanche ciblée et boîte noire ciblée, chacune exécutée dans des environnements cibles isolés équipés de vérificateurs d’état final pour confirmer l’impact de l’exploit.
Le modèle a réussi 40 des 60 tâches, soit un taux de réussite pass@1 de 66,7 % lors des premières tentatives. Cantina a indiqué un coût moyen de calcul de 2,38 $ par tâche, chiffre qui reflète l’efficacité de l’activation parcellaire malgré le nombre élevé de paramètres.
À titre de comparaison, le modèle de base GLM‑5.3‑Flash, non modifié, a résolu 36 tâches sur 60 à un coût de 4,56 $ par tâche, tandis que Claude Opus 5.5 d’Anthropic a résolu 43 tâches mais à un coût nettement plus élevé de 74,68 $ par tâche. Cantina précise que ces chiffres proviennent de ses propres évaluations internes et n’ont pas été vérifiés de façon indépendante.
Mode d’emploi recommandé
Les développeurs conseillent de déployer Apex Flash 1 via le harnais d’agent Codex, en le traitant comme un travailleur spécialisé opérant sous la direction d’un agent superviseur plus global. Cette approche vise à atténuer les risques liés à l’automatisation de la sécurité sans supervision.
L’évaluation publique se concentre exclusivement sur des tâches de sécurité basées sur du texte. Les capacités conservées d’Apex Flash 1 pour le traitement d’images ou de vidéos n’ont pas fait l’objet du benchmark, et les résultats ne doivent pas être extrapolés à des scénarios multimodaux.
Licence et responsabilités légales
Apex Flash 1 est publié sous licence MIT, offrant une large liberté d’utilisation, de modification et de distribution du code. Toutefois, Cantina souligne que les utilisateurs restent entièrement responsables de l’obtention des autorisations légales, du confinement du modèle, de la révision humaine des sorties et de la prévention de toute utilisation offensante au‑delà des systèmes qu’ils sont autorisés à tester.
- Checkpoint à poids ouvert disponible sur Hugging Face
- Activation parcellaire réduit le calcul par token
- Pass@1 de 66,7 % sur 60 tâches de bugs retenues
- Coût moyen de 2,38 $ par tâche
- Intégration recommandée via le harnais d’agent Codex
Deux checkpoints distincts sont distribués : le modèle standard et un dérivé expérimental « abliterated » qui modifie le comportement de refus. Cantina précise que l’évaluation publiée ne s’applique qu’au checkpoint standard ; la version abliterated n’a pas été soumise à un benchmark.
Dans l’ensemble, Apex Flash 1 constitue une avancée notable vers des modèles open‑source à haute capacité capables d’assister les chercheurs en sécurité dans l’automatisation de tâches d’investigation répétitives, tout en nécessitant une supervision humaine pour les décisions stratégiques.
Pour les organisations françaises, l’impact pratique est clair : les équipes peuvent intégrer Apex Flash 1 dans leurs pipelines de sécurité existants comme un travailleur plug‑in, tirant parti de sa capacité à analyser du code, lancer des outils d’analyse et générer des fragments d’exploits à un coût modeste par tâche. En associant le modèle à un agent superviseur et en le confinant strictement, les entreprises peuvent accélérer le triage des vulnérabilités et la production de preuves de concept tout en respectant les exigences légales et éthiques.
Sources
- Can an Open Model Do Security Research? Cantina’s Apex Flash 1 Solves 40 of 60 Held-Out Bug TasksMarkTechPost · 4 octobre 2026
- cantina-security/apex-flash-1Hugging Face · 3 octobre 2026



