Cantina lanceert Apex Flash 1, een open‑weight model voor gerichte software‑beveiligingsonderzoeken
Cantina Security en Yeta onthulden Apex Flash 1, een open‑weight reinforcement‑learning model gebaseerd op GLM‑5.3‑Flash dat code kan lezen, tools kan uitvoeren, exploits kan maken en effecten kan verifiëren, met een succespercentage van 66,7 % op een aparte bug‑taakset.

Cantina Security, in samenwerking met Yeta, heeft de lancering aangekondigd van Apex Flash 1, een post‑training reinforcement‑learning model dat is opgebouwd op de GLM‑5.3‑Flash architectuur en specifiek is geoptimaliseerd voor software‑beveiligingsonderzoeken; het model wordt gepresenteerd als een “gerichte werker” die door een hoger‑niveau agent kan worden aangeroepen om concrete handelingen uit te voeren, waaronder code‑analyse, het aanroepen van beveiligingstools, het genereren van exploits en het live verifiëren van de effecten.
De onderliggende architectuur bestaat uit ongeveer 321,3 miljard parameters, maar dankzij een sparse‑activation mechanisme worden er per token slechts circa 18 miljard parameters geactiveerd, waardoor de rekencapaciteit per stap sterk wordt gereduceerd; hoewel de open‑weight checkpoints publiek beschikbaar zijn, blijven de geheugen‑ en rekenvereisten aanzienlijk, waardoor het model onpraktisch is voor low‑end hardware zonder gespecialiseerde infrastructuur.
Evaluatiemethodologie en resultaten
Cantina heeft Apex Flash 1 geëvalueerd met behulp van een samengestelde suite van zestig taken, afgeleid van twintig afgehouden kwetsbaarheidsgevallen; de taken zijn onderverdeeld in drie onderzoeksperspectieven – guided white‑box, focused white‑box en focused black‑box – en werden uitgevoerd in geïsoleerde doelomgevingen die zijn uitgerust met eind‑toestand verifiers om de impact van gegenereerde exploits nauwkeurig te bevestigen.
Het model behaalde succes in veertig van de zestig taken, wat neerkomt op een pass@1‑score van 66,7 % bij de eerste poging; Cantina rapporteerde bovendien een gemiddelde rekencost van $2,38 per taak, een cijfer dat de efficiëntie van de sparse‑activation benadrukt ondanks het enorme aantal totale parameters.
Ter vergelijking liet Cantina zien dat het onbewerkte basis‑GLM‑5.3‑Flash model dertig‑zestig taken voltooide tegen een gemiddelde kost van $4,56 per taak, terwijl Anthropic’s Claude Opus 5.5 dertig‑drie van de zestig taken voltooide maar tegen een veel hogere kost van $74,68 per taak; Cantina maakt duidelijk dat deze cijfers voortkomen uit interne tests en niet onafhankelijk zijn geverifieerd.
Aanbevolen gebruikspatroon
De ontwikkelaars adviseren om Apex Flash 1 te integreren via de Codex‑agent‑harnas, waarbij het model wordt beschouwd als een gespecialiseerde werker die opereert onder toezicht van een bredere toezichthoudende agent; deze aanpak moet de risico's van onbewaakte, end‑to‑end beveiligingsautomatisering beperken en een extra laag controle toevoegen.
De publieke evaluatie is beperkt tot tekst‑gebaseerde beveiligingstaken; mogelijkheden van Apex Flash 1 om afbeeldingen of video te verwerken werden niet meegenomen in de benchmark, en de behaalde resultaten mogen dan ook niet worden geëxtrapoleerd naar multimodale scenario's.
Licentie en juridische verantwoordelijkheid
Apex Flash 1 wordt uitgebracht onder de MIT‑licentie, die brede vrijheid biedt om de code te gebruiken, te wijzigen en te distribueren; Cantina benadrukt echter dat gebruikers volledig verantwoordelijk blijven voor het verkrijgen van de benodigde wettelijke toestemming, het sandboxen van het model, het uitvoeren van menselijke controle op de gegenereerde output en het voorkomen van offensief gebruik buiten de systemen die zij mogen testen.
- Open‑weight checkpoint beschikbaar op Hugging Face
- Sparse activation vermindert per‑token rekentijd
- Pass@1 van 66,7 % op 60 afgehouden bug‑taken
- Gemiddelde kost van $2,38 per taak
- Aanbevolen integratie via Codex‑agent‑harnas
Er worden twee afzonderlijke checkpoints gedistribueerd: het standaardmodel en een experimentele “abliterated” variant die het weigergedrag wijzigt; Cantina maakt duidelijk dat de gepubliceerde evaluatie uitsluitend van toepassing is op de standaard checkpoint, terwijl de abliterated versie niet is gebenchmarkt en dus geen officiële prestatiecijfers heeft.
Al met al vertegenwoordigt Apex Flash 1 een belangrijke stap richting open‑source, high‑capacity modellen die beveiligingsonderzoekers kunnen ondersteunen bij het automatiseren van repetitieve onderzoekstappen, terwijl menselijk toezicht nog steeds noodzakelijk blijft voor strategische besluitvorming en ethische afwegingen.
Praktische impact voor Nederlandse organisaties
Voor Nederlandse bedrijven is de praktische impact duidelijk: security‑teams kunnen Apex Flash 1 integreren in bestaande beveiligings‑pipelines als een plug‑in worker, gebruikmakend van zijn vermogen om code te analyseren, analyse‑tools uit te voeren en exploit‑fragmenten te genereren tegen een relatief bescheiden per‑taak‑kost.
Door het model te koppelen aan een toezichthoudende agent en strikte sandbox‑maatregelen te hanteren, kunnen organisaties de triage van kwetsbaarheden en de productie van proof‑of‑concepts versnellen, terwijl ze tegelijkertijd voldoen aan zowel wettelijke als ethische normen die in de Nederlandse en EU‑regelgeving zijn verankerd.
De combinatie van een open‑weight checkpoint, een lage rekencost en een duidelijke integratie‑aanbeveling maakt Apex Flash 1 tot een aantrekkelijk instrument voor zowel grote enterprises als kleinere security‑consultancy bureaus die op zoek zijn naar schaalbare, controleerbare automatisering in hun kwetsbaarheidsanalyseprocessen.
Bronnen
- Can an Open Model Do Security Research? Cantina’s Apex Flash 1 Solves 40 of 60 Held-Out Bug TasksMarkTechPost · 4 oktober 2026
- cantina-security/apex-flash-1Hugging Face · 3 oktober 2026



