Cloudflare lanceert open‑source beslissingsmodellen Clef en Clef‑flash: gestructureerde oordelen voor AI‑proxy’s met lage latentie
Op 1 oktober 2026 heeft Cloudflare via Workers AI twee open‑source beslissingsmodellen gelanceerd – Clef (op Qwen3.8‑27B) en Clef‑flash (op Qwen3.5‑9B) – onder de Apache 2.0‑licentie. Ze leveren waarschijnlijkheidswaarden voor ja‑nee‑, keuze‑ of beoordelingsvragen en zijn bedoeld voor toepassingen zoals ticket‑routing, domeinclassificatie, proxy‑firewalls en routeringsbeslissingen.

Release en modeloverzicht
Op 1 oktober 2026 kondigde Cloudflare via zowel de officiële bedrijfsblog als de Workers AI‑marktplaats de beschikbaarstelling aan van twee nieuwe modellen, Clef en Clef‑flash. Clef is gebaseerd op het door Alibaba ontwikkelde Qwen3.8‑27B‑model, terwijl Clef‑flash voortkomt uit Qwen3.5‑9B. Beide modellen worden onder de Apache 2.0‑licentie vrijgegeven, waardoor elke organisatie de gewichten kosteloos kan downloaden, lokaal kan draaien en, indien gewenst, kan aanpassen of opnieuw kan trainen. Deze aankondiging markeert een uitbreiding van Cloudflare’s traditionele CDN‑diensten naar een breder AI‑proxy‑platform dat zich richt op snelle, gestructureerde beslissingsondersteuning aan de edge.
De keuze voor een open‑source‑licentie betekent dat ontwikkelaars niet alleen de modellen kunnen inzetten binnen de Workers AI‑omgeving, maar ook de vrijheid hebben om ze buiten het Cloudflare‑ecosysteem te integreren. Het maakt het mogelijk om de modellen in eigen infrastructuren te hosten, ze te combineren met andere AI‑componenten of ze te verfijnen met eigen data‑sets. Deze flexibiliteit onderstreept Cloudflare’s strategie om AI‑functionaliteit dichter bij de eindgebruiker te brengen, waardoor latency‑gevoelige toepassingen profiteren van de edge‑computing‑capaciteiten van het platform.
Technische details en specificaties
Een beslissingsmodel, zoals gedefinieerd door Cloudflare, is een kunstmatig‑intelligent systeem dat geen vrije tekst genereert, maar in plaats daarvan een vooraf bepaalde set van binaire ja‑nee‑vragen, enkelkeuze‑vragen of beoordelingsschalen beantwoordt door een kansverdeling over de mogelijke antwoorden te retourneren. In tegenstelling tot generatieve grote taalmodellen, die vaak lange, ongestructureerde tekst produceren en extra post‑processing vereisen, leveren deze modellen direct numerieke scores die eenvoudig in geautomatiseerde workflows kunnen worden opgenomen, waardoor de kosten en complexiteit van naverwerking aanzienlijk worden gereduceerd.
De onderliggende training maakt gebruik van de instruct‑fine‑tuning‑techniek die specifiek is ontwikkeld voor de Qwen‑familie. Deze aanpak behoudt de brede semantische begripscapaciteit van het basis‑model, terwijl er in de laatste laag een probabilistische classificatie‑kop wordt toegevoegd. Het resultaat is een model dat zowel de diepgang van een groot taalmodel als de precisie van een gespecialiseerde classifier combineert, waardoor het geschikt is voor het leveren van betrouwbare waarschijnlijkheidswaarden in real‑time scenario’s.
- Clef: Gebaseerd op Qwen3.8‑27B, met ongeveer 2,7 miljard parameters, ondersteunt een contextlengte tot 64 KB, en bevat een ingebouwde visuele encoder die zowel beeld‑ als tekstinvoer in gemengde modaliteit kan verwerken.
- Clef‑flash: Gebaseerd op Qwen3.5‑9B, met ongeveer 900 miljoen parameters, ondersteunt eveneens een contextlengte tot 64 KB, richt zich uitsluitend op pure tekstuele beslissingen en biedt daardoor een snellere responstijd.
- Licentie: Apache 2.0, waardoor zowel commercieel gebruik als herdistributie zonder aanvullende kosten is toegestaan.
- Implementatie: De modellen kunnen rechtstreeks via de Workers AI‑API worden aangeroepen en zijn tevens compatibel met de TypeSafe Jev SDK, waardoor integratie in bestaande systemen eenvoudig is.
- Uitvoerformaat: Een vector van waarschijnlijkheden of een binaire score, ideaal voor toepassingen zoals ticket‑routing, domeinclassificatie, proxy‑firewalls en routeringsbeslissingen.
Prestaties, latentie en RL‑fine‑tuning
Cloudflare publiceerde interne benchmarkresultaten van 43 afzonderlijke tests waarin de mediane responstijd van Clef werd gemeten op 209,3 milliseconden, terwijl Clef‑flash een mediane latentie van 38,8 milliseconden behaalde. Ter vergelijking leverde het bestaande TypeSafe Jev‑model op hetzelfde platform een mediane latentie van 524,1 milliseconden, wat een duidelijk voordeel aantoont voor de nieuw gepubliceerde modellen, vooral in scenario’s waar snelle besluitvorming cruciaal is.
De tests toonden ook dat de twee modellen verschillende sterktes hebben afhankelijk van de kwaliteitscriteria. Bij complexe, beeld‑gebaseerde beslissingen leverde Clef betere nauwkeurigheid en recall, terwijl Clef‑flash superieur presteerde in pure tekst‑scenario’s met een hogere doorvoersnelheid. Cloudflare benadrukt echter dat deze cijfers nog moeten worden bevestigd door onafhankelijke derden, zodat de gerapporteerde voordelen in een bredere context kunnen worden gevalideerd.
Gelijktijdig met de modelrelease introduceerde Cloudflare een reinforcement‑learning (RL)‑fine‑tuning platform. Het platform, ontwikkeld door het interne engineeringteam, biedt een self‑service‑interface waarmee organisaties hun eigen data kunnen gebruiken om een tweede‑fase fine‑tuning uit te voeren. Het proces omvat het ontwerpen van een feedback‑omgeving, het definiëren van een beloningsfunctie en het iteratief verbeteren van de beleids‑ of strategie‑componenten, zodat het uiteindelijke beslissingsmodel nauwkeurig aansluit bij de specifieke use‑case van de klant. Het platform draait volledig binnen de Workers AI‑omgeving, waardoor volledige compatibiliteit met de oorspronkelijke modellen wordt gegarandeerd.
Gebruikslimieten, risico’s en industriële impact
Cloudflare waarschuwt expliciet dat organisaties die Clef of Clef‑flash willen inzetten, eerst de waarschijnlijkheidsdrempels moeten kalibreren op basis van hun eigen data, in plaats van blindelings de standaarddrempels van de leverancier te gebruiken voor kritieke beslissingen. De modellen bieden geen garantie op nul fouten in alle domeinen; met name voor toepassingen die juridische, medische of financiële compliance‑vereisten omvatten, blijft menselijke controle noodzakelijk om onvoorziene fouten te voorkomen.
Hoewel de open‑source‑licentie het toestaat om de modellen zelf aan te passen, kan het nalaten van best practices op het gebied van beveiliging leiden tot model‑drift of blootstelling aan adversarial attacks. Het is daarom essentieel dat bedrijven passende veiligheids‑ en monitoringmaatregelen implementeren voordat ze de modellen in productie nemen, zodat eventuele afwijkingen tijdig worden opgespoord en gecorrigeerd.
Voor bedrijven in Taiwan en de bredere regio biedt de Clef‑serie een haalbare oplossing om AI‑beslissingen met lage latentie direct aan de edge te draaien. Klantenservice‑centra kunnen de modellen inzetten om inkomende tickets in realtime te routeren naar de juiste afdeling, e‑commerce platforms kunnen kwaadaardig verkeer direct op het CDN‑edge classificeren, en financiële instellingen kunnen op de API‑gateway laag snel een risicoscore toekennen aan transacties. Indien onafhankelijke derden de gerapporteerde prestaties bevestigen, wordt verwacht dat een groeiend aantal SaaS‑leveranciers deze beslissingsmodellen zal integreren in hun service‑contracten, waardoor de adoptie van AI‑proxy’s in lokale toepassingen verder zal versnellen.
Bronnen
- Introducing Clef: our open-source decision models, and new RL fine-tuning platformCloudflare · 1 oktober 2026
- Cloudflare 開源 270 億參數決策模型 ClefINSIDE · 3 oktober 2026



