Qwen3.8-Flash-Next: Alibaba zeigt einen Vorgeschmack auf die Qwen4-Architektur
Alibabas Qwen-Team hat Qwen3.8-Flash-Next veröffentlicht, ein MoE-Modell mit 125 Milliarden Parametern, von denen pro Token nur 6 Milliarden aktiv sind, trainiert zu einem Neuntel der Kosten seines Vorgängers.

Alibabas Qwen-Team hat am 26. August 2026 Qwen3.8-Flash-Next veröffentlicht, ein multimodales Mixture-of-Experts-Modell mit offenen Gewichten, das MarkTechPost als „auf Kosten pro Token” ausgelegt beschreibt. Der Checkpoint basiert auf einem 125-Milliarden-Parameter-Backbone, von dem pro Token nur 6 Milliarden Parameter aktiv sind — ein Verhältnis, das das Qwen-Team als frühen Vorgeschmack auf die Architektur präsentiert, die Qwen4 zugrunde liegen wird, dieselbe Rolle, die Qwen3-Next vor Qwen3.5 spielte, so MarkTechPost.
Die Gesamtzahl der Parameter auf der Festplatte erreicht 180 Milliarden, sobald zum Haupt-Backbone eine N-Gramm-Embedding-Tabelle mit 51 Milliarden Parametern und ein Multi-Token-Vorhersagemodul mit 4 Milliarden Parametern hinzukommen, berichtet MarkTechPost. The Decoder beschreibt die N-Gramm-Schicht als eine Art „Phrasenwörterbuch”, das gängige Wortgruppen als eigenständige Einträge speichert und statt im GPU-Speicher im regulären Arbeitsspeicher liegen kann, zu dem, was Qwen als „vergleichsweise geringe zusätzliche Kosten” bezeichnet.
Vier Änderungen tragen die Veröffentlichung
MarkTechPost nennt vier architektonische Änderungen hinter Qwen3.8-Flash-Next. Die erste ist ein hybrides Attention-Schema: Drei von vier Schichten laufen mit Gated DeltaNet, einem linearen Attention-Mechanismus, der die Historie in einen rekurrenten Zustand fester Größe komprimiert, während die vierte Schicht Qwen Sparse Attention (QSA) nutzt, das den Kontext über einen leichtgewichtigen Indexer in Mikroblock-Granularität auswählt. Über die 48 Schichten des Modells wiederholt sich das Muster in 12 Blöcken aus drei Gated-DeltaNet-Schichten gefolgt von einer QSA-Schicht, mit einem QSA-Budget von maximal 512 Blöcken oder 2048 Token.
Die zweite Änderung, Gated Residual, verbreitert den Residual-Strom in vier parallele Zweige, gesteuert von einem elementweisen Lese-Gate und einem Schreib-Gate pro Zweig bei Bottleneck-Rang 320. Die dritte ist das oben beschriebene N-Gramm-Embedding. Die vierte ist ein Trainingsrezept, das den Muon-Optimierer neben AdamW auf bestimmte Gewichtskategorien anwendet, das Batch-Size-Warmup entfernt und die Skalierungsgesetze des Modells neu anpasst, berichtet MarkTechPost. Die Mixture-of-Experts-Schicht selbst routet zwischen 512 Experten, wobei pro Token 10 geroutete Experten plus ein gemeinsamer Experte aktiv sind, bei einer Experten-Zwischendimension von 640.
- 125 Milliarden Parameter insgesamt im Haupt-Backbone, davon nur 6 Milliarden pro Token aktiv
- N-Gramm-Embedding-Tabelle mit 51 Milliarden Parametern plus Multi-Token-Vorhersagemodul mit 4 Milliarden — insgesamt 180 Milliarden Parameter auf der Festplatte
- 512 Experten in der MoE-Schicht, davon 10 geroutete plus 1 gemeinsamer pro Token aktiv
- Natives Kontextfenster von 262.144 Token, über YaRN auf 1 Million Token erweiterbar
- FP8-Checkpoint: 172,78 GiB; BF16-Checkpoint: 335,28 GiB
Benchmarks vor größeren Rivalen — aber nicht überall
Bei agentischem Coding erzielt Flash-Next laut Qwen 58,7 Punkte auf DeepSWE 1.1 und 62,5 auf SWE-bench Pro, jeweils vor DeepSeek-V4-Flash und Claude Opus 4.6 (Max), so The Decoder. Bei Büro- und Arbeitsablaufaufgaben wird der Abstand noch größer: Flash-Next erreicht 73,9 auf CoWorkBench gegenüber 45,1 bei DeepSeek-V4-Flash und 55,7 auf JobBench, fast doppelt so viel wie die 27,6 von Qwen3.7-Plus, berichtet The Decoder. Qwen3.7-Plus selbst hat 397 Milliarden Parameter insgesamt bei 17 Milliarden aktiven Parametern pro Token — fast dreimal so viele aktive Parameter wie Flash-Next —, während DeepSeek-V4-Flash 284 Milliarden Parameter bei 13 Milliarden aktiven hat, laut dem Bericht von The Decoder über Alibabas eigene Benchmark-Vergleiche.
Das Modell gewinnt nicht überall. MarkTechPost merkt an, dass Claude Opus 4.6 (Max) bei Humanity's Last Exam mit 40,0 gegenüber 35,9 bei Qwen führt und dass DeepSeek-V4-Flash-0731 bei NL2Repo-Bench mit 54,2 gegenüber 48,1 vorne liegt. The Decoder fügt hinzu, dass Claude Opus 4.6 im Vergleich ein „älteres” Anthropic-Modell aus dem Februar 2026 sei, und warnt, dass Benchmark-Werte und reale Leistung auseinanderfallen können.
Ein Neuntel der Trainingskosten, ein Bruchteil des Preises
Qwen gibt an, dass das Training von Flash-Next etwa ein Neuntel dessen gekostet habe, was Qwen3.7-Plus gekostet hat, so MarkTechPost. Bei der Serving-Geschwindigkeit weichen die beiden Quellen bei den genauen Zahlen voneinander ab: MarkTechPost berichtet, dass Qwens eigene Ankündigung QSA-Kernel-Beschleunigungen von bis zu 7,6-fach beim Prefill und 4,9-fach beim Decode bei 1 Million Token nennt, während separate SGLang- und vLLM-Deployment-Rezepte, die im selben MarkTechPost-Artikel zitiert werden, die Verbesserung mit 10,2-fach beziehungsweise 6,6-fach angeben — eine Diskrepanz, auf die MarkTechPost selbst hinweist und dazu rät, „die Spanne bis zur unabhängigen Messung als Herstellerangabe zu behandeln”. Qwen beansprucht laut MarkTechPost außerdem den 8,6-fachen Prefill-Durchsatz von Qwen3.7-Plus bei einer Prefix-Cache-Trefferquote von 90 Prozent.
Bei der Preisgestaltung berichtet The Decoder, dass die Produktionsversion Qwen3.8-Flash über QwenCloud zu 0,16 US-Dollar pro Million Input-Token und 0,47 US-Dollar pro Million Output-Token verfügbar ist, wobei die API in Kürze live gehen soll. Damit liegt der Preis bei etwa einem Zwölftel des Preises von Alibabas aktuellem Flaggschiff Qwen3.8-Max, das Anfang August erschien und gegen Claude Opus 4.8, Gemini 3.1 Pro und GPT-5.6 Sol positioniert ist, so The Decoder — auch wenn Flash-Next in Alibabas eigenen Benchmarks knapp unter diesem Flaggschiff liegt.
Einsetzbar, aber nicht auf einer Workstation
Trotz seiner effizienten Anzahl aktiver Parameter ist Flash-Next kein Modell, das ein einzelner Entwickler mal eben laufen lassen kann. MarkTechPost berichtet, dass der FP8-Checkpoint 172,78 GiB und die BF16-Version 335,28 GiB wiegt; laut vLLMs eigenen Deployment-Rezepten benötigt die minimal validierte FP8-Konfiguration zwei GPUs im Tensor-Parallel-Modus auf Nvidias GB300, wobei vier empfohlen werden, während ein 8×H200-Knoten eine gemischte Tensor-Experten-Parallel-Konfiguration erfordert, weil das standardmäßige 8-Wege-Tensor-Parallel nicht mit den 128 breiten Quantisierungsblöcken des Checkpoints kompatibel ist. Die spärliche Aktivierung senkt den Rechenaufwand, so MarkTechPost, aber nicht den Speicherbedarf. Das Modell wird unter Alibabas eigener qwen-community-1.0-Lizenz statt unter Apache 2.0 vertrieben, was bedeutet, dass kommerzielle Nutzer die Bedingungen vor einem Einsatz prüfen müssen, ergänzt MarkTechPost.
Die Wette, die Alibaba mit Flash-Next eingeht, ist struktureller, nicht nur numerischer Art: Wenn die Zahl der aktiven Parameter niedrig bleibt, während die Gesamtkapazität durch Mixture-of-Experts-Routing und zusätzliche Nachschlagetabellen wächst, kann ein Modell sich der Denkqualität weit größerer, teurerer Systeme annähern und dabei zu einem Bruchteil der Rechenkosten pro Anfrage bedient werden. Deshalb positioniert Qwen diese Veröffentlichung nicht als fertiges Produkt, sondern als „Architektur-Vorschau” — eine öffentliche Probe, an einem kleineren Modell, für Ideen, die Alibaba auf die gesamte Qwen4-Reihe skalieren will.
Für deutsche und europäische Unternehmen, die zwischen westlichen proprietären APIs wie Claude oder GPT und chinesischen Open-Weight-Alternativen abwägen, schärft Qwen3.8-Flash-Next diese Entscheidung: Ein Open-Weight-Modell zu einem Bruchteil der Preise proprietärer Spitzenmodelle, das in Code- und Büroautomatisierungs-Benchmarks mit weit größeren Systemen mithält oder sie übertrifft, lässt sich nun selbst hosten oder über QwenCloud mieten — auch wenn dafür weiterhin ein Multi-GPU-Server statt eines Laptops nötig ist und das Modell unter einer Nicht-Apache-Lizenz steht, deren Bedingungen vor jedem kommerziellen Einsatz in Europa genau zu prüfen sind.
Quellen
- Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 ArchitectureMarkTechPost · 26. August 2026
- Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"The Decoder · 26. August 2026



