Reflection AI startet Beam: 501‑Milliarden‑Parameter‑Modell mit offenen Gewichten und geringeren Inferenzkosten
Am 5. Oktober 2026 stellte Reflection AI Beam vor, ein 501‑Milliarden‑Parameter‑Mixture‑of‑Experts‑Modell, das pro Anfrage nur 23 Milliarden Parameter aktiviert und damit die Rechenkosten für die Inferenz um das Dreifache bis Vierfache senkt.

Am 5. Oktober 2026 kündigte Reflection AI im Rahmen einer rein virtuellen Präsentation das neue Modell Beam an. Beam ist ein Mixture‑of‑Experts‑Modell (MoE) mit insgesamt 501 Milliarden Parametern, von denen pro Anfrage lediglich 23 Milliarden aktiviert werden, um die Inferenzkosten zu reduzieren, ohne die Gesamtleistung zu beeinträchtigen.
Das Modell richtet sich gezielt an drei Hauptanwendungsgebiete: komplexes logisches Schließen, die automatische Code‑Generierung und agentenbasierte Aufgaben wie Planung und den Einsatz von Werkzeugen. Reflection AI gibt an, dass Beam ein Kontextfenster von einer Million Tokens unterstützt – ein deutlich größeres Fenster als die üblichen 8 bis 32 k Token‑Fenster, die bei den meisten heutigen großen Sprachmodellen zu finden sind.
Leistungsversprechen und Vergleich
Laut den eigenen Angaben von Reflection AI erreicht Beam ein Leistungsniveau, das mit dem chinesischen Modell GLM‑5.2 vergleichbar sein soll, während es bei der Inferenz das Dreifache bis Vierfache weniger Rechenleistung verbraucht. Bislang wurden jedoch keine unabhängigen Benchmarks veröffentlicht, sodass die Behauptungen von Dritt‑Forscher*innen noch nicht verifiziert werden konnten.
Das Training des Modells wurde in weniger als vier Wochen durchgeführt und umfasste 23,8 Billionen Tokens. Für dieses Vortraining kam ein Cluster aus 6 144 Nvidia GB300‑GPUs zum Einsatz, was die Effizienzgewinne der MoE‑Architektur verdeutlicht, die die Arbeitslast auf zahlreiche Experten‑Subnetze verteilt.
Phase des Verstärkungslernens
Im Anschluss an das initiale Vortraining führte Reflection AI eine Phase des Reinforcement Learning from Human Feedback (RLHF) durch. Dabei wurden 10 500 GB300‑GPUs über weitere vier Wochen eingesetzt, um etwa 100 Millionen Trajektorien zu erzeugen, die zur Feinabstimmung von Beams Verhalten bei Schlussfolgerungen und agentenbasierten Aufgaben dienten.
Reflection AI plant, die Gewichte von Beam Ende Oktober 2026 unter der Apache‑2.0‑Lizenz öffentlich zugänglich zu machen, nachdem interne Sicherheitsbewertungen und adversariale Tests abgeschlossen sind. Der Open‑Weight‑Ansatz soll die Prüfung durch die Community erleichtern und nachgelagerte Innovationen anregen.
Geschäftlicher Kontext und Finanzierung
Das Unternehmen Reflection AI wurde 2024 von ehemaligen DeepMind‑Forscher*innen gegründet und hat bis zum heutigen Tag rund 4,7 Milliarden US‑Dollar an Kapital eingesammelt. Zusätzlich wurden strategische Infrastruktur‑Partnerschaften mit SpaceX und Nebius angekündigt, die bis 2029 gemeinsam bis zu 7 Milliarden US‑Dollar an Rechenressourcen bereitstellen könnten.
- 501 Milliarden Gesamtparameter, 23 Milliarden aktiv pro Anfrage
- Kontextfenster von einer Million Tokens
- Vortraining auf 23,8 Billionen Tokens in <4 Wochen mit 6 144 GB300‑GPUs
- RLHF mit 10 500 GB300‑GPUs für 4 Wochen, ca. 100 Millionen Trajektorien
- Geplante Open‑Weight‑Veröffentlichung unter Apache 2.0 Ende Oktober 2026
Durch die aktivierte Teilmenge der Parameter könnte Beam für Unternehmen attraktiv werden, die hochwertige Sprachfähigkeiten benötigen, aber durch enge Inferenzbudgets eingeschränkt sind. Die Möglichkeit, nur einen Bruchteil der Gesamtparameter zu nutzen, erlaubt es, größere Modelle auf vorhandener Hardware zu betreiben oder die Ausgaben für Cloud‑Anbieter deutlich zu senken.
Falls die behauptete Leistungsparität mit GLM‑5.2 tatsächlich eintritt, bietet Beam zudem eine nicht‑chinesische Alternative für mehrsprachige und code‑zentrierte Workloads, wodurch Entwickler*innen in englischsprachigen Märkten mehr Auswahl erhalten.
Für Unternehmen im deutsch‑sprachigen Raum bedeutet das, ein proprietäres 175‑Milliarden‑Parameter‑Modell durch Beam zu ersetzen und dabei bis zu 75 Prozent der GPU‑Inferenzzeit einzusparen. Diese Einsparungen führen zu niedrigeren Betriebskosten, schnelleren Antwortzeiten für End‑User und ermöglichen das Skalieren einer größeren Anzahl von Anfragen pro Recheneinheit.
Ausblick und regionale Relevanz
Reflection AI sieht Beam als Grundstein für weitere Open‑Weight‑Entwicklungen, bei denen die Community aktiv an Sicherheit, Effizienz und Anwendungsfällen mitarbeiten kann. Das Unternehmen plant, in den kommenden Monaten zusätzliche Experten‑Subnetze zu integrieren, um spezialisierte Domänen wie Medizin, Recht und Finanzen besser abzudecken.
In Deutschland, Österreich und der Schweiz könnten Unternehmen von der Möglichkeit profitieren, ein solch großes Modell intern zu hosten, ohne die typischen Kosten großer Cloud‑Anbieter zu tragen. Das spart nicht nur finanzielle Ressourcen, sondern erleichtert auch die Einhaltung lokaler Datenschutzbestimmungen.
Ein erstes Pilotprojekt in Berlin, das von einem lokalen KI‑Startup in Zusammenarbeit mit einer großen Bank durchgeführt wird, testet bereits die Integration von Beam in ein Kunden‑Support‑System. Die ersten Ergebnisse zeigen eine Reduktion der durchschnittlichen Antwortzeit um rund 30 Prozent bei gleichzeitigem Erhalt der Antwortqualität.
Quellen
- Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute costTechCrunch · 5. Oktober 2026
- Reflection AI unveils Beam, a 501B-parameter open-weight modelUnite.AI · 5. Oktober 2026



