Reflection AI lance Beam, modèle ouvert de 501 milliards de paramètres à coût d’inférence réduit
Le 5 octobre 2026, Reflection AI a présenté Beam, un modèle de langage à 501 milliards de paramètres qui n’active que 23 milliards de paramètres par requête, promettant un coût d’inférence trois à quatre fois moindre tout en égalant les performances des modèles chinois de référence.

Lancement de Beam
Le 5 octobre 2026, Reflection AI a présenté Beam lors d’un événement virtuel. Ce nouveau modèle de langage appartient à la famille des mixture‑of‑experts (MoE) : il comporte un total de 501 milliards de paramètres, mais n’en active que 23 milliards pour chaque requête, une architecture conçue pour limiter les coûts d’inférence tout en conservant des capacités élevées.
Beam vise trois usages prioritaires : le raisonnement complexe, la génération de code et les tâches d’agent, comme la planification ou l’utilisation d’outils externes. L’entreprise indique que le modèle supporte une fenêtre contextuelle d’un million de jetons, bien supérieure aux fenêtres habituelles de 8 à 32 k jetons que l’on retrouve dans les grands modèles actuels.
Promesses de performance et comparaison
Reflection AI affirme que Beam atteint un niveau de performance comparable au modèle chinois GLM‑5.2, tout en consommant trois à quatre fois moins de calcul lors de l’inférence. Aucun benchmark indépendant n’a encore été publié, de sorte que ces affirmations restent à confirmer par la communauté scientifique.
Le pré‑entraînement du modèle a été réalisé sur 23,8 trillions de jetons en moins de quatre semaines, grâce à un cluster de 6 144 GPU Nvidia GB300. Cette rapidité d’entraînement illustre les gains d’efficacité procurés par l’architecture MoE, qui répartit la charge de travail sur de nombreux sous‑réseaux experts.
Phase d’apprentissage par renforcement
Après le pré‑entraînement, Reflection AI a mené une phase d’apprentissage par renforcement à partir de retours humains (RLHF). Cette étape a mobilisé 10 500 GPU GB300 pendant quatre semaines supplémentaires, générant environ 100 millions de trajectoires utilisées pour affiner le comportement de Beam sur les tâches de raisonnement et d’agent.
L’entreprise prévoit de publier les poids de Beam sous licence Apache 2.0 à la fin octobre 2026, après avoir effectué des évaluations internes de sécurité et des tests d’adversaires. Cette démarche open‑weight vise à encourager la scrutiny communautaire et l’innovation en aval.
Contexte commercial et financement
Fondée en 2024 par d’anciens chercheurs de DeepMind, Reflection AI a levé à ce jour environ 4,7 milliards de dollars. Elle a également conclu des accords d’infrastructure stratégique avec SpaceX et Nebius, qui pourraient fournir conjointement jusqu’à 7 milliards de dollars de ressources de calcul d’ici 2029.
- 501 milliards de paramètres au total, 23 milliards actifs par requête
- Fenêtre contextuelle d’un million de jetons
- Pré‑entraînement sur 23,8 trillions de jetons en <4 semaines avec 6 144 GPU GB300
- RLHF avec 10 500 GPU GB300 pendant 4 semaines, générant ~100 millions de trajectoires
- Publication prévue des poids sous Apache 2.0 fin‑octobre 2026
L’efficacité de calcul annoncée pourrait rendre Beam attractif pour les entreprises qui recherchent des capacités linguistiques de haut niveau tout en étant limitées par les budgets d’inférence. En n’activant qu’une fraction des paramètres totaux, les organisations peuvent exploiter des modèles plus gros sur du matériel existant ou réduire leurs dépenses cloud.
Si la parité de performance avec GLM‑5.2 se confirme, Beam offrirait une alternative non chinoise pour les charges de travail multilingues et centrées sur le code, élargissant ainsi le choix des développeurs sur les marchés anglophones et européens.
Concrètement, une société francophone pourrait remplacer un modèle propriétaire de 175 milliards de paramètres par Beam, obtenant des résultats de raisonnement similaires tout en réduisant les heures GPU d’inférence jusqu’à 75 %. Cette économie se traduit par des coûts d’exploitation plus bas, des temps de réponse plus rapides et la capacité de traiter davantage de requêtes par dollar de calcul.
En France, des acteurs comme Dassault Systèmes ou la Banque de France, qui possèdent déjà des infrastructures GPU internes, pourraient déployer Beam pour moderniser leurs assistants virtuels ou leurs systèmes de conformité, tout en maîtrisant leurs dépenses d’inférence grâce à la réduction du nombre de paramètres actifs.
Au niveau européen, plusieurs initiatives publiques et privées cherchent à réduire la dépendance aux modèles chinois. L’arrivée de Beam, avec son code source ouvert et son coût d’inférence moindre, pourrait favoriser l’adoption de solutions souveraines dans les administrations et les entreprises du continent.
Sources
- Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute costTechCrunch · 5 octobre 2026
- Reflection AI unveils Beam, a 501B-parameter open-weight modelUnite.AI · 5 octobre 2026



