RekaがRho‑1を発表、テキスト・画像・動画・ロボット制御を統合した190億パラメータのオムニモデル
2026年10月5日、Reka AIは単一の190億パラメータモデルRho‑1を発表。テキスト、画像、動画、推論、ロボット操作を共通トークンストリームで処理し、リアルタイム動画生成や直接ロボット制御を実現すると発表した。

Reka AIは2026年10月5日のバーチャル発表イベントでRho‑1を紹介した。このモデルは「研究レベル」のシステムとされ、ゼロから構築された190億パラメータを持ち、テキスト、画像、動画、論理推論、物理的アクションといった複数モダリティを単一のニューラルネットワークで処理できるよう設計されている。
従来のAIスタックは各モダリティごとに専門モデルを用意するのが一般的だが、Rho‑1はすべての入力と出力を共通のトークンとして符号化し、同一のコンテキストを共有する。この設計により、ビジョン、言語、制御といった別々のパイプラインが不要となり、同一の重み行列が様々な領域で解釈・生成を行える。
統一トークン表現
Rekaは、テキスト、画像パッチ、動画フレーム、ロボットコマンドすべてを統一トークン形式に変換してからモデルに入力すると説明している。共通コンテキストにより、過去のやり取りの情報が保持され、状態をリセットせずに画像や動画を複数回にわたって反復的に修正できる。
同社は、Rho‑1のベースバージョンがリアルタイムの0.79倍速度で動画を生成でき、リクエストから約6秒で再生を開始できると主張している。内部ベンチマークでは、8ステップに蒸留されたバリアントが5.3秒のクリップを約1秒で生成したとされるが、これらの数値はまだ第三者による検証を受けていない。
性能と学習詳細
The Decoderによると、学習は約3か月間にわたり、320台のNvidia H100 GPUを使用して実施された。この集中的な計算予算は、マルチモーダルスタックを単一アーキテクチャに統合するという野望を反映しており、Rekaはこれを「世界を知覚し、理解し、行動できる」統一モデルへの一歩と位置付けている。
モデルが複数ターンにわたって視覚メディアを生成・編集・比較できる点は重要な差別化要因とされている。ユーザーは照明変更やオブジェクト追加、動きの修正といった一連のリファインメントを要求でき、モデルはシーンの内部表現を一貫して保持する。
同一重みでロボット制御
Rekaは、同一の重みセットがロボット制御にも再利用できることを実証した。逆動力学コンポーネントがインターネット上の公開動画をアクション信号に変換し、ロボットアクチュエータを駆動する。この手法は、視覚学習が別個の制御モジュールを介さずに直接運動行動に結びつく道筋を示唆している。
- 単一ネットワーク内に190億パラメータ
- 3か月・320 GPU H100でのスクラッチ学習
- テキスト・画像・動画・ロボットコマンドを統一トークンストリームで処理
- ベース版はリアルタイムの0.79倍速度、起動約6秒
- 蒸留版8ステップで5.3秒クリップを約1秒で生成
この発表はRho‑1をRekaが呼ぶ「オムニモデル」の概念実証として位置付けている。従来のマルチモーダルパイプラインを一本化することで、開発サイクルの短縮と統合の複雑さの削減が期待できると同社は主張する。
批評家は、特に蒸留バリアントの性能主張が第三者テストで検証されていない点を指摘している。独立したベンチマークが、Rho‑1が専門モデルに対して本当に速度と品質の優位性を提供できるかを確認する上で不可欠になるだろう。
日本企業へのインパクト
日本市場で事業を展開する企業にとって、Rho‑1は複数の個別モデルを単一サービスに置き換えることでAIインフラを簡素化できる可能性がある。コンテンツクリエイターは高速な反復動画生成を活用でき、マーケティング部門はマルチモーダル資産を即座に制作できる。製造業者は、専用の制御ネットワークを訓練せずに視覚ガイド型ロボット制御を試すことができ、統一トークンアプローチはモーダル間の推論整合性を高め、システム間のエラー削減にも寄与するだろう。
出典
- Rho-1: collapsing the multimodal stackReka AI · 2026年10月5日
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 2026年10月5日



