Reka AI、テキスト・画像・動画・ロボット制御を1つのモデルで処理する「Rho-1」公開
190億パラメータのオムニモデルRho-1は、専用モデルへの振り分けを行わず全モダリティを単一ネットワーク内のトークンとして処理。320基のH100で3ヶ月という比較的小さな計算量で実現した。
Reka AIは、テキスト・画像・動画・ロボット制御という4種類のモダリティを単一のニューラルネットワークで処理する研究プレビュー版モデル「Rho-1」を公開した。190億パラメータのモデルは、タスクごとに専用モデルへ振り分ける従来方式を取らず、すべてのモダリティを一つの共有コンテキストウィンドウ内のトークンとして扱う。
複数モダリティを1つのネットワークに統合
Rho-1の最大の特徴は、外部モデルやツール呼び出しに頼らず、テキスト・画像・動画の理解と生成、推論、行動決定までを単一ネットワーク内で完結させている点にある。動画はリアルタイムで連続生成でき、新しい指示が来てもモデルを再起動せずに対応を切り替えられる。
ロボット制御に関しては、インターネット上の一般的な動画から制御信号を抽出する「逆動力学モデル」を採用した。ロボット専用の訓練データが乏しいという業界共通の課題に対し、既存の動画資産を転用することで対応している。
性能と計算コスト
訓練には320基のH100 GPUを約3ヶ月使用したとされ、トップクラスのモデルに比べて小規模な計算資源での実現を主張している。生成速度は基本版で中央値0.79倍のリアルタイム、動画生成の開始までは約6秒。蒸留を施した「Flash版」では、最速1.11〜2.01秒まで短縮され、計測対象の中でテキスト応答も最速だったという。
一方で制限も明確にされている。30秒程度の動画生成では視覚的なリアリズムは保てるものの、構造的な矛盾が生じやすい。動画内でのオブジェクトの位置認識(グラウンディング)は静止画では機能するが、動画では未成熟な段階にあるとされ、解像度も672×384に制限されている。
読者への影響
Rho-1は研究プレビュー版であり、現時点では一般ユーザーが日常的に使えるプロダクトではない。しかし、専用モデルを組み合わせる従来のパイプライン型アーキテクチャに対し、単一ネットワークでの統合処理という設計思想を、比較的小さな計算資源で実証した点は注目に値する。オムニモデルの実用化が進めば、開発者はモデルの組み合わせや切り替えの複雑さから解放され、ロボティクスを含む応用範囲の広いAIシステムをよりシンプルに構築できる可能性がある。