Xiaomi が公開した新しいロボット学習モデル「Xiaomi-Robotics-1」は、言語 AI モデルとは異なるスケーリング則を示唆しています。データセットのサイズを増やすことが、モデル自体をより大きくすることより重要であるという発見です。

10万時間のデータで実現した75%成功率

Xiaomi-Robotics-1 の訓練に使われたデータセットは、単なる AI モデルのテキスト学習ではなく、実際の動作ビデオの膨大な集積です。研究チームは、カメラを装備したハンドグリッパーを人間が直接操作することで、100万時間を超える映像データを1,700以上の環境から収集。データラベリングには別の AI モデルを活用し、わずか2週間で自動化を完了させました。

結果として、各タスクで10時間未満の訓練データを与えるだけで、平均75%の成功率に到達。競合モデルである Physical Intelligence の40%を大きく上回っています。さらにベンチマーク RoboCasa365 での首位獲得、RoboDojoでの58%スコア向上など、複数の指標で優位性を示しました。

「より多く」が「より大きく」を上回る理由

言語モデルのスケーリング則では、訓練時のモデルパラメータ数を増やすことが精度向上に直結してきました。しかし Xiaomi-Robotics-1 の研究は、ロボット学習では データの多様性と量が優先される ことを示唆しています。研究チームの分析では「進展の大部分がデータ量の増加から来ており、モデルサイズ拡大の効果は限定的」と指摘。

背景には、ロボット学習がテキスト学習より複雑な環境認識と身体制御を必要とすることがあります。言語タスクは構造化されたテキスト空間で機能しますが、ロボット動作は物理世界の多種多様なシーンに適応する必要があります。そこでは、より多くの異なる環境・状況でのデータが、パラメータ数の増加より重要になります。

業界への波及効果と開発戦略の転換

この成果は、ロボティクス企業や AI 研究機関の開発戦略に影響を与える可能性があります。これまではモデルサイズの競争が中心でしたが、今後は テレオペレーション(遠隔操作)による現実世界データの効率的な収集 が競争軸になりうるということです。

テレオペレーション方式であれば、実ロボットより低コストでハンドグリッパーなどの入力デバイスを用いて大規模データを集積できます。さらに Xiaomi の事例が示すように、自動ラベリング技術を組み合わせれば、ラベリングのボトルネックも解消可能です。

Xiaomi-Robotics-1 は単なる技術デモではなく、ロボット学習の方向性そのものが変わりつつあることを示す指標となっています。