
小米は本日未明、Xiaomi MiMo-V2.6シリーズを正式に発表し、オープンソース化しました。これにはProとFlashの2つのネイティブ全モーダルモデルが含まれます。小米は、これがRSIによる再帰的自己改善の道筋を模索するための重要な一歩であり、強化学習の計算リソースを拡大することで、モデルが継続的な探索とフィードバックを通じて知能の限界を高めていくと述べています。なお、両バージョンの価格は従来と変更ありません。
Artificial Analysis Intelligence Index v4.3.2において、MiMo-V2.6-Proは46点を獲得し、Kimi K3の44点やGLM-5.3の45点を上回り、現時点でAA指数ランキングで最も高いスコアを記録したオープンソース重みモデルとなりました。これは前世代のMiMo-V2.5-Proの26点から20ポイントの向上です。ただし、小米はClaude Fable 5.1やGPT-6 Astraといった53点のトップクラスのクローズドモデルとはまだ差があることも認めています。
トレーニング面では、ProとFlashはそれぞれ6日足らずで完了し、コストは約262万ドルと85万ドル、各々30ステップ、累計約75万件のトラジェクトリを処理しました。トレーニングタスクの平均通過率はそれぞれ25%および12%向上し、DeepSWE v1.1のスコアも約17点および14点向上しています。小米は、より大きなバッチサイズとスループット、より多くのタスクと複雑な環境、そしてより大規模なグレーダーの計算リソースという3つの側面から強化学習の計算能力を拡張しており、1回の更新で1,568個のサンプルを使用、最大100万のコンテキストをサポート、1ステップあたりのトレーニングトークン数は35億〜37億に達します。タスクの範囲はコード、一般タスク、視覚、サイバーなど多岐にわたります。
性能面では、MiMo-V2.6は3D空間推論、マルチモーダル感知、コンピュータ操作を統合しています。ユーザーが画像、動画、テキストを入力すると、モデルは要求を分解し、複数のエージェントが協調して3Dシーンの構築、インタラクションロジックの作成、視覚的検証を実行します。また、具現化シミュレーションでは、複数のカメラ映像を入力として受け取り、視覚フィードバックに基づいてFranka Pandaロボットアームを制御し、物体の把持、色のマッチング、配置といったタスクをこなします。全モーダルモデルとは、テキスト、画像、動画、音声などの入力を同時に処理できるモデルを指します。