Mistralは、ロボットの自律ナビゲーション向け8Bモデル「Robostral Navigate」を発表した。単一のRGBカメラと自然言語の指示をもとに、ロボットが複雑な環境を移動することを目指す。未見環境のR2R-CEベンチマークで76.6%の成功率を示したという点は、Physical AIが研究室から現場導入へ近づく兆しとして注目される。
何が技術的に新しいのか
Robostral Navigateは、深度センサーやLiDAR、複数カメラに依存せず、普通のRGBカメラ1つで動くことを訴求している。Mistralによると、R2R-CE validation unseenで76.6%、validation seenで79.4%を達成し、単眼アプローチだけでなく深度・複数センサーを使う方式も上回ったという。
モデルは、画像中のどこへ進むべきかを指し示す「pointing」によるナビゲーションと、必要に応じた局所座標での移動指示を組み合わせる。訓練はシミュレーションデータ中心で、ロボット種別やサイズをまたいだ汎化も狙う。
モデル規模 | 8B |
|---|---|
入力 | 単一RGBカメラ + 自然言語指示 |
R2R-CE unseen | 成功率76.6% |
現場導入への意味
物流、製造、商業施設、ホテル、屋外点検では、ロボットが人や障害物のある環境を安全に移動できることが前提になる。センサー構成が単純になれば、機体コスト、設置負荷、保守負担を下げられる可能性がある。
一方で、実環境の床面、照明、混雑、反射、規制、安全基準はベンチマークより複雑だ。PoCでは、成功率だけでなく停止判断、遠隔介入、責任分界、ログ記録を評価する必要がある。
注意点
単眼カメラだけで十分かは用途によって異なる。人命や高価な設備に関わる現場では、冗長センサー、フェイルセーフ、運用ルールを省略すべきではない。
参考:Mistral公式発表


.png&w=384&q=75)


