VLM(視覚と言語を扱うモデル)に「行動」を足した仕組みです。カメラ映像と指示文を受け取り、関節の動きなど実際のロボット操作を出力します。
VLM(視覚と言語を扱うモデル)に「行動」を足した仕組みです。カメラ映像と指示文を受け取り、関節の動きなど実際のロボット操作を出力します。
フィジカル AI やヒューマノイドロボットの記事で、RT-2 や GR00T N1 といったモデル名とセットで登場します。J-15 VLM の発展形として紹介される場面が多いです。
カメラ映像と吹き出し指示文が VLM ブロックに入り、行動生成部を経てロボットアームが動く一連の流れ
擬人化ポンチ絵 · 後日差し込み視覚・言語の理解を行動の出力にまでつなげます。
指示文だけでロボットに具体的な動作を任せられます。
どのモデルが優れているかの比較は誌面では扱いません。
ヒューマノイドや産業用ロボットの操作生成に使われます。
「VLM に行動出力を足したもの」で入門として十分です。
VLM、フィジカル AI、世界モデル
代表的なモデルとして RT-2(Google DeepMind, 2023)、π0(Physical Intelligence)、GR00T N1(NVIDIA, 2025)がある。