カメラや LiDAR、力覚センサーで環境を捉え、VLA(視覚・言語・行動)モデルで判断し、ロボットのハードウェアを実際に動かします。「チャットの中で完結する AI」の外側を担う位置づけです。
カメラや LiDAR、力覚センサーで環境を捉え、VLA(視覚・言語・行動)モデルで判断し、ロボットのハードウェアを実際に動かします。「チャットの中で完結する AI」の外側を担う位置づけです。
NVIDIA が Cosmos(世界モデル)・Isaac Sim(シミュレーション)・Isaac GR00T(ヒューマノイド基盤モデル)・Omniverse(デジタルツイン)で強く押し出している語で、ロボット関連のニュースで見かけます。
ロボットが部屋の中でカメラ・センサーで周囲を捉え、内部で「次はこう動く」と考え、実際にアームを動かす一連のコマ割り
擬人化ポンチ絵 · 後日差し込み現実世界を認識し、ロボットを実際に動かす AI の総称です。
「画面の中の AI」を物理空間の作業に広げられます。
まだ発表が相次ぐ段階で、定着した定義は流動的です。
ロボット・製造・ヒューマノイド関連の開発で登場します。
認識・判断・行動の 3 段構えだと押さえれば十分です。
世界モデル、VLA、VLM
「フィジカル AI」は NVIDIA が強く押し出している呼び方です。