文字・画像・音声・動画といった種類の違う情報を、同じモデルの中でまとめて理解できるようにします。画像を貼って質問したり、音声で話しかけたりする操作がこの性質に支えられています。
文字・画像・音声・動画といった種類の違う情報を、同じモデルの中でまとめて理解できるようにします。画像を貼って質問したり、音声で話しかけたりする操作がこの性質に支えられています。
ChatGPT・Gemini・Claude の説明文で「マルチモーダル対応」という言葉として登場します。エラー画面のスクショを貼って原因を聞いたり、音声メモから文字起こしさせたりする場面がこれにあたります。
文字・画像・音声・動画のアイコンが 1 つの箱(AI)に集まり、箱からテキスト吹き出しと画像が出てくる流れ
擬人化ポンチ絵 · 後日差し込み文字・画像・音声をひとつのモデルで扱う性質です。
画像や音声のまま質問でき、説明の手間が減ります。
モデルやサービスによって対応する種類や精度に差があります。
エラー画面や資料の図解、音声メモの整理に役立ちます。
まず画像を貼って質問する使い方から試すとつかめます。
VLM、LLM、Whisper
本エントリは「読者が実際に出会う場面」に焦点を絞っています。