id: J-34(誌面表示: J-34) · 物理ページ: 728–729(pages=2) · category: term_general · figure_type: structure · status: ready · evaluation_date: 2026-08-10
tagline 37/25-45何を 88/60-200どこで 102/60-200会話例 38/25-50見1 24/15-40見2 24/15-40見3 29/15-40見4 26/15-40見5 26/15-40見6 15/15-50
← J-33 量子コンピュータ 目次 J-35 スケーリング則 →
一般語彙
728

マルチモーダル

文字・画像・音声・動画など複数の種類の情報をまとめて扱えるAIの性質です。
体験区分:触った 推奨読者レベル:Level 1-2

何をしてくれるか

文字・画像・音声・動画といった種類の違う情報を、同じモデルの中でまとめて理解できるようにします。画像を貼って質問したり、音声で話しかけたりする操作がこの性質に支えられています。

どこで出会うか

ChatGPT・Gemini・Claude の説明文で「マルチモーダル対応」という言葉として登場します。エラー画面のスクショを貼って原因を聞いたり、音声メモから文字起こしさせたりする場面がこれにあたります。

構造図
図(figure_type: structure)は本番生成器(Astro + React primitive)で描画。
iter 22 時点ではプレースホルダ。
マルチモーダル を使う人

文字・画像・音声・動画のアイコンが 1 つの箱(AI)に集まり、箱からテキスト吹き出しと画像が出てくる流れ

擬人化ポンチ絵 · 後日差し込み
開発フローでの位置
入力準備
モデル選定
まとめて入力
結果の確認
2026.08·ready
「このツール、マルチモーダル対応だから画像を貼るだけで診断してくれますよ。」
マルチモーダルの見方
729
この用語の見どころ
1
役割

文字・画像・音声をひとつのモデルで扱う性質です。

2
うれしさ

画像や音声のまま質問でき、説明の手間が減ります。

3
注意点

モデルやサービスによって対応する種類や精度に差があります。

4
どこで役立つか

エラー画面や資料の図解、音声メモの整理に役立ちます。

5
はじめに

まず画像を貼って質問する使い方から試すとつかめます。

6
深掘り先

VLM、LLM、Whisper

非エンジニアのつまずき
  • 画像を貼れる機能の名前だと思って終わりがちです
  • 後から足したのか、最初から学んだのか区別できません
  • モデルごとに対応範囲が違い、何が使えるか分かりません
私のコメント
  • 第一印象:Gemini で初めて聞いた言葉です
  • 良い点:いまは多くのモデルが当たり前に扱えます
  • ダメな点:後付けか生まれつきかで差が出そうです
  • 誰向けか:AI を日常的に使う人みんな向けです
関連用語
備考

本エントリは「読者が実際に出会う場面」に焦点を絞っています。

J-34·term_general
バイブコーディング図鑑