マルチモーダル入力(Vision)─ 画像・スクリーンショットをエージェントに渡す
現代のLLMはテキストだけでなく画像を入力として受け取れる「マルチモーダル」機能を持つ。APIではcontentに imageブロックを追加するだけでJPEG・PNG等を渡せ、スクリーンショット読み取り・帳票解析・UI自動化など応用範囲が大きく広がる。
AIエージェントの仕組みを、LLMの基礎から設計パターンまで体系的に学べる学習サイト。
現代のLLMはテキストだけでなく画像を入力として受け取れる「マルチモーダル」機能を持つ。APIではcontentに imageブロックを追加するだけでJPEG・PNG等を渡せ、スクリーンショット読み取り・帳票解析・UI自動化など応用範囲が大きく広がる。