評価・安全・ガードレール
エージェントには暴走・無限ループ・誤ったツール実行・プロンプトインジェクションといった失敗モードがあります。ヒューマン・イン・ザ・ループ、権限最小化、評価(eval)とトレース観測で安全に運用する考え方を解説します。
AIエージェントの仕組みを、LLMの基礎から設計パターンまで体系的に学べる学習サイト。
エージェントには暴走・無限ループ・誤ったツール実行・プロンプトインジェクションといった失敗モードがあります。ヒューマン・イン・ザ・ループ、権限最小化、評価(eval)とトレース観測で安全に運用する考え方を解説します。
プロンプトインジェクションはLLMへの入力に悪意ある指示を仕込み本来の振る舞いを乗っ取る攻撃手法。ユーザーが直接行う「直接型」と外部コンテンツに指示を埋め込む「間接型」があり、Webページやファイルを読むエージェントは特にリスクが高い。入力の分離・権限最小化・人間によるレビューを組み合わせることで防御層を厚くできるとされる。