評価・安全・ガードレール
エージェントには暴走・無限ループ・誤ったツール実行・プロンプトインジェクションといった失敗モードがあります。ヒューマン・イン・ザ・ループ、権限最小化、評価(eval)とトレース観測で安全に運用する考え方を解説します。
AIエージェントの仕組みを、LLMの基礎から設計パターンまで体系的に学べる学習サイト。
エージェントには暴走・無限ループ・誤ったツール実行・プロンプトインジェクションといった失敗モードがあります。ヒューマン・イン・ザ・ループ、権限最小化、評価(eval)とトレース観測で安全に運用する考え方を解説します。
リフレクションとは、エージェントが自分の出力を評価して言語的なフィードバックを生成し、次の試行に活かす自己修正ループ。モデルの重みを変えずに精度を高められる実用的な技術で、Reflexionフレームワークがその代表例とされる。
LLM-as-a-Judgeとは、LLMの出力を別のLLMが採点・評価する手法。人手評価のコストを抑えながら自由記述の品質を測れるが、位置バイアス・冗長さバイアス・自己優遇バイアスの3つの偏りに注意が必要とされる。