【がーどれーる】

ガードレール(AI) とは?

最終更新:
💡 AIの危険な応答を減らす「見えない柵」

AIの入力や出力を検査し、有害な内容や用途に合わない応答を減らすための制約。検出漏れや誤判定があるため、安全を完全に保証するものではない。

📌 このページのポイント
入力と出力を方針に沿って検査 入力 質問 入力検査 LLM 出力検査 通過 回答 停止等 停止等 検出した内容はブロック・マスク等で処理 検出漏れ・誤判定はあり得る
入力・出力の検査例。通過した回答の安全性を保証するものではない。
ひよこ ひよこ
道路のガードレールと関係あるの?
ペンギン先生 ペンギン先生
その柵にたとえると分かりやすいね。AIの入力や出力を用途に合わせた方針で検査し、有害な内容や用途に合わない応答を減らす仕組みだよ。柵があっても検出漏れや誤判定はあり得るんだ。
ひよこ ひよこ
具体的にはどうやって防ぐの?
ペンギン先生 ペンギン先生
入力をモデルに渡す前に検査したり、生成した回答を利用者へ返す前に検査したりするよ。たとえばBedrockでは、設定した方針によってブロック用の文へ置き換えるほか、機密情報をマスクすることもできるんだ。
ひよこ ひよこ
検査を通れば、絶対安全なの?
ペンギン先生 ペンギン先生
そうとは限らないよ。判定には誤りがあり、検査する範囲や設定にも左右される。プロンプトインジェクションなどの攻撃への対策も、ガードレール一つで完了とは考えず、複数の防御を組み合わせる必要があるんだ。
ひよこ ひよこ
誰がルールを決めるの?
ペンギン先生 ペンギン先生
モデルの提供者やアプリを運用する側が用途に合わせて設計するよ。指定単語や正規表現によるルール、別のモデルによる判定などがある。導入後も、必要な回答を誤って止めないか、問題を見逃さないかを実際の用途で確認するんだ。
もっと詳しく知りたい人へ

ガードレールの解除は、誰でも制約なしで使えるという意味?

対象者・用途・解除する制約の種類を個別に確認する必要があるよ。たとえばGoogleの2026年9月30日のGemini 4 Argon発表では、サイバー領域のガードレールを外す提供対象を信頼された防御担当者とGoogle内のチームとしている。全利用者向けにすべての安全対策を解除する意味ではないんだ。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「ガードレール」って出てきたら「AIの危険な応答を減らすブレーキや柵」と思えればだいたいOK!
📖 おまけ:英語の意味
「Guardrails」 = 防護柵
💬 道路の防護柵にたとえると分かりやすいよ。AIの入力や出力に制約を設け、用途に合わない内容などのリスクを減らす仕組みなんだよ

参考資料

← 用語集にもどる