ガードレール

研究・論文

AIエージェント防御の自己進化|論文解説

LLMエージェントの防御ルールを人手で作り込む方式は限界がある——そう指摘し、防御を自動で進化させる枠組みHARDを提案した査読前論文を解説します。適応攻撃では成功率26.5%が残る点など、情シスが押さえるべき現実的な示唆を整理しました。
研究・論文

GUIエージェントのガードレール、説得で崩れる

画面を操作するGUIエージェントに「危険な操作はするな」と1行書くだけで攻撃成功率は最大約40ポイント下がる。ただし単発の依頼に限る話でした。4ターンの段階的な説得で防御が押し戻されることを示した査読前研究を、情シス目線で読み解きます。
研究・論文

医療LLMの安全ガードを『言い換え』で回避する研究

Googleのオープンウェイト医療モデルMedGemma-4Bの安全ガードが、単純な『言い換え』だけで平均38%回避されたとする査読前研究を、業務でLLMを扱う情シス視点で読み解きます。