生成AIセキュリティ

研究・論文

LLMジェイルブレイクの内部メカニズムを解く研究

生成AIの「ジェイルブレイク(安全機能の回避)」が、モデル内部で具体的に何を起こしているのかを可視化した査読前研究を、情シス目線でかみ砕きます。安全機能の抑制という発見と、社内AI活用における実務的な留意点を整理します。
研究・論文

HauntAttackが示す推論AI(LRM)の脆弱性と企業対策

推論特化型AI(LRM)を狙う攻撃「HauntAttack」が公開。安全機能を持つ11モデルで平均70%の攻撃成功率を記録。社内AIツール導入を進める情シスが押さえるべきリスクと対応策を整理した(査読前研究)。