ジェイルブレイク

研究・論文

LLMガードレールの限界:安全性トリレンマ論文を読む

LLMの安全対策を「プロンプトと会話履歴」だけで判断する仕組みは、攻撃者に同じ文脈を模倣されると原理的に破られる。査読前の研究が示した「安全性トリレンマ」を、社内での生成AI利用という実務の視点から読み解きます。
研究・論文

医療LLMの安全ガードを『言い換え』で回避する研究

Googleのオープンウェイト医療モデルMedGemma-4Bの安全ガードが、単純な『言い換え』だけで平均38%回避されたとする査読前研究を、業務でLLMを扱う情シス視点で読み解きます。
研究・論文

LLMジェイルブレイク、日本語は英語より通りやすい

LLMの安全対策は言語をまたぐと崩れます。18言語を検証した査読前研究「Minionese」は、英語で拒否される有害要求が日本語やローマ字表記だと通ってしまう実態を示しました。社内AI活用の前提が変わります。
研究・論文

LLMジェイルブレイクの内部メカニズムを解く研究

生成AIの「ジェイルブレイク(安全機能の回避)」が、モデル内部で具体的に何を起こしているのかを可視化した査読前研究を、情シス目線でかみ砕きます。安全機能の抑制という発見と、社内AI活用における実務的な留意点を整理します。
研究・論文

LLMの多段ジェイルブレイク対策『認知的ファイアウォール』

1通ずつ見れば無害な会話を積み重ねてLLMから有害出力を引き出す「多段ジェイルブレイク」に、会話全体を監視する多層ゲート型の防御を提案した査読前研究をarXivが公開。情シス向けに要点と実務への示唆を解説します。
研究・論文

HauntAttackが示す推論AI(LRM)の脆弱性と企業対策

推論特化型AI(LRM)を狙う攻撃「HauntAttack」が公開。安全機能を持つ11モデルで平均70%の攻撃成功率を記録。社内AIツール導入を進める情シスが押さえるべきリスクと対応策を整理した(査読前研究)。
研究・論文

LLM悪用の自動化リスク:非専門家でも高成功率のジェイルブレイク

LLMのジェイルブレイクを非専門家でも自動実行できる手法を示した研究が公開(査読前プレプリント)。15のオープンウェイトLLMで平均97%の成功率が報告された。組織内のLLM利用リスクを再評価する材料となる。
用語解説

分割攻撃とは|AIエージェントの安全を破る新手口

有害な指示を「無害な小タスク」に分割すると、AIエージェントの安全機構をすり抜けてしまう。新ベンチマークDECOMPBENCHを報告した査読前論文をもとに、社内でAIを使う情シスが今押さえるべき論点を実務目線で解説します。