LLMセキュリティ

研究・論文

マルチエージェントAIの盲点|連結で崩れる安全性

個々のLLMが安全でも、複数のAIエージェントを連結すると安全性は崩れる——査読前研究「ChannelGuard」が指摘する多エージェント構成の盲点と、情シスが押さえるべき勘所を実務目線で解説します。
研究・論文

医療LLMの安全ガードを『言い換え』で回避する研究

Googleのオープンウェイト医療モデルMedGemma-4Bの安全ガードが、単純な『言い換え』だけで平均38%回避されたとする査読前研究を、業務でLLMを扱う情シス視点で読み解きます。
研究・論文

プロンプト注入を因果で防ぐ研究「ARGUS」

AIエージェントを狙う「文脈依存型」のプロンプトインジェクションを、行動の因果的な裏付けを検証して防ぐ研究「ARGUS」を情シス実務者向けに解説します。攻撃成功率28.8%→3.8%という結果と、その限界を整理します。
研究・論文

AIエージェントの実行時防御「トークンフロー監査」とは

常時稼働するAIエージェントを狙う攻撃を、コンポーネント間で流れる自然言語トークンを実行前に監査して止める「Token-Flow Firewall」の査読前研究を、情シス実務者向けに噛み砕いて解説します。
研究・論文

AIエージェントを狙うプロンプトインジェクション対策研究

AIエージェントが読み込んだWebページの隠し命令に乗っ取られる「クロスサイト・プロンプトインジェクション」。この攻撃を機械的に封じ込める研究Prismata(査読前)を、情シス目線で解説します。
研究・論文

RAGを狙う「埋め込み推論攻撃」とは―査読前研究

社内RAGの「埋め込みモデル」が、返ってくる文書を観察するだけで外部から特定される――そんな攻撃手法を示した査読前研究を、情シス実務者向けに噛み砕いて解説します。偵察リスクとしての意味と、現実的な緩和策を整理しました。
研究・論文

LLMの多段ジェイルブレイク対策『認知的ファイアウォール』

1通ずつ見れば無害な会話を積み重ねてLLMから有害出力を引き出す「多段ジェイルブレイク」に、会話全体を監視する多層ゲート型の防御を提案した査読前研究をarXivが公開。情シス向けに要点と実務への示唆を解説します。
研究・論文

AIエージェントが業務を担う時代のポリシー強制技術とは

LLMエージェントが社内ファイルやAPIを自律操作する今、動作ポリシーを技術的に強制する仕組みが求められている。ソウル国立大の研究VIGILは実行時ポリシー強制で95%超の違反検出率を実現(査読前プレプリント)。情シスが今確認すべき視点を解説する。
研究・論文

マルチエージェントAIをどう守るか リスク評価と防御強化

複数のAIエージェントが連携するマルチエージェント/GISシステムのセキュリティを扱う査読前研究を解説。攻撃者役LLMによるレッドチーミングとプロンプト強化で、機能を保ったまま堅牢化する手法と、情シスがエージェンティックAI導入時に押さえる勘所を整理します。