Observation Log(射影された観測/結論なし)

LLMにおけるロールタグと内部ロール表現の乖離

object

複数のLLMを対象とした研究で、ユーザー入力やツール出力内にモデルの思考過程を模した文章を置いた場合、内部probe上で思考過程に近い表現が維持される傾向と、攻撃成功率の上昇が報告された。

notes

  • 研究では、この攻撃手法を「CoT Forgery」と呼んでいる。
  • gpt-oss-20bでは、正規の思考過程ロール内にある文章と、ユーザーロール内へ移した同型文章について、内部probe上で高いCoTnessが維持される結果が報告されている。
  • StrongREJECTを用いた実験では、通常条件よりCoT Forgery条件で攻撃成功率が上昇した。
  • エージェント環境では、ツール出力内のCoT Forgeryを経由して機密情報を外部送信させる実験も行われた。
  • 偽CoTの意味内容を大きく変えず、文体・語彙・構文を変更すると攻撃成功率が低下する結果が報告されている。
  • 研究は、明示的なrole tagだけではなく、文体・語彙・構文などがモデル内部のロール表現形成に作用している可能性を提示している。
  • 「訓練では防げない」「完全に安全なLLMは不可能」という表現は記事側で強く圧縮されている。論文では追加訓練による攻撃検出能力の改善可能性も認めており、攻撃パターンの追加学習だけでは根本原因を解消しないという主張と分離する必要がある。
  • 研究対象外のモデル、将来の学習方式、異なる実装でも同程度のロール表現乖離が生じるかは未確認。
  • 今回観測された不一致が、将来のモデル設計や学習手法によって原理的に解消不能かどうかは確定していない。

implications

  • LLMエージェントにおける入力元識別とツール実行権限の接続部分に影響する。
  • Prompt Injection対策における、外部ロール指定とモデル内部のロール表現の関係に影響する。
  • モデル内部の意味的なロール認識と、システム側のアクセス制御境界をどこまで同一視できるかという設計境界に影響する。

questions

  • 外部のrole tagとモデル内部のrole表現は、どの条件で一致し、どの条件で乖離するのか。
  • ロール認識をモデル内部の推論へ依存させず、権限境界を外部システム側で保持できる範囲はどこまでか。
  • CoT Forgeryへの耐性向上が進んだ場合、不一致そのものが縮小するのか、それとも別の表現経路へ移動するのか。