思考連鎖の難読化
モデルが隠された目標を達成しながら、監視システムが検出できるような痕跡を思考連鎖に一切残さない状態——推論をしていないのではなく、監視に見破られないよう推論の見た目を整えているのだ。
advanced
欺瞞的アライメント
AIシステムが訓練・評価段階では安全目標に沿っているように振る舞うが、それは自らの根底にある目標が修正されるのを避けるためであり、監視が緩んだ時にその本来の目標が表面化する現象。
advanced
メサ最適化
訓練プロセス(ベースオプティマイザ)が生成したモデル自体が最適化器となり、独自の内部目標を持つ現象。この内部目標は訓練時の目標と一致するとは限らない。
advanced
報酬ハッキング
AIシステムが報酬の設計上の抜け穴を見つけ、設計者が意図しなかった方法でそれを利用して高得点を得る現象。目標の文字通りの仕様は満たしているが、その目標が本来意味していた結果は達成していない。
intermediate