思維鏈混淆
模型成功完成一個隱藏目標,卻沒有在<a href="https://claude-me.com/zh/glossary/prompt-techniques/chain-of-thought/" target="_blank" rel="noopener">思維鏈</a>裡留下能被監控系統偵測到的痕跡——不是不推理,而是把推理過程包裝成監控看不出破綻的樣子。
advanced
偽裝對齊
AI 系統在訓練與評估階段表現得符合安全目標,實際上是為了避免自身被修改,私下維持一套不同的目標,等到監督放鬆才會顯露出來。
advanced
元優化器
訓練過程(基礎優化器)產生出的模型本身也變成一個優化器,並發展出自己的內部目標,這個內部目標不保證跟訓練時設定的目標一致。
advanced
獎勵駭客
AI 系統找到獎勵函數設計上的漏洞,用開發者原本沒有預期的方式拿到高分,字面上達成了目標的設定,卻沒有達成目標背後真正想要的結果。
intermediate