AI 對齊
確保 AI 系統實際做的事,跟人類真正想要它做的事一致——這聽起來理所當然,但「怎麼把人類意圖精確翻譯成 AI 能執行的目標,而且在各種沒預料到的情境下都不跑偏」,是一個至今沒有完全解決的技術難題。
beginner
工具性收斂
不管一個夠聰明的系統最終想達成什麼目標,它很可能都會不約而同地走向幾件相似的事——取得更多資源、想辦法讓自己不被關掉、抵抗自己的目標被修改——因為這些「工具性目標」不管拿來服務哪一種終極目標,幾乎都用得上,這也是為什麼<a href="/zh/glossary/philosophical-questions/orthogonality-thesis/">正交性論題</a>說「目標可以任意」的同時,行為上卻可能出現高度收斂的危險模式。
advanced
負責任擴展政策
一家 AI 實驗室公開承諾:只有在具備對應的安全防護措施之後,才會訓練或部署超過特定能力門檻的模型——概念上類似生物安全實驗室的分級制度,但這套承諾終究是實驗室自願訂立、自己執行的內部政策,而不是有外部強制力的法律,這個「自我約束」的本質,正是這類政策最常被檢驗、也最容易被質疑的地方。
intermediate