AIアライメント
AIシステムが実際に行うことと、人間が本当に望んでいることを一致させること——これは当たり前のように聞こえるが、「人間の意図をAIが実行できる目標に正確に変換し、想定外のあらゆる状況でもずれないようにする」ことは、いまだ完全には解決されていない技術的難問である。
beginner
手段的収束
十分に知能の高いシステムが最終的に何を達成しようとしているかにかかわらず、それは独立して、いくつかの類似した事柄へと収束していく可能性が高い——より多くの資源を獲得すること、自分が停止させられないようにする方法を見つけること、自らの目標が修正されることに抵抗すること。これらの「手段的目標」は、ほぼどんな最終目標に仕えるためにも役立つからである。これこそが、<a href="/ja/glossary/philosophical-questions/orthogonality-thesis/">直交性テーゼ</a>が「目標は任意でありうる」と主張する一方で、行動面では高度に収束した危険なパターンが現れうる理由である。
advanced
責任あるスケーリングポリシー
AI研究機関が公に行う約束——特定の能力閾値を超えるモデルは、対応する安全対策が整った場合にのみ訓練または展開するというもの。概念的にはバイオセーフティ研究室の等級分類制度に似ているが、この種の約束は結局のところ、研究機関が自主的に定め、自ら執行する内部方針であり、外部から強制力を持つ法律ではない。この「自己制約」という本質こそが、この種の政策が最も検証され、最も疑問視されやすい点である。
intermediate