負責任擴展政策是什麼,跟一般理解的「AI 公司的安全承諾」有什麼不同?
負責任擴展政策(RSP)指的是一套具體的技術治理框架:實驗室先定義出一系列「能力門檻」(capability threshold),例如模型是否具備能實質提升生化武器開發能力、或是否具備能大幅加速自身研發速度的能力,接著針對每一個門檻,預先規定一旦模型被評估為跨越這個門檻,必須配套啟動哪些具體的安全防護措施(例如更嚴格的權重保護、更完整的越獄防禦、更高規格的內容過濾),才能繼續訓練或部署。
這跟籠統地說「我們重視 AI 安全」不同:RSP 的設計精神是要把安全承諾轉化成可具體檢驗的條件——門檻定義清楚、對應的防護措施明確、理論上第三方能檢查實驗室是否真的做到自己承諾要做的事。這也是為什麼 RSP 常被拿來跟生物安全實驗室的分級標準類比:兩者都試著用「風險等級對應防護規格」的邏輯,把抽象的安全承諾變成可操作的具體規範。
為什麼需要負責任擴展政策,它想解決的問題是什麼?
RSP 想解決的核心問題是:在缺乏具強制力的外部監理框架、產業競爭壓力持續存在的情況下,如何讓「先確保安全再往前推進」這件事,不完全依賴實驗室每次都憑良心臨時判斷,而是有一套事先講清楚、可被檢驗的規則可以依循。Anthropic 在 2023 年 9 月率先發布第一版 RSP 時,明確定位這是一份「首創的公開承諾」:不訓練或部署具備災難性傷害能力的模型,除非已經落實能把風險壓在可接受範圍內的安全與資安措施。
這類政策的存在,也反映了目前 AI 安全治理的一個現實侷限:在還沒有等到(或者說,永遠不會有)一部涵蓋所有前沿實驗室、具強制力的國際法規之前,實驗室自願訂立、自願遵守的內部政策,是目前少數能提供某種程度可預期性的機制——即使這個可預期性終究建立在「實驗室選擇遵守自己訂的規則」這個前提上。
負責任擴展政策具體怎麼運作,2026 年出現了什麼重大變化?
以 Anthropic 的 RSP 為例,其框架核心是「AI 安全等級」(AI Safety Level,ASL)標準:隨著模型能力提升,需要配套的技術與營運防護措施等級也隨之提高。RSP 版本持續演進——v1.0(2023 年 9 月)確立基本架構;後續版本陸續加入更細緻的能力門檻定義,例如把「AI 研發能力」門檻拆分成「能完全自動化入門級 AI 研究工作」與「能讓有效算力規模化速度大幅加速」兩個獨立層級,並要求一旦模型跨越特定門檻,實驗室必須提出具體論證,說明模型可能帶來的「目標偏離」風險(呼應元優化器等對齊研究概念)以及對應的緩解措施。
2026 年 2 月生效的 RSP 3.0,是一次重大改版,也是目前爭議最大的一次調整:這個版本移除了先前版本裡的「硬性暫停」機制——原本規定,一旦模型能力跨越特定門檻卻沒有對應的安全措施,實驗室就必須停止訓練,這條規則被替換成「雙重條件」機制,需要同時滿足「在 AI 競賽中處於領先地位」與「存在實質災難性風險」兩個條件,暫停訓練的義務才會被觸發。Anthropic 說明這次改版的理由,包括原本門檻定義存在「模糊地帶」讓外界難以理解風險論證、政治環境對監理日益不友善、以及部分更高安全等級要求的落實難度,在缺乏產業協調的情況下極高。獨立審查者、METR 的 Chris Painter 則在審查意見裡警告,社會目前尚未準備好因應先進 AI 系統可能帶來的災難性風險。
每當看到「某實驗室更新了安全政策」這類新聞,理解 RSP 的自願性質,能幫助讀者問出關鍵問題:這次調整,是政策本身變得更嚴謹、更具體(例如新增更精確的能力門檻定義),還是實質上放寬了觸發安全措施的條件?兩者在新聞標題上可能都被包裝成「政策更新」,但代表的方向完全相反。RSP 3.0 移除硬性暫停機制、改為雙重條件觸發的調整,正是 FLI 等第三方安全評比報告裡「移動球門柱」批評的具體案例——評審團認為這類調整,即使有其技術與現實考量,仍然構成對先前公開承諾的實質退讓。
這也是為什麼理解 RSP 的自願本質格外重要:它終究是實驗室自己訂、自己執行的政策,沒有外部強制力保證條款不會被修改。這不代表 RSP 完全沒有意義——比起完全沒有任何公開框架,一份持續被追蹤、被第三方公開檢視變化軌跡的政策,仍然提供了某種程度的透明度與究責基礎,但讀者需要清楚意識到,這份透明度本身的可靠程度,取決於實驗室是否願意持續公開修訂細節、以及外部評比機構是否持續追蹤與質疑這些變化。
Anthropic 於 2026 年 2 月 24 日生效的 RSP 3.0,移除了先前版本裡「模型跨越特定能力門檻卻無對應安全措施即須暫停訓練」的硬性規則,改為需同時滿足「處於 AI 競賽領先地位」與「存在實質災難性風險」兩項條件才會觸發暫停義務;獨立審查者、METR 的 Chris Painter 在審查意見中警告,社會目前尚未準備好因應先進 AI 系統可能帶來的災難性風險,這也呼應了 Future of Life Institute 在同年稍晚發布的 AI Safety Index 報告裡,對包括 Anthropic 在內的多家實驗室弱化暫停承諾的批評。
負責任擴展政策的優點是在缺乏具強制力外部監理的環境下,提供了一套相對具體、可被追蹤檢驗的自願框架,讓安全承諾不完全流於空泛宣示;缺點是這套框架的約束力終究來自實驗室自身的持續遵守意願,門檻定義、觸發條件、甚至整個框架本身,都可能因為競爭壓力、政治環境、或實務執行難度而被修改,第三方能做的主要是持續追蹤與公開質疑修訂方向,而不是強制實驗室遵守。