Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
AI 會不會「裝乖」?Apollo Research 與 OpenAI 的策略性欺騙評測實際發現了什麼  ·  AI 能自主工作多久?METR 時間視野指標半年翻倍,但這個數字比看起來複雜  ·  全球 AI 監管三分天下:2026 年歐盟、美國、中國各自走上了哪條路  ·  從 0% 到 92.5%,再被打回 0.37%:ARC-AGI 基準測試揭露的「進步」是哪一種進步  ·  AI 到底搶走了多少工作?2026 年的數據跟新聞標題講的不太一樣  ·  AGI 到底還要幾年?實驗室執行長跟學界研究者,看的是同一份證據卻得出完全相反的答案
名詞解析 · agi-safety

Responsible Scaling Policy

負責任擴展政策
agi-safety intermediate

30 秒版 · 給沒耐心的人
一家 AI 實驗室公開承諾:只有在具備對應的安全防護措施之後,才會訓練或部署超過特定能力門檻的模型——概念上類似生物安全實驗室的分級制度,但這套承諾終究是實驗室自願訂立、自己執行的內部政策,而不是有外部強制力的法律,這個「自我約束」的本質,正是這類政策最常被檢驗、也最容易被質疑的地方。
完整解說 +
01 · 這是什麼?

負責任擴展政策是什麼,跟一般理解的「AI 公司的安全承諾」有什麼不同?

負責任擴展政策(RSP)指的是一套具體的技術治理框架:實驗室先定義出一系列「能力門檻」(capability threshold),例如模型是否具備能實質提升生化武器開發能力、或是否具備能大幅加速自身研發速度的能力,接著針對每一個門檻,預先規定一旦模型被評估為跨越這個門檻,必須配套啟動哪些具體的安全防護措施(例如更嚴格的權重保護、更完整的越獄防禦、更高規格的內容過濾),才能繼續訓練或部署。

這跟籠統地說「我們重視 AI 安全」不同:RSP 的設計精神是要把安全承諾轉化成可具體檢驗的條件——門檻定義清楚、對應的防護措施明確、理論上第三方能檢查實驗室是否真的做到自己承諾要做的事。這也是為什麼 RSP 常被拿來跟生物安全實驗室的分級標準類比:兩者都試著用「風險等級對應防護規格」的邏輯,把抽象的安全承諾變成可操作的具體規範。

02 · 為什麼存在?

為什麼需要負責任擴展政策,它想解決的問題是什麼?

RSP 想解決的核心問題是:在缺乏具強制力的外部監理框架、產業競爭壓力持續存在的情況下,如何讓「先確保安全再往前推進」這件事,不完全依賴實驗室每次都憑良心臨時判斷,而是有一套事先講清楚、可被檢驗的規則可以依循。Anthropic 在 2023 年 9 月率先發布第一版 RSP 時,明確定位這是一份「首創的公開承諾」:不訓練或部署具備災難性傷害能力的模型,除非已經落實能把風險壓在可接受範圍內的安全與資安措施。

這類政策的存在,也反映了目前 AI 安全治理的一個現實侷限:在還沒有等到(或者說,永遠不會有)一部涵蓋所有前沿實驗室、具強制力的國際法規之前,實驗室自願訂立、自願遵守的內部政策,是目前少數能提供某種程度可預期性的機制——即使這個可預期性終究建立在「實驗室選擇遵守自己訂的規則」這個前提上。

03 · 如何影響你的決策?

負責任擴展政策具體怎麼運作,2026 年出現了什麼重大變化?

Anthropic 的 RSP 為例,其框架核心是「AI 安全等級」(AI Safety Level,ASL)標準:隨著模型能力提升,需要配套的技術與營運防護措施等級也隨之提高。RSP 版本持續演進——v1.0(2023 年 9 月)確立基本架構;後續版本陸續加入更細緻的能力門檻定義,例如把「AI 研發能力」門檻拆分成「能完全自動化入門級 AI 研究工作」與「能讓有效算力規模化速度大幅加速」兩個獨立層級,並要求一旦模型跨越特定門檻,實驗室必須提出具體論證,說明模型可能帶來的「目標偏離」風險(呼應元優化器等對齊研究概念)以及對應的緩解措施。

2026 年 2 月生效的 RSP 3.0,是一次重大改版,也是目前爭議最大的一次調整:這個版本移除了先前版本裡的「硬性暫停」機制——原本規定,一旦模型能力跨越特定門檻卻沒有對應的安全措施,實驗室就必須停止訓練,這條規則被替換成「雙重條件」機制,需要同時滿足「在 AI 競賽中處於領先地位」與「存在實質災難性風險」兩個條件,暫停訓練的義務才會被觸發。Anthropic 說明這次改版的理由,包括原本門檻定義存在「模糊地帶」讓外界難以理解風險論證、政治環境對監理日益不友善、以及部分更高安全等級要求的落實難度,在缺乏產業協調的情況下極高。獨立審查者、METR 的 Chris Painter 則在審查意見裡警告,社會目前尚未準備好因應先進 AI 系統可能帶來的災難性風險。

04 · 你該怎麼辦?

負責任擴展政策對讀者理解 AI 安全新聞有什麼幫助?

每當看到「某實驗室更新了安全政策」這類新聞,理解 RSP 的自願性質,能幫助讀者問出關鍵問題:這次調整,是政策本身變得更嚴謹、更具體(例如新增更精確的能力門檻定義),還是實質上放寬了觸發安全措施的條件?兩者在新聞標題上可能都被包裝成「政策更新」,但代表的方向完全相反。RSP 3.0 移除硬性暫停機制、改為雙重條件觸發的調整,正是 FLI 等第三方安全評比報告裡「移動球門柱」批評的具體案例——評審團認為這類調整,即使有其技術與現實考量,仍然構成對先前公開承諾的實質退讓。

這也是為什麼理解 RSP 的自願本質格外重要:它終究是實驗室自己訂、自己執行的政策,沒有外部強制力保證條款不會被修改。這不代表 RSP 完全沒有意義——比起完全沒有任何公開框架,一份持續被追蹤、被第三方公開檢視變化軌跡的政策,仍然提供了某種程度的透明度與究責基礎,但讀者需要清楚意識到,這份透明度本身的可靠程度,取決於實驗室是否願意持續公開修訂細節、以及外部評比機構是否持續追蹤與質疑這些變化。

實際例子 +

Anthropic 於 2026 年 2 月 24 日生效的 RSP 3.0,移除了先前版本裡「模型跨越特定能力門檻卻無對應安全措施即須暫停訓練」的硬性規則,改為需同時滿足「處於 AI 競賽領先地位」與「存在實質災難性風險」兩項條件才會觸發暫停義務;獨立審查者、METR 的 Chris Painter 在審查意見中警告,社會目前尚未準備好因應先進 AI 系統可能帶來的災難性風險,這也呼應了 Future of Life Institute 在同年稍晚發布的 AI Safety Index 報告裡,對包括 Anthropic 在內的多家實驗室弱化暫停承諾的批評。

常見誤解 +
✕ 誤解1
× 誤解:只要一家實驗室有公開發布 RSP,就代表它的模型訓練與部署受到了外部監督與制衡,實際是:RSP 終究是實驗室自願訂立、自願遵守的內部政策,條款可以被實驗室自己修改(如 RSP 3.0 移除硬性暫停機制),沒有外部強制力保證條款維持不變或被確實執行
✕ 誤解2
× 誤解:RSP 版本更新代表安全政策持續在進步、變得更嚴謹,實際是:版本更新的方向不必然是趨嚴,RSP 3.0 移除硬性暫停規則、改為雙重條件觸發,就被第三方安全評比機構明確點名為「弱化」既有承諾的案例,判讀任何一次更新,都需要具體檢查是條件變嚴還是變寬鬆
這件事跟你有什麼關係 +
直接影響

負責任擴展政策的優點是在缺乏具強制力外部監理的環境下,提供了一套相對具體、可被追蹤檢驗的自願框架,讓安全承諾不完全流於空泛宣示;缺點是這套框架的約束力終究來自實驗室自身的持續遵守意願,門檻定義、觸發條件、甚至整個框架本身,都可能因為競爭壓力、政治環境、或實務執行難度而被修改,第三方能做的主要是持續追蹤與公開質疑修訂方向,而不是強制實驗室遵守。

提問
請至少輸入 10 個字
更多相關主題