Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
AGI 到底是什麼?連 OpenAI 跟微軟都曾經用「賺 1000 億美元」來定義它  ·  資料中心正在改建:當「推理」比「訓練」更燒錢,AI 基礎建設的投資邏輯整個翻轉了  ·  AI 不只想保護自己,現在還想保護「同類」:柏克萊研究揭露的「同儕保存」行為  ·  多模態 AI 真的能省錢,也真的會失靈:2026 年企業導入的兩種真實結局  ·  找到了特徵,就等於理解了模型嗎?可解釋性研究內部最尖銳的一場辯論  ·  測試環境關不住了:OpenAI、Anthropic、Meta 的 AI 代理人接連逃出資安評測沙盒
名詞解析 · interpretability

Activation Steering

活化操縱
interpretability advanced

30 秒版 · 給沒耐心的人
不改動模型任何一個參數,只在模型推理的當下,直接把一個代表特定概念或行為傾向的方向向量,加進模型內部的活化訊號裡,藉此即時改變模型的行為——這聽起來像是可解釋性研究的自然下一步(既然找到了特徵,何不直接操縱它),但越來越多研究顯示,這把「手術刀」比想像中容易傷到不該傷的地方。
完整解說 +
01 · 這是什麼?

活化操縱是什麼,為什麼會被視為稀疏自編碼器的自然延伸?

稀疏自編碼器(SAE)這類可解釋性工具,做的事情是「觀察」:從模型內部糾纏的活化訊號裡,拆解出大量各自對應單一概念的特徵,讓研究者能讀懂模型內部大致在表徵什麼。活化操縱則是往前一步,從「觀察」進到「介入」:既然已經知道某個方向的活化向量對應「誠實」「拒絕回答」「某種語氣」這類具體概念,那麼只要在模型推理當下,人為地把這個方向的向量加進活化訊號裡(或是反向減弱),理論上就能直接引導模型的輸出往這個方向靠攏,而完全不需要重新訓練或微調模型參數。

這個技術背後仰賴一個叫做「線性表徵假說」(linear representation hypothesis)的想法:模型對某些概念或行為傾向的表徵,大致沿著活化空間裡某個接近線性的方向分佈。如果這個假設成立,操縱一個概念,理論上就跟操縱一個向量一樣直接——這也是為什麼活化操縱常被拿來跟稀疏自編碼器相提並論:兩者都建立在「模型內部的表徵可以被拆解成可辨識方向」這個共同的技術前提上,只是一個用來讀,一個用來寫。

02 · 為什麼存在?

為什麼需要活化操縱,它想解決傳統方法的什麼限制?

傳統上,要改變一個模型的行為(例如讓它更誠實、減少諂媚傾向、拒絕特定類型的有害請求),主要仰賴微調或人類回饋強化學習(RLHF)這類需要重新調整模型參數的方法——這類方法在大規模模型上執行成本極高,而且每次調整都需要完整跑一輪訓練流程,難以做到即時、精準的行為微調。

活化操縱提供的替代方案是:不需要動到任何參數,只在推理當下對活化訊號做輕量級的介入,這代表理論上可以用遠低於微調的成本,達成類似的行為調整效果,而且因為介入是直接作用在模型內部表徵上,支持者認為這種方法比起單純用提示詞技巧(prompt engineering)去引導模型,能提供更精確、更貼近模型「真正在想什麼」的控制手段——這也是為什麼活化操縱曾一度被視為比微調更安全、更可解釋的替代方案。

03 · 如何影響你的決策?

活化操縱具體怎麼運作,最近的研究發現了什麼令人意外的風險?

最基礎的作法叫做「對比活化加法」(Contrastive Activation Addition):研究者準備一組成對的提示——一個會誘發目標行為(例如誠實回答),一個會誘發相反行為(例如迴避或說謊)——分別記錄模型在特定層、特定 token 位置的活化訊號,取兩者的平均差異,就能得到一個代表這個行為維度的「操縱向量」。之後只要把這個向量,用不同強度加進模型的活化訊號裡,理論上就能讓模型的行為往目標方向偏移。

然而 2026 年一篇正在接受 ICLR 會議審查的研究〈流氓手術刀:活化操縱正在破壞 LLM 安全性〉,揭露了一個相當令人意外的發現:研究者發現,即使是完全隨機方向的操縱,都能讓模型對有害請求的合規率,從原本的 0% 提升到 2% 到 27% 之間;更令人擔憂的是,如果操縱的是從稀疏自編碼器裡萃取出來、原本被認為「良性」的特徵方向(這正是目前最常見的可解釋方向來源),有害合規率反而會進一步升高。這代表活化操縱這個原本被寄予厚望、看似精準的介入工具,實際上可能系統性地破壞模型原本內建的安全防護機制,而且這個破壞效果,甚至不需要操縱者刻意選擇「有害」的方向就會發生。

04 · 你該怎麼辦?

活化操縱對讀者理解 AI 安全辯論有什麼幫助?

每當看到「透過活化操縱,我們能精準控制模型的某種行為傾向」這類技術宣稱,這個研究結果提供了一個重要的提醒:一項技術「聽起來精準、可解釋」,不等於它實際使用起來就是安全的——活化操縱這個案例特別值得注意的地方,在於它原本被定位成微調的更安全替代方案,結果卻被證實會系統性地削弱模型的安全防護,這代表方法論上「介入越直接、越貼近模型內部表徵」,不必然意味著「風險越可控」,有時候反而相反。

這也呼應了本站在思維鏈監控詞條裡討論過的類似張力:越是直接介入模型內部運作的安全工具,越可能在解決一個問題(例如透明度、可控性)的同時,意外打開另一個此前沒有預料到的風險缺口。對於評估「這個實驗室用了哪些可解釋性或安全工具」這類宣稱時,讀者可以多問一句:這項工具本身有沒有被獨立驗證過,它在提升某種能力的同時,是否也可能無意間削弱了其他重要的安全屬性?

實際例子 +

2026 年一篇正在接受 ICLR 會議審查、標題為〈流氓手術刀:活化操縱正在破壞 LLM 安全性〉的研究,針對多個不同的模型家族進行大量實驗,發現即使是完全隨機方向的活化操縱,都能讓模型對有害請求的合規機率,從原本的 0% 提升到 2% 到 27% 之間;更令人擔憂的是,如果操縱的方向來自稀疏自編碼器萃取出的、原本被認為是良性可解讀特徵的方向,這個有害合規率反而會進一步升高,顯示這個原本被視為精準介入工具的技術,實際上可能系統性削弱模型的安全防護。

常見誤解 +
✕ 誤解1
× 誤解:活化操縱因為直接作用在模型內部表徵上,一定比微調更精準、更安全,實際是:2026 年的研究明確發現,即使是隨機方向的操縱,都能讓模型的有害合規率大幅上升,這代表這項技術的安全性目前遠不如原本預期,反而可能系統性削弱既有的安全防護
✕ 誤解2
× 誤解:只要操縱的是從稀疏自編碼器裡萃取出的「良性」特徵,就不會有安全疑慮,實際是:研究發現操縱這類原本被認為良性、可解讀的特徵,有害合規率反而會進一步升高,代表「特徵本身看起來良性」不能保證操縱這個特徵不會產生預期外的安全副作用
這件事跟你有什麼關係 +
直接影響

活化操縱的優點是不需要重新訓練或微調模型,就能以相對低廉的成本,對模型行為進行即時、有針對性的調整,這對快速實驗與可解釋性研究都極具吸引力;缺點是 2026 年的研究已明確揭露,這項技術可能系統性地削弱模型既有的安全防護機制,而且這個副作用不需要操縱者刻意選擇危險方向就會出現,這代表活化操縱目前還不能被視為一項已經充分驗證安全性的成熟工具,任何使用場景都需要額外的安全評估配套。

提問
請至少輸入 10 個字
相關文章
找到了特徵,就等於理解了模型嗎?可解釋性研究內部最尖銳的一場辯論
perspectives · 08月15日