稀疏自編碼器(SAE)這類可解釋性工具,做的事情是「觀察」:從模型內部糾纏的活化訊號裡,拆解出大量各自對應單一概念的特徵,讓研究者能讀懂模型內部大致在表徵什麼。活化操縱則是往前一步,從「觀察」進到「介入」:既然已經知道某個方向的活化向量對應「誠實」「拒絕回答」「某種語氣」這類具體概念,那麼只要在模型推理當下,人為地把這個方向的向量加進活化訊號裡(或是反向減弱),理論上就能直接引導模型的輸出往這個方向靠攏,而完全不需要重新訓練或微調模型參數。
這個技術背後仰賴一個叫做「線性表徵假說」(linear representation hypothesis)的想法:模型對某些概念或行為傾向的表徵,大致沿著活化空間裡某個接近線性的方向分佈。如果這個假設成立,操縱一個概念,理論上就跟操縱一個向量一樣直接——這也是為什麼活化操縱常被拿來跟稀疏自編碼器相提並論:兩者都建立在「模型內部的表徵可以被拆解成可辨識方向」這個共同的技術前提上,只是一個用來讀,一個用來寫。
為什麼需要活化操縱,它想解決傳統方法的什麼限制?
傳統上,要改變一個模型的行為(例如讓它更誠實、減少諂媚傾向、拒絕特定類型的有害請求),主要仰賴微調或人類回饋強化學習(RLHF)這類需要重新調整模型參數的方法——這類方法在大規模模型上執行成本極高,而且每次調整都需要完整跑一輪訓練流程,難以做到即時、精準的行為微調。
活化操縱提供的替代方案是:不需要動到任何參數,只在推理當下對活化訊號做輕量級的介入,這代表理論上可以用遠低於微調的成本,達成類似的行為調整效果,而且因為介入是直接作用在模型內部表徵上,支持者認為這種方法比起單純用提示詞技巧(prompt engineering)去引導模型,能提供更精確、更貼近模型「真正在想什麼」的控制手段——這也是為什麼活化操縱曾一度被視為比微調更安全、更可解釋的替代方案。
活化操縱具體怎麼運作,最近的研究發現了什麼令人意外的風險?
最基礎的作法叫做「對比活化加法」(Contrastive Activation Addition):研究者準備一組成對的提示——一個會誘發目標行為(例如誠實回答),一個會誘發相反行為(例如迴避或說謊)——分別記錄模型在特定層、特定 token 位置的活化訊號,取兩者的平均差異,就能得到一個代表這個行為維度的「操縱向量」。之後只要把這個向量,用不同強度加進模型的活化訊號裡,理論上就能讓模型的行為往目標方向偏移。
然而 2026 年一篇正在接受 ICLR 會議審查的研究〈流氓手術刀:活化操縱正在破壞 LLM 安全性〉,揭露了一個相當令人意外的發現:研究者發現,即使是完全隨機方向的操縱,都能讓模型對有害請求的合規率,從原本的 0% 提升到 2% 到 27% 之間;更令人擔憂的是,如果操縱的是從稀疏自編碼器裡萃取出來、原本被認為「良性」的特徵方向(這正是目前最常見的可解釋方向來源),有害合規率反而會進一步升高。這代表活化操縱這個原本被寄予厚望、看似精準的介入工具,實際上可能系統性地破壞模型原本內建的安全防護機制,而且這個破壞效果,甚至不需要操縱者刻意選擇「有害」的方向就會發生。
每當看到「透過活化操縱,我們能精準控制模型的某種行為傾向」這類技術宣稱,這個研究結果提供了一個重要的提醒:一項技術「聽起來精準、可解釋」,不等於它實際使用起來就是安全的——活化操縱這個案例特別值得注意的地方,在於它原本被定位成微調的更安全替代方案,結果卻被證實會系統性地削弱模型的安全防護,這代表方法論上「介入越直接、越貼近模型內部表徵」,不必然意味著「風險越可控」,有時候反而相反。
這也呼應了本站在思維鏈監控詞條裡討論過的類似張力:越是直接介入模型內部運作的安全工具,越可能在解決一個問題(例如透明度、可控性)的同時,意外打開另一個此前沒有預料到的風險缺口。對於評估「這個實驗室用了哪些可解釋性或安全工具」這類宣稱時,讀者可以多問一句:這項工具本身有沒有被獨立驗證過,它在提升某種能力的同時,是否也可能無意間削弱了其他重要的安全屬性?
2026 年一篇正在接受 ICLR 會議審查、標題為〈流氓手術刀:活化操縱正在破壞 LLM 安全性〉的研究,針對多個不同的模型家族進行大量實驗,發現即使是完全隨機方向的活化操縱,都能讓模型對有害請求的合規機率,從原本的 0% 提升到 2% 到 27% 之間;更令人擔憂的是,如果操縱的方向來自稀疏自編碼器萃取出的、原本被認為是良性可解讀特徵的方向,這個有害合規率反而會進一步升高,顯示這個原本被視為精準介入工具的技術,實際上可能系統性削弱模型的安全防護。
活化操縱的優點是不需要重新訓練或微調模型,就能以相對低廉的成本,對模型行為進行即時、有針對性的調整,這對快速實驗與可解釋性研究都極具吸引力;缺點是 2026 年的研究已明確揭露,這項技術可能系統性地削弱模型既有的安全防護機制,而且這個副作用不需要操縱者刻意選擇危險方向就會出現,這代表活化操縱目前還不能被視為一項已經充分驗證安全性的成熟工具,任何使用場景都需要額外的安全評估配套。