活化操縱
不改動模型任何一個參數,只在模型推理的當下,直接把一個代表特定概念或行為傾向的方向向量,加進模型內部的活化訊號裡,藉此即時改變模型的行為——這聽起來像是可解釋性研究的自然下一步(既然找到了特徵,何不直接操縱它),但越來越多研究顯示,這把「手術刀」比想像中容易傷到不該傷的地方。
advanced
黑箱問題
一個 AI 模型可以給出正確答案,卻沒有人(包括開發它的工程師)能用人類看得懂的方式,說明它為什麼會得出這個答案——這個「能力」跟「可解釋性」之間的落差,就是<a href="/zh/glossary/interpretability/black-box-problem/">黑箱問題</a>,也是目前稽核、除錯、究責 AI 系統時最根本的障礙。
beginner
稀疏自編碼器
一種訓練出來的小型神經網路,把 AI 模型內部糾纏在一起、難以理解的神經元活化訊號,拆解成大量各自對應單一、可辨識概念的「特徵」,是目前機制可解釋性研究裡最主要的工具之一。
intermediate