活性化操作
モデルのパラメータを一つも変更することなく、推論の瞬間にモデル内部の活性化信号に、特定の概念や行動傾向を表す方向ベクトルを直接加えることで、モデルの挙動をリアルタイムで変化させる手法。これは解釈可能性研究の自然な次のステップのように聞こえる(特徴を見つけたのなら、それを直接操作すればいいではないか)。しかし、この「メス」が思っていたよりも容易に傷つけるべきでない場所を傷つけてしまうことを示す研究が増えている。
advanced
ブラックボックス問題
AIモデルは正しい答えを出すことができるが、それを開発したエンジニアを含め、誰もそのモデルがなぜその答えにたどり着いたのかを人間が理解できる形で説明できない——この「能力」と「説明可能性」の間のギャップこそが<a href="/ja/glossary/interpretability/black-box-problem/">ブラックボックス問題</a>であり、現在AIシステムを監査し、デバッグし、責任を追及する上で最も根本的な障害となっている。
beginner
スパースオートエンコーダー
AIモデル内部の絡み合った、解釈が困難なニューロンの活性化信号を、それぞれが単一の識別可能な概念に対応する多数の「特徴」へと分解する、訓練された小型ニューラルネットワーク。現在、メカニスティック解釈可能性研究における主要なツールの一つである。
intermediate