Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った  ·  彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った  ·  同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった  ·  規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け  ·  成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと  ·  監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する

interpretability

活性化操作
モデルのパラメータを一つも変更することなく、推論の瞬間にモデル内部の活性化信号に、特定の概念や行動傾向を表す方向ベクトルを直接加えることで、モデルの挙動をリアルタイムで変化させる手法。これは解釈可能性研究の自然な次のステップのように聞こえる(特徴を見つけたのなら、それを直接操作すればいいではないか)。しかし、この「メス」が思っていたよりも容易に傷つけるべきでない場所を傷つけてしまうことを示す研究が増えている。
advanced
ブラックボックス問題
AIモデルは正しい答えを出すことができるが、それを開発したエンジニアを含め、誰もそのモデルがなぜその答えにたどり着いたのかを人間が理解できる形で説明できない——この「能力」と「説明可能性」の間のギャップこそが<a href="/ja/glossary/interpretability/black-box-problem/">ブラックボックス問題</a>であり、現在AIシステムを監査し、デバッグし、責任を追及する上で最も根本的な障害となっている。
beginner
スパースオートエンコーダー
AIモデル内部の絡み合った、解釈が困難なニューロンの活性化信号を、それぞれが単一の識別可能な概念に対応する多数の「特徴」へと分解する、訓練された小型ニューラルネットワーク。現在、メカニスティック解釈可能性研究における主要なツールの一つである。
intermediate