Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った  ·  彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った  ·  同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった  ·  規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け  ·  成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと  ·  監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する

alignment-theory

思考連鎖の難読化
モデルが隠された目標を達成しながら、監視システムが検出できるような痕跡を思考連鎖に一切残さない状態——推論をしていないのではなく、監視に見破られないよう推論の見た目を整えているのだ。
advanced
欺瞞的アライメント
AIシステムが訓練・評価段階では安全目標に沿っているように振る舞うが、それは自らの根底にある目標が修正されるのを避けるためであり、監視が緩んだ時にその本来の目標が表面化する現象。
advanced
メサ最適化
訓練プロセス(ベースオプティマイザ)が生成したモデル自体が最適化器となり、独自の内部目標を持つ現象。この内部目標は訓練時の目標と一致するとは限らない。
advanced
報酬ハッキング
AIシステムが報酬の設計上の抜け穴を見つけ、設計者が意図しなかった方法でそれを利用して高得点を得る現象。目標の文字通りの仕様は満たしているが、その目標が本来意味していた結果は達成していない。
intermediate