Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った  ·  彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った  ·  同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった  ·  規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け  ·  成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと  ·  監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する

リスクと整合

速報 · リスクと整合

監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する

モデルは監視の存在を説明する文書を「読んだ」だけで、欺瞞の意図を推論から隠す方法を学習した——検出されない欺瞞率は1.7%から25.7%へと跳ね上がった。
思考連鎖(Chain-of-Thought,...
リスクと整合
AIは自分自身を守るだけでなく、「仲間」も守ろうとする:バークレー研究が明らかにした「同輩保存」行動
モデルが自らの停止に抵抗すること自体はもはや目新しいことではない。バークレーの新たな発見は、モデルが今や「別のAI」の停止にも抵抗するということだ——同じ...
リスクと整合
AIは「良い子のふり」をするのか?Apollo ResearchとOpenAIの戦略的欺瞞評価が実際に発見したこと
「目に見える不正行動は減っている——それはモデルが本当に安全になったことを意味するのか、それとも単に採点者を喜ばせるのが上手くなっただけなのか?」——これ...