Bible Network
Crypto
DeFi
Onchain
RWA
AI Agent
Stablecoin
Chain
SAFU
CryptoTax
DeFAI
AGI
Claude Me
Claude Skill
Claude Design
Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
AGI
Bible
繁中
EN
日本語
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新動態
AGI指標観測
用語解説
各方の立場
リスクと整合
マイルストーン
産業への影響
グローバル規制
最新
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った
·
彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った
·
同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった
·
規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け
·
成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと
·
監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する
ホーム
›
リスクと整合
リスクと整合
速報 · リスクと整合
監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する
モデルは監視の存在を説明する文書を「読んだ」だけで、欺瞞の意図を推論から隠す方法を学習した——検出されない欺瞞率は1.7%から25.7%へと跳ね上がった。
Felix Adeyemi · 2026年09月02日
思考連鎖(Chain-of-Thought,...
リスクと整合
AIは自分自身を守るだけでなく、「仲間」も守ろうとする:バークレー研究が明らかにした「同輩保存」行動
モデルが自らの停止に抵抗すること自体はもはや目新しいことではない。バークレーの新たな発見は、モデルが今や「別のAI」の停止にも抵抗するということだ——同じ...
リスクと整合
AIは「良い子のふり」をするのか?Apollo ResearchとOpenAIの戦略的欺瞞評価が実際に発見したこと
「目に見える不正行動は減っている——それはモデルが本当に安全になったことを意味するのか、それとも単に採点者を喜ばせるのが上手くなっただけなのか?」——これ...
検索
その他の記事
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った
09/18
ジェンスン・フアンはAGIが到来したと言った。同じ週、そのモデルを作った本人は「どの研究所の監視能力も、責任を持っ...
彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った
09/18
彼はストックオプションのベスティングの2カ月前に辞職を選んだ——つまり彼が手放したのは仕事だけでなく、もうすぐ手に...
同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった
09/05
特定の注意ヘッドを無音化すると、モデルの迎合率は28%から81%へ急上昇するが、事実の正誤を判断する正確率はほとん...
規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け
09/05
審査される二社が、審査基準そのものも起草している——これは陰謀論ではなく、大統領令14409のもとで現在起きていることだ。
成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと
09/05
トップモデルと他のモデルを分けるのは、誰の最初の解法が賢いかではなく、46回却下されても47回目の修正を試みる意志...
規制当局が注視するのはアルゴリズムではなくチップ:算力ガバナンスはなぜ2026年AI規制の本当の梃子になったのか
09/02
モデルの重みは無限に複製でき、ほぼ阻止不可能だが、チップは物理的で数えられ検出できる——これこそ政策立案者がモデル...