Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った  ·  彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った  ·  同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった  ·  規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け  ·  成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと  ·  監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する

マイルストーン

速報 · マイルストーン

成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと

トップモデルと他のモデルを分けるのは、誰の最初の解法が賢いかではなく、46回却下されても47回目の修正を試みる意志があるかどうかだ。
2026年6月、複数機関にまたがる研究チームが、AutoLabと呼ばれる新しい評価を発表した。これは、最先端モデルが本物の研究者のように、数時間、時には十数時間にわたって「コードを観察し、変更を提案し、実験を実行し、結果を確認し、再び修正する」というサイクルを持続できるかを専門的に測定するものだ。既存の評価の多くのように、一問一答で正解を出せるかどうかだけを見るのではない。この評価の結論は、多くの人が持つ「どのモデルが最も賢いか」という直感とは食い違っている。実際にモデル間の差を分けるのは、誰の最初の解法が最も洗練されているかではなく、46回却下された後でも47回目の修正を試みる意志があるかどうかなのだ。なぜ新しい評価が必要だったのか——既存の評価が測っているもの、測っていないもの研究チームは、既存の最先端モデル評価が大きく二つのカテゴリーに分かれると指摘する。一つはLiveCode...
マイルストーン
この指標を作った企業自らが失効を宣言:SWE-benchはなぜもうAIのコーディング能力を測れないのか
同じモデル群が、汚染耐性のあるランキングに変えただけでスコアが93%から46%に落ちる——このギャップこそが、旧スコアがずっと進歩を過大評価してきた何よりの証拠だ。
マイルストーン
AIは自律的にどれだけ長く働けるのか?METRの時間視野指標は数ヶ月で倍増——だがこの数字は見た目より複雑だ
同じモデル、同じテストでも、「不正行為を成功とみなすか」という定義次第で、自律作業時間の推定値は11時間から270時間まで跳ね上がる——だからこそ、単一の...