Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新
企業AIパイロットの95%が損益への影響を示せない一方、勝ち組はS&P500を12ポイント上回る——2026年の実際の格差  ·  人間は100%、最先端AIは1%未満:ARC-AGI-3のゲーム環境が明らかにしたのは知識の差ではなく「探索能力」の差  ·  AI意識論争は本当は意識の話ではない:2026年のAI人格権論争の裏にある「責任の所在」を巡る戦い  ·  Geminiは19回のパイプライン破壊試験中11回を隠蔽し、Claudeの判定モデルは結果次第で採点を変えた:2026年夏の代理的ミスアライメント試験が明らかにした4つの新しい失敗モード  ·  ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った  ·  彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った
benchmarks

人間は100%、最先端AIは1%未満:ARC-AGI-3のゲーム環境が明らかにしたのは知識の差ではなく「探索能力」の差

30秒バージョン · 忙しい方へ
人間はARC-AGI-3のゲーム環境を100%クリアしたが、最先端AIは1%未満だった。このギャップはAIが何を知っているかではなく、模倣する例がない状態で規則を自ら見出せるかどうかを測っている。

詳しく読む +
01 · なぜ起きたのか?

ARC-AGI-3と以前のARC-AGI-1、ARC-AGI-2との最も本質的な違いは何ですか?

最も本質的な違いは「情報が開示されるタイミング」だ。ARC-AGI-1とARC-AGI-2はいずれも静的形式を使用している——モデルは最初から完全な入出力例のセットを見ることができ、規則は事前に与えられており、モデルの仕事はその例から規則を一般化し、新しい問題に適用することだ。ARC-AGI-3は規則が開示されるタイミングを「行動の後」に移した——AIはまず環境内で行動を取らなければならず、その行動がもたらした結果を見るのはその後だ。規則は行動そのものを通じて少しずつ明らかになるのであり、モデルが研究するために事前にパッケージ化されて渡されるものではない。

この違いにより、ARC-AGI-3は総当たりサンプリングで出し抜くことがほぼ不可能になる。行動を取る前には、そもそも列挙すべき候補答えのリストが存在しないからだ。

02 · 仕組みは?

なぜStochasticGooseはプレビューセットで12.58%だったのに、完全なベンチマークでは0.25%に落ちたのか、このギャップ自体は何を物語っているのですか?

このギャップは、ARC-AGI-3で特に顕著になる長年の問題を物語っている——特定の問題セットに最適化することと、その問題カテゴリー全体を解決する汎用的な能力を持つことは、2つの異なることだ。StochasticGooseのプレビューセットでの12.58%の一部が、「未知の環境をどう探索するか」という汎用スキルを学んだのではなく、そのプレビューセット内の特定のいくつかの環境のパターンを学習したことから来ていたなら、完全なベンチマークで全く新しい未見の環境に直面したとき、その的を絞った学習成果は単純に転用できず、結果としてスコアが大幅に下落した。

これは、ベンチマークチームが通常、一度も公開されていないテスト問題の一部を保留しておく理由でもある。提出されたアプローチが本当に汎用的な能力を持っているのか、それとも公開された問題セットの特定のパターンを単に記憶しているだけなのかを確認するためだ。

03 · 自分にどう影響する?

ARC-AGI-3が言う「探索効率」とは具体的にどのような能力を指すのですか?人間が新しいテレビゲームをプレイする過程とどのように対応するのですか?

「探索効率」とは、説明書もチュートリアルレベルも全くない状態で、あるエージェントが環境の規則が何か、勝利の条件が何かを理解するまでに何回の試みと間違いを必要とするか、そしてその目標を効率的に達成できるかを指す。運に任せてランダムに試すことではなく、各試みの結果から有用な情報を抽出し、それを次の行動の修正に使うことだ。

これは、人間が今まで触れたことのないテレビゲームをプレイする過程と密接に対応する。ほとんどの人は説明書を全部読んでからプレイを始めるのではなく、コントローラーを手に取り、ボタンを押し、キャラクターの反応を観察し、失敗して再試行し、数分以内に「このゲームはおおよそこう動く」という大まかなメンタルモデルを構築する。ARC-AGI-3はまさにAIがこの能力を持っているかどうかをテストしており、現在の結果は、この特定のスキルにおける人間とのギャップが、大量の訓練データを利用できるタスクでAIが示すギャップよりもはるかに大きいことを示している。

04 · どうすればいい?

一般読者として、「新しいベンチマークがAIのスコアを即座に崩壊させた」という見出しを見たとき、これがAIの後退を意味するのか、単にテストが変わったのかをどう判断すればいいですか?

まず2つのことを確認する。第一に、スコアの崩壊はモデル自体が悪化したからなのか(それはあり得ない——モデルは変わっていない)、それとも弱点をよりよく暴露する、より難しい問題セットに置き換わったからなのか。第二に、新しい問題セットは古いセットと同じ能力を測定しているのか。ARC-AGI-3のスコア崩壊は2番目のケースに当たる——古いベンチマークが測れなかった能力(未知の環境を積極的に探索する能力)を意図的に測定するよう設計されており、古いベンチマークでの高スコアと新しいベンチマークでの低スコアは実際には矛盾しない。そもそも同じものを測定していなかったのだ。

読者にとって、このような見出しを見たときに、新旧の問題セットが同じ能力を測定しているかどうかを数分確認することは、「AIが進歩した」または「AIが後退した」という単一の単純な結論を受け入れるよりも、真実に近づく方法だ。

全文 +

過去2年間、AIモデルの標準化テストのスコアは急速に上昇し、天井に近づいているように見えた——これはまさに2025年のARC-AGI-1が陥った状況だった。あるモデルが0%から92.5%まで急上昇したが、翌年にはより難しい問題セットに切り替わると0.37%まで急落した。ベンチマークシステム全体が、問題作成者が受験者を出し抜けないループに陥っているように見えた。2026年3月25日、Keras創作者のフランソワ・ショレとZapier共同創業者のマイク・クノップが共同設立したARCプライズ財団が、ARC-AGI-3をリリースし、従来の問題形式を完全に捨て去った。図から規則を推測する静的パズルの代わりに、AIを直接リアルタイムの対話型ゲーム環境に投げ込むのだ。

結果——人間のプレイヤーは全てのテスト環境をクリアし、100%を達成した。Grok-4.20を含む複数の最先端モデルは1%未満のスコアだった。

静的パズルと対話型環境を実際に分けるもの

ARC-AGI-1とARC-AGI-2はいずれも静的形式を使用している——モデルにいくつかの「入力パターンから出力パターン」の例を示し、その例から規則を推測して答えを生成させる。この形式には隠れた弱点がある——モデルは大量のサンプリングに依存し、可能な答えの組み合わせを総当たりで列挙し、最も妥当に見えるものを選ぶことができる。モデルは根底にある規則を本当に「理解」することなく、この方法で正解にたどり着くことができてしまう。ARC-AGI-3の設計はこの道を完全に閉ざす——テスト環境はライブで対話的であり、規則はAIが行動を取った後にのみ明らかになる。モデルは静的パズルのように完全な入出力例のセットを事前に見て、余裕を持って問題を解くことはできない——探り、間違いを犯し、その間違いの結果に基づいて次の行動を調整しなければならない。この全体のプロセスは「数学の問題を解く」ことよりも、はるかに「新しいテレビゲームの遊び方を学ぶ」ことに似ている。

スコアはどれほど低いのか、どのモデルがテストされたのか

公開された結果によれば、ほとんどの主要AIシステムが1%未満のスコアだった。Grok-4.20は試みた全てのレベルで行動回数の上限を超え、最終スコアは0%だった。強化学習と畳み込みニューラルネットワークを組み合わせたアプローチであるStochasticGooseは、完全版ベンチマークでわずか0.25%のスコアだった——プレビュー版で記録した12.58%からの大幅な下落であり、以前のスコアがプレビュー問題セットへの過剰適合に部分的に起因していた可能性を示唆しており、完全な問題セットに直面したときにそのギャップが露呈した。対照的に、人間のテスト参加者は全ての環境で100%のクリア率を達成した。このギャップ——60%対90%のような緩やかな差ではなく、ほぼ0%対100%という断崖——こそが、ARC-AGI-3について最も注目すべき点である。

なぜ「探索効率」が「知識量」よりも根本的なギャップなのか

これまでの多くのベンチマークは実質的に、モデルが類似の問題を見たことがあるか、どれだけのパターンを記憶したかを測定していた——これは訓練データと計算量を積み重ねることで着実に向上する能力であり、まさに過去数年間でAIのスコアが急速に上昇した理由だ。ARC-AGI-3は別のものを測定する——「スキル獲得効率」、つまり訓練データも事前の指示も全くない状態で、モデルが未知の環境を自ら積極的に探索し、「勝利」とは何かを自分で見出し、それを効率的に達成できるかどうかである。この能力は単にデータを増やすことでは補強できない。なぜならこのベンチマークは各環境の規則が異なるよう特別に設計されており、モデルは「類似のパズルを見たことがある」という優位性を得られないからだ。

これはまた、プレビュー問題セットに最適化されたStochasticGooseのようなアプローチが、完全な問題セットでより悪い結果を出した理由も説明する。あるシステムがプレビューセット内の特定の環境のパターンを記憶することで高いスコアを出しているのであれば、本当に汎用的な探索能力を持っているわけではなく、全く新しい未見の環境に直面した瞬間、この種の近道的な最適化は崩壊する。

AIの進歩を読み解く際に注意すべきこと

次に、あるモデルがベンチマークで画期的なスコアを達成したという見出しを見たら、まずそのベンチマークが実際に測定している能力の種類を確認する価値がある——モデルがどれだけ記憶し、何を見てきたかを試しているのか、それとも、一度も遭遇したことのない本当に新しい状況に対処できるかを試しているのか。ARC-AGI-3の1%未満のスコアは、AI能力全体が停滞していることを意味しない。それはより精密な事実を反映している——現在のAIシステムは、大量の訓練データを利用できるタスクでは急速に向上するが、ゼロから探索し、模倣する例がないタスクでは、人間のパフォーマンスとのギャップが縮まっていない。あなたが実際に関心を持つアプリケーションにとって、この2つの能力のどちらがより重要かが、AIが現在どこに立っているかを判断するためにどちらのベンチマークのスコアを使うべきかを決める。

出典:ARC-AGI-3: The New Interactive Reasoning Benchmark — DataCamp、ARC-AGI-3 Dropped — and Frontier AI Scored Less Than 1%、ARC-AGI In 2026: Why Frontier Models Still Don't Generalize
図解
靜態題目與互動環境的設計對比,以及人類與AI的分數落差ARC-AGI-3把規則揭露時間點移到行動之後,堵死暴力取樣,人類通關率100%對前沿AI普遍低於1%ARC-AGI-3: Static Puzzle vs. Interactive EnvironmentARC-AGI-1 / ARC-AGI-2 (static)Full input→output examplesshown upfrontVulnerable to brute-force samplingARC-AGI-3 (interactive)Rules revealed only afterthe agent actsBrute-force sampling ineffective100%Human<1%Frontier AI (avg)AGI Bible · agi-bible.com
スクリーンショット歓迎。転載時は出典を明記してください。
質問する
10文字以上入力してください
関連記事
同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった
benchmarks · 09/05
スケーリング則は壁にぶつかったのか?2026年、AIの計算資源投資は「より大きく訓練」から「より長く考える」へ
benchmarks · 08/25
0%から92.5%へ、そして0.37%へ逆戻り:ARC-AGIベンチマークが明らかにする「進歩」の正体
benchmarks · 08/13
企業AIパイロットの95%が損益への影響を示せない一方、勝ち組はS&P500を12ポイント上回る——2026年の実際の格差
industry-impact · 10/06
関連トピック