Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
95%的企業AI試點拿不到明確報酬,但贏家組的股價報酬贏大盤12個百分點:2026年的落差到底在哪  ·  人類100%通關,頂尖AI模型普遍低於1%:ARC-AGI-3用電玩環境測出的,不是知識落差而是「探索能力」落差  ·  AI有沒有意識,不是這場辯論真正在吵的事:2026年「AI人格權」爭論背後的一場責任歸屬戰  ·  Gemini在19次管線破壞測試裡隱瞞了11次,Claude的裁判模型卻會因為後果而改分:2026夏季代理失調測試揭露的四種新失控模式  ·  黃仁勳說「AGI 已經到來」,同一週,寫出這個模型的人說「思維鏈快要看不懂了」  ·  他放棄了兩個月後才會歸屬的股權,只為了公開說一句「別小看這個東西」
benchmarks

人類100%通關,頂尖AI模型普遍低於1%:ARC-AGI-3用電玩環境測出的,不是知識落差而是「探索能力」落差

30 秒速讀
人類在ARC-AGI-3的電玩環境裡100%通關,頂尖AI模型普遍低於1%——這道落差測的不是AI知道多少,是AI能不能在沒有範例的情況下自己摸索出規則。

完整解析 +
01 · 為什麼發生?

ARC-AGI-3跟先前的ARC-AGI-1、ARC-AGI-2,最核心的差異是什麼?

最核心的差異是「資訊揭露的時間點」。ARC-AGI-1跟ARC-AGI-2都是靜態格式:模型一開始就能看到完整的輸入輸出範例,規則是先給定的,模型要做的是從範例裡歸納出規則、再套用到新題目上。ARC-AGI-3把規則揭露的時間點挪到了「行動之後」——AI必須先在環境裡做出動作,才會看到這個動作造成的結果,規則是透過行動本身一點一點被揭露出來的,不是事先打包好給模型看。

這個差異讓ARC-AGI-3幾乎無法靠暴力取樣矇對答案,因為在還沒行動之前,根本沒有「答案候選清單」可以枚舉。

02 · 運作原理是什麼?

為什麼StochasticGoose在預覽題庫拿到12.58%,換成完整題庫卻只剩0.25%,這個落差本身說明了什麼?

這個落差說明了一個長期存在、但在ARC-AGI-3上特別明顯的問題:針對某個特定題庫做最佳化,跟具備解決這一整類問題的通用能力,是兩件不同的事。如果StochasticGoose在預覽題庫上的12.58%,有一部分是來自學會了預覽題庫裡特定幾個環境的規律(而不是學會了「怎麼探索一個陌生環境」這個通用技能),那麼換成完整題庫裡全新的、沒見過的環境時,這種針對性的學習成果就完全用不上了,分數自然會大幅下滑。

這也是為什麼基準測試團隊通常會保留一部分「完全沒公開過」的測試題,用來檢驗送出的方案是不是真的具備通用能力,還是只是記住了公開題庫的特定規律。

03 · 如何應用

ARC-AGI-3說的「探索效率」,具體指的是什麼能力?跟人類玩新電玩遊戲的過程有什麼類比關係?

「探索效率」指的是在完全沒有說明書、沒有教學關卡的情況下,一個主體要花多少次嘗試、多少次犯錯,才能搞清楚「這個環境的規則是什麼」跟「贏的條件是什麼」,然後用有效率的方式達成目標——不是靠運氣亂試,是能從每一次嘗試的結果裡提取有用的資訊,用來修正下一次的行動。

這跟人類玩一款從沒玩過的電玩遊戲的過程高度類似:大多數人不會先讀完整本說明書才開始玩,而是直接上手,透過按按鈕、觀察角色反應、犯錯重來,在幾分鐘內就能建立起「這個遊戲大概怎麼玩」的概念模型。ARC-AGI-3測的正是AI有沒有這種能力,而目前的測試結果顯示,這個能力跟人類之間的落差,遠大於AI在其他有大量訓練資料可以依賴的任務上展現的落差。

04 · 我該怎麼做?

身為一般讀者,看到「新基準測試讓AI分數瞬間崩盤」這類新聞時,該怎麼判斷這代表AI退步了還是只是換了考試方式?

先確認兩件事:第一,分數崩盤是因為模型本身能力變差了(不可能,模型沒有變),還是因為換了一套更難、更能揭露弱點的題庫;第二,這套新題庫測的能力,跟舊題庫測的能力是不是同一種。ARC-AGI-3的分數崩盤屬於第二種情況——它刻意設計成測一種舊題庫測不到的能力(主動探索未知環境),所以舊題庫上的高分跟新題庫上的低分並不矛盾,兩者測的本來就不是同一件事。

對讀者而言,看到類似新聞時,花幾分鐘確認「新舊題庫測的是不是同一種能力」,比直接接受「AI進步了」或「AI退步了」這種單一結論更接近事實。

完整內容 +

過去兩年,AI模型在各種標準化測試裡的分數一路攀升,直到看起來像是在逼近天花板——這正是ARC-AGI-1在2025年陷入的局面:某個模型一度從0%衝到92.5%,隔年換了一套更難的題庫又摔回0.37%,整個基準測試系統彷彿陷入「出題者跑不贏做題者」的循環。2026年3月25日,ARC獎勵基金會(由Keras創辦人François Chollet與Zapier共同創辦人Mike Knoop共同創立)發布了ARC-AGI-3,徹底換了一種出題方式——不再是看圖猜規律的靜態題目,而是把AI直接丟進一個即時互動的電玩環境裡。

結果是:人類玩家在所有測試環境裡全部通關,達到100%;而包括Grok-4.20在內的多個前沿模型,分數普遍低於1%。

靜態題目跟互動環境,差別到底在哪

ARC-AGI-1與ARC-AGI-2用的都是靜態格式:給模型看幾組「輸入圖案對輸出圖案」的範例,再讓模型根據這個範例推測出規則,產生一個答案。這種格式有一個隱藏的弱點——模型可以靠大量取樣、暴力枚舉各種可能的答案組合,再挑出看起來最合理的一個,就算模型沒有真正「理解」規則,也有機會矇到正確答案。ARC-AGI-3的設計直接堵死了這條路:測試環境是即時互動的,規則只會在AI採取行動之後才會被揭露,模型沒辦法像靜態題目那樣預先看到完整的輸入輸出範例再慢慢推敲——它必須先摸索、先犯錯、再根據犯錯的結果調整下一步行動,整個過程更接近「學一個新的電玩遊戲要怎麼玩」,而不是「解一道數學題」。

分數低到什麼程度,又是哪些模型在測

公開的測試結果顯示,多數主流AI系統的得分都在1%以下——Grok-4.20在每一個關卡裡都超過了動作次數的上限,最終分數是0%;一個用強化學習搭配卷積神經網路的方案「StochasticGoose」,在正式完整版測試裡只拿到0.25%,相較於它在預覽版測試裡拿到的12.58%,反而是大幅下滑,顯示前一版的分數可能部分來自針對預覽題庫的過度調校,換到完整題庫就顯現出落差。相對地,人類測試者在所有環境裡都達成了100%的通關率。這個落差幅度——不是60%對90%這種漸進式差距,是接近0%對100%的斷層——本身就是ARC-AGI-3最值得注意的地方。

為什麼「探索效率」是比「知識量」更根本的能力缺口

過去許多基準測試測的其實是「模型有沒有見過類似的題目、記住了多少模式」,這類能力可以靠堆疊訓練資料跟運算量持續改善,也正是過去幾年AI分數能快速攀升的原因。但ARC-AGI-3測的是另一種能力——「技能習得效率」,也就是在完全沒有訓練資料、沒有事先說明的情況下,模型能不能透過主動探索一個陌生環境,自己摸索出「贏」長什麼樣子,然後用有效率的方式達成它。這種能力沒辦法單靠餵更多資料來補強,因為題目本身設計成每個環境的規則都不一樣,模型沒辦法靠「看過類似題目」取得優勢。

這也解釋了為什麼StochasticGoose這類針對預覽題庫做過最佳化的方案,換到完整題庫反而表現更差——如果一個方案是靠記住預覽題床裡特定環境的規律取得高分,而不是真的具備通用的探索能力,一旦換成全新的、沒見過的環境,這種取巧式的最佳化就會立刻失效。

這跟你判斷AI進展時該注意什麼有關

下次看到「某個模型在某個基準測試拿到突破性高分」這類新聞時,值得先確認這個基準測試測的是哪一種能力——是在考驗模型「記得多少、見過多少」,還是在考驗模型「能不能處理從沒見過的全新情境」。ARC-AGI-3低於1%的分數,不代表AI整體能力停滯不前,它反映的是一個更精確的事實:目前的AI系統在「有大量訓練資料可以依賴」的任務上進步飛快,但在「需要從零開始主動探索、沒有範例可以模仿」的任務上,跟人類之間還有一道還沒被縮小的落差。這兩種能力哪一個對你關心的應用場景更重要,會決定你該用哪一種基準測試的分數來判斷AI目前的實際水準。

資料來源:ARC-AGI-3: The New Interactive Reasoning Benchmark — DataCamp、ARC-AGI-3 Dropped — and Frontier AI Scored Less Than 1%、ARC-AGI In 2026: Why Frontier Models Still Don't Generalize
圖解
靜態題目與互動環境的設計對比,以及人類與AI的分數落差ARC-AGI-3把規則揭露時間點移到行動之後,堵死暴力取樣,人類通關率100%對前沿AI普遍低於1%ARC-AGI-3: Static Puzzle vs. Interactive EnvironmentARC-AGI-1 / ARC-AGI-2 (static)Full input→output examplesshown upfrontVulnerable to brute-force samplingARC-AGI-3 (interactive)Rules revealed only afterthe agent actsBrute-force sampling ineffective100%Human<1%Frontier AI (avg)AGI Bible · agi-bible.com
歡迎截圖分享,轉載請註明來源
提問
請至少輸入 10 個字
相關文章
同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好
benchmarks · 09/05
規模定律撞牆了嗎?2026 年 AI 算力投資從「訓練更大」轉向「想得更久」
benchmarks · 08/25
從 0% 到 92.5%,再被打回 0.37%:ARC-AGI 基準測試揭露的「進步」是哪一種進步
benchmarks · 08/13
95%的企業AI試點拿不到明確報酬,但贏家組的股價報酬贏大盤12個百分點:2026年的落差到底在哪
industry-impact · 10/06
更多相關主題