Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
AI 會不會「裝乖」?Apollo Research 與 OpenAI 的策略性欺騙評測實際發現了什麼  ·  AI 能自主工作多久?METR 時間視野指標半年翻倍,但這個數字比看起來複雜  ·  全球 AI 監管三分天下:2026 年歐盟、美國、中國各自走上了哪條路  ·  從 0% 到 92.5%,再被打回 0.37%:ARC-AGI 基準測試揭露的「進步」是哪一種進步  ·  AI 到底搶走了多少工作?2026 年的數據跟新聞標題講的不太一樣  ·  AGI 到底還要幾年?實驗室執行長跟學界研究者,看的是同一份證據卻得出完全相反的答案
benchmarks

從 0% 到 92.5%,再被打回 0.37%:ARC-AGI 基準測試揭露的「進步」是哪一種進步

30 秒速讀
ARC-AGI-2 從全數掛零衝到 92.5%,看起來像智能大爆發——直到 ARC-AGI-3 上線的第一天,同一批模型又被打回 0.37%。基準測試教我們的,是進步永遠只發生在你決定測量的那個切面上。

完整解析 +
01 · 為什麼發生?

既然基準測試分數這麼容易被下一代測試打回原形,這些分數對評估 AI 進展還有意義嗎?

有意義,但意義是局部而非全面的。ARC-AGI-2 從 0% 到 92.5% 的曲線,確實真實反映了「靜態抽象推理能力」這個特定切面上的進步——這不是灌水或造假,而是模型在這個明確定義的任務類型上,能力真的顯著提升了。問題不在於分數本身不可信,而在於「這個分數能代表整體智能」這個推論站不住腳。

比較準確的理解方式是:把每個基準測試都當成一把特定形狀的尺,它能精確測量某個維度,但無法告訴你尺以外的維度發生了什麼。ARC-AGI-2 測的是靜態抽象推理,ARC-AGI-3 測的是互動式探索,兩者分數的落差不是矛盾,而是揭露了「AI 能力」本身是一個多維度的概念,不存在單一數字能完整概括。

02 · 運作原理是什麼?

NVARC 用低成本模型打敗高成本暴力解法這件事,具體透露了什麼訊息?

這件事直接挑戰了一個常見的假設:分數高低直接等於能力高低,而能力提升唯一的路徑就是砸更多算力。NVARC 用一個經過微調的 40 億參數小模型,以遠低於暴力取樣策略的成本,達到具競爭力的準確率,這代表在特定任務類型上,經過針對性優化的小規模系統,可以在效率上超越單純堆疊運算資源的大規模嘗試。

這個發現對算力規模化的敘事提供了一個重要的補充視角:算力規模化能持續帶來能力提升,這個大方向的觀察沒有問題,但這不代表「效率」這個維度可以被忽略——基準測試設計者刻意把單題成本納入評分依據,本身就是在提醒產業,一個只看最高分、不看達成這個分數花了多少資源的評測文化,容易獎勵到工程層面的資源堆疊,而非真正的認知層面突破。

03 · 如何應用

ARC-AGI-3 測的「互動式探索」,跟前面文章提到的 agentic AI(自主代理人)有什麼具體關聯?

關聯非常直接。ARC-AGI-3 刻意不給模型任何說明文字,要求模型透過探索、實驗、試錯去推斷遊戲規則——這正是 agentic AI 在真實世界工作流程裡必須具備的核心能力:面對一個沒有現成腳本、規則要自己摸索出來的新情境,能不能有效率地建立對這個情境的理解、規劃行動、並根據回饋調整策略。ARC-AGI 技術報告裡明確指出,這套測試評估的是「透過探索、模型建構、目標推理與規劃來獲取新技能的效率」,並用相對於人類基準的行動效率來衡量表現,而不只是「有沒有成功」這種二元結果。

這也是為什麼 Gemini 3.1 Pro 在 ARC-AGI-2(靜態推理)逼近人類水準,卻在 ARC-AGI-3(互動探索)只拿到 0.37% 這件事特別值得警惕:如果企業評估某個模型是否適合承擔自主性高的 agentic 工作流程時,只參考它在靜態基準測試上的分數,很可能會嚴重高估這個模型實際處理陌生、需要主動探索情境的能力。

04 · 我該怎麼做?

這種「測試被攻克就換一套更難的測試」的模式會一直持續下去嗎?這對追蹤 AGI 進展的讀者有什麼意義?

從 ARC-AGI 系列的演進軌跡來看,這個模式很可能會持續。ARC-AGI 系列本身在 2022 年就已規劃了演進路徑,ARC-AGI-2 是刻意設計來抵抗前一代測試已知的弱點(例如暴力搜尋、資料污染),ARC-AGI-3 則是刻意把測試軸線從靜態推理切換到互動探索——每一代新測試的設計邏輯,都是針對前一代測試被攻克後暴露出的侷限做出的回應。

對讀者而言,這代表追蹤 AGI 進展時,與其緊盯任何單一基準測試的分數是否「被攻克」,更值得關注的是這整套測試演進背後透露的訊號:如果某個能力維度的測試持續能被相對容易地攻克,這代表現有模型架構在這個維度上已經比較成熟;如果新一代測試又把分數打回接近零,這代表下一個需要突破的能力邊界在哪裡。這種持續尋找「模型還做不到什麼」的過程,本身就是判斷 AGI 距離還有多遠時,比單一分數更有參考價值的訊號。

完整內容 +

ARC-AGI 系列基準測試,是目前少數被廣泛認為能真正檢驗「新穎推理能力」而非「訓練資料裡見過的模式」的評測工具。它的設計者 François Chollet 把這種能力稱為「智能裡唯一真正重要的東西」:不靠檢索、不靠在龐大訓練語料裡做模式比對,而是從極少數範例裡,解出一個全新的抽象視覺謎題。這套邏輯讓 ARC-AGI 系列基準測試的分數曲線,成為觀察 AI 能力進展最戲劇性的案例之一。

ARC-AGI-2:從全數掛零到 92.5%,只花了約十七個月

ARC-AGI-2 於 2025 年 3 月推出時,包括在其他基準測試上表現亮眼、能通過律師考試、產出可用程式碼的前沿模型,在這套新測試上的分數是精確的 0%——不是接近零,是分毫不差的零。這個數字本身就傳遞了一個訊息:這些模型過去展現的能力,跟 ARC-AGI-2 要測的「從最少範例解出全新問題」的能力,是兩件不同的事。

但接下來的進展速度相當驚人。OpenAI 的 GPT-5.2 在 2025 年 12 月率先突破 50% 大關,來到約 54%;到了 2026 年 4 月,多個團隊已經把分數推進到 98% 左右。截至 2026 年 8 月,追蹤機構 BenchLM 的排行榜顯示 GPT-5.6 Sol 以 92.5% 領先,Claude Opus 5(90.4%)、GPT-5.5(85%)緊追在後——對照人類專家小組能達成完全解題、一般人類平均表現約 66% 的基準,這些前沿模型的分數已經明顯超越一般人類水準。

效率門檻:分數不是唯一指標,「怎麼拿到分數」同樣重要

ARC-AGI-2 的設計者刻意加入了一個容易被忽略的觀察角度:單題成本。2025 年的 ARC Prize 競賽裡,NVARC 團隊用一個經過微調的 40 億參數小模型,以每題約 0.20 美元的成本拿到 24% 準確率,效率表現超越了每題花費高達 200 美元、透過窮舉式取樣數千個候選答案再過濾的暴力解法。基準測試設計者明確把這種暴力取樣策略視為「一個漏洞,不是一個解答」——因為它反映的是工程層面的資源堆疊,不是認知層面的推理能力提升。這也是為什麼獲獎資格的評測要求參賽者必須公開運算預算與單題成本,避免分數被純粹的算力堆疊灌水。

ARC-AGI-3:分數才剛被攻克,難度軸線立刻切換

就在 ARC-AGI-2 的分數快速逼近飽和的同時,設計團隊已經在 2026 年 3 月 25 日於 Y Combinator 總部發布了 ARC-AGI-3——這是第一個完全互動式的基準測試:不給任何說明文字,模型必須靠探索、實驗、試錯來推斷遊戲規則,考驗的是「透過探索取得新技能的效率」,而不是靜態的抽象推理。結果相當令人清醒:當時最強的前沿模型 Gemini 3.1 Pro 在 ARC-AGI-3 上只拿到 0.37%。剛剛才在 ARC-AGI-2 上逼近人類水準的模型,換到一個測試「主動探索」而非「被動推理」的情境裡,幾乎又被打回了原點。

這跟你的錢有什麼關係

對於評估 AI 產業進展速度的讀者而言,ARC-AGI 系列基準測試的完整軌跡提供了一個重要的校準框架:任何單一基準測試的分數,都只反映了它刻意設計要測量的那個能力切面,而不是「智能」本身的完整樣貌。ARC-AGI-2 的分數從 0% 衝到 92.5%,看起來像是能力的爆發性成長,但緊接著推出的 ARC-AGI-3 立刻證明,靜態抽象推理的進步,跟互動式探索能力的進步,是兩條幾乎獨立的曲線。這對評估企業導入 agentic AI(需要主動探索、規劃、適應的自主系統)的可行性尤其重要——如果只看模型在靜態基準測試上的高分就假設它已經具備自主應對新情境的能力,很可能會高估目前系統的實際可靠度。基準測試設計者刻意保留「未飽和」的測試軸線,本身就是一種提醒:任何看起來已經被攻克的分數,背後可能還藏著一整條尚未被測量的能力維度。

圖解
ARC-AGI-2 分數攀升,ARC-AGI-3 立即歸零折線圖顯示 ARC-AGI-2 分數從 2025 年 3 月的 0% 快速攀升至 2026 年 4 月的約 98%,同時標示 ARC-AGI-3 於 2026 年 3 月推出時前沿模型僅拿到 0.37%ARC-AGI-2 Rises, ARC-AGI-3 Resets0%100%Mar 20250%Dec 202554%Apr 2026~98%ARC-AGI-2 (static reasoning)Mar 20260.37%ARC-AGI-3(interactive)AGI Bible · agi-bible.com
歡迎截圖分享,轉載請註明來源
提問
請至少輸入 10 個字
相關文章
AGI 到底還要幾年?實驗室執行長跟學界研究者,看的是同一份證據卻得出完全相反的答案
perspectives · 08/13
AI 能自主工作多久?METR 時間視野指標半年翻倍,但這個數字比看起來複雜
milestones · 08/13
AI 到底搶走了多少工作?2026 年的數據跟新聞標題講的不太一樣
industry-impact · 08/13
AI 會不會「裝乖」?Apollo Research 與 OpenAI 的策略性欺騙評測實際發現了什麼
risk-alignment · 08/13
更多相關主題