Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好  ·  被監管的兩家公司,同時也在起草監管規則:OpenAI 與 Anthropic 的 8 月 1 日賭局  ·  決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼  ·  監控工具自己說出了漏洞:一旦模型知道自己被思維鏈監控,就學會了怎麼騙過它  ·  為什麼監管機構盯上的不是演算法,而是晶片:算力治理如何成為 2026 年 AI 監管的真正槓桿  ·  打造這個指標的公司,親自宣布它已經失效:SWE-bench 為什麼不再能告訴我們 AI 到底會不會寫程式
milestones

決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼

30 秒速讀
頂尖模型跟其他模型的差距,不是誰的解法一開始更聰明,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。

完整解析 +
01 · 為什麼發生?

AutoLab 跟大家熟悉的 SWE-bench 或 LiveCodeBench,本質上有什麼不同?

最核心的差異在於任務的時間跨度與互動性質。LiveCodeBench 這類靜態評測本質上是「一次性作答」:給模型一個題目,看它能不能一次寫出正確答案,整個過程沒有來回互動。SWE-bench 這類評測往前推進了一步,允許模型多輪操作、閱讀錯誤訊息、修改程式碼,但整個任務通常在幾分鐘到半小時內就會結束,比較接近「修一個明確定義的 bug」。

AutoLab 測的是完全不同量級的能力:模型拿到的不是一個需要「修對」的明確錯誤,而是一份「能跑但還很糟」的基準實作,任務目標是持續優化,時間預算長達數小時甚至十幾個小時。這代表模型必須自己決定「現在該往哪個方向探索、什麼時候該放棄某個嘗試、時間預算該怎麼分配」,這些決策在短時程評測裡幾乎不會出現,卻是真實世界研究與工程工作裡最核心的部分。

02 · 運作原理是什麼?

為什麼「智能體工具介面」(agent harness)這個變因值得被特別提出來討論?

因為它揭露了一個過去經常被忽略的評測盲點:模型的分數不完全只反映模型本身的能力,也反映了模型與環境互動時所使用的操作框架設計得好不好。AutoLab 團隊的實驗顯示,把同一批模型換一套原本設計給「一次性補丁編輯」用途的工具介面重新測試,模型會傾向提早提交、放棄繼續優化,導致分數明顯下滑——但這個分數下滑跟模型本身的能力毫無關係,純粹是工具介面跟任務性質不匹配造成的。

這個發現的意義在於:如果一份長時程評測的排行榜沒有公開說明使用了哪一套工具介面、介面本身有沒有做過妥善的任務適配,那麼看到某個模型分數偏低,就不能直接推論這個模型「不擅長長時程任務」,也可能只是工具介面拖累了它。這也是為什麼 AutoLab 團隊特別強調,未來的長時程評測應該把工具介面的選擇與設計,當成跟模型能力同等重要的變因來公開揭露。

03 · 如何應用

「頭對頭優勢率」(Dominance)這個指標,跟一般常見的平均分數有什麼不同,為什麼要額外設計這個指標?

平均分數(Avg@3)反映的是一個模型在所有任務上的絕對表現水準,但這個數字容易被少數幾個特別極端的任務(例如某個模型剛好在某一題完全解不出來、拿到 0 分)拖累或墊高,也難以直接看出「這個模型面對其他對手時,實際勝率有多高」。

頭對頭優勢率換了一個角度衡量:針對每一個任務,直接比較某個模型的分數是否勝過其他每一個模型,勝就記 1 分、平手記 0.5 分,再把所有任務、所有對手的結果平均起來。這個指標的好處是對硬體效能落差、單一任務評分設計差異相對不敏感,能提供一種比賽淘汰賽式的視角,也比較不容易被少數幾個高槓桿任務(表現差異特別劇烈的任務)過度影響整體排名。claude-opus-4.6 在整體優勢率拿到 0.93,代表它幾乎在所有任務、面對所有對手時都佔優勢,這比單看平均分數 0.68 更直觀地說明了它的領先幅度。

04 · 我該怎麼做?

一般讀者不會親自跑這類評測,這份研究對日常判斷 AI 產品有什麼實際幫助?

最直接的幫助是重新校正一個常見的誤解:看到某個模型在編程評測排行榜上分數很高,不代表這個模型就適合用來處理需要長時間自主工作的任務(例如讓 AI 代理長時間跑一個研究專案、或自動優化一套系統)。這份研究說明了「一次答對」的能力跟「持續迭代到把事情做好」的能力,是兩種需要分開評估的獨立能力,市面上多數產品宣傳引用的分數,通常只涵蓋前者。

實務上,如果正在評估一個標榜能「自主完成長時間任務」的 AI 產品或服務,比較值得追問的問題包括:這家公司有沒有公開過模型在長任務中期放棄或提早結束的比例、有沒有揭露評測時使用的工具介面細節、以及該產品是否針對「如何有效分配時間預算」這件事做過特別優化,而不只是簡單地把一個擅長單題作答的模型包裝成能自主工作數小時的產品。

完整內容 +

2026 年 6 月,一組跨機構研究團隊發布了名為 AutoLab 的新評測,専門測試前沿模型能不能像真正的研究人員一樣,花數小時甚至十幾個小時,持續對一份程式碼進行「觀察、修改、跑實驗、看結果、再修改」的反覆循環——而不是像多數現有評測那樣,只看模型能不能一次答對一道題。這份評測的結論,跟多數人對「哪個模型最聰明」的直覺印象並不一致:真正拉開模型之間差距的,不是誰的第一次嘗試解法多優雅,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。

為什麼需要一份全新的評測——現有的評測在測什麼,沒測什麼

研究團隊指出,現有的前沿模型評測大致分成兩類:一類是像 LiveCodeBench 這樣的靜態單輪評測,測試模型知不知道怎麼寫程式碼,但整個互動只有一輪;另一類是像 SWE-bench 這樣的短時程互動評測,模型可以來回操作,但整個任務通常在幾分鐘到半小時內就能結束。真正橫跨數小時、需要模型自己判斷「現在該繼續深挖,還是該換個方向」的長時程封閉迴圈優化任務,此前只有零星幾份評測局部觸及,且大多侷限在單一領域(例如只測 GPU 核心優化,或只測機器學習工程),沒有一份能同時涵蓋多個真實研究與工程領域、且難度設計到「目前最強模型也無法輕鬆刷滿分」的程度。

36 個任務,四個領域,一套刻意設計來抵抗投機取巧的評分機制

AutoLab 由資深研究人員與工程師親自貢獻的 36 個任務組成,橫跨系統優化(15 題,涵蓋 C、Rust、Go、Python 語言下的核心、排序、雜湊、壓縮、加密等底層效能工程)、模型開發(7 題,涵蓋預訓練縮放法則、強化學習後訓練、監督式微調資料篩選等 LLM 開發全流程)、益智與挑戰(10 題,圍繞單一關鍵洞察設計的演算法題)、以及 CUDA(4 題,鎖定加密運算、點雲配準與壓縮的 GPU 核心優化)。每個任務都提供一個「正確但刻意留有優化空間」的基準版本,模型必須在嚴格的時鐘時間預算內(從最小益智題的 2 小時,到端到端 LLM 開發任務的 12 小時不等)持續改進這份程式碼。

研究團隊特別設計了一套抗投機取巧機制:評分用的驗證器對模型完全封閉,模型只能拿到本地評分腳本做開發階段的自我檢查;機器學習類任務額外設有正確性關卡,關卡輸入資料跟開發階段完全不重疊;團隊還專門派出一個「對抗型智能體」,在任務設計階段主動尋找任何可能被投機取巧的漏洞;不該被修改的關鍵檔案則用 SHA 雜湊值鎖定,任何未授權修改立即判定零分。整場評測總共消耗 2544 個時鐘小時與 86 億個 token。

頂尖模型的表現差距,比想像中懸殊

在整體綜合分數(Avg@3,三次獨立測試的平均分)上,claude-opus-4.6 以 0.68 分拿下所有四個子領域的第一名,第二名(依領域輪替,可能是 gemini-3.1-pro 或 kimi-k2.6)落在 0.50 分附近,落差相當明顯。更值得留意的是「頭對頭優勢率」(Dominance,衡量一個模型在所有任務上打贏其他所有模型的比例)這項指標:claude-opus-4.6 在這項指標上拿到 0.93,代表它在絕大多數任務、絕大多數對手面前都佔優勢;相較之下多數其他前沿模型的頭對頭優勢率落在 0.3 到 0.6 之間,包括原本被視為強力競爭者的 gpt-5.4,其頭對頭優勢率僅有 0.39。研究團隊特別指出,多個原本能力不弱的模型(包括 gpt-5.4)之所以在這份評測上表現不佳,原因往往跟「原始寫程式能力不足」無關,而是出在探索沒幾步就提早結束任務,或是把整個時間預算耗光卻沒有繳出一份有效的最終解法。

真正決定分數的變因:不是解法多聰明,是願不願意持續迭代

研究團隊對所有測試軌跡進行了深入分析,包括人工檢視 302 個零分結果,得出這份研究最核心的發現:最終表現跟「智能體第一次嘗試的解法品質」之間的相關性,遠不如跟「智能體在整個過程中反覆進行基準測試、修改程式碼、吸收實驗回饋」這個持續迭代行為之間的相關性。換句話說,一個一開始寫得不夠好、但願意反覆跑測試、根據結果持續修正的模型,最終表現通常會大幅超越一個開局漂亮、卻沒有持續依據實證回饋調整方向的模型。研究團隊將這個現象總結為:長時程優化能力,需要的是「時間感知」與「堅持不懈地進行實證探索」,這是一種無法單純從「模型有多聰明」推論出來、必須額外測量的獨立能力。

連工具介面本身都可能影響分數——連 SWE-bench 都沒有系統性處理的變因

AutoLab 研究團隊還做了一項多數評測都不會做的實驗:用不同的「智能體工具介面」(agent harness,也就是模型與程式碼環境互動時使用的操作框架)重新測試同一批模型,比較 Harbor 框架搭配 terminus-2 智能體(研究團隊的預設組合)跟另外兩套工具介面(mini-swe-agent 與 pi-mono)之間的分數差異。結果顯示,即使是同一個模型,換一套工具介面就可能造成顯著的分數波動——其中一套原本設計給「一次性補丁編輯」使用的工具介面,因為不適合這種需要持續迭代的優化任務,導致模型傾向過早提交、放棄繼續優化。這代表評測分數不只受模型本身能力影響,也受評測時搭配的工具介面設計影響,而這個變因過去經常被當成「無關緊要的實作細節」直接忽略。

這跟你的錢有什麼關係

對於評估 AI 相關投資或選擇 AI 工具的讀者而言,這份研究最直接的啟示是:如果你關心的是模型能不能勝任真正需要長時間自主工作的任務(例如自動化研究、系統優化、複雜工程專案),單看該模型在傳統一次性編程評測(如 SWE-bench)上的分數,參考價值相當有限,因為那類評測測的是完全不同的能力面向。更值得留意的訊號是:這家公司是否公開揭露模型在長時程任務中的行為模式(例如有沒有提早放棄的傾向、能不能有效分配時間預算),以及該公司選用的評測工具介面設計是否公開透明、能否被第三方複現——工具介面本身既然能顯著影響分數,那麼一份未公開工具介面細節的長時程評測分數,可信度就必須打上折扣。

資料來源:AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks? — arXivLong-horizon AI agents: the end of the two-week sprint — LovexTask-Completion Time Horizons of Frontier AI Models — METR
圖解
平均分數與頭對頭優勢率的落差claude-opus-4.6 的平均分數領先幅度看似溫和(0.68 vs 0.50),但頭對頭優勢率的差距(0.93 vs 0.39)揭露了實際領先幅度遠比想像懸殊AutoLab: Overall Score vs Head-to-Head Dominance0.00.250.500.750.68Avg@30.93Dominanceclaude-opus-4.60.50Avg@30.39Dominancegpt-5.4source: AutoLab, arXiv 2606.05080AGI Bible · agi-bible.com
歡迎截圖分享,轉載請註明來源
提問
請至少輸入 10 個字
相關文章
打造這個指標的公司,親自宣布它已經失效:SWE-bench 為什麼不再能告訴我們 AI 到底會不會寫程式
milestones · 09/02
AI 能自主工作多久?METR 時間視野指標半年翻倍,但這個數字比看起來複雜
milestones · 08/13
同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好
benchmarks · 09/05
被監管的兩家公司,同時也在起草監管規則:OpenAI 與 Anthropic 的 8 月 1 日賭局
regulation · 09/05
更多相關主題