Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
AI 會不會「裝乖」?Apollo Research 與 OpenAI 的策略性欺騙評測實際發現了什麼  ·  AI 能自主工作多久?METR 時間視野指標半年翻倍,但這個數字比看起來複雜  ·  全球 AI 監管三分天下:2026 年歐盟、美國、中國各自走上了哪條路  ·  從 0% 到 92.5%,再被打回 0.37%:ARC-AGI 基準測試揭露的「進步」是哪一種進步  ·  AI 到底搶走了多少工作?2026 年的數據跟新聞標題講的不太一樣  ·  AGI 到底還要幾年?實驗室執行長跟學界研究者,看的是同一份證據卻得出完全相反的答案
名詞解析 · capability-research

Test-Time Compute

測試時算力
capability-research advanced

30 秒版 · 給沒耐心的人
與其把運算資源全部砸在訓練階段,讓模型變得更大,改成在模型實際回答問題的當下,多花一點運算資源讓它「想久一點」——探索多條推理路徑、自我檢查、反覆修正——用這種方式換取答案品質的提升,是繼<a href="/zh/glossary/scaling-laws/compute-scaling/">算力規模化</a>之後,另一個驅動 AI 能力進步的獨立軸線。
完整解說 +
01 · 這是什麼?

測試時算力是什麼,跟算力規模化有什麼不同?

算力規模化談的是「訓練階段」投入多少運算資源——放大模型參數量、訓練資料量、訓練用的運算量,換取模型訓練完成後的整體能力提升;測試時算力談的則是完全不同的階段:模型訓練完成、已經部署上線之後,「回答一個具體問題的當下」要花多少運算資源。

具體來說,測試時算力包含幾種常見手法:讓模型生成更長的思維鏈、一次生成多條不同的推理路徑再挑出最好的一條(例如 best-of-N 取樣)、用搜尋演算法(如蒙地卡羅樹搜尋)系統性探索解答空間、或是讓模型對自己先前的輸出進行自我批評與修正。這些方法的共同點是:不改變模型本身的參數,純粹透過「回答問題時多花點運算力氣」來換取更高品質的答案——這也是為什麼具備這種能力的模型常被稱為「推理模型」(reasoning model)。

02 · 為什麼存在?

為什麼測試時算力重要,它解決了算力規模化解決不了的什麼問題?

算力規模化的邏輯有一個現實限制:預訓練階段能取得的高品質人類資料量本身是有限的,當資料量趨近瓶頸,單純繼續放大模型規模帶來的邊際效益會開始遞減。測試時算力提供了一條互補的路徑:與其繼續在訓練階段砸更多資源,不如把部分運算預算挪到推理階段,讓模型在回答每個具體問題時能有更多機會「想清楚」。

這個路徑之所以重要,是因為它揭示了一個此前被低估的現象:同一個模型,如果被允許在推理時花更多運算資源思考,表現往往能大幅提升,甚至讓相對較小的模型在特定任務上逼近、甚至超越規模大上許多的模型的表現。這代表「模型多大」跟「模型多聰明」之間,多了一個可以獨立調節的槓桿——這也是為什麼測試時算力常被視為跟參數規模、訓練算力並列的第三條能力擴展軸線。

03 · 如何影響你的決策?

測試時算力具體怎麼運作,目前有哪些驗證過的實際案例?

測試時算力的技術路線大致分成兩類:「序列式」方法讓模型透過訓練學會自我反思與驗證,逐步修正推理過程;「平行式」方法則同時生成多個候選答案,再用驗證機制(例如另一個獎勵模型)挑出最佳解——最簡單的平行式作法是生成大量候選答案後,直接選出出現頻率最高的那個。

2025 年 1 月,DeepSeek 發布的 R1 模型提供了一個被廣泛引用的實證案例:這個模型純粹透過強化學習訓練出推理能力,在生成的 token 數量比一般模型多出 10 到 100 倍的情況下,達到了跟 OpenAI o1 相近的表現,證明了測試時算力路線本身可以獨立成為一條有效的能力提升途徑,不完全依賴預訓練規模的持續擴張。這類推理模型帶來的效果也反映在具體基準測試上:SWE-bench 的程式解題成功率一年內從 4.4% 衝到 71.7%,Google DeepMind 的 Gemini Deep Think 在 2025 年國際數學奧林匹亞(IMO)拿到金牌等級的成績(42 題中對 35 題)。

04 · 你該怎麼辦?

測試時算力對讀者理解 AI 產業新聞有什麼幫助?

每當看到「這個新模型在某個困難任務上表現大幅提升」這類新聞,測試時算力提供了一個重要的解讀角度:這個提升,是來自模型本身變得更大、訓練資料更多(算力規模化路線),還是來自模型被允許在回答時花更多運算力氣去想(測試時算力路線)?這兩種路徑背後的成本結構完全不同——後者代表的是每一次回答問題,都要付出更高的即時運算成本與更長的等待時間,而不是一次性的訓練成本。

這個成本結構的轉變,正在重塑整個 AI 基礎建設的投資邏輯:據產業分析估計,到 2026 年,推理階段所需的運算需求可能會超過訓練階段需求達 118 倍,這代表資料中心的投資重心,正從「蓋更大的訓練叢集」逐漸轉向「蓋更多能因應大量即時推理請求的推理叢集」。理解這個轉變,能幫助讀者判斷企業晶片採購策略與資料中心建設新聞背後,反映的是哪一種算力需求在成長。

實際例子 +

DeepSeek 於 2025 年 1 月發布的 R1 模型,純粹透過強化學習訓練出模型的推理能力(不依賴大規模監督式微調),在生成的 token 數量比同類非推理模型多出 10 到 100 倍的情況下,達到了與 OpenAI o1 相近的表現水準,被廣泛視為證明測試時算力路線可獨立產生顯著能力提升的關鍵實證案例。

常見誤解 +
✕ 誤解1
× 誤解:測試時算力只是讓模型「多想一下」,跟真正的能力提升沒有本質差別,實際是:測試時算力已被證實能讓相對較小的模型在特定任務上逼近甚至超越大上許多的模型,代表這是一條獨立、可測量、可優化的能力擴展軸線,不只是表面上的延遲增加
✕ 誤解2
× 誤解:測試時算力會讓推理成本持續下降,因為單位算力成本本身在下降,實際是:雖然單位 token 的運算成本確實在下降,但推理模型單次回答消耗的 token 數量大幅增加,兩者相抵之下,困難任務的單次查詢總成本反而可能上升,這也是為什麼推理階段的整體算力與能源需求持續攀升
這件事跟你有什麼關係 +
直接影響

測試時算力的優點是提供了一條不完全依賴預訓練規模持續擴張的能力提升路徑,讓相對較小的模型也能在特定任務上達到具競爭力的表現;缺點是這個優點是用即時運算成本與回應延遲換來的——困難任務的單次查詢成本可能不降反升,這正在把整個產業的基礎建設投資重心,從訓練叢集轉向推理叢集,也讓「多花算力換一次更好的答案」值不值得,變成一個需要依任務難度、錯誤代價個別權衡的商業決策。

提問
請至少輸入 10 個字