算力規模化談的是「訓練階段」投入多少運算資源——放大模型參數量、訓練資料量、訓練用的運算量,換取模型訓練完成後的整體能力提升;測試時算力談的則是完全不同的階段:模型訓練完成、已經部署上線之後,「回答一個具體問題的當下」要花多少運算資源。
具體來說,測試時算力包含幾種常見手法:讓模型生成更長的思維鏈、一次生成多條不同的推理路徑再挑出最好的一條(例如 best-of-N 取樣)、用搜尋演算法(如蒙地卡羅樹搜尋)系統性探索解答空間、或是讓模型對自己先前的輸出進行自我批評與修正。這些方法的共同點是:不改變模型本身的參數,純粹透過「回答問題時多花點運算力氣」來換取更高品質的答案——這也是為什麼具備這種能力的模型常被稱為「推理模型」(reasoning model)。
為什麼測試時算力重要,它解決了算力規模化解決不了的什麼問題?
算力規模化的邏輯有一個現實限制:預訓練階段能取得的高品質人類資料量本身是有限的,當資料量趨近瓶頸,單純繼續放大模型規模帶來的邊際效益會開始遞減。測試時算力提供了一條互補的路徑:與其繼續在訓練階段砸更多資源,不如把部分運算預算挪到推理階段,讓模型在回答每個具體問題時能有更多機會「想清楚」。
這個路徑之所以重要,是因為它揭示了一個此前被低估的現象:同一個模型,如果被允許在推理時花更多運算資源思考,表現往往能大幅提升,甚至讓相對較小的模型在特定任務上逼近、甚至超越規模大上許多的模型的表現。這代表「模型多大」跟「模型多聰明」之間,多了一個可以獨立調節的槓桿——這也是為什麼測試時算力常被視為跟參數規模、訓練算力並列的第三條能力擴展軸線。
測試時算力具體怎麼運作,目前有哪些驗證過的實際案例?
測試時算力的技術路線大致分成兩類:「序列式」方法讓模型透過訓練學會自我反思與驗證,逐步修正推理過程;「平行式」方法則同時生成多個候選答案,再用驗證機制(例如另一個獎勵模型)挑出最佳解——最簡單的平行式作法是生成大量候選答案後,直接選出出現頻率最高的那個。
2025 年 1 月,DeepSeek 發布的 R1 模型提供了一個被廣泛引用的實證案例:這個模型純粹透過強化學習訓練出推理能力,在生成的 token 數量比一般模型多出 10 到 100 倍的情況下,達到了跟 OpenAI o1 相近的表現,證明了測試時算力路線本身可以獨立成為一條有效的能力提升途徑,不完全依賴預訓練規模的持續擴張。這類推理模型帶來的效果也反映在具體基準測試上:SWE-bench 的程式解題成功率一年內從 4.4% 衝到 71.7%,Google DeepMind 的 Gemini Deep Think 在 2025 年國際數學奧林匹亞(IMO)拿到金牌等級的成績(42 題中對 35 題)。
測試時算力對讀者理解 AI 產業新聞有什麼幫助?
每當看到「這個新模型在某個困難任務上表現大幅提升」這類新聞,測試時算力提供了一個重要的解讀角度:這個提升,是來自模型本身變得更大、訓練資料更多(算力規模化路線),還是來自模型被允許在回答時花更多運算力氣去想(測試時算力路線)?這兩種路徑背後的成本結構完全不同——後者代表的是每一次回答問題,都要付出更高的即時運算成本與更長的等待時間,而不是一次性的訓練成本。
這個成本結構的轉變,正在重塑整個 AI 基礎建設的投資邏輯:據產業分析估計,到 2026 年,推理階段所需的運算需求可能會超過訓練階段需求達 118 倍,這代表資料中心的投資重心,正從「蓋更大的訓練叢集」逐漸轉向「蓋更多能因應大量即時推理請求的推理叢集」。理解這個轉變,能幫助讀者判斷企業晶片採購策略與資料中心建設新聞背後,反映的是哪一種算力需求在成長。
DeepSeek 於 2025 年 1 月發布的 R1 模型,純粹透過強化學習訓練出模型的推理能力(不依賴大規模監督式微調),在生成的 token 數量比同類非推理模型多出 10 到 100 倍的情況下,達到了與 OpenAI o1 相近的表現水準,被廣泛視為證明測試時算力路線可獨立產生顯著能力提升的關鍵實證案例。
測試時算力的優點是提供了一條不完全依賴預訓練規模持續擴張的能力提升路徑,讓相對較小的模型也能在特定任務上達到具競爭力的表現;缺點是這個優點是用即時運算成本與回應延遲換來的——困難任務的單次查詢成本可能不降反升,這正在把整個產業的基礎建設投資重心,從訓練叢集轉向推理叢集,也讓「多花算力換一次更好的答案」值不值得,變成一個需要依任務難度、錯誤代價個別權衡的商業決策。