規模定律(Scaling Laws)具體是指什麼?跟「模型越大越好」是同一件事嗎?
規模定律是一個可以量化預測的數學關係,不是「越大越好」這種模糊直覺。2020 年 OpenAI 的 Kaplan 論文證明,只要固定模型架構,損失值會隨著參數量、資料量、訓練算力的增加,呈現可預測的冪律下降——也就是說,你可以在訓練前就大致算出「投入這麼多算力,能換到多少效能提升」。
這跟「越大越好」的差別在於:規模定律從一開始就內建了「報酬遞減」——冪律曲線在對數座標上看起來是直線,但換算回線性座標,其實是早期漲得快、後期漲得慢的曲線。規模定律從來沒有承諾效能會無限線性提升,它只是讓「報酬遞減的速度」變得可預測。
業界為什麼要發明「測試時算力」這個新方向?直接繼續加大模型不行嗎?
直接加大模型當然可以繼續做,但邊際效益已經明顯下降——這是「資料牆」造成的硬限制。要用業界公認的最適比例(Chinchilla-optimal,大約每個參數配 20 個訓練 token)訓練一個一兆參數的模型,需要大約二十兆 token 的訓練資料,而網路上公認的高品質文字資料總量,估計就落在十兆到五十兆 token 之間——換句話說,繼續單純加大模型,很快就會撞上「沒有足夠乾淨資料可以餵」的物理上限,不是砸更多錢就能解決。
測試時算力提供了另一條路:與其在訓練階段一次性砸入天量算力換取一個更大的固定模型,不如讓算力分散到每一次推論——模型在回答問題的當下多花幾秒鐘做推理,用可調節的方式換取準確度,而且這條路目前還沒有明顯撞到資料量的天花板。
GPT-4.5 下架這件事,具體上是怎麼發生的?跟規模定律撞牆有什麼直接關係?
GPT-4.5(內部代號 Orion)於 2025 年 2 月上線,是 OpenAI 當時訓練資料與算力規模最大的非推理型模型,在事實準確度等基準測試上確實優於前代 GPT-4o。但它的推論定價高達每百萬 token 輸入 75 美元、輸出 150 美元,是後續推出的 GPT-4.1(每百萬 token 輸入 2 美元、輸出 8 美元)的約 38 倍。OpenAI 在推出 GPT-4.1 的同一天,宣布 GPT-4.5 將於 2025 年 7 月 14 日從 API 下架,距離上線僅四個半月,是 OpenAI 商業史上生命週期最短的模型。
這個案例之所以常被拿來當規模定律撞牆的代表性例子,是因為它精準示範了「技術指標提升」跟「商業上划算」是兩件事——GPT-4.5 確實透過砸更多算力換到了可量測的效能提升,但這個提升幅度,撐不起同等幅度的推論成本,市場最終用腳投票,選了效能相近但便宜 38 倍的替代方案。
這場「規模定律撞牆」的辯論,跟一般讀者理解 AGI 進展速度有什麼關係?
如果你是透過媒體標題在追蹤「AGI 還有多久到來」,這場辯論提醒你一件事:算力投入的「總量」持續增加,不等於「單一維度的效能提升速度」也持續加快。近兩年訓練階段的規模定律曲線確實在變平,但這不代表 AI 整體進展停滯——業界只是把資源分散到多個獨立軸線(訓練規模、資料效率、測試時推理、後訓練技術),單一軸線變慢,不等於整體變慢,但也不等於整體一定加速,這中間有很大的判斷空間。
對讀者而言,比較務實的判斷方式是:不要只看「這家實驗室訓練了多大的模型」這種單一指標的宣傳,而是留意這家實驗室是否同時在多個軸線上都有紮實進展——如果一家公司只能靠「模型變更大」這一招來製造話題,反而是規模報酬遞減下相對脆弱的訊號。
過去十年,AI 實驗室有一套幾乎萬用的公式:模型做大一點、資料餵多一點、算力砸多一點,效能就會可預期地變好。這個規律被稱為規模定律(Scaling Laws)——2020 年 OpenAI 的 Kaplan 論文首次系統性證明,只要固定架構,損失值會隨著參數量、資料量、訓練算力呈現可預測的冪律下降。這個發現讓算力投資變成一門可以精算的生意,而不是憑直覺賭一把。
問題是,這條曲線在近兩年明顯變平。多篇 2026 年發表的分析指出,把訓練算力翻倍所帶來的效能提升,已經明顯不如上一次翻倍時那麼多——這正是規模定律圖上「冪律」的必然結果:在線性座標上,冪律曲線一開始漲得又快又猛,之後會迅速趨緩,愈到後面每多投入一倍算力,換到的進步愈少。業界最常被引用的案例是 OpenAI 的 GPT-4.5:這款模型使用了比前代更多的訓練資料與算力,在事實準確度等指標上確實有提升,卻在上線僅四個半月後就從 API 下架,原因是推論成本過高、實際效益追不上運算開銷。OpenAI 首席科學家 Ilya Sutskever 在 2024 年底的 NeurIPS 會議上直言「我們所知的預訓練即將終結」,這句話後來被反覆引用,成為業界公開承認曲線變平的分水嶺時刻。
但這不代表算力投資本身失去意義——業界的反應不是恐慌,而是把算力挪去一個新的維度:讓模型在回答問題的當下想久一點,而不是只在訓練階段加碼。這種做法被稱為測試時算力(Test-Time Compute),也就是讓模型生成答案時進行更多推理步驟,用推論階段的算力換取準確度。2024 到 2026 年間,這條新曲線目前看起來還相對陡峭,還沒有明顯出現訓練階段那種迅速趨緩的訊號,這也是為什麼 2026 年資料中心的建設重心,正從單純堆訓練用 GPU,轉向能同時支撐大量即時推論的基礎設施。
研究社群內部對此仍有分歧。一派認為,單軸的暴力堆參數確實已經摸到實際上限——最直接的證據是「資料牆」:要用 Chinchilla 最適比例訓練一個一兆參數模型,大約需要二十兆 token 的訓練資料,而網路上公認高品質的文字資料總量,估計也就落在十兆到五十兆 token 之間,天花板肉眼可見。另一派則指出,規模定律本身沒有失效,失效的只是「單一軸線」的暴力打法——只要把算力拆成訓練、資料、後訓練、測試時推理等多個獨立可疊加的軸線分別優化,整體進步曲線依然能維持陡峭,只是不再只靠「模型變更大」這一招。
如果你在評估 AI 相關的投資或採購決策,「這家公司還在單純比模型參數大小」本身就是一個過時的訊號——真正值得追問的是,這家公司的算力配置策略橫跨了幾個獨立軸線(訓練規模、資料效率、推論時運算、後訓練技術),而不是只押注在其中一項。GPT-4.5 的下架案例也提醒一件事:技術指標變好,不等於商業上划算,一款模型即使在基準測試上創新高,只要推論成本壓不下來,照樣可能撐不過半年就被市場淘汰。