算力規模化是什麼,跟一般理解的「AI 變聰明」有什麼不同?
算力規模化指的是一個經過大量實證觀察得出的規律:如果把訓練一個 AI 模型所用的運算量(用 FLOP,浮點運算次數計算)、資料量、模型參數量同步放大,模型在各種任務上的表現往往會沿著一條可預測的曲線持續提升——這條曲線被稱為「規模定律」(scaling laws)。
這跟直覺上「工程師想出更聰明的演算法讓 AI 變強」不同。規模化強調的重點反而是:即使演算法架構大致不變,光是把算力、資料、參數量這三個維度同時放大,就能穩定帶來能力提升,而且提升幅度在放大之前就能相當準確地預測出來——這也是為什麼各大實驗室願意投入數十億美元蓋資料中心,賭的正是這條曲線會持續有效。
算力規模化為什麼重要,它解決了 AI 研究的什麼問題?
在規模定律被系統性驗證之前,AI 研究長期依賴的是「巧思」:研究者手動設計特徵、調整架構、發明新的訓練技巧,進展速度取決於少數人的創意突破,難以預測、難以規劃投資。
規模定律的出現把這個問題轉化成一個工程和資本問題:只要你知道規模定律的曲線形狀,就可以合理預測「投入 X 倍算力,大概能得到 Y 幅度的能力提升」,這讓 AI 開發從「賭巧思」變成「賭基礎建設」——只要有足夠的資金蓋資料中心、取得晶片、取得電力,就有相對確定的路徑讓模型變強。這正是過去幾年 AI 產業資本支出爆炸性成長的核心原因。
算力規模化具體怎麼運作,最近有哪些新發展或爭議?
根據 Epoch AI 等研究機構的追蹤,前沿語言模型的訓練算力自 2020 年以來大約以每年 5 倍的速度成長,換算下來大約每 5.2 個月就翻一倍——這個成長速度遠超過摩爾定律描述的硬體效能提升速度,代表產業同時也在大量增加投入的資金與晶片數量,而不只是等硬體變快。
不過 2024 年底到 2025 年,出現過一波「規模化是否已經失效」的爭議:部分實驗室的大型預訓練模型(例如某代 GPT 模型)表現不如預期,一度讓業界懷疑單純放大預訓練規模的報酬正在遞減。但後續分析指出,這比較像是暫時性的物理與經濟限制(資料中心蓋設速度跟不上、晶片供給吃緊),而不是規模定律本身失效——後續世代的模型仍延續了原本的規模化曲線,顯示「規模化已死」的說法為時過早。
算力規模化對一般讀者有什麼影響,該從哪個角度理解相關新聞?
每當看到「某實驗室砸下數十億美元蓋新資料中心」「某國宣布投入巨額算力補貼」這類新聞,背後邏輯往往就是算力規模化:只要規模定律持續有效,誰能取得更多算力,誰就更有機會取得能力領先地位,這也是為什麼算力(以及背後的晶片、電力、資本)逐漸被視為堪比石油的戰略資源,各國政府開始把晶片出口管制、資料中心用電當成國安層級的政策議題。
對讀者而言,理解算力規模化的意義在於:判斷一則「AI 突破」新聞的可信度時,可以多問一句「這個進步主要來自演算法創新,還是純粹砸更多算力換來的」——這兩種進步路徑代表的護城河和可複製性完全不同,前者代表某個團隊有特殊技術優勢,後者則代表誰有錢誰就能追上。
研究機構 Epoch AI 追蹤資料顯示,前沿語言模型的訓練算力自 2020 年以來大約以每年 5 倍的速度成長,等同每 5.2 個月翻一倍;2023 年最大公開揭露算力預算的模型 Inflection-2 用了約 10^25 FLOP,相較 2010 年代表性模型平均約 10^15 FLOP 的算力,十年間成長了約百億倍。
算力規模化的優點是提供了一條相對可預測、可規劃投資的能力提升路徑,讓 AI 產業能用資本支出而非純創意突破推動進展;缺點是門檻極高、贏家集中——只有能取得數十億美元資本與大規模晶片供應鏈的少數玩家能參與這場競賽,也讓算力供給(進而是晶片與能源)成為地緣政治角力的焦點。