評測資料污染是什麼?跟「模型考試作弊」是同一回事嗎?
評測資料污染指的是一套用來衡量模型能力的測驗題目(或這些題目的近似版本、討論內容),意外出現在模型的訓練資料裡,導致模型在評測時的分數被人為墊高,卻無法反映它在真實世界任務上的實際表現。學界對這個概念有兩種定義取徑:一種著重「資訊流向」,關注測驗資料是否真的流入了訓練過程;另一種著重「表現結果」,只要一個模型在某個評測上的分數,明顯高於它在同等難度的參考評測上的表現、且這種落差無法用能力差異解釋,就視為污染的證據,不去糾結污染實際是怎麼發生的。
這跟「模型考試作弊」的直覺說法有微妙但重要的差異:作弊通常暗示某種主動、有意圖的行為,但污染絕大多數情況下是意外發生的——模型的訓練資料來自海量的網路爬蟲文字,題目與答案很可能只是剛好出現在某個公開討論串、某篇部落格文章,或是題目原始資料來源的公開版本庫裡,沒有人刻意把答案「餵」給模型。
為什麼評測資料污染會被視為一個嚴重問題,需要特別提出來討論?
因為 benchmark 分數之所以有意義,前提是研究人員能相信「模型的訓練資料」跟「拿來測試模型的資料」是兩個完全獨立、互不重疊的集合——這個前提一旦被打破,分數就從「衡量能力的溫度計」變成「衡量記憶力的溫度計」,而這兩者代表的意義完全不同:一個懂得舉一反三、能解決全新問題的模型,跟一個只是把訓練時看過的答案原封不動搬出來的模型,在污染的評測上可能拿到一模一樣的高分,但實際部署到真實世界、面對評測集裡沒出現過的新問題時,兩者的表現可能天差地遠。
更麻煩的是,隨著模型能吸收的訓練資料規模越來越龐大,而評測資料集本身通常是公開、且長期存在於網路上的,污染幾乎變成一種難以完全避免的結構性風險,而不是單一模型、單一公司的個別疏失。
污染只有「模型直接背過一模一樣的題目」這一種形式嗎?
不是,研究文獻通常把污染依嚴重程度分成好幾個層級。最直接的一種是「逐字污染」——題目與答案幾乎一字不差地出現在訓練資料裡,模型可以直接複誦出正確答案,這也是最容易被抓到的一種。比較隱蔽的是「近似複製污染」——訓練資料裡出現的不是完全相同的題目,而是高度相似的變體(例如同一類演算法題目在不同教學網站上被反覆改寫),這種情況模型並非精確記住了考題本身,而是透過大量重複曝光學會了某種解題「套路」,通用性遠不如真正理解問題本身。
最難被察覺的則是「間接洩漏」——訓練資料裡出現的不是題目本身,而是關於這個評測集的討論、方法論介紹,或是不同模型在這個評測上的分數比較表。這種情況下,即使模型從未見過任何一道原始題目,也可能透過大量接觸「別人怎麼討論這個評測」的資訊,間接獲得某種背景線索,這種污染路徑最難量化,也最容易跟模型單純學到了該領域的正常知識混在一起、難以區分。
一般讀者不是研究人員,看到某個模型的評測分數,該怎麼判斷這個分數是不是被污染撐高的?
可以留意幾個相對容易查證的間接線索。第一,這個評測集發布至今已經多久——發布時間越久、越廣為人知,污染機率通常越高,一個剛推出、題庫還沒被大量討論的評測,相對更值得信任。第二,這家公司或第三方是否針對這個評測分數做過污染測試並公開結果——願意主動揭露污染風險的做法,本身就是一個正面訊號。第三,比較同一個模型在「傳統公開評測」與「有明確抗污染設計的評測」(例如依發布日期動態篩選題目、或完全私有命題的評測)上的分數落差——如果落差很大,代表傳統評測的分數參考價值有限;如果落差不大,則相對能提高對這個分數的信任度。
OpenAI 在 2026 年 2 月的分析中,設計了一套自動化紅隊測試,讓 GPT-5 只給模型片段線索去「套話」GPT-5.2、Claude Opus 4.5、Gemini 3 Flash Preview。結果 GPT-5.2 僅憑一句片段問題描述,就完整複誦出正確的程式碼修改與精確函式名稱;Claude Opus 4.5 甚至一字不差引用出原始 pull request 裡的程式碼註解;Gemini 3 Flash 則連題目描述都能逐字背出——三家公司、三個不同模型,全部被抓到看過同一批 SWE-bench Verified 題目的正確答案,這正是 OpenAI 隨後宣布停止報告該榜單分數的直接原因。