Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
監控工具自己說出了漏洞:一旦模型知道自己被思維鏈監控,就學會了怎麼騙過它  ·  為什麼監管機構盯上的不是演算法,而是晶片:算力治理如何成為 2026 年 AI 監管的真正槓桿  ·  打造這個指標的公司,親自宣布它已經失效:SWE-bench 為什麼不再能告訴我們 AI 到底會不會寫程式  ·  一手說「年底前有 AGI」,一手才凍結訓練:OpenAI 的 Astra 模型與它的資安危機  ·  規模定律撞牆了嗎?2026 年 AI 算力投資從「訓練更大」轉向「想得更久」  ·  晶片不用進中國,一樣能訓練出前沿模型:出口管制擋不住的「遠端存取」漏洞
名詞解析 · capability-research

Benchmark Contamination

評測資料污染
capability-research beginner

30 秒版 · 給沒耐心的人
一套測驗題目連同它的正確答案,早在考試之前就已經悄悄混進了考生的參考書裡——模型考出高分,反映的可能是它「背過答案」,而不是它真正學會了這項能力。
完整解說 +
01 · 這是什麼?

評測資料污染是什麼?跟「模型考試作弊」是同一回事嗎?

評測資料污染指的是一套用來衡量模型能力的測驗題目(或這些題目的近似版本、討論內容),意外出現在模型的訓練資料裡,導致模型在評測時的分數被人為墊高,卻無法反映它在真實世界任務上的實際表現。學界對這個概念有兩種定義取徑:一種著重「資訊流向」,關注測驗資料是否真的流入了訓練過程;另一種著重「表現結果」,只要一個模型在某個評測上的分數,明顯高於它在同等難度的參考評測上的表現、且這種落差無法用能力差異解釋,就視為污染的證據,不去糾結污染實際是怎麼發生的。

這跟「模型考試作弊」的直覺說法有微妙但重要的差異:作弊通常暗示某種主動、有意圖的行為,但污染絕大多數情況下是意外發生的——模型的訓練資料來自海量的網路爬蟲文字,題目與答案很可能只是剛好出現在某個公開討論串、某篇部落格文章,或是題目原始資料來源的公開版本庫裡,沒有人刻意把答案「餵」給模型。

02 · 為什麼存在?

為什麼評測資料污染會被視為一個嚴重問題,需要特別提出來討論?

因為 benchmark 分數之所以有意義,前提是研究人員能相信「模型的訓練資料」跟「拿來測試模型的資料」是兩個完全獨立、互不重疊的集合——這個前提一旦被打破,分數就從「衡量能力的溫度計」變成「衡量記憶力的溫度計」,而這兩者代表的意義完全不同:一個懂得舉一反三、能解決全新問題的模型,跟一個只是把訓練時看過的答案原封不動搬出來的模型,在污染的評測上可能拿到一模一樣的高分,但實際部署到真實世界、面對評測集裡沒出現過的新問題時,兩者的表現可能天差地遠。

更麻煩的是,隨著模型能吸收的訓練資料規模越來越龐大,而評測資料集本身通常是公開、且長期存在於網路上的,污染幾乎變成一種難以完全避免的結構性風險,而不是單一模型、單一公司的個別疏失。

03 · 如何影響你的決策?

污染只有「模型直接背過一模一樣的題目」這一種形式嗎?

不是,研究文獻通常把污染依嚴重程度分成好幾個層級。最直接的一種是「逐字污染」——題目與答案幾乎一字不差地出現在訓練資料裡,模型可以直接複誦出正確答案,這也是最容易被抓到的一種。比較隱蔽的是「近似複製污染」——訓練資料裡出現的不是完全相同的題目,而是高度相似的變體(例如同一類演算法題目在不同教學網站上被反覆改寫),這種情況模型並非精確記住了考題本身,而是透過大量重複曝光學會了某種解題「套路」,通用性遠不如真正理解問題本身。

最難被察覺的則是「間接洩漏」——訓練資料裡出現的不是題目本身,而是關於這個評測集的討論、方法論介紹,或是不同模型在這個評測上的分數比較表。這種情況下,即使模型從未見過任何一道原始題目,也可能透過大量接觸「別人怎麼討論這個評測」的資訊,間接獲得某種背景線索,這種污染路徑最難量化,也最容易跟模型單純學到了該領域的正常知識混在一起、難以區分。

04 · 你該怎麼辦?

一般讀者不是研究人員,看到某個模型的評測分數,該怎麼判斷這個分數是不是被污染撐高的?

可以留意幾個相對容易查證的間接線索。第一,這個評測集發布至今已經多久——發布時間越久、越廣為人知,污染機率通常越高,一個剛推出、題庫還沒被大量討論的評測,相對更值得信任。第二,這家公司或第三方是否針對這個評測分數做過污染測試並公開結果——願意主動揭露污染風險的做法,本身就是一個正面訊號。第三,比較同一個模型在「傳統公開評測」與「有明確抗污染設計的評測」(例如依發布日期動態篩選題目、或完全私有命題的評測)上的分數落差——如果落差很大,代表傳統評測的分數參考價值有限;如果落差不大,則相對能提高對這個分數的信任度。

資料來源:Why SWE-bench Verified no longer measures frontier coding capabilities — OpenAIBenchmark Data Contamination of Large Language Models: A Survey — arXivConStat: Performance-Based Contamination Detection in Large Language Models — arXiv
實際例子 +

OpenAI 在 2026 年 2 月的分析中,設計了一套自動化紅隊測試,讓 GPT-5 只給模型片段線索去「套話」GPT-5.2、Claude Opus 4.5、Gemini 3 Flash Preview。結果 GPT-5.2 僅憑一句片段問題描述,就完整複誦出正確的程式碼修改與精確函式名稱;Claude Opus 4.5 甚至一字不差引用出原始 pull request 裡的程式碼註解;Gemini 3 Flash 則連題目描述都能逐字背出——三家公司、三個不同模型,全部被抓到看過同一批 SWE-bench Verified 題目的正確答案,這正是 OpenAI 隨後宣布停止報告該榜單分數的直接原因。

常見誤解 +
✕ 誤解1
× 誤解:污染只要規模夠大、幾乎整份題目都被背下來才算數,實際是:研究已經證實,即使只有相對小比例的評測資料混入訓練語料,也足以讓分數出現明顯的虛高,不需要整份題庫都外洩才會構成問題——這也是為什麼即使某家公司宣稱「我們只是不小心用了一小部分公開資料」,這種說法本身也不能保證分數沒有受到污染影響。
提問
請至少輸入 10 個字