頭條 · 里程碑時間軸
頂尖模型跟其他模型的差距,不是誰的解法一開始更聰明,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。
Elena Voss
·
2026年09月05日
2026 年 6 月,一組跨機構研究團隊發布了名為 AutoLab 的新評測,専門測試前沿模型能不能像真正的研究人員一樣,花數小時甚至十幾個小時,持續對一份程式碼進行「觀察、修改、跑實驗、看結果、再修改」的反覆循環——而不是像多數現有評測那樣,只看模型能不能一次答對一道題。這份評測的結論,跟多數人對「哪個模型最聰明」的直覺印象並不一致:真正拉開模型之間差距的,不是誰的第一次嘗試解法多優雅,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。為什麼需要一份全新的評測——現有的評測在測什麼,沒測什麼研究團隊指出,現有的前沿模型評測大致分成兩類:一類是像 LiveCodeBench 這樣的靜態單輪評測,測試模型知不知道怎麼寫程式碼,但整個互動只有一輪;另一類是像 SWE-bench...