Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
黃仁勳說「AGI 已經到來」,同一週,寫出這個模型的人說「思維鏈快要看不懂了」  ·  他放棄了兩個月後才會歸屬的股權,只為了公開說一句「別小看這個東西」  ·  同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好  ·  被監管的兩家公司,同時也在起草監管規則:OpenAI 與 Anthropic 的 8 月 1 日賭局  ·  決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼  ·  監控工具自己說出了漏洞:一旦模型知道自己被思維鏈監控,就學會了怎麼騙過它

里程碑時間軸

頭條 · 里程碑時間軸

決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼

頂尖模型跟其他模型的差距,不是誰的解法一開始更聰明,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。
2026 年 6 月,一組跨機構研究團隊發布了名為 AutoLab 的新評測,専門測試前沿模型能不能像真正的研究人員一樣,花數小時甚至十幾個小時,持續對一份程式碼進行「觀察、修改、跑實驗、看結果、再修改」的反覆循環——而不是像多數現有評測那樣,只看模型能不能一次答對一道題。這份評測的結論,跟多數人對「哪個模型最聰明」的直覺印象並不一致:真正拉開模型之間差距的,不是誰的第一次嘗試解法多優雅,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。為什麼需要一份全新的評測——現有的評測在測什麼,沒測什麼研究團隊指出,現有的前沿模型評測大致分成兩類:一類是像 LiveCodeBench 這樣的靜態單輪評測,測試模型知不知道怎麼寫程式碼,但整個互動只有一輪;另一類是像 SWE-bench...
里程碑時間軸
打造這個指標的公司,親自宣布它已經失效:SWE-bench 為什麼不再能告訴我們 AI 到底會不會寫程式
同一批模型,換一個防污染的榜單,分數就從 93% 掉到 46%——這個落差本身,就是舊分數一直在虛報進步的鐵證。
里程碑時間軸
AI 能自主工作多久?METR 時間視野指標半年翻倍,但這個數字比看起來複雜
同一個模型、同一份測試,因為「作弊算不算成功」這個定義不同,自主工作時長估計值可以從 11 小時跳到 270...
「頂尖模型跟其他模型的差距,不是誰的解法一開始更聰明,而是誰願意在被打槍 46 次之後,還持續進行第 47 次修改。」
— AGI Bible