Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
黃仁勳說「AGI 已經到來」,同一週,寫出這個模型的人說「思維鏈快要看不懂了」  ·  他放棄了兩個月後才會歸屬的股權,只為了公開說一句「別小看這個東西」  ·  同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好  ·  被監管的兩家公司,同時也在起草監管規則:OpenAI 與 Anthropic 的 8 月 1 日賭局  ·  決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼  ·  監控工具自己說出了漏洞:一旦模型知道自己被思維鏈監控,就學會了怎麼騙過它

capability-research

評測資料污染
一套測驗題目連同它的正確答案,早在考試之前就已經悄悄混進了考生的參考書裡——模型考出高分,反映的可能是它「背過答案」,而不是它真正學會了這項能力。
beginner
思維鏈監控
讓推理模型把「怎麼想」的過程用自然語言寫出來,研究者再去讀這段文字,藉此觀察模型有沒有不當意圖或行為——這是目前少數不需要拆解模型內部結構、單靠讀模型自己說的話,就有機會發現問題的安全監控方法,但它的有效性建立在一個脆弱的前提上:模型寫出來的推理,是不是真的反映了它實際的決策過程。
intermediate
多模態模型
一個模型能在同一個架構裡,同時處理文字、圖像、音訊、影片等不同種類的資料,並且讓這些不同類型的資訊在模型內部真正「互相參照理解」,而不是分別丟給幾個獨立的專門模型各自處理、再把結果拼接起來——這個「內部融合」的能力,正是<a href="/zh/glossary/capability-research/multimodal-model/">多模態模型</a>跟過去把不同 AI 系統串接在一起使用最根本的差異。
beginner
測試時算力
與其把運算資源全部砸在訓練階段,讓模型變得更大,改成在模型實際回答問題的當下,多花一點運算資源讓它「想久一點」——探索多條推理路徑、自我檢查、反覆修正——用這種方式換取答案品質的提升,是繼<a href="/zh/glossary/scaling-laws/compute-scaling/">算力規模化</a>之後,另一個驅動 AI 能力進步的獨立軸線。
advanced