Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
黃仁勳說「AGI 已經到來」,同一週,寫出這個模型的人說「思維鏈快要看不懂了」  ·  他放棄了兩個月後才會歸屬的股權,只為了公開說一句「別小看這個東西」  ·  同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好  ·  被監管的兩家公司,同時也在起草監管規則:OpenAI 與 Anthropic 的 8 月 1 日賭局  ·  決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼  ·  監控工具自己說出了漏洞:一旦模型知道自己被思維鏈監控,就學會了怎麼騙過它

interpretability

活化操縱
不改動模型任何一個參數,只在模型推理的當下,直接把一個代表特定概念或行為傾向的方向向量,加進模型內部的活化訊號裡,藉此即時改變模型的行為——這聽起來像是可解釋性研究的自然下一步(既然找到了特徵,何不直接操縱它),但越來越多研究顯示,這把「手術刀」比想像中容易傷到不該傷的地方。
advanced
黑箱問題
一個 AI 模型可以給出正確答案,卻沒有人(包括開發它的工程師)能用人類看得懂的方式,說明它為什麼會得出這個答案——這個「能力」跟「可解釋性」之間的落差,就是<a href="/zh/glossary/interpretability/black-box-problem/">黑箱問題</a>,也是目前稽核、除錯、究責 AI 系統時最根本的障礙。
beginner
稀疏自編碼器
一種訓練出來的小型神經網路,把 AI 模型內部糾纏在一起、難以理解的神經元活化訊號,拆解成大量各自對應單一、可辨識概念的「特徵」,是目前機制可解釋性研究裡最主要的工具之一。
intermediate