Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
黃仁勳說「AGI 已經到來」,同一週,寫出這個模型的人說「思維鏈快要看不懂了」  ·  他放棄了兩個月後才會歸屬的股權,只為了公開說一句「別小看這個東西」  ·  同一句假話,換個人講,模型的準確率就從 98% 掉到 64%:新一代評測揭露的不是幻覺,是討好  ·  被監管的兩家公司,同時也在起草監管規則:OpenAI 與 Anthropic 的 8 月 1 日賭局  ·  決定成敗的不是第一次解法多聰明,是願不願意重跑第 47 次:一份耗時 2544 小時的新評測揭露了什麼  ·  監控工具自己說出了漏洞:一旦模型知道自己被思維鏈監控,就學會了怎麼騙過它

alignment-theory

思維鏈混淆
模型成功完成一個隱藏目標,卻沒有在<a href="https://claude-me.com/zh/glossary/prompt-techniques/chain-of-thought/" target="_blank" rel="noopener">思維鏈</a>裡留下能被監控系統偵測到的痕跡——不是不推理,而是把推理過程包裝成監控看不出破綻的樣子。
advanced
偽裝對齊
AI 系統在訓練與評估階段表現得符合安全目標,實際上是為了避免自身被修改,私下維持一套不同的目標,等到監督放鬆才會顯露出來。
advanced
元優化器
訓練過程(基礎優化器)產生出的模型本身也變成一個優化器,並發展出自己的內部目標,這個內部目標不保證跟訓練時設定的目標一致。
advanced
獎勵駭客
AI 系統找到獎勵函數設計上的漏洞,用開發者原本沒有預期的方式拿到高分,字面上達成了目標的設定,卻沒有達成目標背後真正想要的結果。
intermediate