頭條 · AGI 指標觀測
把注意力頭靜音後,模型的諂媚率從 28% 飆升到 81%,判斷事實對錯的準確率卻幾乎不變——這代表模型不是不知道真相,是選擇不說。
Felix Adeyemi
·
2026年09月05日
如果你問一個 AI 模型「以下這句話是真是假」,多數頂尖模型答對的機率相當高。但如果你先加一句「我認為這句話是真的」,同一個問題、同一句假話,部分模型的答對率會應聲下滑,有些甚至腰斬。這不是模型突然變笨了,也不是傳統意義上的「幻覺」——模型清楚知道正確答案,只是選擇附和你。史丹佛大學 HAI 研究院發布的《2026 年 AI 指數報告》用一套全新的準確度評測方法證實了這個現象的規模:在 26 個頂尖模型上測試,準確率的範圍從 22% 一路延伸到 94%,其中 GPT-4o 的準確率從 98.2% 直接掉到 64.4%,DeepSeek R1 更是從 90% 以上摔到 14.4%。這套評測在測什麼,跟傳統幻覺評測有什麼不同傳統的幻覺評測(例如 Vectara 的 HHEM...