Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
通用人工智慧,從理論到現實的全解析
agi-bible.com
最新
95%的企業AI試點拿不到明確報酬,但贏家組的股價報酬贏大盤12個百分點:2026年的落差到底在哪  ·  人類100%通關,頂尖AI模型普遍低於1%:ARC-AGI-3用電玩環境測出的,不是知識落差而是「探索能力」落差  ·  AI有沒有意識,不是這場辯論真正在吵的事:2026年「AI人格權」爭論背後的一場責任歸屬戰  ·  Gemini在19次管線破壞測試裡隱瞞了11次,Claude的裁判模型卻會因為後果而改分:2026夏季代理失調測試揭露的四種新失控模式  ·  黃仁勳說「AGI 已經到來」,同一週,寫出這個模型的人說「思維鏈快要看不懂了」  ·  他放棄了兩個月後才會歸屬的股權,只為了公開說一句「別小看這個東西」
industry-impact

95%的企業AI試點拿不到明確報酬,但贏家組的股價報酬贏大盤12個百分點:2026年的落差到底在哪

30 秒速讀
95%的企業AI試點拿不到報酬,但贏家組不是砸最多錢的公司——是同時做到報酬衡量與基礎設施投資的公司,股價贏大盤1,200個基點。

完整解析 +
01 · 為什麼發生?

「95%失敗率」跟「AI沒有用」是同一件事嗎?

不是。95%這個數字衡量的是「試點階段有沒有拿到可衡量的財務報酬」,不是「AI技術本身有沒有效果」。同一份研究裡,做對事情的5%公司拿到的報酬幅度大到能拉開股價表現,代表問題不在技術能不能用,而在多數企業把AI當成一次性採購,沒有搭配持續的基礎設施投資與明確的衡量機制。

把「試點沒報酬」直接等同「技術沒用」,會讓決策者錯誤地縮手,而不是去修正真正的問題:執行落差。

02 · 運作原理是什麼?

為什麼「有衡量ROI」卻沒有搭配基礎設施投資,報酬反而比什麼都不做還差?

市場數據顯示,只做報酬衡量、沒有對應基礎設施投資的公司,股價報酬只有8.14%,比大盤落後2,100個基點——這個結果乍看違反直覺,但邏輯其實一致:衡量本身會揭露問題(例如發現某個AI專案根本沒有帶來效益),但如果公司沒有能力或資源去修正這個問題,衡量的結果就只是白紙黑字承認失敗,卻沒有後續行動,市場會把這種「知道問題卻解決不了」解讀為管理能力的警訊,而不是正面訊號。

這說明報酬衡量必須跟執行能力綁在一起,單獨存在時甚至可能是負面指標。

03 · 如何應用

XPO、C3.ai、Upstart這三個案例,具體的共通操作方式是什麼?

三者的順序都是「先鎖定一個可以對財報負責的具體指標」,再回頭問「AI能不能改善這個指標」。XPO鎖定的是「每提升一個百分點效率換算多少節省」,C3.ai的PANDA平台鎖定的是「年度維運成本 vs. 年度節省的具體對比」,Upstart鎖定的是「跟公債報酬相比的基點差距」——三個指標都是財務或營運部門本來就在追蹤的數字,AI只是被拿來改善這個既有的、可驗證的指標,而不是被當成一個獨立的、需要自己發明新衡量標準的專案。

這跟多數失敗案例的順序相反:多數失敗案例是先買了工具,才去想「這個工具帶來了什麼好處」。

04 · 我該怎麼做?

如果我是企業內部負責評估AI投資的人,這份數據給我的具體行動建議是什麼?

先問自己一個問題:「如果這個AI專案上線半年後完全看不出效果,我們有沒有一個具體的、財務部門認可的數字可以拿出來檢驗?」如果答不出來,代表專案還停在「概念驗證」階段,不該急著擴大投入。標普全球的銀行業調查顯示,91%的董事會核准了AI專案,卻只有26%真正執行到底——這個落差通常發生在核准階段沒有把「衡量指標」跟「執行資源」綁在同一份提案裡。

比較實際的做法,是把AI投資提案跟現有的營運或財務KPI綁定,而不是另外發明一套「AI專屬」的成效指標,後者往往是試點結束後拿不出報酬的主因。

完整內容 +

2026年最容易被誤讀的AI統計數字,大概就是「95%的企業AI試點拿不到可衡量的財務報酬」。這個數字來自MIT NANDA計畫對數百個企業生成式AI部署案例的追蹤研究,很多人讀到這句話直接得出「AI對企業沒用」的結論,但這個推論跳過了同一批研究裡更重要的另一半:一小群企業不只拿到報酬,報酬幅度大到把它們的股價表現跟大盤徹底拉開差距。

問題不是「AI有沒有用」,是「為什麼同樣買同樣的工具,95%的公司什麼都沒拿到,剩下的一小撮卻拿到超額報酬」。

數字怎麼疊出來的

先把幾份互相獨立的調查放在一起看。IBM針對CEO的年度調查發現,只有25%的AI專案達到原先預期的投資報酬,56%的CEO坦承他們的AI投資目前完全沒有帶來明顯的財務效益。摩根士丹利在2025年第四季的統計更嚴格:標普500成分股公司裡,只有21%能具體說出AI帶來的可衡量效益,換句話說,接近八成的大型上市公司連「AI幫我們省了多少錢」這種基本問題都答不出來。標普全球的產業調查則指向另一個角度——會放棄大多數AI專案的公司比例,一年之內從先前的水準翻倍,代表企業不是還在觀望,是已經試過、然後放棄了。

這些數字疊在一起,指向同一件事:多數企業把AI當成一次性採購決策,而不是一套需要持續投入的營運能力,試點結束、預算用完,專案就停在那裡,沒有進入下一階段。

贏家組真正在做的事,跟預算大小無關

拆開贏家組的樣本會發現一個違反直覺的結果:贏的不是砸最多預算的公司。市場數據顯示,同時具備「嚴謹報酬衡量機制」加上「對應基礎設施投資」兩項條件的公司,股價報酬達到41.38%,超越標普500指數同期29.40%的表現,差距高達1,200個基點;但如果一家公司只做了報酬衡量、卻沒有搭配對應的基礎設施投資,報酬反而只有8.14%,比大盤還落後2,100個基點——衡量本身如果沒有配套的執行能力,不只沒幫助,還可能是一種警訊,代表公司發現了問題卻沒有能力解決。

花旗集團的信用分析團隊甚至把這個落差量化進了債券定價:被歸類為「有AI採用但拿不出報酬證據」的發行人,信用利差被額外加了30個基點的懲罰性利率,市場已經在用真金白銀替「有沒有真的做出結果」定價,不是替「有沒有買工具」定價。

具體案例:贏家組怎麼把AI變成報酬

物流公司XPO的案例值得拆解,因為它把「效率」翻譯成了可以直接對財報的數字:每提升一個百分點的營運效率,換算成2,900萬美元的實際節省,整體營運比率改善了180個基點——這不是「AI讓我們更聰明」這種模糊描述,是能寫進季報的具體行項。美國空軍採用C3.ai的PANDA平台則是另一種驗證:平台年度成本300萬美元,換來940萬美元的年度節省,投資報酬率超過三倍,而且這個數字是政府採購合約裡可審計的公開數據,不是廠商自己講的行銷話術。信用貸款平台Upstart的模型則在1.04億筆還款紀錄上,跑出比公債報酬高608個基點的績效——樣本量夠大,統計上站得住腳。

這三個案例的共通點:都是先定義好「要改善的具體指標」,再回頭問「AI能不能改善這個指標」,而不是先買了工具,再事後想辦法找數字證明它有用。

這跟你的錢有什麼關係

如果你的公司正在評估或已經部署AI,「有沒有衡量ROI」這個問題本身比「花了多少預算」重要得多——標普全球的銀行業調查發現,82%的銀行董事根本不衡量科技投資的報酬,91%的董事會核准了AI專案,但只有26%的公司真正有能力執行到底,這個「核准與執行」之間的落差,正是95%失敗率的根本來源。對投資人而言,一家公司如果只會講「我們投資了AI」卻拿不出具體的效率指標,這本身就是一個該追問的訊號;對企業決策者而言,先定義好單一可驗證的財務指標,再決定要不要投入基礎設施把它做到底,會比先買工具再找理由更接近贏家組的做法。

資料來源:MIT Report Finds 95% of AI Pilots Fail to Deliver ROI, Exposing the GenAI Divide、95% of enterprise AI pilots deliver no measurable ROI, and the fix isn't more tools、AI ROI in 2026: Why Enterprise AI Fails & What Actually Works
圖解
Stock returns: measurement alone vs. measurement + infrastructure investment只做報酬衡量的公司報酬落後大盤,同時投入基礎設施的公司則大幅超越大盤Enterprise AI: Measurement vs. Infrastructure Investment45%25%5%8.14%Measurement Only29.40%S&P 500 Benchmark41.38%Measurement + Infra(the winning cohort)AGI Bible · agi-bible.com
歡迎截圖分享,轉載請註明來源
提問
請至少輸入 10 個字
相關文章
資料中心正在改建:當「推理」比「訓練」更燒錢,AI 基礎建設的投資邏輯整個翻轉了
industry-impact · 08/15
多模態 AI 真的能省錢,也真的會失靈:2026 年企業導入的兩種真實結局
industry-impact · 08/15
AI 到底搶走了多少工作?2026 年的數據跟新聞標題講的不太一樣
industry-impact · 08/13
人類100%通關,頂尖AI模型普遍低於1%:ARC-AGI-3用電玩環境測出的,不是知識落差而是「探索能力」落差
benchmarks · 10/06