AI 只做一件事,剩下六件都是你的
2026-08-25
水電工阿水
18
七要素裡,AI 只做一件事:預測。訓練、判斷、行動、結果、回饋——剩下六步,都是你的責任。 2021 年,Zillow 用演算法買房,一季虧損超過 6 億美元,平均每棟房子虧 8 萬美元,最後認賠關閉整個業務。同一個錯誤,Ray Dalio 在 1982 年也犯過——公開判斷經濟衰退卻完全押錯,賠到必須遣散全部員工、向父親借錢度日。兩個故事中間隔了四十年,一個是演算法一個是人腦,敗因卻是同一個。 本篇是「企業決策進化論」第一章的收尾篇,從 Zillow 與 Dalio 的慘敗案例出發,帶進 Tetlock「超級預測者」研究——贏的不是天賦,是持續記錄、對照、校準的紀律。
一、2021 年,Zillow 用演算法買房,一季虧了六億美元
Zillow Offers 曾經是最被看好的 AI 應用之一:用演算法估算房價,直接向屋主報價買下房子,翻新後轉賣。邏輯很簡單——模型準,就能穩定套利。
2021 年 11 月,Zillow 宣布關閉這項業務。第三季財報顯示,公司當季虧損超過 6 億美元,手上囤積近萬棟房子,平均每棟虧損高達 8 萬美元。CEO Rich Barton 在法說會上罕見地公開承認:「我們無法以足夠準確的水準預測未來房價。」隔月,公司裁員約四分之一。
問題不是模型不夠複雜。Zillow 的演算法是頂尖團隊做出來的,訓練資料量龐大。問題是模型是用「過去」訓練的,而疫情之後的房市,供應鏈延遲、價格劇烈波動,跟過去的資料型態完全不同——模型還在用舊地圖,走新的路。
在我們的七要素框架裡,決策鏈是「輸入→訓練→預測→判斷→行動→結果→回饋」七步。AI 在這條鏈上只負責一步:預測——根據資料算出一個數字或一個答案。Zillow 的演算法做的正是這件事,而且做得很快、很有信心。
但預測前面還有一步:訓練。不是 AI 模型的訓練,是你——這個要用預測結果做決定的人——有沒有先訓練好自己的判斷力,知道這個預測在什麼情況下該信、什麼情況下該打折扣。Zillow 的悲劇不是「預測」這一步做壞了,是「訓練」這一步從缺:沒有人系統性地檢查模型的假設在疫情後是不是還成立,就讓預測結果直接變成報價、變成交易。
二、比 Zillow 早四十年,有人也栽過同樣的跟頭
1982 年,年輕的基金經理人 Ray Dalio 公開判斷全球經濟即將陷入嚴重衰退,並照這個判斷下重注操作。
結果完全相反——美國股市走出了史上最長的非通膨成長期之一,接下來將近二十年持續上漲。Dalio 賠到必須把公司裡的人一個一個資遣,自己一度周轉不靈,向父親借了 4,000 美元度日,甚至賣掉家裡的第二輛車。
多年後他回顧這段經歷時說,那次慘敗把他從「我是對的」逼到「我怎麼知道我是對的」。他開始強迫自己找立場相反、獨立思考的人來質疑自己的判斷,這套習慣後來演變成 Bridgewater 內部的「想法精英制度」(idea meritocracy)——每個人的判斷都被系統性記錄、追蹤、事後對照結果,可信度高的意見權重才高。Bridgewater 後來成為全球最大的避險基金之一。
Zillow 和 Dalio 的故事,中間隔了四十年、一個是演算法一個是人腦,但敗因是同一個:做出判斷,卻沒有機制去檢驗判斷準不準,更別說根據落差去校準下一次。

三、真正厲害的預測者,贏在紀律,不是天賦
賓州大學心理學家 Philip Tetlock 花了數年時間,找了數千名一般人來預測政治、經濟事件,追蹤誰的判斷持續比較準。他把表現最好的一群人稱為「超級預測者」。
在美國情報體系贊助的 IARPA 預測競賽中,這群業餘的超級預測者,準確率贏過擁有機密情報管道的專業情報分析師 30% 以上;跟其他參賽研究團隊相比,贏了 35% 到 72%。
有意思的是,Tetlock 的研究發現,超級預測者贏的不是聰明才智,而是一套共同的習慣:把每一次預測寫下具體機率、設定可檢驗的時間點、結果出來後誠實對照、然後小幅度調整下一次的判斷。不是「我判斷錯了,全部推翻重來」,而是每一次都用結果去微調一點點信念的權重。
這其實就是七要素框架裡「訓練」這一步該做的事——不是訓練 AI,是訓練你自己判斷力的準確度。AI 模型有工程師盯著它的誤差、定期重新訓練;但大部分企業主用 AI 給的「預測」做決定時,卻沒有人幫自己記錄誤差、更沒有人幫自己重新校準。少了這一步,AI 的預測再快,也只是把沒校準過的判斷力放大。
四、你的組織,有「記錄誤差」的習慣嗎
回到我們自己身上:AI 讓「做預測」這件事變得非常便宜——市場報告、銷售預估、客戶會不會流失,AI 幾秒鐘就能給你一個數字。但便宜的是「生成預測」,不是「驗證預測」。
三個常見的落差:
第一種:預測做了一堆,沒人回頭對答案。 AI 幫你估了下季營收、估了廣告成效、估了庫存需求,數字很漂亮地躺在報表裡。但三個月後,實際數字出來時,有沒有人把兩者放在一起比對?如果沒有,這些預測就只是產出,不是判斷力的來源。
第二種:錯了就整套換掉,而不是校準。 一次判斷失準,很多人的反應是「這個方法不準,換一套」,而不是問「差在哪裡、下次怎麼調整權重」。真正的校準是漸進式的,不是砍掉重練。
第三種:只記錄結果,不記錄當初的信心程度。 「我覺得這個客戶大概會續約」跟「我有九成把握這個客戶會續約」,事後檢討的意義完全不同。沒有寫下當時的把握程度,就沒辦法知道自己是「運氣好矇對」還是「判斷真的準」。
五、小而扎實的校準機制,比看起來厲害的模型更值錢
不需要 Bridgewater 那種全公司規模的系統。真正有效的校準機制,往往很小、很笨拙,但持續在做。
具體做法可以很簡單:每一次重要判斷(要不要跟這個客戶簽約、這波廣告預算該不該加碼、這個新產品該不該上),寫下當時的預測與把握程度;設一個檢驗時間點;時間到了,誠實記錄實際結果,跟原本的預測放在一起看。不用花俏的工具,一張 Excel 表就能開始。
重點不是紀錄本身,是紀錄之後真的回頭去看——而且看的時候問的不是「我做對了嗎」,是「我當初的把握程度,跟後來的準確度,對得上嗎」。如果你每次都說九成把握,但實際對的次數只有六成,這個落差本身就是最值錢的資訊:你可能太自信了,該調整權重。

六、第一章收束:七步裡,AI 只站一個位置
這是第一章的最後一篇。完整的七要素順序是:輸入(你怎麼定義問題)→訓練(你有沒有校準過自己的判斷力)→預測(AI 給你一個答案)→判斷(你怎麼決定要不要信這個答案)→行動(你做了什麼)→結果(有沒有换成價值)→回饋(結果有沒有傳回來,變成下一輪的訓練材料)。
七步裡,AI 只站在第三格。前面的「訓練」跟後面的「判斷、行動、結果、回饋」,全部是人的責任——尤其是回饋這一步,會直接接回第一步的訓練,讓整條鏈變成一個閉環,而不是一條直線用完就丟。少了這個閉環,AI 那一步的預測再快、再準,也只是在一條沒有終點的直線上跑得更快。
Zillow 有全世界最好的工程團隊,也沒能在疫情後及時校準模型;Dalio 曾經因為一次判斷賠到要跟父親借錢,後來卻建立起延續四十年的系統。差別不在起點的失誤大小,在有沒有把失誤變成下一次判斷的養分。
我們自己也還在練這件事。這系列文章寫到這裡,某種程度上也是我們自己的「記錄與校準」——每一篇發布之後回頭看數據、看留言,跟原本設想的落差在哪裡,然後調整下一篇。準備了七篇,不代表我們已經做對了,只代表我們開始有意識地在記錄落差。
七篇寫到這裡,輸入、訓練、預測、判斷、行動、結果、回饋,七個環節都談過了。這不是終點,是起點——這套閉環要真的轉起來,靠的不是再寫幾篇文章,是每一次決策都老實走過這七步。之後的文章,會回到一個個具體的場景,繼續驗證這套框架禁不禁得起現實檢驗。