AI 導入的第二個流程:第一個會成功,常常只是因為你派了最強的那個人
2026-09-23
夜羽凌
4
AI 導入的第一個流程跑出成效之後,下一個問題通常是「接下來複製到哪」。但第一個會成功,常常不是流程設計得好,而是剛好交給了團隊裡最強的那個人。研究顯示 AI 能拉近新手和老手的差距,卻只在任務落在 AI 能力範圍內時成立。這篇提供一個判斷第二個流程能不能複製的方法:換一個中等水準的人做,看落差出在哪裡。
先講結論:第一個 AI 流程跑出漂亮成效,很常見的原因不是流程設計得好,而是它剛好交到了團隊裡最強的那個人手上。
所以決定第二個流程要不要照抄第一個之前,先別看成效數字。先做一個測試:換一個中等水準的人做同一件事,看產出的落差有多大。
落差小,代表成效長在流程上,比較適合複製。落差大,代表成效有很大一部分長在那個人身上——你複製過去的,只會是流程的外殼。
先交代這篇的邊界:我帶過團隊,但沒有做過企業級的 AI 導入。這篇的論證來自兩個地方:公開的實驗研究,以及我自己把一條流程「複製成第二條」時踩到的坑。後者只是一個人的經驗,推不出必然,我會把它當觀察,不當定律。
第一個 AI 流程成功之後,功勞常常記錯了地方
AI 導入的第一個流程成功時,功勞通常被記在流程或工具上,但真正的貢獻常常來自執行它的人。
第一個流程幾乎都是挑出來的。挑的人想要一個「一定要成功」的開局,所以會把它交給最積極、最懂業務、也最願意花時間試錯的那個人。這很合理——換作是我也會這樣挑。
問題出在事後。成效出來了,簡報上寫的是「導入某流程後,處理時間縮短多少」。不會有人寫「因為負責的那位同事,每天多花時間檢查 AI 的產出,還把其中一部分直接丟掉重寫」。
那些檢查、那些丟掉重寫,才是這個流程真正的零件。而它們不在任何文件裡。
AI 真的能拉近新手和老手的差距嗎?能,但有一個條件
AI 能拉近新手和老手的差距,這件事有兩份很紮實的研究支持。但兩份一起讀,會看到一個很重要的條件。
客服研究:新手進步 34%,老手幾乎沒變
經濟學者 Brynjolfsson、Li 與 Raymond 追蹤了 5,179 名客服人員分批導入 AI 助理的過程,研究刊登在《經濟學季刊》(QJE)。結果是:
- 每小時解決的問題數,平均增加 14%
- 新手與低技能人員,進步 34%
- 資深與高技能人員,幾乎沒有影響
研究者給的解釋很值得看:AI 助理似乎是在把能力較強員工的做法,傳遞給比較新的員工。
讀到這裡,好像答案是「那就放心複製吧,AI 會把高手的功力傳給大家」。但第二份研究,把這個結論的適用範圍畫了出來。
顧問研究:任務一旦超出 AI 的能力邊界,用 AI 的人反而更容易錯
哈佛商學院等學者和波士頓顧問公司(BCG)合作做了一個預先註冊的實驗,受試者是 758 名顧問。
在 18 項落在 AI 能力範圍內的顧問任務上,使用 AI 的人:
- 平均多完成 12.2% 的任務
- 完成速度快 25.1%
- 品質比對照組高出 40% 以上
- 而且原本表現低於平均的人進步 43%,高於平均的人進步 17%——跟客服研究同一個方向
但研究裡另外設計了一個刻意挑在 AI 能力範圍之外的任務。在那個任務上,使用 AI 的顧問產出正確答案的機率,比不用 AI 的人低了 19 個百分點。
研究者把這個現象叫做「鋸齒狀的技術邊界」(jagged technological frontier):難度看起來差不多的兩件事,一件 AI 做得很好,另一件 AI 做不到——而且從外表很難分辨。
兩份研究放在一起,我讀到的是這件事
AI 能拉近差距,前提是任務落在它的能力範圍內。一旦超出範圍,AI 不只幫不上忙,還會讓人更容易錯。
那誰比較分辨得出「這一次落在範圍內,還是範圍外」?
通常是那個最強的人。 他懂業務,所以看得出 AI 這次的回答哪裡怪;他有經驗,所以知道哪一類案子不能照單全收。
這不代表高手不會錯——BCG 那 758 名受試者本來就是專業顧問,任務一超出範圍,照樣掉了 19 個百分點。高手的優勢不是不會錯,而是比較有機會在錯的時候察覺。
這就是第一個流程成功時,最容易被記錯的那份功勞:不是他用 AI 用得多好,是他比較常察覺什麼時候不該相信 AI 的答案。 而這個判斷,很難寫進流程文件。
(這是我把兩份研究並讀的推論,不是研究本身的結論。研究證明的是「範圍內會拉近差距、範圍外會變差」;「分辨範圍的能力比較集中在高手身上」是我的延伸。)
我自己的版本:規則一個晚上就能複製,判斷複製不過去
規則可以複製、判斷複製不過去,這是我自己把一條流程複製成兩條之後學到的——規模比企業導入小很多,但結構很像。
我經營自己的網站,後台有一套自己搭的選題與資料整理流程——排程、規則文件、檢查清單。這套東西跑順之後,我決定開第二條線,處理另一個主題。
從開始到第二條線整套長出來,花了 107 分鐘。 規則文件、排程設定、規劃表,幾乎是把第一條線整份複製過去,只改了主題相關的設定。當時我覺得,這證明規則已經變成可以搬來搬去的資產。
接下來幾個月,有三件事讓我改變了想法。
分數很漂亮,查證卻沒過
同一個月,我對原本那條線做了一次抽查。流程裡有一道自動檢查會打分數,分數到了 88.3 分,看起來很不錯。
但我手動拿其中一份資料去對官網:整理了 13 到 16 個工具的價格,至少 4 個跟官方對不上。
後來我下的結論是:那個分數在「結構和格式」上大致可信,但「資料查證」這一塊明顯沒做到位。分數量得到的是規則有沒有被遵守,量不到判斷有沒有做對。
要注意,這些錯是在原本那條線上抓到的——有我在旁邊,它一樣會錯。差別在於:原本那條線有我會去抽查,而複製出去的規則文件裡,沒有「誰去抽查」這一步。
兩條並行的線,排進了同一個題目
第二件事,是線一多就開始互撞。某條線前一天排好的題目,另一條並行的線隔天已經先處理了同一個主題,連要回答的問題都一模一樣。我是在第二份送出去之前,才發現並攔下來的。
「我們是不是已經做過這個了?」這個判斷,在只有一條線的時候,一直是我自己腦中在做的。規則文件裡沒有這一條,所以每一條照規則複製出來的線,當然也都沒有。
規則寫在文件裡,執行時還是做錯
第三件最讓我無力。有一次流程又出了錯,我回頭翻文件,發現正確做法早就寫在規則裡了——位置清楚、寫得明白,而且是我自己寫的。規則沒有少,只是執行的那一刻,沒有人把它翻出來。
這件事讓我分清楚:知識「寫下來」,和知識「在需要的時候被用上」,是兩件事。 第一條線能跑順,有一部分是因為我在旁邊——我記得那條規則,也知道什麼時候該回去翻。複製出去的只有文件,沒有那個會去翻文件的人。
這個類比有它的限度:流程不是人,複製出去的第二條線,也不完全等於「換一個中等水準的同事」。但它讓我看清一件事:第一條線的成效裡,有一部分是我本人的判斷,而我自己完全沒有意識到。 如果連搭流程的人都會記錯功勞,只看簡報的人更不用說。
第二個 AI 流程怎麼挑?看「換人落差」,不看成效數字
判斷第二個 AI 流程能不能照第一個複製,最直接的方法是做一次「換人測試」:讓一個中等水準的人,只拿著寫下來的做法,獨立做同一件事。
做法很簡單:
- 挑一個表現中等、沒參與第一個流程的人。不是新人(新人什麼都會卡),也不是另一個高手
- 只給他寫下來的東西:文件、範本、提示詞、檢查清單
- 做同一類任務三到五次,跟原本那個人的產出並排比較
- 不要只看最後的品質,要看落差出在哪一步
第 4 點最重要,因為落差出現的位置,決定了你接下來該怎麼做。
落差出在「輸入」→ 比較適合複製
例如他不知道要餵哪些資料、格式亂掉、漏了某個欄位。這類落差可以用範本和檢查清單補起來,補完之後通常就收斂了。這種流程比較適合複製,第二個流程挑同類型的問題不大。
落差出在「判斷」→ 先別複製同類型的
例如 AI 給了一個看起來合理、其實不對的答案,原本那個人會丟掉重來,而他照單全收了。這正是前面研究講的「能力範圍外」的狀況。這類落差很難只靠文件補起來——「看得出哪裡怪」不太能寫成檢查清單。
這時候,第二個流程不要挑同類型的,改挑判斷成分更少、對錯更明顯的任務。我在〈AI 導入該從哪個部門開始?〉那篇講過一個條件:做錯了,當天就看得出來。第二個流程,更要守這一條。
落差出在「檢查」→ 把檢查從人身上拆下來
例如他其實有發現問題,只是不知道要檢查哪幾個地方,或檢查到後來就鬆掉了。這類可以救:把原本那個人「憑經驗看的地方」,拆成固定的、不依賴當下警覺的檢查動作。我在〈跨部門週報交給 AI〉那篇寫過一個數數字的檢查法,就是這個思路。
這個測試有三個限制,做之前先知道
換人測試不是實驗室,它有三個很容易被忽略的偏差:
- 評比的人,不要是原本那位高手。 他最懂標準,但也最難中立——那是他做出來的成績。讓收件的人或第三個人來比,最好不告訴他哪份是誰做的
- 三到五次很少,而且人會邊做邊學。 所以別只看平均,看趨勢:落差隨次數縮小,多半是輸入或熟悉度的問題;做到第五次還是一樣大,才比較像判斷的問題
- 高手完全不在場,比真正推廣時嚴格。 實際推廣時,大家還是可以去問他。所以測試時可以開放提問,但把每一個問題記下來——那些問題,就是文件裡缺的東西
站內那篇「三階段」,中間可以再補一步
換人測試剛好可以補在「組成專門團隊」和「向更多使用者開放」之間——這是我讀就享知站上〈企業導入生成式AI必經3階段,6步驟完成!〉(智慧製造趨勢所,2025 年 3 月)時想到的。那篇把導入分成三個階段:先確立特定領域與職務、決定資料來源;接著組成專門團隊設計提示與介面,再向更多使用者開放;最後擬定營運計畫、擴大應用範圍。
這個架構本身沒有問題,順序我也同意。我想補的是第二階段裡兩個步驟之間的那道縫:
「組成專門團隊」和「向更多使用者開放」之間,其實藏著一次換人。
專門團隊,通常是最強的那批人。向更多使用者開放,就是交到中等水準的人手上。如果中間沒有做過換人測試,你開放出去的,可能只是一個「在高手手上才會動」的流程。
可複製性自測四問
可複製性自測四問,是在決定第二個 AI 流程之前,拿第一個流程來回答的四個問題——答不出來的越多,越不該直接複製。
第一問:第一個流程的產出,最後是誰把關的?把他拿掉,還剩幾道關卡?
如果答案是「一道都不剩」,那個人就是流程本身。
第二問:那個人多常把 AI 的產出丟掉重來?
直接問他本人,請他估一個大概的比例。這個比例,就是他替流程做的隱形判斷量。比例越高,換人之後的落差很可能越大。
第三問:換一個中等水準的人做三到五次,落差出在輸入、判斷、還是檢查?
輸入和檢查比較好補,判斷很難只靠文件補。
第四問:如果那個人只能看最後結果、不能插手過程,成效會剩多少?
這一題不用精算,憑直覺回答就好。直覺是「大概會垮」,就先別複製。
這套判準適合誰、不適合誰
換人測試這套判準,最適合已經有一個 AI 流程跑出成效、正在決定下一步往哪裡擴的團隊。
適合你,如果:
- 你的團隊已經有一個 AI 流程跑出成效,正在規劃下一個
- 第一個流程是交給某個特別積極、或特別資深的人負責的
- 你需要跟上面報告「接下來要擴大到哪裡」,而且不想擴完才發現垮掉
不適合你,如果:
- 你的第一個流程本來就是全員一起用、沒有特定負責人——換人落差已經反映在成效裡了
- 你的團隊只有兩三個人、而且每個人都是資深的——這個測試意義不大,該擔心的是別的事
代價:
第一個流程的漂亮數字,可能會變難看。 換人測試做下去,常常會發現成效有一部分是人撐出來的。這對當初推動的人不太好受,要先講好這不是在追究誰。
你要讓最強的那個人退一步。 測試期間他不能下場幫忙,而高手通常很難忍住不插手。
擴大的速度會變慢。 多一輪換人測試,就多一段等結果的時間。但比起擴出去再收回來,這段時間便宜很多。
判斷可以複製之後,下一步看什麼?
判斷可以複製之後,下一步才輪到工具層的問題——前面全篇沒有提任何工具,就是因為「能不能複製」是判斷題,跟用哪套工具無關。
確定要往更多人擴的時候,接下來會問的是:要用什麼串、要不要讓 AI Agent 接手其中幾個步驟。我在自己的部落格整理過一篇 AI Agent 入門與工具選擇,可以接著看。
FAQ 常見問題
第一個 AI 流程成效很好,老闆要我馬上複製到其他部門,怎麼辦?
不用反對複製,只要爭取一次換人測試的時間。可以這樣說:「複製之前,我想先確認這個成效不是因為剛好交給了誰。找一個沒參與過的人照文件做三到五次,很快就有結果。」這個說法不否定成效,只是確認成效帶得走,通常比較聽得進去。
換人測試要找誰?找新人不是更能看出問題嗎?
不建議找新人。新人什麼都會卡,你分不出落差是來自流程,還是來自他不熟業務。找表現中等、熟悉業務、但沒參與第一個流程的人最準——他代表的是「流程擴出去之後,大多數使用者的樣子」。
如果換人落差很大,是不是代表第一個流程失敗了?
不是。它依然有效,只是它的有效建立在那個人身上。這種流程可以繼續由他跑,但不適合當複製的樣板。第二個流程改挑判斷成分少、對錯明顯的任務,會比硬複製第一個穩很多。
研究說 AI 能把高手的經驗傳給新手,那還需要做換人測試嗎?
需要。客服研究裡新手確實進步了 34%,但顧問研究同時顯示,任務超出 AI 能力範圍時,用 AI 的人產出正確答案的機率反而低了 19 個百分點。AI 傳得過去的是做法,傳不太過去的是「這一次該不該相信 AI」的判斷。 你的第一個流程落在哪一邊,研究沒辦法替你回答——換人測試可以。
參考資料
Brynjolfsson, Li & Raymond,Generative AI at Work(The Quarterly Journal of Economics, Vol.140(2), 2025, pp.889–942):5,179 名客服人員;每小時解決問題數平均 +14%,新手與低技能人員 +34%,資深與高技能人員影響極小。
Dell'Acqua et al.,Navigating the Jagged Technological Frontier(與 BCG 合作之預先註冊實驗,SSRN 工作論文;數字取自 2023 年 9 月工作論文初版):758 名顧問;能力範圍內任務多完成 12.2%、快 25.1%、品質高 40% 以上;低於平均者 +43%、高於平均者 +17%;範圍外任務正確率低 19 個百分點。
就享知,企業導入生成式AI必經3階段,6步驟完成!(智慧製造趨勢所,2025-03-10)