跨部門週報交給 AI:能做到哪一步,哪裡一定要人接手
2026-08-28
夜羽凌
13
把五個部門的進度丟給 AI 彙整成一份週報,十分鐘就好了——問題是它漏掉的東西有規律。研究一致指出:AI 摘要最常漏掉的是中段,而最容易憑空生出來的是結尾。對照到週報,中段是期中進度與卡關紀錄,結尾是結論與下一步——剛好都是最該被看見的部分。這篇畫出我的分工線:哪三段可以交給 AI,哪三段人一定要接手。
先講結論:AI 寫週報的問題不是寫得不好,是漏得有規律。
而那個規律很不巧——它漏掉的位置,剛好是週報裡最該被看見的地方。
我自己用 AI 做進度彙整超過一年。剛開始我以為只要提示詞寫好就沒事,直到有一次我把三個月的專案紀錄整包丟進去,產出的摘要讀起來完全合理、結構漂亮、每一句都通順——但整段「第六週卡在等外部回覆」完全不見了。而那正是整季唯一真正該被拉出來討論的事。
我那時候以為是運氣不好。後來去翻研究才發現,那不是運氣,是可預測的行為。
先講一件必須誠實交代的事:目前沒有任何針對「企業週報/專案進度彙整」這個特定任務的公開學術評測。我能找到最接近的,是對話摘要和長文件摘要的研究。所以下面的數字都不是「AI 寫週報的失誤率」,而是「AI 在最像週報的那類任務上的失誤模式」。這個差別我會一直標出來,因為把對話摘要的數字說成週報的數字,就是誤用研究。
AI 摘要會出錯的位置,是可以預測的
先給結論:三條獨立的研究線指向同一組模式——中段被漏、結尾被加料、有前提的話被寫成通則。
一、中段最容易被漏掉
2023 年有一篇被大量引用的論文叫《Lost in the Middle》,發現 LLM 讀長文件時有明顯的位置偏誤:關鍵資訊放在開頭或結尾時表現最好,放在中段時表現顯著下降。
這裡要加三個但書,不然就是過度外推:那篇測的是 2023 年世代的模型;在它自己的實驗裡也不是全體適用(其中一個模型在合成檢索任務上所有位置都近乎滿分);而且這現象在只有十份文件的短脈絡就已經出現,不是長文件專屬。2024 年之後的研究普遍認為它是「隨任務與模型而異」的性質——簡單的事實檢索在新模型上常常已經測不到,但長文的多跳推理與資訊整合仍然明顯。
真正讓我在意的是 2026 年這篇針對對話摘要的研究。它的結論寫得非常直接:
「turns occurring in middle of the dialogue are the most frequently missed in the summary」——對話中段的發言,是摘要裡最常被漏掉的。
而對話摘要,是所有公開研究裡最接近「跨部門討論彙整」的任務型態。
二、結尾最容易被憑空生出來
同一篇研究的下半句更值得看:「extrinsic hallucinations largely occur at the end」——憑空生成的內容,大多出現在摘要的結尾。
這個組合很惡劣:中段被漏,結尾被加料。
那篇研究的量化結果是:70.3% 的摘要至少含一個幻覺錯誤,29.7% 漏掉整個發言回合,73.4% 出現更嚴重的「漏掉整段對話」,20.8% 出現視角扭曲。受測模型包含 GPT-5 和 Claude-Sonnet-4.5 這類前沿模型——所以這不是「用了爛模型」的問題。
(再次提醒:這些是對話摘要的數字,不是週報的數字。我引它是因為任務型態最接近,不是因為它測過週報。)
另外一篇針對超長文件的人工評測也指向同一個方向:LLM 摘要會系統性遺漏關鍵內容,而且結構性地偏重文件後段發生的事、犧牲前段。
三、有前提的結論會被寫成通則
第三個模式最安靜,也最容易矇混過關。
有一份分析了 4,900 篇 LLM 摘要、涵蓋十個主流模型的研究發現:LLM 摘要出現寬泛概化的機率,是人類撰寫摘要的約五倍(勝算比 4.85,95% 信賴區間 3.06 到 7.70),部分模型的概化率達 26% 到 73%。
翻成白話:原文寫「A 案在小範圍初步測試中結果良好」,摘要會變成「A 案結果良好」。
那個「小範圍初步」被吃掉了。而在週報裡,被吃掉的那幾個字往往就是整句話的重量所在。
對到週報上,這三個模式分別會吃掉什麼
把上面三條對回你手上那份週報,會發現對應得非常整齊。
中段被漏 → 期中進度和卡關紀錄蒸發。
週報的素材本來就是一長串按時間排的紀錄。開頭是這週開始做什麼,結尾是現在的狀態。中段是什麼?是過程——包括卡在哪裡、等誰回覆、試了什麼沒成功。
而那正是週報唯一真正的價值。如果週報只剩下「開始做 X、現在做到 Y」,那它就退化成一份行事曆。
結尾被加料 → 結論與下一步最不可信。
主管讀週報常常只讀最後一段,因為那裡有結論和下一步。而那剛好是最容易出現憑空內容的位置。
我自己遇過一次,AI 在結尾寫了「下週將與供應商確認交期」——沒有人講過這句話,它是被生出來的。看起來很合理,所以差點就過了。
過度一般化 → 風險被抹平。
「初步測試順利」變成「順利」、「目前尚無異常」變成「一切正常」、「A 廠商回覆較慢但已在跟進」變成「進度正常」。
每一句都不算說謊,但整份讀起來的風險感受完全不一樣。而週報的用途,本來就是讓風險被看見。
「那我再叫另一個 AI 檢查一次」——這條路目前不通
這是我第一個想到的解法,也是我看到很多人在做的。研究結果是:不行。
那篇長文件摘要研究實作了多個 LLM 忠實度評分器,結論是「none correlates strongly with human annotations」——沒有一個與人類標註有強相關,尤其在偵測「不忠實的主張」上特別差。
另一個專門評測「幻覺偵測器」的基準 FaithBench 講得更白:包含 GPT-4o 當評審在內的當前最強偵測模型,在困難案例上準確率約 50%。
50% 是什麼概念?擲硬幣。
所以「用 AI 檢查 AI」在目前這個階段,不能算是一道關卡。它會給你一種有在把關的感覺,而那種感覺比沒有把關更危險。
也不要指望換個更新的模型就解決。 2025 年有一篇研究指出,幻覺之所以持續存在,是因為現行的評測方式結構性地獎勵它——模型被優化成好的應試者,而在不確定時「猜」比「說不知道」更容易得分。這是訓練與評測機制的問題,不是模型版本的問題。
順帶補一個規模夠大的旁證:跨 18 國、22 家公共媒體、涵蓋 14 種語言的 AI 助理評測顯示,45% 的回應至少有一項重大問題,31% 有嚴重的來源問題,20% 有重大準確性問題。這不是特例,是普遍狀況。
更麻煩的是:人接手這一關,會自己鬆掉
假設你認同上面的結論,決定「那就人來檢查」。這裡還有最後一個陷阱,而且它跟 AI 無關,跟人有關。
微軟研究院針對 319 位知識工作者、936 個真實 AI 使用案例做過調查,結論是:對生成式 AI 的信心越高,啟動的批判性思考越少。
意思是:一開始你會逐字檢查,因為你不信任它。用了三個月之後,它大部分時候都對,於是你開始只掃過去。而它出錯的頻率沒有變。
這件事沒辦法靠「提醒大家要仔細看」解決——它是心理機制,不是態度問題。唯一能解的是把檢查變成制度化的固定動作,不依賴當下的警覺。
我的分工線:AI 做這三段,人做這三段
講完問題,講做法。這是我現在實際在用的分法。
交給 AI(省時間,而且失誤成本低)
- 把散落的格式統一:五個人五種寫法,變成同一個結構。這件事 AI 做得又快又穩
- 時間軸整理:把「誰在什麼時候做了什麼」按序排好
- 初步分類:哪些屬於進度、哪些屬於問題、哪些屬於待決事項
這三段的共同點是:做錯了你一眼就看得出來,而且它不涉及判斷,只涉及搬運和排序。
人一定要接手(對應前面三個失效模式)
- 風險與阻礙那一段——對應「中段被漏」。這段不要讓 AI 寫,你自己從原始素材裡撈。如果一定要 AI 幫忙,就明確要求它「只列出提到卡住、延遲、等待、失敗的句子」,讓它做檢索而不是做摘要
- 結論與下一步——對應「結尾被加料」。這段是最容易出現沒人講過的內容的位置,也是主管唯一一定會讀的位置。自己寫,或者逐句比對原文
- 把限定詞加回去——對應「過度一般化」。掃一遍摘要,凡是斷言句都回頭問:原文有沒有加條件?「初步」「小範圍」「部分」「暫時」這些詞被吃掉了沒有
一個很土但有效的檢查法:把 AI 產出的摘要跟原始素材並排,只做一件事——數。 原始素材裡提到「卡住/延遲/等待/還沒」的句子有幾句?摘要裡剩幾句?
如果原文有六句、摘要剩一句,那不是摘要,那是美化。
這個檢查三十秒做得完,而且因為它是「數數字」不是「憑感覺讀」,比較不會隨著信任度上升而鬆掉——這正是前面那個心理陷阱的解法。
這套做法適合誰、不適合誰
適合你,如果:
- 你每週要彙整三個以上來源的進度
- 你的週報會被更上層看到,錯誤有實際後果
- 你願意接受「AI 省你 60% 的時間,不是 90%」
不適合你,如果:
- 你的週報本來就只是形式、沒人細看——那優化它沒有意義,該處理的是別的問題
- 你需要的是「完全不用碰」的自動化。以目前的研究結果,那個東西還不存在,賣你這個的人在賣你風險
代價:
它只省一部分時間。 格式統一和時間軸整理省很多,但風險段和結論段還是要你自己來。我自己的實感大概是原本的四成到五成時間,不是十分之一。
你得留著原始素材。 這套檢查法要並排比對,所以不能丟了原文只留摘要。這會多一點保存和整理的功夫。
剛開始會比不用還慢。 因為你要同時學會怎麼下指令、怎麼檢查。大約兩三次之後才會回本。
那用什麼工具?
這題一樣放最後。走完上面的分工之後,你需要的其實只是一個「能吃長文件、能穩定輸出固定格式」的工具——不需要多聰明,需要的是穩定。
免費工具在這個用途上多半就夠了,因為你交給它的是搬運和排序,不是判斷。我在自己的部落格上整理過一份免費 AI 工具的實測清單,裡面有幾款專門處理長文件的,可以拿去對照。
但工具不是重點。這篇真正想給你的是那條分工線,以及那個三十秒的數數字檢查。 工具會換,那條線不會。
FAQ 常見問題
我的週報素材不長,是不是就沒有「中段被漏」的問題?
不一定。原始研究指出這個位置偏誤在只有十份文件的短脈絡就已經出現,不是長文件專屬。而且跨部門週報的麻煩不在總長度,在來源分散——五個人各寫一段,AI 要同時處理五條時間線,中段的定義會變得更模糊。素材短的好處是你自己核對比較快,那就更該核對。
把提示詞寫得更精確,能不能解決漏掉中段的問題?
能改善,不能根除。有效的做法是別讓它做摘要,讓它做檢索——例如「列出所有提到延遲、卡住、等待的句子,逐句照抄不要改寫」。這把任務從「壓縮」變成「篩選」,失效模式完全不同,也讓你可以逐句核對。但涉及判斷的那幾段(風險評估、下一步),提示詞再好也還是要人接。
團隊已經習慣讓 AI 寫完整份週報了,怎麼改比較不會被抵抗?
不要用「AI 不可靠」當理由,那會變成價值觀辯論。改用那個數數字的檢查——拿最近一份 AI 產出的週報,跟原始素材並排,數「提到卡住/延遲的句子」在兩邊各有幾句。我自己第一次數的時候是六比一。看到數字之後就不用說服了,而且這個做法不否定 AI 的貢獻,只是加一道關。
有沒有辦法量化「AI 寫的週報漏了多少」?
以目前公開的研究,沒有針對週報這個任務的評測數字——我文章裡引的都是對話摘要和長文件摘要的研究,只是型態最接近。所以與其找一個外部數字,不如量自己的:連續四週做那個「數卡住句子」的比對,你會得到屬於你們團隊的比例。那個數字比任何論文都有說服力,因為它就是你們的素材、你們的模型、你們的提示詞。
參考資料
Liu et al.,Lost in the Middle: How Language Models Use Long Contexts(arXiv 2307.03172;TACL Vol.12, 2024):位置偏誤,中段表現顯著下降。受測為 2023 年世代模型,2024 年後研究視為隨任務與模型而異。
Ramnath et al.,Dial-SummEr(arXiv 2602.08149, 2026-02):對話中段最常被漏、憑空生成多出現在結尾;70.3% 摘要至少一個幻覺錯誤、29.7% 漏掉整個發言回合。受測含 GPT-5、Claude-Sonnet-4.5。
Kim et al.,FABLES(COLM 2024):超長文件摘要系統性遺漏關鍵內容並偏重後段;多個 LLM 忠實度評分器與人類標註均無強相關。
FaithBench(NAACL 2025):當前最強幻覺偵測模型在困難案例上準確率約 50%。
Generalization bias in LLM summarization(Royal Society Open Science, DOI 10.1098/rsos.241776):LLM 摘要寬泛概化機率為人類約 5 倍(OR 4.85, 95% CI 3.06–7.70)。
Kalai et al.,Why Language Models Hallucinate(2025-09):幻覺持續存在源於評測計分方式對「猜」的獎勵。
EBU/BBC,News Integrity in AI Assistants(2025-10):45% 回應至少一項重大問題。Microsoft Research,The Impact of Generative AI on Critical Thinking(CHI 2025):對 GenAI 信心越高,批判性思考越少。