每週吃掉一個工作天!揭開「AI監工」隱形成本,組織設計三解方

班傑明(Benjamin)是一名顧問,協助政府機關處理科技合作伙伴關係。他開始使用一款AI排程代理,原本期待能替自己省下時間。接受我們訪談時,班傑明說,他原先想像的是一份乾乾淨淨的行事曆、一整天少一點干擾,也不必再為安排會議而忍受令人心力交瘁的來回溝通。結果,他獲得的是一份額外的工作:管理那個原本請來替他管理行事曆的AI代理。
AI代理動作又快又有把握,幾秒鐘就能替班傑明排好會議。問題在於,AI代理不知道班傑明行事曆背後那些看不見的脈絡。它把客戶電話會議排進班傑明每週固定保留的兩小時準備時段。行事曆上沒有任何標記顯示這段時間不能使用,這只有班傑明自己知。代理還把兩場會議一前一後排在城市兩端,中間完全沒有預留交通時間,因為它不知道兩地相距多遠。代理替班傑明和一位新進員工安排簡短會議,該員工的主管原本也要出席,代理卻沒有邀請到他。代理甚至邀請一位政府機關高階官員「撥15分鐘聊聊」,語氣和稱呼卻與對班傑明的大學老友一樣輕鬆隨意、直呼其名,因為沒有人教過它有些關係需要更細膩地拿捏分寸。
AI代理幾秒鐘就排好每一場會議,班傑明卻得花更久時間收拾善後:手動把準備時段重新排回去、打電話向主管解釋這場烏龍、處理那兩場分處城市兩端卻被排在一起的會議,還得向那位政府官員道歉。
生產力悖論
過去十多年來,我們一直研究數位科技帶來的隱性負擔,包括「協作超載」、在不同應用程式之間反覆切換所付出的「切換成本」,以及數位工具干擾認知與情緒資源所造成的「數位疲勞」。AI原本帶來的承諾,是減輕其中一些負擔。然而,在我們研究的100多家組織裡,多數情況反而變本加厲。班傑明這一週的經歷,只是更大問題的一個縮影;這個現象來自我們與同事為Glean旗下AI工作研究所(Work AI Institute)進行「AI工作指數」(Work AI Index)研究時所做的一項調查。
這項研究的一部分,調查了美國、英國與澳洲6,000名全職工作者,他們的工作大多是在電腦上或使用數位工具完成。這些數位工作者之中——如軟體工程師、金融分析師與產品行銷人員——有75%表示,使用AI之後生產力提高;平均而言,AI每週替他們自動化11小時的工作。但只有13%表示,組織績效因此獲得顯著改善。
我們認為,其中一個最大的問題就是「顧機器」(botsitting):為了讓AI真正派得上用場,人類必須投入一種看不見、未被追蹤,也沒有獲得獎酬的勞動。工作者表示,每週平均花6.4小時「顧機器」——幾乎等於一整個工作日——占所有AI相關時間的37%,甚至略高於真正使用AI完成工作的時間(36%)。「顧機器」並不是單一活動,而是一整組工作,包括替AI補充脈絡(每週2.3小時);找出並修正AI的錯誤、偏誤或非預期行為(每週2.2小時),以及在AI產出投入使用前進行檢查,確認結果確實符合預期用途(每週1.7小時)。
AI的隱藏成本不只在時間。員工還得不斷檢查、修正並穩住系統,直到產出可以使用為止,這也會造成心智耗損。
有些「顧機器」工作無可避免,甚至是有益的。但員工回報的大部分工作都十分繁瑣平凡:同一個提示詞重寫4次、在不同工具之間複製貼上脈絡、反覆切換彼此無法互通的工具,以及收拾AI無意間製造的爛攤子。
隨著token成本——也就是AI處理提示詞、擷取脈絡及生成產出所需支付的費用——愈來愈高,「顧機器」的代價也會隨之增加。員工每一次把過多脈絡塞進模型、重新執行同一項工作,或只是為了取得堪用結果而改用成本更高的模型,組織其實都付了兩次錢:一次支付額外消耗的運算資源,另一次則支付人類必須親自引導工具、直到產出有用結果所投入的勞動。
領導人的3項誤算
乍看之下,這似乎是個人生產力問題,實際上卻是組織設計問題,源自領導人常犯的3項誤算。
低估AI需要多少管理
領導人往往看不見,也沒有計入讓AI真正派得上用場所需的人力。這些工作包括補上缺漏的脈絡、查核準確性、修正只答對一半的答案,以及當工具誤判人際關係、事情的利害程度或適當語氣時出面收拾善後。
要處理這個問題,第一步是盤點員工究竟花多少時間「顧機器」。接著追問:這些人工監督是否真的創造價值?還是反而說明,這項工具尚未準備好承擔這項工作?
企業也可以把AI直接嵌入工作流程,減少不必要的監督。每增加一個獨立AI工具,就多一個員工必須學習、登入、反覆切換,還得不斷補充脈絡的介面。例如,Reddit的領導人把AI直接整合進員工原本就在使用的工具,包括電子郵件、客服佇列及其他日常工作平台,而沒有另外設置一個獨立AI介面,要求員工記得特地登入使用。
最後,組織必須透過政策與日常實務明確傳達:AI輔助決策最終仍由人類當責。我們的研究發現,系統運作得愈自主,責任歸屬就愈容易分散。
把數據存取誤當成可用脈絡
AI若要在組織中真正派得上用場,就必須掌握組織特有的脈絡。例如,哪一版簡報才是最新版本;銷售部門和行銷部門說「流程」時各自指什麼;一筆交易在實務上究竟如何成交,而不是內部手冊規範如何成交。像模型脈絡協定(Model Context Protocol, MCP)這類協定——一項用來連結AI應用程式與外部系統的開源標準——可以跨系統擷取數據,卻往往缺少這一層詮釋。其中一部分原因是,許多脈絡從來就沒有被正式記錄下來。最後只能由員工自己填補缺口:貼上缺少的脈絡、補回被抹平的細微差異,再一遍又一遍重新下提示詞,直到AI產出讀起來終於像是公司內部的人寫的。
「AI工作指數」調查中,有53%受訪者表示,工作所需的重要資訊無法透過AI系統取得。代價也不只是不理想的產出。在脈絡不足的組織裡,員工因AI而感到疲憊不堪的機率,幾乎是脈絡充足組織員工的3倍,兩者分別為50%與18%。
組織應把脈絡視為基礎設施,而不是要求員工親手餵給AI工具的材料。AI開發人員若能與領域專家一起打造系統,會有莫大幫助,因為這些專家知道正式流程在實務上會在哪裡失靈,也知道第一線怎樣才算做得好。意識到這項需求之後,OpenAI與Anthropic等AI公司開始派遣「客戶端派駐工程師」(forward-deployed engineers, FDEs)到客戶端,協助客製AI模型。然而,我們也看到有些組織跟進這波FDE做法後依然卡關,原因在於他們仍把事情當成技術部署問題,彷彿只要串接數據、描繪工作流程,再把AI接進去,工作就完成了。實務上,更困難的挑戰在組織層面,不只有技術層面:企業必須重新設計角色、交接方式與決策權,讓人與系統能有效協作。
組織還必須投資建立「脈絡層」(context layer),也就是能夠捕捉工作實際如何完成的基礎設施,而不只是記錄文件上寫了什麼。這些脈絡包括:大家真正信任哪一個文件版本、成果正式送出前需要哪位主管簽核、原本的負責人離開之後現在誰才是權威;以及誰知道訂價準則寫了什麼,與法遵部門實際會核准什麼之間的差別。我們的研究顯示,這種後設知識是組織得以運作的重要一環,但大多數工具都沒有收錄,因為這些知識通常是內隱的——存在於人與人際關係之中——而未被清楚記錄並加以明文化。
衡量的東西錯了
太多組織仍緊抓著一位《財富》100大企業高階主管口中的「虛榮指標」(vanity metrics):容易計算的數字,例如點擊次數、token用量、部署了多少軟體授權。有一家企業把Copilot的token用量拿到董事會面前,當成AI導入進展的證明,私下卻向我們抱怨,員工都在拿它處理無關緊要的工作。一旦看得見的活動成了目標,員工就會想辦法把這些活動數字做高。一名工程師告訴我們,他開始拿一些自己其實能更快回答的問題去問AI,只為了墊高自己的使用數字。
古德哈特定律(Goodhart's Law)——當一項衡量指標成為目標時,就不再是好的衡量指標——如今正在AI導入中活生生上演。要避免這個問題,企業必須從多個面向進行衡量,其中也要納入品質。我們的調查顯示,如果組織同時追蹤品質與生產力,有83%員工表示AI改善了自己的工作;如果組織只追蹤生產力,這個比例只有68%。我們研究的一家組織從3個面向評估AI:效率、品質與員工體驗,以免只看到效率提升就予以核准,結果卻讓員工筋疲力竭,或犧牲顧客體驗。
組織也應針對「顧機器」的成本建立指標,例如AI產出有多常需要人工審查、要重下幾次提示詞才能取得可用結果,以及員工花多少時間查核答案,或在不同工具之間補上缺少的脈絡。舉例來說,工作流程自動化公司Zapier會追蹤「提示詞到結果滿意度」,以及「AI╱人類完成比例」,也就是AI代理與人類使用者完成的所有任務、訊息或專案行動中,由AI代理自主完成的比例。
員工也需要足夠的心理安全感,才敢回報AI失敗。如果領導人大力吹捧token用量與連續登入天數,那麼員工不再主動指出糟糕的AI產出,也不足為奇。我們曾合作過的一家中型企業,員工好幾個月都默默自行吸收出問題的AI工作流程所增加的成本,因為他們擔心,若坦白說AI其實讓工作增加了更多時間與心力,會顯得自己沒有全力支持組織的AI發展目標。後來,領導階層終於在團隊會議中,針對AI造成的重複工作加入不究責檢討,也開始表揚那些能提出具體證據、證明某項工作不該自動化的員工。直到這時,領導人才真正看見,原來員工一直以來處理了多少善後工作。
AI背後真正的工作
最後,班傑明終於摸索出如何使用自己的AI代理:由他來做工具做不到的工作。他把AI無從得知的事情一一寫下來,例如哪些準備時段不能動、不同會議之間需要多少交通時間,以及哪些聯絡人需要更細心地照應。最重要的會議仍由他親自盯著,也不再把收拾工具錯誤當成自己做不好,而是把這項工作正式納入工作流程。
最後,AI代理確實替班傑明省下了時間。但要達到這個結果,班傑明也必須把省下的一部分時間重新投入,有策略地管理這個代理。
「顧機器」的代價不該由個別員工默默吞下。這件事必須從領導階層開始:決定哪些工作該交給AI、留意AI會在哪裡出錯,再修正流程,讓相同問題不再重複發生。目前太多組織都沒有任何人負責這項工作、沒有編列預算,也沒有人當責確認這些投入究竟是否值得。
工具還會持續進步,但一如往常,這些進步能否真正轉化為組織績效,最終仍取決於那些經營組織、推動工具部署的人。
(費艾文編校)



