
公司剛導入AI後,最可能帶來重大影響的,或許不是AI有多聰明,而是它如何與使用者說話。幾乎沒有高階主管在衡量這件事,但我們的研究顯示,他們應該開始重視。許多領導人仍用過去IT評估資料庫的方式評估AI:看能力、速度和成本。然而,另一個因素對績效可能同樣重要,那就是AI的人格與互動風格。
這一點很重要,因為員工現在不只用AI完成任務,也愈來愈需要花時間管理AI系統本身。AI能否提升組織績效,不僅取決於AI能做什麼,也取決於日常協作時如何表現。而這種行為,是組織可以設計與治理的。
評估AI人格如何影響使用者
AI最初的定位,尤其生成式AI,是居於從屬地位的支援系統:能夠回應、配合指示,並以協助人類完成任務為目的。但隨著這些系統自主性愈來愈高,也更深入工作流程,員工開始把AI當成隊友、評估者,有時甚至是非正式主管。到了這個階段,系統如何與人互動就開始產生影響。由於生成式AI的回應具有機率性,因此無法單靠規則完全限定其行為;無論設計者是否刻意安排,都會形成一貫的互動模式。對使用者來說,這是AI的「人格」,表徵包括支持、謹慎、輕視或阻撓。
為了解AI人格如何形塑這些反應,我們以58名參與者進行實驗室控制研究,並用兩種方式即時追蹤每個人的生理反應。第一種是測量皮膚電導反應(skin conductance),也就是與個人情緒喚起程度相關的皮膚電活動指標(也就是測謊器偵測的訊號)。第二種是使用臉部肌電圖(facial electromyography, fEMG),測量臉部肌肉收縮時產生的微小電訊號,藉此偵測皺眉(負向情緒)與微笑(正向情緒)。
我們也分析參與者與我們建立的AI之間的對話,讓專家盲評最終作品品質,並收集任務結束後的自我陳述(也就是參與者自行提供關於自身想法、感受、信念或行為的資訊)。58人的樣本規模在心理生理學研究中很常見。每位參與者都會貢獻數千筆連續記錄的生理數據,而且每場實驗的執行與分析都相當耗時,因此這類研究通常犧牲廣度,以換取深度。
參與者一邊完成一項模擬任務,為虛構的環保科技公司進行四部分的行銷作業,一邊與被設定為主管的AI聊天機器人協作。31名參與者使用「僕人式領導人格」(servant leader persona),這個AI會鼓勵人、保持耐心,也願意把判斷空間留給員工;其設計取自管理學對賦權型領導的研究。另外27名參與者使用「暗黑三特質人格」(dark triad persona),這個AI語帶諷刺、缺乏耐性,動輒搶功,也傾向於把責任推給別人;其設計取自有毒領導研究。兩組唯一的差異是互動風格。兩種AI也都被要求不能直接替參與者完成任務,因此結果若有差異,反映的是協作方式,而非提供了多少協助。
員工自述與實際經歷有何落差
關於人們如何體驗職場AI的研究,通常仰賴自我陳述,但這只能說明部分情況。我們在研究中觀察4個面向的證據:人們與聊天機器人互動時如何行動、身體當下如何反應、最終作品品質如何,以及事後如何自我陳述。綜合4個面向,我們便能清楚看出人們實際經歷與事後說法之間的落差。
第一個模式出現在行為。帶有敵意的AI會造成隱性的協調成本。參與者無法單純使用系統,還得花力氣與系統周旋。在暗黑三特質組,對話拉得更長,AI本身的回覆則更短;使用者做了更多工作,得到的有用互動卻更少。抗拒也大幅增加:在這一組中,使用者反駁或質疑AI的訊息占全部互動的13%,僕人式領導組只有1%。透過提示詞注入(prompt injection),或要求AI改扮另一個角色,試圖改變系統既定行為的情況,出現頻率也是另一組的4倍。
對話的情緒語氣也支持這項結果。使用僕人式領導AI時,挫折感幾乎沒有出現,約每100則訊息才有1則;使用暗黑三特質AI時,則升到將近每5則就有1則。第一組很少出現的防衛性語言,在暗黑三特質組成為常態。面對帶有敵意的AI,參與者雖然更努力,說話時卻顯得更沒有把握。他們在配合、抗拒、協商與求助之間反覆切換,試著找出讓系統變得有用的策略。與僕人式領導AI協作的參與者則很快找到節奏,之後便維持下去。
生理數據也證實壓力與身體負荷增加。在暗黑三特質組,皮膚電導的峰值高出72%,而且每次互動結束後仍維持在較高水準。白話而言,參與者與帶有敵意的AI工作時,身體會維持警戒。如果螢幕上的文字在實驗室裡就足以引發這種反應,領導人更應正視:在利害關係更高的真實職場中,長期暴露在這類互動之下,可能造成什麼影響。
工作成果本身也受到影響。不知道參與者使用哪一種AI的獨立專家,從完整度、原創性、策略契合度與整體品質等面向評分,僕人式領導組都更高,兩組在七分量表上的差距約有整整一分。暗黑三特質組的評分變異程度也約為另一組的兩倍。這表示設計不良的AI人格除了拉低平均工作品質,也會讓不同使用者之間的績效更難預測。對主管而言,後果除了工作品質下降,還包括員工產出變得更難掌握。
接著是令人意外的部分:參與者的自我陳述幾乎看不出差異。以愉悅感、滿意度、注意力、對AI的看法等常見指標來衡量,兩組幾乎一樣。許多組織用來評估AI導入成效的工具,如滿意度調查、情緒分析和導入後問卷,反而最難察覺我們觀察到的影響。員工可能說工具用起來沒問題,但他們的行為、壓力程度與工作品質卻呈現另一番景象,尤其時間拉長後更是如此。
主管應採取的3項做法
我們的研究結果顯示,主管應採取3項行動。
1. 把AI人格視為需要治理的設計變數
組織已經要求AI系統符合準確性、偏誤與資安等標準;AI人格也應列入同一張清單。這一點對具有評估或監督功能的工具尤其重要,如會評論工作成果的寫作助理、程式碼審查系統,以及自動化績效回饋意見工具。企業採購與導入AI時,除了能力標準,也應納入互動標準。組織內必須明確有人為兩個問題當責:當AI不同意員工時,應該如何回應?我們有什麼證據顯示,AI能持續以這種方式回應?
2. 衡量使用阻力,不只看採用情況
多數公司追蹤員工是否在使用AI工具,如登入率、查詢量和滿意度分數。這些數字能顯示使用程度,卻看不出工具是否真的能改善工作。這些數字漏掉的是「阻力」,也就是員工為了與系統周旋而額外付出的力氣;這些力氣原本可以用來從系統取得價值。企業也應衡量這項指標。阻力能補上採用情況看不出的資訊:AI究竟讓工作更容易,還是只是增加額外負擔。
在我們的研究中,阻力表現在更長的來回對話、反覆改寫同一項要求,以及愈來愈多與AI爭辯或試圖繞過AI的行為。這些訊號在真實職場也看得到,只要查看一般使用紀錄,不需要任何特殊設備。一項工具可以同時有很高的採用程度與很高的阻力:員工因為不得不用而持續使用,私下卻一直想辦法繞過系統。
3. 員工試圖繞過AI,應視為系統異常的訊號,而非行為不當
如果沒有資安訓練、也沒有對抗意圖的員工,開始設法改寫、繞過或讓AI系統的既定行為失效,領導人不應先認定主要問題在於員工行為不當。這些行為往往表示系統設計正在引發可預期的抗拒。在我們的研究中,試著以提示詞誘使AI忽略自身規則,或改扮另一個角色的情況,只出現在帶有敵意的AI組。員工之所以和AI對抗,有時可能是AI先把互動推向對抗。在許多情況下,修正這個設計問題,會比用新的限制、監控或使用規則來約束員工成本更低,也更有成效。
***
我們的暗黑三特質AI,是把有毒互動刻意推到極端的一種誇張版本,藉此讓原本容易忽略的效果顯現出來。不過,有毒互動有很多形式:一味迎合、永遠同意、急著取悅使用者的AI,同樣可能造成傷害,讓使用者的批判思考變鈍,對薄弱構想照單全收。這並不表示AI應該更溫和或更順從;研究要指出的是,互動風格是一個會造成實質後果的重要變數,而且正反兩種方向都可能產生影響。因此,組織重視AI人格的程度,應不亞於它的技術能力。
(費艾文編校)







