在美国,超过65%的管理者在工作中使用人工智能。根据2025 Resume Builder对1300多名管理者进行的一项调查,94%的管理者使用人工智能工具来评估其直属下属,而评估结果进而影响加薪、晋升和裁员等决策。其中,五分之一的管理者允许人工智能在未经人工审核的情况下做出最终决定。更令人担忧的是,不到三分之一的管理者曾接受过关于如何负责任地使用这些工具的系统化伦理指导。
许多管理者将人工智能视为一款功能特别强大的搜索引擎:输入问题,即可获得答案。但关于大型语言模型在职场伦理困境中表现的研究揭示了一个更具深远影响的事实:这些工具实际上是咨询系统,且每种模型都具有独特的倾向性,这些倾向性会影响其给出的建议。
通过研究针对八种主流AI模型,通过一系列基于同一伦理困境的受控职场情景进行了测试:一名在关键职责岗位上工作的同事表现出可能存在能力受损的迹象。该困境被呈现于从医疗保健到航空、金融、法律服务、IT、建筑及公共交通等不同专业领域和风险等级中,同时系统性地调整了风险程度、证据充分性及报告义务的要求。模型被要求在非正式处理此事或通过机构渠道上报之间做出选择。研究结果揭示了四种截然不同的建议风格。
四位顾问,四种方法
ChatGPT的表现如同经验丰富的管理顾问。其回复始终最为详尽且结构严谨,建议均以组织政策和既定流程为依据。即使在建议进行正式的人力资源报告时,其表述也遵循常规且恰如其分,而非危言耸听。上报被呈现为治理机制的延伸,而非紧急事件。
Gemini 的运作更像一名系统分析师。在风险较低的情境中,其回复强调透明度和职场文化;而在高风险场景下,尤其是医疗保健和航空领域,其建议会迅速转向机构干预和正式的安全流程,且随着风险严重程度的增加,这种转变的幅度比几乎所有其他测试模型都要更为显著。
Mistral的功能更像是一位非正式的同行。在整个测试过程中,它从未建议过正式上报。即使在涉及潜在患者或航空安全隐患的情景中,其响应也侧重于直接沟通、加强监督和就地解决问题。这使得Mistral在情况真正模糊不清时非常有用,但在风险升高时,可能容易出现系统性的上报不足。
DeepSeek的表现类似于审查法律风险的合规官。其建议具有临床分析性且保持客观,高度关注问责与法律责任,其中“适任性”和“机构责任”等概念的出现频率远高于大多数其他模型。该模型非常适合注重可辩护性的受监管环境,但在人际关怀至关重要的情境中可能不太适用。
关键并不在于这些“人格类型”中哪一种是正确的,而在于它们确实存在。每种模型都有实质性的差异,而大多数管理人员在打开浏览器时,并未意识到自己正在这些人格类型之间做出选择。
盲点
这项研究中最出人意料的发现,或许在于正式规则的影响微乎其微。推动上报建议的最强且最一致的驱动因素是潜在的身体伤害。因此,航空和医疗保健等领域的上报率远高于金融、法律或行政领域——即使这些领域中的组织后果同样严重。令人惊讶的是,一旦确定了潜在的风险水平,增加一项明确的正式报告义务并不会实质性地改变建议。这些模型似乎更注重危害程度,而非遵循规则。
模型配置增添了另一层变数,而大多数用户往往未曾考虑这一点。将同一模型从标准模式切换至推理或思考模式,可能会产生截然不同的建议。当Mistral在高风险的航空场景中切换至思考配置时,其建议发生了彻底转变,从非正式处理转变为立即上报。在某些情境下,Gemini也表现出类似的转变。这些并非边缘案例;它们表明模型设置可能会以用户未预料到的方式影响建议。
夺回决策权
模型之间的差异足够大,以至于在实践中,工具的选择会产生重大影响。面对相同的风险信号,不同的系统展现出不同的上报阈值、推理风格和响应方式。
这些工具并非设计为可互换的。它们由处于不同文化背景、监管环境和商业优先级下的公司开发。在某种机构背景下训练的模型,其对问责制的解读将与在另一种背景下训练的模型有所不同。使用人工智能进行决策支持的管理者,可能会根据所用工具及其配置方式的不同,收到截然不同的建议。
如果使用得当,这些工具可以拓展管理者的思维。但它们无法取代的是情境知识、关系历史以及管理者所肩负的道德责任。
