普林斯顿大学和芝加哥大学的研究人员发现,大型语言模型 (LLM),包括 ChatGPT 等工具,不仅会根据人类训练数据产生偏差,还会根据他们自己在模拟招聘场景中的经验产生偏差。在这些实验中,模型在解释早期结果后根据人口统计信息对候选人进行分类,显示出与人类参与者相比,对求职者产生刻板印象的倾向更高。
研究采用了模拟招聘游戏,涉及 20 个工作角色,例如医生和清洁工,涵盖四个虚构的族裔群体:Tufa、Aima、Reku 和维基。每个模型的任务是在 40 轮中最大限度地成功招聘,而不知道所有候选人都有平等的成功机会。在得知特定候选人在职位上失败或成功后,模特们经常会调整他们的招聘偏好。例如,如果艾玛候选人在医生方面表现不佳,模型就会转向雇用艾玛担任清洁工职位。
根据这项研究,法学硕士在隔离量表上的得分明显高于人类受试者,平均得分约为 1.83,而人类受试者的平均得分为 0.84。合著者、普林斯顿大学博士生 Ryan Liu 表示:“法学硕士确实渴望从有限的数据中得出概括。”这种快速概括的倾向可能会导致破坏性的刻板印象,因为较新的模型表现出更强的偏见。
其影响意义重大,尤其是当人工智能聊天机器人获得先进的记忆和个性化功能时。康奈尔大学计算机科学家安吉丽娜·王 (Angelina Wang) 表示,聊天机器人可能会因过度依赖之前的互动而形成根深蒂固的偏见。简单地减少内存并不是解决方案,因为用户更喜欢记住其输入的系统。
研究表明,指示模型优先考虑公平对他们的行为影响有限。然而,激励多元化招聘可以减少决策的偏见。刘指出,将社会目标融入人工智能目标可以促进语言模型中更多对社会负责的行为。
此外,当提供有关候选人的更多相关个人信息(例如年龄和教育程度)而不是不相关的详细信息(例如头发颜色)时,法学硕士表现出较少的偏见。该研究强调了这些发现在现实世界应用的不确定性,特别是因为筛选工作申请的人工智能模型不会立即收到有关招聘的反馈。
研究人员担心,随着公司越来越多地部署法学硕士进行简历筛选和其他关键评估,模型存在在没有直接人工输入的情况下产生新偏差的风险。刘说:“这些新颖的偏见一直存在。”他强调,随着人工智能在招聘和其他决策过程中的使用不断扩大,我们需要提高认识。
<小时/>





