计算机与人工智能预印本实验阅读 1 分钟

由算法决定难民从哪里起步

难民在东道国往往很难找到工作。论文指出,在20个欧洲国家,难民就业的可能性比条件相当的移民低约12%,这一差距会持续十到十五年。抵达后的最初几个月和几年最为关键,难民被安置在哪里也同样重要。然而在包括瑞士在内的许多国家,安置遵循行政配额,官员对每个人在哪里能发展得最好知之甚少。

是建议,不是决定

2018年,柯克·班萨克(Kirk Bansak)、延斯·海因米勒(Jens Hainmueller)及其同事提出了难民算法匹配。一个用以往抵达者数据训练的机器学习模型,预测每位难民在每个可能地点找到工作的可能性。随后,一个优化步骤在遵守所有配额的前提下,推荐能使预期就业最大化的安置方案。最终决定仍由人类官员作出。

此前,这种方法的效益只是通过回放历史数据来估算。这项研究由班萨克(加州大学伯克利分校)、海因米勒(斯坦福大学)和多米尼克·汉加特纳(Dominik Hangartner,苏黎世联邦理工学院)领导,报告了作者认为的这一方法的首个随机对照试验。试验与瑞士国家移民秘书处(SEM)合作开展,使用的是其工具GeoMatch的早期版本。

真实行政机构中的盲法抽签

从2020年1月到2023年6月,每个符合条件的案例——获得难民身份或临时保护、且可被安置到任何一个州的家庭或单身成人——都由计算机按50/50的比例分入两组之一:

  • 算法组: GeoMatch预测能使就业最大化的州;
  • 对照组: 按常规程序,在可用名额中随机抽取的州。

无论哪组,安置官员看到的屏幕都相同,他们和难民都不知道某个案例属于哪一组。每组都有一份各自独立但完全相同的按州和国籍划分的配额。这一设计排除了一个简单的“捷径”:算法无法把更多人送往就业市场强劲的州。它只能改善人与地点之间的匹配度。

模型掌握的信息很少:性别、年龄、婚姻状况、家庭规模、抵达日期、国籍和母语。教育程度、工作经历和语言能力都没有记录在它所使用的登记系统中。官员约**97%**的情况下采纳了屏幕上显示的建议。

最终样本为:2000个案例,2156名成人,主要来自阿富汗(54%)、土耳其(26%)和叙利亚(9%)。

结果

预注册方案中确定的主要指标,是前三年中有工作的月份所占比例。在对照组中,成人平均在**22.3%**的月份里有工作。

  • 全部批次(2020—2023年): 算法组高出2.2个百分点,约多10%,置信区间为+0.05至+4.3个百分点。
  • 疫情后批次(2022—2023年): 高出3.9个百分点,约多17%。试验在疫情暴发前几周开始,而模型是用疫情前的数据训练的;2020年和2021年批次的效果与零无法区分。这些按批次的比较并未预注册。
  • 随时间增长: 安置36个月后,至少有一名成人工作的家庭比例高出5.2个百分点(约11%)。
  • 工作更稳定: 持续至少六个月的工作高出5.6个百分点;三年时签订无固定期限合同的比例高出4.5个百分点。

低成本,源于设计

仅计算公共财政——不再支付的福利,加上社保缴费和税收——作者估计每多一个就业月的价值约为1950瑞士法郎。假设运行成本为每名成人50瑞士法郎,他们估计每名成人的净收益约为1300瑞士法郎,比例约为27比1。他们将三年时的效果与增加数百小时语言培训的项目相比较,同时强调算法不能取代这类课程。

他们称这次试验是一次保守的检验:工具是早期的冻结版本,预测变量少,地理划分粗略,配额严格,而且只有一半的案例可供优化。更新、限制更少的版本能否表现更好,仍有待检验。

谁开发,谁检验

GeoMatch方法由作者自己开发。他们声明无利益冲突,并表示没有因开发或运行该工具而从瑞士政府获得任何报酬;这项工作由斯坦福大学、包括Google.org在内的基金会和慈善机构,以及一项欧洲研究资助提供经费。在难民问题之外,他们认为这次试验是罕见的实地证据,表明预测工具在辅助而非取代决策者时,可以改善高风险的公共决策——同时也提醒人们,当世界发生变化时,比如2020年那样,这类工具必须重新训练。

Legal notice