「AI 到底让谁受益更多」这个问题上,实证研究给出过两组互相打架的证据。
一派发现 AI 让新手提升最大。最常被引用的是 Brynjolfsson 等人对 5,179 名客服坐席的研究:接入生成式助手后,整体产出(每小时解决问题数)提升 14%,经验最少的那批人提升 34%,而资深坐席几乎没有变化。写作任务上也观察到类似的收敛,垫底的人被拉起来,组内差距缩小。按这组证据,AI 是一台均衡器。
另一派观察到的方向相反:在需要专业判断的工作里,专家把 AI 用得明显更好,差距被拉大。同一件工具,两个方向的结论。
论文说了什么
这篇发表于第 5 届混合人机智能大会(HHAI 2026,布鲁塞尔)的立场论文给出的调和是:两派都对,分水岭在任务复杂度。
作者基于 2024 年中以来在企业部署与教学场景中的结构化田野观察,提出一条分界:在常规的、结构良好的、有明确对错的任务上,AI 是均衡器,新手与专家的差距被压平;在需要深度判断的复杂任务上,AI 是放大器。
放大的机制说得比结论更有意思。复杂任务里模型的输出必然掺杂错误,而专家和新手面对同一份错误输出的处置完全不同:专家能校验、能追问、能识别哪一句不对并要求重来,模型于是成为他判断力的杠杆;新手缺乏校验能力,只能把输出照单全收,错误被原样带进最终成果。也就是说,AI 放大的不是"使用技巧",而是使用者原有的判断力,包括判断力的缺失。
由此得到的推论是:决定谁受益的是领域专业度,而不是提示工程。「会写 prompt」不构成长期优势,领域判断力才是。
这篇的证据强度
这是一篇立场论文,依据是结构化田野观察,不是对照实验。它调和的那两派恰恰是随机对照实验,所以在证据等级上它反而低于被它调和的对象。这一点值得读者自己拎清楚:它提供的是一个解释框架,不是对该框架的检验。
「任务复杂度」也没有被操作化成可测量的变量。什么算常规、什么算复杂,论文靠例子划界而不是靠定义划界,落到具体岗位上边界会相当模糊。想直接拿它做决策依据的人,需要自己补上这一步。
作为立场论文这些都不算硬伤,但它意味着这个框架当前的地位是"值得检验的假说",而不是"已经站住的结论"。
对实践的意义
这个框架直接影响我们做企业 AI 交付的方式:把常规环节交给 AI 拉平效率,把复杂判断环节留给专家、再用 AI 放大他们。两件事要分开设计,不能用同一套流程覆盖。
它也解释了一个我们反复遇到的现象:同一套工具铺给全公司,有的团队用出效果,有的团队产出反而更糟。差别常常不在培训是否到位,而在那个岗位的核心任务落在分界线的哪一侧。FIM 的内训按岗位领域组织而不是按「AI 通识」组织,依据就在这里。
对个人也有一条推论:如果长期优势来自领域判断力,那么把时间投在追工具、追提示词技巧上的回报会迅速衰减,投在本行的判断力上才是复利。
论文收录于 IOS Press《Frontiers in AI and Applications》第 423 卷,pp. 212–220,开放获取(CC BY-NC)。