Google Research 研究 AI 辅助是否会提升或削弱专利律师专业判断
Does better work always mean better workers?
Google Research 介绍了一项关于 AI 辅助对专利律师专业能力影响的三个月现场实验,研究对象为 11 家知识产权律所的 133 名律师。实验随机开放当时未发布、现已属于 Gemini Notebook 的 Google Labs AI 专利写作助手,结果显示 AI 在 10 天和 90 天的起草任务中分别将评分提高 0.34 SD 和 0.38 SD。
这项现场实验区分了 AI 辅助产出与无辅助判断,提供了观察专业技能迁移的具体设计。
判断力是将资深专业人士与初级同行区分开来的关键。培养判断力需要数千小时的在岗学习,通常是通过在经验丰富的员工指导监督下,参与相对常规、繁琐但具有塑造作用的工作来实现。但 AI 已经在改变在岗学习的运作方式。一方面,放射学、商业问题解决、求职者写作和法律教育领域的实证研究表明,当 AI 工具被深思熟虑地嵌入培训流程时,经验较少的员工可以提升其独立工作表现。
另一方面,近期针对软件工程师、管理顾问、高中生和临床医生的实验表明,虽然 AI 可以作为临时外骨骼,提升即时产出,但一旦移除该工具,这些收益往往无法持续。要理解 AI 如何削弱或增强专业能力,需要三个很少同时具备的要素:(1) 将持续数月而非数小时的 AI 使用嵌入日常专业工作中,(2) 在无法使用 AI 时对无辅助判断力进行可信评估,以及 (3) 由领域专家进行盲评。
在由美国国家经济研究局发表的《AI 辅助会增强还是侵蚀专业能力?来自专利撰写三个月田野实验的证据》中,我们描述了一项田野实验,用于捕捉在知识产权法这一高度依赖专业能力的职业中,AI 使用带来的短期生产力变化和长期技能培养变化。在我们的实验中,我们在 11 家与 Google 保持常规、非独家业务往来的知识产权律师事务所的 133 名律师中,随机分配了一款当时尚未发布的 Google Labs AI 专利写作助手工具的使用权限,该工具现已成为 Gemini Notebook 的一部分。每家事务所三分之二的律师(“处理”组)获得了该工具的早期访问权限,而其余律师(“对照”组)接受了一些关于如何使用 AI 的培训,但在三个月研究期结束之前不得使用该工具。
更好地与 AI 协作
在 10 天的 AI 辅助之后,我们向所有参与的律师发送了一套假想发明的发明人材料,并要求他们起草一份专利。90 天后,我们也进行了同样的操作,只是换成了另一套模拟发明人材料。我们在这两个时间点的起草任务中都看到了预期的 AI 性能提升。第 10 天时,AI 工具的使用权限使起草评分(由独立法律专家按五个不同质量维度的李克特量表评分)提高了 0.34 个标准差,相当于在对照组分数的百分位排名中上升 10 个百分点;到 90 天时,这一提升增至 0.38 个标准差,意味着百分位提高 11 个百分点。这些改进在所有质量维度上都表现出显著的一致性。值得注意的是,更好的表现来自低分出现频率降低和良好分数出现频率提高,而优秀分数的出现频率没有变化。从形式上看,被分配到 AI 使用权限的律师,其分数从底部五分位移至较低的中间五分位和中间五分位,但优异分数的数量没有明显变化。这一模式在初级律师身上尤其明显,他们在质量上的提升也伴随着显著的时间节省(例如,在 10 天任务中比对照组平均 124 分钟的速度快 18 分钟)。
但专利律师不只是起草专利;他们还会审查彼此的工作中是否存在关键错误(有时称为“专利亵渎”),这些错误可能使专利在法庭上无法执行——例如,过度主张一项发明的新颖性或范围。因此,我们在 90 天时增加了另一项任务,要求受试者对一份现有的假想专利进行红线标注(手动标记并更正),该专利包含许多实质性和文体上的错误。这项测试任务反映了更资深律师日常使用的那种专业判断,而在这类判断中,他们往往没有依赖 AI 的便利。关键在于,虽然处理组律师在起草任务中被鼓励使用尚未发布的 AI 工具或任何其他 AI 工具,但没有人被允许在红线标注任务中使用 AI,因此他们在这项任务上的分数衡量的是他们的技能发展得有多好。对于所有任务,无论是起草还是红线标注,我们都与第三方专利专业人士合作,从五个质量维度对提交内容评分:(1) 可执行性,(2) 准确性,(3) 战略性模糊(权利要求的战术性范围界定),(4) 完整性,以及 (5) 清晰度。
当 AI 被移除时
当 AI 助手在 90 天的红线标注任务中被移除时,拉平效应消失了。获得 AI 工具使用权限的律师在这项无辅助任务中的表现比对照组高出 0.32 个标准差(相当于百分位排名上升 9 个百分点),但这一效应完全由资深律师驱动,他们的表现比对照组高出 0.45 个标准差(上升 13 个百分点),而初级律师没有显示出可辨别的提升。相反,初级律师的分数出现分化:极低分更多,平庸分更少,良好分更多,但优秀分没有增加。
这些结果对学习意味着什么?获得 AI 工具使用权限的资深人员,显然在过去三个月使用该工具的过程中,在专业判断力方面收获了显著价值。但初级人员的情况则更为复杂。一些分数有所提高,暗示 AI 具有跨越式促进学习的能力。另一些分数则扩散到了分布的较低层级,表明在某些场景下,AI 可以帮助初级人员交付合格的工作,但他们在机器辅助下取得的更高表现,并不会转化为更快获得使资深专业人士具有独特价值的专业能力。
考察定性的编辑模式,可以让我们了解不同经验水平的专业人士如何使用生成式 AI 工具。在处理组和对照组中,初级人员的提交都遵循僵化的形式主义:初级人员按从上到下的顺序工作,经常把时间耗在对低风险的引言部分进行文字编辑上,还没来得及处理主要的专利权利要求。初级人员还专注于表层的同义词替换,而不是改进商业保护范围。即使初级人员发现了严重缺陷,他们也常常留下描述性评论来诊断问题,而不是实际执行红线修改来修复它。由于这种“诊断但不执行”的姿态在没有辅助的对照组初级人员中同样常见,它代表了一种初级人员的基线缺陷,而三个月依赖 AI 执行改写并未弥补这一缺陷。
相比之下,资深律师始终从 AI 接触中受益。接受处理的资深律师花在红线修改上的时间比初级人员更长,他们绕过低风险的文字表述,从头重建权利要求,剔除可能无意中缩小法律权利或限制保护范围的措辞,并将许多修改与明确的法律原则相结合。在后续访谈中,资深律师表示,他们并不把 AI 输出视为成品,而是把它当作“逻辑审计员”。它削弱了他们对现有文本的依附,迫使他们阐明结构性修改的原因和方式,从而激活并磨砺了他们的基础专业能力。
进一步方向
提升表现和建立持久的专业判断力是不同的目标。尤其对初级专业人士而言,二者之间可能存在张力。基础专业能力可能是缺失的一环,使得 AI 辅助下的重复练习能够在整个职业生涯中转化为成熟的专业判断力。即使随着模型能力进步,这种判断力很可能仍将重要:律师将继续在与法官、客户和同事的互动中运用自己的判断力。他们不可能在所有场景下都依赖 AI 工具来辅助自己。当前这一 AI 时刻面临的一个关键挑战,是确保那些旨在今天产出更好工作的工具,不会妨碍初级专业人士成长为我们明天所需要的专家。
在工作环境中研究专业人士,对研究人员来说是一项挑战。我们的实验包含了一组数量有限的专利律师样本,这反映出该领域顶级专业人士按小时计费的费率很高。我们只在三个月内观察他们,与他们培养持久专业能力所需的多年时间相比,这是一个很短的窗口。此外,在过去一年中,模型能力和基线 AI 熟悉度(以及法律领域中 AI 赋能产品的渗透率)都在快速提升,如果我们现在重新进行试验,可能会影响我们的结果。这些局限性带来了进一步研究的机会,其中一些是我们希望在未来几个月继续推进的。尽管如此,我们工作的一个明确结论是:要理解 AI 辅助对专业技能的影响,需要通过测试将使用工具的影响与用户在无辅助情况下表现的影响区分开来。
致谢
衷心感谢合著者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;感谢 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 的指导与支持;感谢 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 与我们合作开展实验;感谢 Kiera Russell 提供产品访问权限和可信测试者支持;感谢 Steve Gong 和 Taylor Montgomery 提供法律指导和招募支持;也感谢我们的传播、营销和 Research Blog 合作伙伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo,推动发布工作。
来源:Google Research · research.google