

这项由来自加利福尼亚州桑尼维尔和圣地亚哥的两位零丁策划者完成的策划,发表于2026年ICML(海外机器学习大会)旗下的"郊野智能体:安全、安保与将来"第二届研讨会(AIWILD @ ICML 2026),论文预印本编号为arXiv:2606.18021,于2026年6月16日公开。有酷好深切了解的读者不错通过该编号在arXiv平台查询齐备论文。
假定你是一家公司的法务隆重东谈主,你刚刚用了一款AI器具来审查一份遑急契约。AI自信满满地告诉你:契约里有一条国法,对方的抵偿牵累最高不进取500万好意思元。于是你定心肠签了字。几个月后,纠纷确切发生了,讼师翻遍契约,阿谁500万上限根底不存在——是AI臆造抓造的。亏空可能是几千万,以至公司的死活。
这不是科幻故事,这正是今天法律AI边界正在发生的真实风险。两位零丁策划者为此设立了一套名为LegalHalluLens(法律幻觉透镜)的审计框架,挑升用来拆解AI在法律文献中"说谎"的样式、位置和主张,并给出了一套经过考证的修正决策。
一、AI讼师的坏话:不是一种,而是四种
当咱们说AI在"幻觉"(hallucination),庸碌来说就是AI在一册正经地瞎掰八谈——它把我方编造的内容当成真实信息输出给你。在法律契约审查这件事上,这种问题尤为危境,因为契约里每一个字都可能价值千金。
这项策划把契约中的内容按照"容易出错的样式"分红了四大类。第一类叫作念数字类,指的是契约里的金额、比例、数目上限这些东西,比如抵偿上限是若干钱、最低采购量是若干件。第二类叫作念时候类,指的是日历、期限、文告周期,比如契约什么时候到期、续约需要提前若干天文告。第三类是义务与权力类,这类是最复杂的,因为它包含了"应当""不错""必须"这些抒发强制进度的词,还有多样例外条目、附加条件和范围规定,比如"供应商须在居品制造前的灵验期内,对第三方索赔提供抵偿,但第4.2条国法的情况之外"。第四类是事实类,指的是当事方称号、适用法律、契约称号这些基础信息,看起来精炼,但AI有时会把常见的"默许法律"强行套进去。
策划团队接纳了一个叫作念CUAD(契约连合分析数据集)的范例测试库手脚"科场"。这个数据集由法律众人经心标注,包含510份真实贸易契约,覆盖41种具体条目类型,特地于给AI准备了一份有范例谜底的法律试卷。所有这个词这个词策划共产生了249,252条条目级别的判定数据,范围特地广漠。
二、平平分的骗局:一个52%背后藏着的惊天落差
策划团队测试了四款主流AI模子,区分是两款贸易API(谷歌的gemini-3-flash和OpenAI的gpt-5.2),以及两款开源模子(领有328亿参数的qwen3-32b和领有700亿参数的llama-3.3-70b)。每款模子在所有这个词510份契约上跑了三轮,确保扫尾认知可靠。
汇总扫尾出来之后,名义上看起来没什么大问题:四款模子的全体"内容幻觉率"(也就是AI找到了条目,但说的内容和原文对不上的比例)聚合在50.9%到56.5%之间。换句话说,全球都差未几,都在52%阁下。如果你只看这个数字,你会认为这四款器具半斤八两,没什么好比的。
但当策划者把这52%按照上头那四种类型断绝来看时,画风突变。在义务与权力类条目上,四款模子的幻觉率都在64.8%到73.6%之间;在数字类条目上,幻觉率在66.8%到74.3%之间。而在时候类条目上,幻觉率仅为29.0%到35.1%。
这意味着什么?吞并个AI模子,处理时候类条目时,大致每三次才错一次;但处理数字类和义务类条目时,简直每四次就要错三次。两者之间的差距高达38到41个百分点。用一个譬如来说:这就好像一个学生数学考了90分,语文考了50分,但你只知谈他的平平分是70分——你以为他是个中等生,本色上他的数学相配好,语文却岌岌可危。而在契约审查这件事上,出问题最多的义务类和数字类条目,恰正是决定抵偿上限、契约义务范围、法律着力的最重要条目。
这个发现被策划者称为"类型化失败排序",并且这个排序在所有这个词四款模子上都完全一致,莫得任何例外:数字类和义务类名次最差,其次是事实类,时候类推崇最佳。这种跨模子的一致性意味着这不是某个模子的个别问题,而是现时这代AI系统在法律连合上的结构性流毒。
策划者还绝顶指出了一个令东谈主不安的细节:他们在给AI的领导词里,挑升对数字类条目写了明确的摈斥说明,比如告诉AI"仅摈斥某类毁伤抵偿而不设定最高金额上限的条目,不算抵偿上限条目"。但是数字类条目的幻觉率也曾高居前两位。这说明AI的"老师记念"(也就是它从大量文本中学到的"常见默许值",比如"抵偿上限时时是500万或1000万好意思元")会在处理具体契约期暗暗覆盖掉明确的指示,这是领导词工程(通过变调给AI的指示来改善输出)无法完全责罚的深层问题。
三、不仅仅错了,还要看往哪个主张错
策划的下一个问题愈加诡秘,也愈加遑急:AI犯错的时候,是倾向于"漏说"(把契约里有的条件暗暗丢掉)照旧倾向于"乱加"(把契约里莫得的条件臆造加进去)?
这两种乌有看起来差未几,但法律后果截然不同。假定契约里国法了"供应商须抵偿第三方索赔,但由买方误差导致的情形之外"。如果AI漏掉了"买方误差之外"这个条件,那契约看起来供应商要承担所有这个词情况的抵偿,范围被无穷扩大;而如果契约里根底莫得抵偿上限,但AI臆造加了一个"抵偿上限为500万好意思元",那审阅者就会以为有保护,扫尾莫得。前者让义务看起来比本色更重,后者让风险看起来比本色更小。两种乌有都能导致真实的法律亏空,但它们需要的救济步骤完全不同。
为了把这种主张性各别形成一个不错平直拿来比拟不同AI系统的数字,策划团队发明了一个叫作念"风险主张指数"(RDI,Risk Direction Index)的方针。它的打算样式相配平直:用"多加条件"(AI发明了契约里莫得的条件)的比例,减去"少说条件"(AI漏掉了契约里有的条件)的比例,再除以100,获得一个正负号明晰的数字。正数代表AI倾向于发明内容,负数代表AI倾向于遗漏内容。
测试扫尾在这里展现出了惊东谈主的分化。gpt-5.2的RDI是+0.161,这意味着它更倾向于多说、多加、偏向"发明"乌有。qwen3-32b的RDI是-0.202,意味着它更倾向于少说、漏掉,偏向"遗漏"乌有。这两个模子的全体幻觉率简直完全交流,都在52%阁下,但它们犯错的主张完全相背。
策划团队还对这个RDI数字作念了统计上的可靠性考证,通过2000次重采样打算出置信区间,阐明gpt-5.2的[+0.151, +0.170]和qwen3-32b的[-0.212, -0.193]两个区间完全不重复。这说明这种方进取的各别是认知存在的,不是未必的气运问题。
这对本色使用有什么意旨?当一家公司主要在用AI作念合规监控,匡助阐明对方是否履行了所有这个词义务时,他们最怕的是AI漏掉了义务条目——明明契约里写了对方要作念什么,AI却没检测出来。这时候选一个RDI为正或接近零的系统(比如gpt-5.2)更安全,因为它犯的乌有是"多说",至少那些它认为存在的义务是真实存在的。而如果一家公司主要用AI来批量过滤契约、快速识别高风险条目,假阳性(AI把莫得的东西当有)会浪费大量东谈主工复审资源,这时候可能更倾向于选一个RDI偏负的系统。莫得哪个模子是皆备好的,重要在于你的业务场景是什么。这正是RDI这个方针瞎想的价值所在:让底本无法比拟的"雷同52%"形成了不错根据本色需求作念出接纳的决策依据。
四、给AI配上六东谈主申辩团,乌有下落45%
知谈了AI在那处出错、往哪个主张出错,下一步就是能不成修好。策划团队瞎想了一套叫作念"类型化申辩活水线"(Typed Debate Pipeline)的多智能体系统,想路是让多个AI扮装彼此质疑、核实、仲裁,最终给出一个比单打独斗更可靠的谜底。
所有这个词这个词活水线由六个AI扮装构成,每个扮装都有明确单干。第一个扮装叫作念怀疑者,它的责任是挑升针对最容易出错的那些类型,发出精确的挑战性问题。关于数字类条目,怀疑者会问:这个数字是在契约原文里空口无凭写着的,照旧AI根据行业常见值猜出来的?单元是明确的吗?关于义务类条目,怀疑者会问:阿谁暗示强制进度的动词("应当"照旧"不错")原文是奈何写的?所有这个词触发条件都捕捉到了吗?有莫得漏掉任何"除……情形外"这么的例外?这些挑战问题不是赶紧生成的,而是根据第一轮实验测量出来的具体失败方式量身定制的。
第二个扮装是支持者,它的任务是退守,通过从契约原文中逐字援用来支持AI领先的提真金不怕火扫尾。第三个扮装叫作念再提真金不怕火者,当怀疑者发现AI提真金不怕火的根底是乌有的条目(不仅仅条目内容有偏差,而是找错了场地),活水线就不再争论这个乌有谜底,而是从头从契约原文里提真金不怕火一次,幸免在乌有基础上连接申辩。第四个扮装是仲裁者,当怀疑者和支持者经过两轮申辩仍然僵持不下时,仲裁者介入作念出保守决定,倾向于保管原始提真金不怕火扫尾,除非有压倒性笔据讲明需要改变。第五个扮装是核实者,它零丁搜索契约文本,不依赖申辩两边的任何不雅点,单独阐明某个条目是否真实存在、其界说是否顺应要求。第六个扮装是法官,它读完所有这个词这个词申辩纪录、核实者的论说和仲裁者的意见,作念出最终决定,同期履行两个非对称的安全门。
这两个安全门是所有这个词这个词系统中相配精妙的瞎想。加多门(absent to present)隆重处理"AI新发现了一个之前没发现的条目"的情况,它要求核实者和申辩两边同期甘心武艺通过,门槛极高,防患臆造抓造。删除门(present to absent)隆重处理"把原来发现的条目删掉"的情况,一朝核实者阐明这个条目照实存在于契约中,删除门就会被锁死,防患正确的发现被过度保守地抹掉。这种分歧称的瞎想来自第一轮实验测量出的FAR(误报率)大于FRR(漏报率)的履行,用系统性的门控机制来改革AI的天生偏向。
测试这套活水线时,策划者用的是一款叫作念gemma-4-26B-A4B的开源模子,它是一种羼杂众人架构,固然总参数目是260亿,但每次推理本色激活的唯有40亿,资本相配低。并且这个模子在第一轮实验中莫得参与基准测试,保证了第二轮实验的零丁性。更遑急的是,在120份契约的测试子集上,这个模子的基础版块(不加申辩)在所有这个词对比系统中名次垫底,任何提高都能明确归因于申辩活水线的扫尾,而不是底座模子自己就强。
扫尾特地明晰。加了申辩活水线之后,误报提真金不怕火(AI说有这个条目但本色上莫得)的数目从524条降到了287条,降幅达到了45%。这对本色使宅心旨首要:减少了近一半的"幻觉条目",意味着法务东谈主员不需要再花大量时候核查那些根底不存在的条目。
并且降幅的分散与第一轮实验的展望完全吻合。义务类条目的误报率降幅最大(降了8.2个百分点),事实类次之(降了5.8个百分点),数字类和时候类降幅较小(区分降了3.6和2.4个百分点)。时候类条目本来就是所有这个词类型中幻觉率最低的,怀疑者对它的挑战扫尾当然也最有限。这种展望与实测的吻合,讲明了第一轮实验测量出来的失败方式会诊是有本色价值的,不仅仅好意思瞻念的数字。
在义务类条目的乌有方进取,申辩活水线也带来了显赫修正。加申辩之前,这个模子在义务类条目上的RDI是-0.078,偏向于遗漏条件;加申辩之后,RDI形成了-0.014,简直趋于均衡。怀疑者针对遗漏条件和例外条目的精确追问,照实把AI从"少说"的偏向中拉了讲求。
在详尽名次上,加了申辩活水线的gemma-4-26B-A4B(详尽得分2.4分,越低越好)进取了贸易API gpt-5.2(详尽得分2.6分),在五种不同的权重决策中,有四种决策下名轮番一,唯有在偏重调回率(强调不漏掉条目)的决策下,gpt-5.2名轮番一。这意味着一个激活参数目唯有40亿的小模子,通过瞎想良好的申辩架构,达到以至进取了大型贸易模子的水平,同期推理资本大幅裁汰。
五、这套框架对本色部署意味着什么
策划者在盘问这些发现对履行天下的影响时,给出了几条具体的举止建议,这些建议对任何正在使用或探求使用法律AI器具的机构都有参考价值。
任何只论说总体准确率的法律AI评估,都无法着实支持部署决策。一个论说说"准确率88%"的系统,可能在抵偿上限、义务范围这些最重要的条目上,乌有率高达65%以上。采购时必须要求按条目类型分开论说的测试数据,而不是一个平均数。
RDI这个主张方针让底本无法平直比拟的不同系统变得可比。在接纳系统时,应当根据本色业务场景中"漏报"和"误报"哪种代价更高,来决定倾向于接纳哪个主张的RDI。合规监控场景下,漏掉义务比多报一条不存在的义务代价更高,应选RDI偏正的系统;批量文献初筛场景下,误报虚耗大量东谈主工复审资源,应选RDI偏负的系统。
这套审计框架自己是通用的。策划者明确指出,他们测量出的具体数字只适用于510份英好意思贸易契约,其他法律统治区、其他文献类型的情况需要从头测量。但是这套框架的方法论自己——四类条目分类、RDI打算、申辩活水线校准——不错迁徙到任何有可考证范例谜底的法律提真金不怕火任务上。
即即是最佳的系统,在检测出的条目内容上仍然有58.6%的乌有率。这意味着AI补助法律责任应当是"补助"而非"替代"——法律AI器具应当用来匡助东谈主工筛选和聚焦扎倡导,而不是平直输出最终法律判断。策划者明确建议:不应自主部署而不加东谈主工审核,尤其对义务类和数字类条目,必须保留东谈主工复核设施,并明确见知使用方,全体准确率不成代表法律风险的上限。
此外,策划者还提议了一个值得警惕的双重使用风险:瞎想良好的多智能体提真金不怕火活水线,可能会被用来伪造"合规审查的外不雅",也就是输出一份看起来经过仔细审查的论说,但本色上仍然覆盖了那40个百分点的类型化差距。对此他们建议,在每次本色部署前都应该针对代表性文档从头测量类型化失败率,而不是依赖供应商论说的汇总准确率。
说到底,这项策划揭示的中枢矛盾在于:法律AI边界永远以来用来研究系统狠恶的那把尺子——全体准确率——本色上丈量的是一个乌有的维度。一把只会测量长度的尺子,无法告诉你一个物体有多重;一个只会请教平均幻觉率的方针,无法告诉你某个系统在你最在乎的那类条目上会犯什么错、往哪个主张犯错。
这就是LegalHalluLens这套框架着实想作念的事:不是告诉你哪个AI更好,而是给你提供一套器具,让你能够根据我方的业务场景、风险承受才略和法律牵累,作念出着实有据可依的接纳。它把一个依稀的"52%",拆解成了一张不错对照使用场景逐条磨练的会诊论说。
对任何正在探求在法律经由中引入AI的团队来说,这里有几个值得接续追问的问题:你们的系统有莫得提供按条目类型分类的幻觉率论说?你们了解这个系统的乌有是偏向遗漏照旧偏向发明?你们的义务类和数字类条目有莫得东谈主工复核机制?这些问题的谜底,可能比AI供应商的任何演示论说都更接近真实的法律风险所在。有酷好深切了解这套框架的齐备时刻细节,不错通过arXiv:2606.18021找到原始论文。
Q&A
Q1:法律AI的"幻觉率"(hallucination rate)是什么真义,52%代表什么?
A:幻觉率指AI把乌有或伪善内容当成真实信息输出的比例。52%的幻觉率意味着AI在找到契约条目之后,简略有一半的概率给出的内容和契约原文对不上,可能是金额乌有、条件遗漏或者臆造添加了不存在的内容。但策划发现,这个平均数覆盖了巨大各别:重要的义务类和数字类条目乌有率高达65%到74%,而时候类条目唯有29%到35%。
Q2:风险主张指数(RDI)对接纳法律AI器具有什么本色匡助?
A:RDI告诉你一个AI系统犯错时更倾向于"多加不存在的内容"照旧"漏掉存在的内容"。如果你的业务场景主如若合规监控,最怕漏掉契约义务,应选RDI为正数的系统;如果主要作念多数目初筛,误报太多会浪费东谈主力,应选RDI为负数的系统。两款幻觉率完全交流的系统,RDI可能迥乎不同,顺应的场景也完全不同。
Q3:LegalHalluLens申辩活水线是奈何作念到让小模子进取大型贸易AI的?
A:申辩活水线让六个AI扮装单干配合:怀疑者挑升针对最容易出错的条目类型提议精确质疑,核实者零丁从契约原文查证,加多门和删除门用分歧称的严格进度防患臆造添加条目。这种瞎想把乌有率最高的义务类条目的误报裁汰了8.2个百分点开云体育,全体误报下落45%,让一个激活参数仅40亿的小模子在详尽评分上进取了贸易大模子。