凡是用上 AI 的企业,迟早都会遇到同一个瞬间:系统用笃定的语气给出回答,而这个回答是错的。
这并不意味着系统坏了。语言模型建立在概率之上,手头信息不足时,它可能不会沉默,而是拼出看起来最合理的一句话。真正的问题不在于回答可能出错,而在于错误的回答与正确回答语气相同。
这篇文章讲的是错误答案为什么出现、什么情况下真正要紧,以及实施过程中控制点应当放在哪里。
🔍 请记住:把 AI 引入企业,不是当作错误不存在,而是提前决定错误会落在哪里。一条回答是送到客户手上、落在员工屏幕上,还是进入审核栏,这是实施阶段的决定。
AI 为什么会答错
单一成因很少见。实施中最常见的有四种。
信息缺失或已过时
模型只读取交给它的资料。如果价目表没有更新、下架的商品仍留在目录里,或者规则变动只存在于某个人的脑子里,回答就会建立在那份旧信息之上。这里有问题的是资料,不是模型。
问题本身含糊
像"这笔订单该怎么处理"这样的问题,在没有上下文时可以有多个正确答案。模型挑出一个并为自己的选择给出理由。换成人类同事会追问一句;系统则可能带着假设继续走下去。
填补空白
资料里没有答案时,模型可能按照从相似文本中学到的样式造一个出来。这种表现常被称作幻觉。生成的句子在语言上无可挑剔,在内容上是编的。这就是不会暴露自己的错误。
资料正确,语境不对
信息本身没错,却属于另一种情形。只对某一类客户适用的条件被告知了所有人,因为系统里没有定义这个区分。这类错误单看每一条都像是对的,因此可能很晚才被发现。
错误的分量并不相同
把所有错误都当作同等严重,会让实施变得沉重,而这份重量没人扛得住。区分依据在于错误触及了什么。
- 留在内部的错误:员工看到错误回答,改正后工作继续。代价较低。
- 送到客户手上的错误:错误信息离开了公司。这已经不是技术问题,而是信任问题。
- 牵涉金钱或法律的错误:价格、折扣、合同条款、个人信息。这一类里,回答不直接对外发出更稳妥。
缺少这层区分,系统往往落到两端之一:要么每条回答都等审核,系统随之变慢;要么根本不设审核关卡,第一次严重错误就在客户面前发生。
人工审核该放在哪里
审核放在错误可能代价高昂的位置,而不是系统的每一步。实践中有三种布置可能奏效。
审核关卡
约定类型的回答在发出前先落到某个人的屏幕上。此人可以通过、修改或退回。关卡只在选定的流程上起作用,其余部分不必等待,照常推进。
不确定时停下
当资料中找不到对应内容时,可以把系统设置成把问题转出去,而不是作答。"这个我转给同事"这句话胜过一个编出来的答案。这种行为要在实施阶段写下来,不会自己出现。
权限边界
系统能独立做什么,应当落到纸面上:它可以提供信息、开立记录,但不能改价格,也不能批准退货。边界不写下来,就等于没有边界。
让回答依据自有文档
面对错误答案,最直接的一条路是让模型从企业自己的文档出发作答,而不是依赖它的自由知识。系统接到问题,找出相关文档,把回答建立在这份文档上。
由此可能带来两项附带好处。其一,可以把出处放在回答旁边:依据的是哪份文档一目了然,核对因此变得容易。其二,资料留在企业内部。数据存放在哪里、又流向何处是另一个话题,我们在您的数据去了哪里一文中谈过。
依据文档也让文档本身成为一份责任。文档过时,回答也就过时。因此要及早定下哪份文档算作现行版本、由谁负责更新。
出现错误回答时怎么办
逐条改正并不够,还要追到成因,让同一个错误不再回来。顺序可以这样安排:
- 连同记录一起保存这一例:问的是什么、依据了哪份资料、谁看到了。
- 把成因分开:是资料过时,是问题含糊,还是填补了空白。
- 若资料过时,更新文档并指定它的负责人。
- 若问题含糊,把系统设置成会反问一句。
- 若在填补空白,就把这个主题移到审核关卡或转人工的路径上。
没有写下来的流程,错误只会被一条条谈论,同一个错误来回出现好几次。项目在哪些环节卡住,我们在自动化项目为什么失败一文中另作讨论。
记录为什么重要
系统若不记得自己说过什么,错误也就无从吸取。事后回看时,记录应当能回答这些问题:问题何时到达、给出了什么回答、依据哪份文档、是否经过审核、由谁审核。
这份记录同时是一份凭据。当客户说"你们系统当时说的是另一套"时,谈话依据的是日志,而不是记忆。
对客户怎么说
对方知道自己在和系统对话,并不会伤害信任;事后才发现才会。一句清楚的说明和一条转人工的通道,应当放在对话开头。
错误真的传到外面时,更好的做法是不拖延地更正,并用平实的话说明哪里出了问题。客户侧的流程如何搭建,我们写在客户服务自动化一文中。
实施前该问的问题
如果在 AI 项目开始时就把这些问题摆出来,后面的争论有很大一部分可以省去。
- 系统将从哪份资料构建回答?
- 这份资料由谁更新、多久复核一次?
- 哪些回答可以不经人工直接发出?
- 系统不确定时会做什么?
- 发现错误回答时通知谁?
- 对话记录存放在哪里、谁可以查看?
答案因企业而异。如果想动手梳理业务流程,我们的培训系列会逐步讲到这些主题。
我们怎么做
实施时我们先确定回答从哪份资料构建。接着一起写明哪些回答要经过审核,以及系统不确定时该做什么。
我们不会提出一套当作错误不存在的实施方案。我们做的是定下错误落在哪里、留下它的记录,并把更正路径放进实施本身。
常见问题
我们怎么察觉 AI 回答错了?
仅靠阅读很难察觉,因为错误回答和正确回答用的是同一种语言。实践中有三件事有帮助:把回答依据的出处一并显示、在敏感主题上设置人工审核、按固定间隔抽样阅读对话记录。客户那句"我这边不是这样写的"之类的反馈,也应当作为单独的一条渠道收集起来。
每条回答都需要人工审核吗?
通常不需要,而把每条回答都送去审核可能让系统变得无法使用。区分依据在于回答的类型:提供信息、开立记录和转接引导这三类,在多数企业里可以直接发出。牵涉价格、折扣、合同条款、退货或个人信息的回答,则可以送进审核关卡。这份清单在实施阶段写下,并随着时间复核。
系统能学会说"我不知道"吗?
与其说是学习问题,不如说是设置问题。当资料中没有对应内容时,可以把系统搭建成把主题转给一个人,而不是造出一个答案。转出时怎么措辞、转给谁、客户可以在多久内等到回复,都在同一次实施中定下。这种行为不是默认值,需要写出来。
错误回答造成的损失由谁负责?
责任看的是运营系统的一方,而不是系统本身,因此实施的边界应当写进合同。如果事先约定哪些回答要经过人工审核、记录保存多久、发现错误后如何通报,争论就不会被推到后面。若您所在行业受监管,这些条款应当与您的法律顾问一同拟定。
依据我们自己文档的系统还会答错吗?
会,但错误的种类变了。在依据文档的系统里,编造出来的回答变得少见;走到前面的是选错文档,或者把正确文档搬到不合适的语境中。这类错误更容易被看见,因为回答所依据的文档就摆在旁边。也正因如此,让资料保持现行状态是实施中的一项长期工作。
结语
AI 答错并不是故障,而是它工作方式的结果。因此实施要问的不是"会不会出错",而是出错时会落在哪里。
让回答依据企业自有资料、把敏感回答送进审核关卡、写明系统不确定时停下、把对话留成记录。这四件事到位之后,错误不会消失,但会变得看得见、改得动。
