很多企业一提到AI客服,第一反应就是接个大模型API,把所有问题都丢进去。这种做法在Demo阶段看起来很美好,一旦上了生产环境,账单和投诉就会同时教你做人。
生鲜电商的客服场景尤其典型:用户情绪激动、问题五花八门、配送时效敏感,一次AI幻觉就可能引发投诉升级。我最近看到一个很有意思的落地案例,他们的思路不是“用最强的模型解决所有问题”,而是反过来——从最便宜、最可控的手段开始,一层层往下漏。
【核心逻辑:能规则就不模型,能小模型就不大模型】
这套系统的骨架是一个五层漏斗。流量从顶部进入,每层命中即返回,不命中才继续下沉。越往下,成本越高、可控性越低。
第一层是FAQ精确匹配,消化了40%到60%的流量。很多人以为这就是关键词比对,其实他们用了双路召回:BM25抓字面命中,向量相似度抓换了说法的表达。这一层几乎是零成本秒回,是整个系统性价比最高的部分。
第二层是业务API直调。比如用户问“我的订单几点能送到”,系统识别出意图后直接查订单接口,不需要大模型参与。这一层的关键在于意图识别要足够精准,能把“你妈这榴莲坏了cnm,单3792到底几点能送到啊”这种夹杂情绪和多个意图的句子拆解清楚。
第三层是RAG检索增强。当FAQ和API都搞不定时,系统会去知识库里检索相关文档,拼装成上下文再交给大模型生成回答。这一层比纯大模型便宜,因为检索结果约束了生成范围,降低了幻觉概率。
第四层才是大模型兜底。只有前面三层都没接住的流量,才会真正调用大模型API。这个比例被控制得很低。
第五层是人工介入。当AI连续无法解决或用户明确要求转人工时,才会进入人工队列。
【意图识别才是真正的分拣员】
这套架构能跑通的前提,是意图识别足够准。他们做了三级级联意图识别:先用规则匹配高频意图,再用小模型处理中等复杂度的情况,最后才用大模型做兜底判断。
这让我想到办公自动化领域的一个普遍误区:很多人觉得AI就是“一个大模型解决所有问题”,但实际上,真正的效率提升往往来自于把问题拆解、分类、分层处理。
比如在企业内部的知识问答场景,员工问“年假怎么算”和“帮我查一下上个月的报销进度”,前者适合FAQ匹配,后者需要调HR系统API。如果全部丢给大模型,不仅慢,还容易出错。
【成本账:从“烧钱”到“省钱”的关键】
这个案例最让我印象深刻的,是他们对成本的精细计算。通过分层路由,60%的流量在第一层零成本解决,30%在第二层和第三层用较低成本处理,只有10%左右会真正调用大模型。整体成本直降90%。
这不是技术炫技,而是工程思维。AI落地不是比谁的模型更强,而是比谁能在保证体验的前提下,把成本控制在合理范围。
【对办公自动化的启示】
第一,不要迷信“大一统”的AI方案。分层处理、逐级过滤,才是可持续的架构。
第二,意图识别是AI应用的地基。没有精准的意图识别,后面的路由和分发都是空谈。
第三,可控性比能力更重要。在客服、HR、财务等场景,一次错误可能带来连锁反应,宁可回答得保守一点,也不能让AI自由发挥。
第四,成本意识应该贯穿AI产品设计始终。不是所有问题都值得用大模型解决,很多时候,一张FAQ表加上一个API调用,效果比大模型更好。
回到那个生鲜客服的案例,他们的成功不在于用了多先进的模型,而在于想清楚了一件事:AI不是万能药,而是一套需要精心设计的工程系统。什么时候用规则,什么时候用检索,什么时候用大模型,每一个决策背后都是对成本、体验和可控性的权衡。
这种分层思维,值得每一个做AI落地的人借鉴。