如果你用过任何一家公司的在线客服,大概率说过这句话:转人工。
这三个字几乎是所有客服机器人的噩梦。但有意思的是,很多人以为机器人被嫌弃是因为「不会说话」,可如今大模型的表达能力早就不是瓶颈了。真正让用户崩溃的,是它判断错了。
用户说「耳机用了两天,左耳就没声了」,机器人回一句「签收已超7天,不支持无理由退货」。可按照规则,15天内的质量问题本该直接换货。用户第三次追问「到底什么时候发货」,语气已经冒火,机器人还在礼貌地重复物流模板。话说得再漂亮,判断错一次,就是一次投诉。
这背后暴露的,其实是当前AI客服架构的一个根本性错位。
【让作家答选择题,本身就是个错误】
一个成熟的客服系统,一轮对话背后要做的判断多达十几次:用户意图是什么、情绪到了什么级别、该走哪条规则、是否需要升级、要不要转人工。而目前行业里最常见的做法是——每做一次判断,就让大模型写一段JSON。
这就好比让一位作家用写作文的方式来答选择题。他能写,但慢,而且容易跑偏。
大模型擅长的是生成连贯的自然语言,不是做高频率、低延迟的结构化决策。你让它每次都输出一段完整的JSON,它不仅要理解问题,还要组织语言格式,还要保证字段不出错。这个过程消耗了大量推理资源,却把最关键的「判断准确性」放在了次要位置。
在办公自动化和企业服务场景中,这种错位的代价非常直接:响应变慢、判断出错、用户体验崩塌,最终还是要人工兜底。
【「系统一」思路正在改变游戏规则】
最近硅谷有一个趋势值得关注:不让模型「写」答案,只让它给出每个选项的概率。这种做法借鉴了认知科学里「系统一」的概念——快速、直觉、不做冗长推理,直接给出判断。
最近有个叫 Instinct 的开源项目,就是沿着这个思路做的。它由企业AI平台 ZooWork 推出,专注在客服场景中做决策。核心逻辑很简单:不让大模型输出长篇JSON,只让它在候选答案里选一个,并说清自己有多确定。
这个思路的价值在于,它把模型的角色从「内容生成器」重新定义为「决策引擎」。模型不需要组织语言,只需要做分类和判断。推理路径短了,速度快了,准确率反而上去了。
而且这个项目4B权重开源、可以本地部署,27B版本面向更复杂的规则判断。对于有数据合规要求的企业来说,本地部署意味着客服数据不用出内网,这在金融、医疗等行业尤其关键。
【这对办公自动化意味着什么】
我一直觉得,AI在企业场景中的落地,最大的障碍不是「能不能生成内容」,而是「能不能做对判断」。
客服只是冰山一角。在审批流、工单分配、邮件分类、合同审核等办公自动化场景中,同样存在大量「高频判断」的需求。这些场景的共同特征是:判断次数多、单次决策逻辑不复杂、但对准确性和响应速度要求极高。
用大模型写JSON的方式去做这些事,成本高、延迟大、出错率也不低。而用「决策模型」的思路,把这些判断从生成任务中剥离出来,交给专门的小模型处理,反而更务实。
这其实指向了一个更大的趋势:AI应用正在从「一个大模型包打天下」走向「大小模型各司其职」。大模型负责理解和生成,小模型负责快速决策和分类。这种分工在办公自动化领域会越来越普遍。
【判断对了,表达才有意义】
回到客服场景。用户真正需要的不是一个说话好听的机器人,而是一个能准确理解问题、做出正确判断、该转人工时果断转人工的系统。
「转人工」之所以成为高频词,本质上不是因为机器人不会说话,而是因为它在该做对判断的时候做错了。
决策模型的出现,让我们看到了另一种可能:把判断这件事交给更合适的工具去做。当判断准确率上来了,表达才有意义。当决策对了,用户才愿意多给机器人一次机会。
对于正在做企业AI落地的团队来说,这或许是一个值得重新审视架构方向的信号:与其不断给大模型加提示词、调格式,不如想想哪些环节根本不该让它来做。