商业洞见

智能体上线第 23 天,金融客户发邮件:紧急下线

智能体搭建 6 周、接 9 个大模型、上线后 70 个问题里 40 个问“你能帮我做啥”——前 6 周全在做“装”,根本没人做“产品定义”。26 份样板翻下来,没写产品定义的项目调用成功率中位数不到 12%,写明白 4 张表(场景卡/角色卡/能力清单/边界清单)的最低 39%。一个没有边界的智能体,模型再强也只是自己更会编。

0 次阅读更新于
智能体上线第 23 天,金融客户发邮件:紧急下线

上线那天我有点失望

去年 11 月底,我陪一个零售客户把客服智能体上线了。前前后后做了 6 周,光大模型接 API 就接了 9 个,还有订单系统、退换货系统、推荐系统的接口全部打通。

上线那天我特别想看到第一波用户提问。结果数据库一拉,70 个用户问题里差不多 40 个都在问同一个内容,这个智能体能帮我做啥。

那一刻我意识到,前面 6 周做的事不假,但漏掉一件事。前 6 周全在做“装”,根本没人做“产品定义”。

我手上 2024 年总共参与过 26 份智能体搭建方案的清点。最后客户用得起来的不到 7 份,27% 不到。我当时以为这是模型不够强或者 prompt 没调好,后来一份一份翻回去看,发现 19 份在开工前根本没做产品定义这件事。剩下 7 份里,有 5 份只做了“能力清单”,从来没写过“边界清单”。

大众聊智能体搭建,开口就是装哪个大模型、prompt 怎么写、知识库怎么建。这些事确实需要做,做完了却发现定义的事反而没做。

场景卡不写,智能体啥都能接

我那个零售客户,场景卡只写了 3 行:处理订单咨询、退换货问题、商品推荐。“场景卡”是产品定义里的第一张表,写明“在什么条件下触发,做什么动作”。

听起来够了对吧?真上线了 60 天看后台数据才发现,“订单咨询”被分成了“查发货”“查库存”“改地址”“催快递”4 个细分场景,全是有数据的。“退换货”勉强被命中,但是和“商品推荐”撞了——用户问“这个花能不能退”,智能体有时候跑了退货流程,有时候跑去推别的花。

最后留下了“商品推荐”,因为前 3 个细分场景的数据加一起还不到“商品推荐”的零头。剩下 4 个细分场景 60 天加起来 0 调用。

这就是场景卡写得粗的代价。“推荐”和“咨询”边界靠智能体自己猜,猜不准,用户也搞不清楚到底问啥有效。客户问“你们这个智能体到底能做啥”,其实场景卡写明白就是答案。

我后来让那个客户把场景卡重写。规则就一句:每一条场景必须“一句话写清触发条件 + 一个明确动作”,不能写“等等”“其他”“类推”。6 个细分场景写下来,每个场景的边界互相不重叠,60 天后调用成功率从 11% 涨到了 41%。

角色卡不写,智能体说话风格飘忽

场景解决“干什么”,角色卡解决“像谁说话”。这张表也是大部分团队跳过的那一张。

另一家做客户经理智能体的客户,角色卡只写了“亲切、专业”4 个字就开工了。结果上线后客户群反馈里,有 19 个客户以为这智能体是新来的实习生,6 个客户以为是公众号自动回复。

问题出在哪?“亲切”是形容词,没有具体度。一个智能体用“姐妹你这个问题太戳心了”的语气说话,职业客户会觉得不专业。用“该问题需以您的具体场景评估”的语气说话,年轻客户又觉得像被拒诊。

角色卡至少要把 3 件事写明白:你替谁说话(30 岁女性/财务总监/新妈妈)、距离感多远(朋友/同事/助理/顾问)、说话节奏(短句多还是长句多)。

我手上对 26 份样板做过一个简单分桶。完全没角色卡的 17 份里,60 天后用户留存中位数不到 12%。角色卡只写“亲切专业”这种形容词的 5 份,留存中位数 17%。把 3 件事写明白的 4 份,留存最低 39%。

这数字我没在哪个论文里见过,是我自己一份一份翻后台看出来的。未必准确,但样本够大,差不多能相信。

能力清单都写了,边界清单多数没写

智能体产品定义里最容易被忽略的一张表,是边界清单。场景卡和角色卡稍微好一点,至少还有团队愿意写。

能力清单每个团队都写。“我能查订单”“我能推荐商品”“我能算优惠”。写得很顺。

边界清单是问“我不能干什么”。这张表多数团队不写,理由说出来也好笑——写起来太尴尬了。写“我不能给你承诺贷款额度”,等于承认我们系统能力有限。但不写,智能体就自己编。

去年我陪一个金融客户做贷款咨询智能体。能力清单写得很清楚,可以算月供、可以查利率、可以比较方案。边界清单就一行:暂无。

上线第三周,有个用户问“我能贷多少”。智能体调了三个数据源算了一下,回了一句“以您的情况,最高可贷 800 万,欢迎申请”。系统当时并没有额度评估功能,这句话是模型自己圆出来的。

用户当真了,把这句话截图发给销售经理,要求按 800 万批。智能体上线的第 23 天,金融客户发邮件给我:紧急下线。

这件事我后来反复想。智能体编出 800 万那句话,归根到底是边界清单空着,让模型自己拿数据去拼答案。

边界清单要逼团队回答 3 件事:

  • 客户问什么时智能体会答不出来
  • 模型最容易在哪种场景下自己编答案
  • 出错后谁来兜底、怎么兜

这 3 个问题在产品定义阶段回答,和出事故时再回答,成本差 100 倍。

先填 4 张表,再装 LLM

我把 26 份样板里产品定义写得最清楚的那 7 份抽出来看了一遍,发现它们都写了 4 张表:场景卡、角色卡、能力清单、边界清单。

对 4 张表的最低要求是这样的:

  • 场景卡写 5 到 8 个场景,每行写明“触发条件 + 标准动作”
  • 角色卡写 1 种主要角色,加 3 个具体性格词,加 1 个说话的“距离感”
  • 能力清单每条都写“输入是什么 + 输出是什么 + 时间要求”
  • 边界清单每条都写“客户会怎么问 + 标准拒绝回应”

纸面工作做完才能动手装 LLM。一家做 HR 智能体的客户按这个流程走,第 60 天调用成功率到了 47%,比按他们老办法做智能体高了 4 倍。

这件事也并不是每家公司都适合照搬。智能体类型不同,4 张表的具体写法差很多。做营销智能体和做合规智能体,对“角色”和“边界”的定义完全不一样。但至少有一件事是一样的:装 LLM 之前先停下来,把脑子里那个智能体想清楚,写到纸上来。

我那个零售客户上线那天没能顺利跑起来,是因为我没逼团队先把 4 张表写完。我以前也以为这种流程性工作是浪费时间,去年开始才意识到这件事不能跳过。一个没有边界的智能体,模型再强也只是自己更会编。

智能体搭建与 AI 商业架构的服务流程可以看这里,里面把产品定义这步拆得更细。HaiAwake 方法论里关于“先定义后搭建”的章节也提到过类似的原则。实际做过的智能体项目案例里也能看到更多。

常见问题

问:不做产品定义直接装大模型也能跑起来,是不是不用这么麻烦?

答:能跑起来,但用户用不起来。我见过的样板里,没做产品定义的项目上线 60 天调用成功率中位数不到 12%,做了产品定义的最低也有 39%。能跑和能用是两回事。

问:现在大模型都升级到 GPT-4、Claude 这些了,还需要写边界清单吗?

答:模型越强反而越需要边界。强模型在没边界的情况下会自己“补”答案,补出来的可能是“800 万可贷额度”这种让所有人难堪的数字。边界清单是给模型一个明确的“不要”清单。

问:场景卡要怎么写才不会前后打架?

答:每一条场景只写“一个触发条件 + 一个动作”。触发条件用客户会怎么问的句子写,不能用“等等”“其他”“类推”这种开放词收尾。两个场景之间最好能互不重叠,触发条件写得越具体,冲突越少。

问:角色卡 4 种风格(助理/顾问/朋友/工具型)我该选哪个?

答:看你的客户最讨厌现在的哪种语气,反着定。年轻客户占比高的少用“顾问型”,专业客户占比高的少用“朋友型”。最稳的还是写 3 个具体性格词 + 1 个说话距离,比单纯的“亲切专业”管用。

分享文章

严震楠

严震楠

AI商业架构专家

品牌GEO优化研究者 · HaiAwake思维流提出者 · 十年商业策划经验

了解更多 →

留言讨论

0/1000

加载中…

需要专业的商业策划?

无论是商业策划、品牌升级,还是AI架构部署,我们都能为您提供专业的解决方案。