跳到正文
0727
资讯学院案例活动登录
中文/EN
案例/Nubank
← 返回案例库
← 上一案例16 / 127下一案例 →

Nubank

五类生产客服Agent:评测驱动的迭代与A/B上线
企业原始材料 数字银行/金融服务 企业内部AI改造 ⚙ 技术方案 深度案例|关键链路较完整 A级证据 五个场景生产部署/持续A/B
A 证据等级
Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
发布方:Nubank团队 / KDD 2026论文 · 企业员工署名技术论文 · 案例级直接来源
指标口径:企业项目团队披露 · 独立核验:否 · 查阅日期:2026-09-23
证据等级衡量“能否定位和复核来源”,不评价厂商披露是否经过第三方审计。
深度案例|关键链路较完整 12 / 12
业务背景2 / 2
改造流程2 / 2
技术工作流2 / 2
人机与治理2 / 2
量化结果2 / 2
来源定位2 / 2
六个维度均达到当前完整度标准。
Nubank把客服Agent做成评测驱动的生产工程:SOP与工具模块化、人工标注校准评审器、离线模拟筛选版本、1%流量起步A/B,最终在五类客服场景复用。
业务问题

Nubank的客服需要处理卡片配送、债务管理、信用额度、卡片管理和产品解释等不同问题。传统知识库型机器人难以调用实时业务数据、执行受控操作或处理复杂分支;若只看离线答题分数,也无法证明真实客户满意度和自助解决率会改善。

解决方案

团队把客服SOP拆成可版本化的指令、例行流程、工具说明和工作记忆,并按场景配置Agent。以卡片配送为例,Agent读取物流与客户资料、按地址类型排查、必要时发起补卡或带上下文转人工。团队先用人工标注、LLM评审器和离线模拟定位失败,再用GEPA优化评测提示,最终以小流量A/B逐步发布并跟踪交易NPS和自助服务率。

技术架构与生产工作流
Step 01
把人类客服SOP改写为可组合、语义版本化的指令、例行流程、工具描述与工作记忆
→
Step 02
卡片配送Agent通过客户资料、配送状态与补卡工具执行受控步骤
→
Step 03
离线案例和人工标注构建场景评测集,LLM评审器与人工判断做一致性校准
→
Step 04
用GEPA在DSPy中优化评审提示词,并比较不同模型上的评测稳定性
→
Step 05
新版本先在1%流量发布,再按离线失败率和线上表现扩大A/B流量
→
Step 06
线上同时测交易NPS、自助服务率、任务完成率,并在低置信度时转人工
→
Step 07
客服数据最小化与去标识化,日志及评测集按角色、审计与时限授权
关键技术与基础设施组件
模块化上下文工程领域SOP/例行流程客户资料与配送工具LLM-as-a-JudgeGEPA / DSPy离线模拟与人工标注线上A/B和交易NPS转人工与隐私治理
人机分工与责任边界

人工客服承接低置信度、客户不满或自动流程无法解决的场景,交接时保留上下文。领域专家标注评测集并校准LLM评审器;受监管的授信和债务相关决策仍受既有规则、人工监督与申诉机制约束。对话数据经最小化、去标识化和受控访问。

FDE 动作拆解
  • 先选高频且可观测的卡片配送问题,明确老版本机器人与人工服务基线
  • 将客服SOP拆成可维护的步骤、工具权限和触发条件
  • 用专家标注校准自动评测,而非直接信任模型自评
  • 根据失败案例逐项增加物流工具、补卡能力、挫败识别和简洁性约束
  • 从1%流量开始做真实客户A/B,并同时衡量满意度和自助解决率
  • 为隐私、争议处理和人工接管建立生产边界
可迁移复用的落地方法论
  • 离线评测应与线上业务指标建立可检验关联
  • 满意度与自助率可能互相牵制,不能只优化一个指标
  • 先在单一高频场景验证再扩展为多场景共用框架
  • 生产Agent的工具权限、人工交接和数据保护与提示词同等重要
业务成效与交付成果

论文报告5个生产客服Agent。卡片配送Agent相对先前版本,AI交易NPS提高37个百分点、自助服务率提高29个百分点;其NPS仍比专家人工客服低10个百分点。债务管理Agent虽有改善,NPS仍低于专家人工客服23.6个百分点;产品解释Agent的自助服务率短暂下降1.5个百分点。论文未公开完整财务回报或独立审计。

证据边界与核验记录
  • 100M+是Nubank客户规模,不是这些Agent的实际用户数。
  • 37和29都是百分点,不是相对百分比;对照组是先前Agent版本。
  • 五个Agent的交易NPS均改善,但产品解释场景自助服务率短暂下降;不得写作所有指标全面提升。
  • 论文未给出完整ROI,线上结果和隐私控制均属于企业团队自述。
主要来源:Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework ↗ 补充来源:arXiv论文摘要、作者与KDD 2026收录信息 ↗
可追溯不等于独立审计
访问主要公开来源
0727.ai · Trusted agents, built together.案例资料:FDE-case-library ↗ · MIT