DoorDash
客服LLM的离线仿真与评测飞轮
企业原始材料
本地生活/配送平台
企业部署案例
⚙ 技术方案
深度案例|关键链路较完整
A级证据
生产质量平台
A
证据等级
A Simulation and Evaluation Flywheel to Develop LLM Chatbots
证据等级衡量“能否定位和复核来源”,不评价厂商披露是否经过第三方审计。
深度案例|关键链路较完整
12 / 12
业务背景2 / 2
改造流程2 / 2
技术工作流2 / 2
人机与治理2 / 2
量化结果2 / 2
来源定位2 / 2
六个维度均达到当前完整度标准。
业务问题
DoorDash把确定性客服决策树升级为LLM对话后,提示改动可能改善一个场景却破坏另一个场景;直接上生产会把客户当测试样本,人工回放又慢、覆盖有限,欺诈、高额退款和极端延误等边缘问题尤其难验证。
解决方案
DoorDash建设离线仿真与评测双系统:从历史生产会话提取行为场景,LLM扮演会追问和反驳的客户,Mock层混合生产与测试数据并模拟配送状态、退款和订单工具返回;校准后的LLM-as-a-judge对数百轮对话做幻觉、语气和分类评测,通过回归门槛后再A/B上线并复用同一评测监控线上。
技术架构与生产工作流
Step 01
历史生产对话生成行为测试场景
→
Step 02
LLM客户模拟器生成追问、反驳和升级行为
→
Step 03
混合生产与测试数据的Mock工具及后端响应
→
Step 04
LLM客服在完整多轮环境中调用配送/退款/订单工具
→
Step 05
校准的LLM-as-a-judge与50多项质量评测
→
Step 06
回归门禁、A/B发布及同一评测的线上监控
关键技术与基础设施组件
场景生成流水线LLM用户模拟器混合Mock数据工具调用模拟LLM-as-a-judge回归测试A/B实验生产监控
人机分工与责任边界
领域专家先校准评测器与人工判断的一致性,工程和数据团队根据失败案例修改提示、上下文或工具;只有全部护栏稳定后才进入标准A/B测试,生产监控继续确认改进是否保持。
FDE 动作拆解
- 从历史会话抽取真实行为而非手写所有脚本
- 同时模拟用户和后端工具响应
- 用专家人工判断校准自动评测
- 把每个生产失败固化成新的回归评测
- 通过护栏后再A/B上线并核对离线线上相关性
可迁移复用的落地方法论
- 非确定性Agent需要行为仿真而不只是单轮测试
- LLM评测器必须先与人类专家校准
- 测试数据要覆盖工具返回和业务状态
- 生产失败应转成永久回归项形成飞轮
业务成效与交付成果
DoorDash披露一次关键改造使仿真中的幻觉减少90%,且效果延续到生产;单轮迭代从数天缩短到数小时,系统可在5分钟内运行200多段多轮会话,评测集已超过50项。
证据边界与核验记录
- 幻觉减少90%先在仿真中测得,文章称趋势延续到生产,但未公开绝对基线。
- 5分钟200多段是测试吞吐,不等于线上客服吞吐。