Grab
从技术支持Bot演进为企业Agent开发平台 LLM-Kit
企业原始材料
出行与本地生活平台
企业部署案例
⚙ 技术方案
深度案例|关键链路较完整
A级证据
企业级平台规模化
A
证据等级
Agent platform (Part 1): How we help Grab build and run AI agents at scale
证据等级衡量“能否定位和复核来源”,不评价厂商披露是否经过第三方审计。
深度案例|关键链路较完整
12 / 12
业务背景2 / 2
改造流程2 / 2
技术工作流2 / 2
人机与治理2 / 2
量化结果2 / 2
来源定位2 / 2
六个维度均达到当前完整度标准。
业务问题
Grab技术基础设施团队每半年要处理数千个重复支持工单;早期支持Bot能回答问题,但每个新Agent团队仍要重复处理认证、密钥、部署、可观测性、工具连接和评测,导致原型难以稳定进入生产。
解决方案
Grab先以Go服务构建Level-0支持Bot,让单Agent循环调用Glean、Kibana、GitLab、Slack和HTTP工具,无法解决时携带上下文转人工;再把踩过的坑沉淀为LLM-Kit模板,一键生成含FastAPI、LangGraph ReAct、远程MCP、pgvector、Vault、OIDC、OpenTelemetry、测试和Evals的生产仓库。
技术架构与生产工作流
Step 01
文档、Runbook、Slack、Jira、日志和GitLab文件
→
Step 02
Glean检索及Kibana/GitLab/Slack等工具层
→
Step 03
LangGraph ReAct推理循环与远程MCP工具发现
→
Step 04
统一LLM Gateway、模型路由与用量治理
→
Step 05
FastAPI、Postgres/pgvector、Vault、OIDC与环境配置
→
Step 06
OpenTelemetry可观测、黄金集、ROUGE/BLEU和LLM-as-a-judge评测
关键技术与基础设施组件
LLM-KitLangGraphFastAPIMCPGleanPostgres/pgvectorVault/OIDCOpenTelemetryEvalshub
人机分工与责任边界
Bot先尝试回答文档化问题,未解决工单路由到正确的技术人员;Agent开发者只维护自己的业务逻辑和工具,平台团队统一维护认证、密钥、部署、网关、可观测与评测底座。
FDE 动作拆解
- 先用一个高频支持流程暴露Agent生产化问题
- 把推理平面和工具平面分离
- 将认证、密钥、存储和部署固化为模板
- 让开发者从可运行Agent而不是空项目开始
- 在项目第一天内置黄金集和多种评测器
可迁移复用的落地方法论
- Agent规模化的瓶颈通常是生产工程而不是第一次演示
- 统一框架应标准化基础设施但保留业务逻辑自由度
- MCP工具和模型调用都需要企业级注册与治理
- 评测能力应随模板交付而不是上线前补建
业务成效与交付成果
Grab披露已有500多个服务运行在内部Agent框架上,注册50多个远程MCP服务器,统一LLM网关每月处理数十亿Token;过去至少两周的首日基础接线缩短到约1小时。
证据边界与核验记录
- 500多个服务不等于500个独立Agent产品,按原文保留“服务”口径。
- 两周到一小时指基础接线,不代表完整Agent交付周期。