Bayer
PRINCE:临床前研究资料检索与多Agent研究助手
企业原始材料
制药/临床前研发
伴随式部署
⚙ 技术方案
深度案例|关键链路较完整
A级证据
内部生产使用/持续迭代
A
证据等级
Building Reliable Agentic AI Systems
证据等级衡量“能否定位和复核来源”,不评价厂商披露是否经过第三方审计。
深度案例|关键链路较完整
12 / 12
业务背景2 / 2
改造流程2 / 2
技术工作流2 / 2
人机与治理2 / 2
量化结果2 / 2
来源定位2 / 2
六个维度均达到当前完整度标准。
业务问题
拜耳的临床前研究数据分散在多个系统中,既有结构化研究元数据,也有数十年积累的PDF安全性研究报告;历史迁移造成部分元数据缺失或错误。关键词检索难以回答跨研究、跨文档的问题,研究人员需要花时间手工查找和核对原始报告。
解决方案
拜耳与Thoughtworks逐步把PRINCE从结构化数据搜索平台扩展为研究助手。先汇集研究报告和元数据,再用RAG检索PDF证据、用Text-to-SQL查询结构化数据;LangGraph协调意图澄清、规划、研究、证据充分性检查与答案撰写。回答附原始文档引用;撰写监管相关文档前由研究人员复核提示,最终内容仍由人审核。
技术架构与生产工作流
Step 01
内部研究系统与PDF报告汇入S3;文档提取、切分并附研究及章节元数据
→
Step 02
结构化研究元数据经整理后由Amazon Athena提供查询
→
Step 03
报告片段嵌入OpenSearch,按元数据过滤并结合关键词与向量做混合检索、重排
→
Step 04
Text-to-SQL按相关Schema和示例生成只读SELECT语句,并限制返回条数
→
Step 05
LangGraph协调意图澄清、规划、Researcher、Reflection与Writer,答案引用原文
→
Step 06
PostgreSQL保存工作流检查点,DynamoDB保存应用状态;失败时重试或切换模型
→
Step 07
Langfuse保存追踪及专家评测集,对生产查询每日做无参考答案评测
关键技术与基础设施组件
React / FastAPILangGraphAmazon S3 / Athena / OpenSearchRAG混合检索与重排Text-to-SQL只读校验PostgreSQL / DynamoDBLangfuse / RAGAS人工复核与来源引用
人机分工与责任边界
研究人员可选择或调整数据来源,并核查回答链接到的报告页码和原文片段;涉及监管文档时,用户先审改写作提示,再负责审阅、验证和定稿。领域专家整理评测题与参考答案,团队根据用户反馈和生产流量持续检查质量。
FDE 动作拆解
- 从研究人员跨系统寻找安全性研究证据的流程入手,先建设可搜索的数据入口
- 将PDF原文与不完整的历史元数据关联,保留报告作为可核查依据
- 按问题类型路由非结构化检索与结构化SQL查询,并约束工具权限
- 用领域专家问题集与真实用户反馈评估检索、答案和复杂查询响应
- 为多步骤工作流增加检查点、节点重试、模型回退与生产追踪
- 让科学家在文档生成前后保留审改、验证和最终责任
可迁移复用的落地方法论
- 历史元数据可能不可靠时,以获批原始文档作为可追溯事实依据
- 同时有结构化表和非结构化报告时,分别设计SQL和检索路径再汇总证据
- 多Agent工作流需要可恢复状态、明确工具边界和分阶段评测
- 高风险研究与监管文档应显示逐句出处并保留专家定稿权
业务成效与交付成果
拜耳与Thoughtworks合著论文称,PRINCE整合超过18,000项内部研究;在15至20名高频用户的反馈中,75%表示查找信息所花时间显著减少;引入多Agent后,复杂查询的平均响应时间改善30%。系统满足用户需求的平均评分为3.1/5;未披露药物研发周期或财务收益。
证据边界与核验记录
- martinfowler.com是刊载网站,文章作者是Thoughtworks的Sarang Sanjay Kulkarni,不是Martin Fowler本人。
- 论文由拜耳和Thoughtworks项目人员合著;同行评审不等于结果经过独立审计。
- 75%来自15至20名高频用户的反馈;30%是复杂查询平均响应时间改善,论文未公开完整基线和测试样本。
- 论文同时报告系统满足用户需求的评分仅3.1/5;不能据此推断药物研发周期缩短或监管决策自动化。
- 文中按领域拆分Researcher子Agent及自动修复元数据属于演进计划,未写作已上线功能。