跳到正文
0727
资讯学院案例活动登录
中文/EN
案例/Bayer
← 返回案例库
← 上一案例2 / 127下一案例 →

Bayer

PRINCE:临床前研究资料检索与多Agent研究助手
企业原始材料 制药/临床前研发 伴随式部署 ⚙ 技术方案 深度案例|关键链路较完整 A级证据 内部生产使用/持续迭代
A 证据等级
Building Reliable Agentic AI Systems
发布方:martinfowler.com / Thoughtworks项目团队 · 项目参与者技术复盘 · 案例级直接来源
指标口径:项目参与者与拜耳合著论文披露 · 独立核验:否 · 查阅日期:2026-09-23
证据等级衡量“能否定位和复核来源”,不评价厂商披露是否经过第三方审计。
深度案例|关键链路较完整 12 / 12
业务背景2 / 2
改造流程2 / 2
技术工作流2 / 2
人机与治理2 / 2
量化结果2 / 2
来源定位2 / 2
六个维度均达到当前完整度标准。
PRINCE的参考价值在于把几十年临床前报告与结构化研究数据接进同一可追溯工作流,并将证据引用、只读SQL、人工复核、失败恢复和持续评测做成生产系统的一部分。
业务问题

拜耳的临床前研究数据分散在多个系统中,既有结构化研究元数据,也有数十年积累的PDF安全性研究报告;历史迁移造成部分元数据缺失或错误。关键词检索难以回答跨研究、跨文档的问题,研究人员需要花时间手工查找和核对原始报告。

解决方案

拜耳与Thoughtworks逐步把PRINCE从结构化数据搜索平台扩展为研究助手。先汇集研究报告和元数据,再用RAG检索PDF证据、用Text-to-SQL查询结构化数据;LangGraph协调意图澄清、规划、研究、证据充分性检查与答案撰写。回答附原始文档引用;撰写监管相关文档前由研究人员复核提示,最终内容仍由人审核。

技术架构与生产工作流
Step 01
内部研究系统与PDF报告汇入S3;文档提取、切分并附研究及章节元数据
→
Step 02
结构化研究元数据经整理后由Amazon Athena提供查询
→
Step 03
报告片段嵌入OpenSearch,按元数据过滤并结合关键词与向量做混合检索、重排
→
Step 04
Text-to-SQL按相关Schema和示例生成只读SELECT语句,并限制返回条数
→
Step 05
LangGraph协调意图澄清、规划、Researcher、Reflection与Writer,答案引用原文
→
Step 06
PostgreSQL保存工作流检查点,DynamoDB保存应用状态;失败时重试或切换模型
→
Step 07
Langfuse保存追踪及专家评测集,对生产查询每日做无参考答案评测
关键技术与基础设施组件
React / FastAPILangGraphAmazon S3 / Athena / OpenSearchRAG混合检索与重排Text-to-SQL只读校验PostgreSQL / DynamoDBLangfuse / RAGAS人工复核与来源引用
人机分工与责任边界

研究人员可选择或调整数据来源,并核查回答链接到的报告页码和原文片段;涉及监管文档时,用户先审改写作提示,再负责审阅、验证和定稿。领域专家整理评测题与参考答案,团队根据用户反馈和生产流量持续检查质量。

FDE 动作拆解
  • 从研究人员跨系统寻找安全性研究证据的流程入手,先建设可搜索的数据入口
  • 将PDF原文与不完整的历史元数据关联,保留报告作为可核查依据
  • 按问题类型路由非结构化检索与结构化SQL查询,并约束工具权限
  • 用领域专家问题集与真实用户反馈评估检索、答案和复杂查询响应
  • 为多步骤工作流增加检查点、节点重试、模型回退与生产追踪
  • 让科学家在文档生成前后保留审改、验证和最终责任
可迁移复用的落地方法论
  • 历史元数据可能不可靠时,以获批原始文档作为可追溯事实依据
  • 同时有结构化表和非结构化报告时,分别设计SQL和检索路径再汇总证据
  • 多Agent工作流需要可恢复状态、明确工具边界和分阶段评测
  • 高风险研究与监管文档应显示逐句出处并保留专家定稿权
业务成效与交付成果

拜耳与Thoughtworks合著论文称,PRINCE整合超过18,000项内部研究;在15至20名高频用户的反馈中,75%表示查找信息所花时间显著减少;引入多Agent后,复杂查询的平均响应时间改善30%。系统满足用户需求的平均评分为3.1/5;未披露药物研发周期或财务收益。

证据边界与核验记录
  • martinfowler.com是刊载网站,文章作者是Thoughtworks的Sarang Sanjay Kulkarni,不是Martin Fowler本人。
  • 论文由拜耳和Thoughtworks项目人员合著;同行评审不等于结果经过独立审计。
  • 75%来自15至20名高频用户的反馈;30%是复杂查询平均响应时间改善,论文未公开完整基线和测试样本。
  • 论文同时报告系统满足用户需求的评分仅3.1/5;不能据此推断药物研发周期缩短或监管决策自动化。
  • 文中按领域拆分Researcher子Agent及自动修复元数据属于演进计划,未写作已上线功能。
主要来源:Building Reliable Agentic AI Systems ↗ 补充来源:拜耳与Thoughtworks合著论文|PRINCE的演进、实现与用户反馈 ↗
可追溯不等于独立审计
访问主要公开来源
0727.ai · Trusted agents, built together.案例资料:FDE-case-library ↗ · MIT