02 / Dify 工作流

从用药不良反应病历中提取结构化数据

把非结构化的口语化病历和报告,通过 Dify 抽出标准字段并对齐医学编码,写了测试脚本防止格式失真。

问题

一线收集上来的不良反应报告多是一大段随访口述或手写病历。 人工录入费时,而且每个人对医学症状的用词习惯不一样。 直接丢给大模型处理,容易出现字段格式跑飞或者医学术语乱编的情况,导致没法导入数据库。

我做了什么

  • 在 Dify 上搭了一个工作流,第一步先核对患者、报告者、药品、症状四要素。要素不全直接打回,不浪费后续算力。
  • 根据是否危及生命、是否住院等明确条件,自动打上严重等级并标记上报截止时间。
  • 把大白话描述(比如“身上大片起疹子奇痒”)对齐到 MedDRA 词典的标准术语(LLT/PT)。
  • 写了本地测试脚本 test_pv_live.py,用固定测试集对抽取出的 JSON 做字段和关键词断言。

结果

  • 单条报告的初筛和结构化提取缩短到几秒内。
  • 平时微调提示词或者换模型后,跑一遍脚本就能立刻知道关键字段有没有丢。

用到的工具

Dify MedDRA 词典 Python pytest JSON Schema
← 上一篇:AI API 网关 下一篇:知识库切栈 →