拿到真实病历有四条路,区别在于谁还在局里。
需要病历级健康数据的研究者,现实中有四个选择:向数据经纪商买一份去标识化的数据、生成合成数据、和每一家机构分别谈数据使用协议,或者用患者自己同意共享的数据。四者的差别,不在于表里的行长什么样,而在于数据摆到你面前之后你还能做什么——还能不能再问患者一个问题、患者反悔了能不能撤下来、审稿人问起来能不能说清一个数字是怎么来的。
- 对比的方案
- 4 种
- 同意模型(Prometheno)
- 按人授权,限定范围,可撤销
- 访问方式
- 按同意范围查询与导出
- 阶段
- 试点前——开发数据集,不是真实患者群
每条路是什么,最擅长什么,又要你付出什么。
患者自己从医院门户把病历接进来,并给出一份指明研究或用途的同意。查询也好,导出也好,只覆盖同意范围对得上的那些人,并且每位患者留下一条审计记录。
- 擅长
- 患者一直是够得着的:同意能限定范围、能核验、能撤销,每一次访问都留下可验证的痕迹。
- 代价
- 队列有多大,取决于有多少患者加入。现在还在试点之前,背后是公开研究数据集,不是真实患者群。
厂商把理赔、药房、检验或电子病历的数据拼成一份去标识化数据授权给你。合同一签,拿到文件或者一个数仓账号,回自己的系统里分析。
- 擅长
- 规模和速度。上百万患者、跨很多年,签完就能用。
- 代价
- 患者是够不着的:去标识化之后没有回到本人的路径,所以没法再征求同意、没法更正、没法撤回、也没法追问。几路数据之间怎么关联上,只能听厂商解释。
照着真实数据集的统计特征生成的记录。文件里没有真人,所以不存在同意的问题,通常也不用谈协议。
- 擅长
- 做方法、在真实数据到位之前先把代码写完、教学,以及把一条流水线公开分享出去。
- 代价
- 它不含任何源分布里没有的事实,撑不起一个关于真实患者身上发生了什么的结论。
最常走的那条路:先过伦理委员会,再和每家机构的法务谈数据使用协议,然后从这家机构的数仓里出一份数据,通常以豁免知情同意的方式。
- 擅长
- 真实病历、真实结局,而且这套治理方式各方都熟。
- 代价
- 有几个中心就要谈几次,各有各的排期;患者由机构代表,你没法直接触达。
这四条路没有哪条是骗人的,它们回答的是不同的问题。而且其中两条可以同时成立——用合成数据把流水线写好,再用经同意的访问去跑。
差别体现在具体场景里,不在功能清单里。
下面每一行都是决定一项研究走向的时刻,写的是每条路在那一刻实际会发生什么——包括 Prometheno 压根没做的那一格。
- 01
立项之前,你得先知道数据里有谁。
写方案之前的可行性计数。
Prometheno按同意范围计数:只覆盖同意与你指明的研究或用途对得上的人,其余的人根本不会进入结果。
数据经纪商厂商的数字在谈授权的时候就给你,但要拿底层记录核对,一般得等签完合同。
合成数据数字是生成器生出来的,描述的是生成器,不是一个人群。
逐机构 DUA可行性通常要各中心的可信第三方帮你跑一次查询,而这本身就是一个要排队的申请。
- 02
患者做到一半改主意了。
分析已经开始之后的撤回。
Prometheno撤销在下一次访问就生效:同意校验不通过,这个人从按范围的查询里掉出去,而这次拒绝本身也写进审计。
数据经纪商没有回到本人的路径,你手上那份文件里也就没什么可撤的。
合成数据不适用——文件里没有真人。
逐机构 DUA多数数据是以豁免同意出的,撤回就算处理,也是在机构那一端,够不到你手上已有的那份副本。
- 03
审稿人问你这个数字是从哪来的。
半年之后,返修的时候。
Prometheno每一次访问都写一条哈希链上的审计记录,任何一条都能连同包含性证明一起核验——不用先相信我们没动过手脚。
数据经纪商你可以引用所授权的数据集和版本号。数据出库之前经历了什么,那是厂商的文档,不是你的。
合成数据你可以公开生成器和随机种子,文件能一字不差地复现,但它对任何一位患者什么都没说。
逐机构 DUA查询日志在机构手里,要看,就得向数仓团队提申请。
- 04
你要同一个人多年的检验、用药和结局。
一个人,跨几年,跨几个系统。
Prometheno一位患者可以接入不止一个门户;记录汇进同一个人的一份 OMOP CDM 5.4 病历,原始编码和标准编码并排留着。
数据经纪商跨数据源的关联是厂商的方法,在你这个队列上对得准不准,通常没法自己查。
合成数据形状上很真。生成器没学过的相关性,文件里就不存在。
逐机构 DUA在一家机构的墙内是完整的,出了墙就断了。患者在别处看的病看不见。
- 05
样本不够,你得再加一个中心。
第一个队列太小了。
Prometheno没做。Prometheno 今天就是一个环境;跨机构联邦写在协议里,代码里还没有。这一格说实话是 DUA 那条路赢。
数据经纪商本来就是全国范围的——你买的就是这个。
合成数据再生成一些就是了。加的是量,不是证据。
逐机构 DUA再签一份协议、再报一次伦理、再对接一个数仓团队:这是常规成本,也是多中心研究动辄拖几年的原因。
- 06
患者想知道最后研究出了什么。
研究做完了,然后呢?
Prometheno因为同意是指向具体的人的,研究结束时可以把一份大白话的小结返还给贡献过病历的患者,连同优先参与权和一份分成。
数据经纪商没有回去的路。文件里的那些人不会知道这项研究发生过。
合成数据没有人可以告知。
逐机构 DUA结果回到机构和文献里。会不会传到患者个人那里,不在这套安排的范围内。
该说「还没有」的地方。
只夸自己的对比页不值得读。下面这些地方,目前是别的选择更好。
- 数据集还是开发用的。
- Prometheno 背后现在是一个公开的重症监护研究数据集,1,000 位患者。还在试点之前:目前没有真实的患者群可以从中拉队列。
- 已经出去的文件收不回来。
- 撤销同意能挡住下一次查询,但挡不住一份已经下载走的病历级导出——这一点下游谁也做不到。正因如此,把分析放进环境里跑、只让结果出来,才是这件事该走的方向。
- 按同意范围过滤目前要显式开启。
- 这道闸门已经写好,也有测试,但调用方得主动要求,这样背后没有同意记录的公开研究数据集才照样能用。真正存着患者病历的部署,会把它设成每一次请求都强制生效。
- 还没有跨机构联邦。
- 一个环境,一个受治理的存储。同一份队列定义在多家机构上跑,协议里写了,代码里还没有。
这一页通常会引出的问题。
- 这不就是加了个同意勾选框的数据经纪商吗?
- 不是。经纪商卖的是一份在患者不在场的情况下拼出来的数据;在这里,只有当患者持有一份指明研究或用途的同意,数据才会动,患者撤销,它就停。Prometheno 不卖患者数据,而且「谁在什么时候访问了我的什么」这份记录本身就属于患者,不是我们应要求才生成的一份报告。
- 为什么不直接用合成数据?
- 要写流水线、要教学、要把代码公开分享,合成数据往往就是对的答案,我们自己也这么用。但它撑不起关于真实患者的结论:生成器只能重放它被喂过的结构,所以在合成数据里发现的东西,是关于生成器的发现。
- 有了患者同意,还需要伦理审查吗?
- 需要。患者同意和伦理委员会批准回答的是两个问题,一项研究两个都要。Prometheno 记录同意和伦理批件编号,但它不替你批。
- 这个要多少钱?
- 还在试点之前,不报价。已经定下来的是开放部分的授权:HAVEN 协议采用 CC BY 4.0,署名即可自由阅读、实现和分叉,PSDL 同样开放。想聊试点,写信给我们。
- 我能把自己的队列定义带过来跑吗?
- 这正是要做的方向。队列定义用 PSDL 写,打包成认证包(Certified Bundle),自带哈希和签名,所以你发出去的定义和真正跑的那一个是同一个,这一点可以证明。把认证包提交到环境里执行这一步,设计好了但还没实现;现在的队列是在研究者工作台里搭的。
- 患者能得到什么?
- 首先是一个答复:一份大白话的研究结果小结,对应到他们贡献的那些病历。其次是优先——让这项研究成为可能的人,排在最前面。然后是他们的病历所承载价值的一份分成。顺序就是这样,钱是其中最小的那一部分。