Prometheno博客联系 ↗

合成数据的真实表现

合成数据能干真活。但当用例需要真实结果或监管基准真相时,它替代不了真实患者基础设施。

管子元
管子元
9 分钟阅读

《临床真相缺口》里我说临床真相验证属于医学经验主义。一个公平的反对是:既然合成数据存在,为什么还要费劲建真实患者基础设施?Synthea、MDClone、Syntegra、mostly.ai——生成具有真实患者统计属性的假患者,用那些训练模型,发布。

诚实的答案是看合成数据实际怎么表现,而不是怎么被推销。

合成数据做得好的地方#

三个它站得住的用途。

流水线测试。 没有 PHI,不用 HIPAA 审查,不用同意开销。工程师压力测试摄入代码、验证 FHIR 映射、跑边缘情况。Synthea——MITRE 做的开源生成器——明确就是为这个建的1,大部分美国健康 IT 项目都在用。

训练增强。 对于真实数据样本在临床上不够多的罕见疾病,合成补充能明显提升模型性能。2024 年一项关于罕见甲状腺癌亚型分类的研究用文本引导扩散生成合成图像,把亚型分类 AUC 从 0.7364 提到了 0.84422。提升来自混合训练。合成 + 真实比单用任何一种都强。

聚合统计研究。 像"平均 HbA1c 轨迹是什么"或"共病患病率是多少"这种问题,合成和真实数据往往给出相似的答案,同时没有个体级别的暴露。一项 JMIR 比较研究对五个 MDClone 生成的队列和它们的真实对应物做了比较,发现这些分析"总体上提供了真实数据结果的接近估计",具体取决于患者变量比3

这是真实的价值主张。这个系列不否认它。

基准测试说明了什么#

三个数字,都不利于"用合成替代真实"。

罕见事件性能触顶。 SHEPHERD——一个在 40,000+ 合成患者跨 2,134 种罕见疾病上训练的哈佛/Zitnik 实验室模型——在根据真实世界未确诊疾病网络队列评估时,因果基因发现只达到了 40% 的 top-1 准确率4。40% 作为分诊工具有用,但不是临床级的。合成训练性能和真实世界基准真相之间的差距,正是合成数据单独弥合不了的差距。

两列决策矩阵。左列(合成够用):流水线测试、训练增强、聚合研究、假设生成。右列(需要真实数据):监管提交、结果验证、AI 问责、罕见事件预测。
合成数据在左列干真活。右列是 HAVEN 的真实患者基础设施存在的理由。

混合几乎总是赢,而混合需要真实数据。 在医疗 AI 基准测试里,用合成 + 真实训练的模型优于单用任何一种。一项用 ResNet-18 做 AMD 眼底图像的研究在使用组合数据时达到了 85% 的准确率——比仅用合成训练的同一架构高出一个临床有意义的幅度5。目的地很少是纯合成的,是增强。

隐私没宣传的那么干净。 针对合成健康数据的成员推断攻击是有效的。2022 年 JMIR 的分析(后来被多篇 2024 年论文扩展)表明,攻击者能以相当的信心推断某个真实患者的记录是不是被用于生成合成队列6。对于独特病例——老年患者、罕见疾病——重新识别风险上升,而这恰恰是合成数据最常被用于的人群。差分隐私能缓解,但代价是有意义的效用损失。

合成数据在结构上到不了的地方#

两个范畴上的限制。生成器再好也修不了。

真实结果。 合成患者不会发展脓毒症。不会从癌症中存活。不会五年后死于心力衰竭。合成结果数据是虚构的——生成出来匹配训练分布,不是真实的生物学。对于 Prometheno 更长期的愿景——当 AI 供应商的预测匹配或错过现实时奖励或处罚他们——结果一端不能是合成的。没有算法能把模拟变成观察。

监管基准真相。 FDA 器械中心 2025 年 12 月发布了更新的真实世界证据指南7。框架基于实际护理中实际患者的观察数据。合成对照组作为真实证据的补充有一条定义的路径,但不是替代。EMA 立场类似。对于任何寻求许可的 AI/ML 医疗器械,路径都要经过真实数据。

HAVEN 做什么而合成数据做不了#

承认合成数据的优势,恰恰是支持 HAVEN 的最强论点。

如果仅合成训练在罕见事件上的表现远低于临床级,前进的路就要经过混合模型——而混合需要受治理的真实数据。同意、审计和质量评级是让混合在人口规模上站得住脚的东西。

如果真实结果不能被合成,AI 问责就得跑在真实结果数据上。收集结果、把它们和之前的预测挂钩、把价值归因回贡献患者——这套基础设施是 HAVEN 的四个原语启用的。

如果成员推断攻击损害了合成的隐私声明,答案不是放弃真实数据,是适当地治理对真实数据的访问。同意证明和哈希链式审计产生的可追溯性,是去识别从来做不到的。

合成数据是互补的。它加强了患者主权协议层的论据,不是取代它。

接下来讲什么#

下一篇承诺什么会证明整个论证是错的。

References

  1. Walonoski, J., et al. "Synthea: An approach, method, and software mechanism for generating synthetic patients and the synthetic electronic health care record." Journal of the American Medical Informatics Association 25, no. 3 (2018): 230-238. 开源,MITRE 维护,广泛用于测试和演示。

  2. Frontiers in Digital Health,"Synthetic data generation: a privacy-preserving approach to accelerate rare disease research"(2025)。文本引导扩散产生的合成图像真实率为 92.2%;混合训练将 AUC 从 0.7364 提升到 0.8442。

  3. JMIR Medical Informatics 8, no. 2 (2020),"Analyzing Medical Research Results Based on Synthetic Data and Their Relation to Real Data Results: Systematic Comparison From Five Observational Studies." https://medinform.jmir.org/2020/2/e16492/

  4. Alsentzer, E., et al. "Deep learning for diagnosing patients with rare genetic diseases." Zitnik Lab,哈佛。SHEPHERD 模型根据 NIH 未确诊疾病网络真实世界队列进行评估;发布的结果显示因果基因发现的 top-1 准确率为 40%。

  5. npj Digital Medicine,"Generating high-fidelity synthetic patient data for assessing machine learning healthcare software"(2020)。https://www.nature.com/articles/s41746-020-00353-9。AMD 眼底图像上的 ResNet-18:使用组合真实+合成数据准确率 85%。

  6. Hyeong, J., et al. "Membership inference attacks against synthetic health data." Journal of Biomedical Informatics 125 (2022). https://pmc.ncbi.nlm.nih.gov/articles/PMC8766950/。被多篇 2024 年论文扩展,包括关于差分隐私合成数据和表格 GAN 重新识别的工作。

  7. 美国食品药品监督管理局。Use of Real-World Evidence to Support Regulatory Decision-Making for Medical Devices. 最终指南,2025 年 12 月 16 日(取代 2017 年指南)。真实世界数据质量标准强调实际护理中实际患者观察数据的相关性和可靠性。

邮件订阅更新

无跟踪,无推销。每篇文章一封邮件,随时退订。