数据质量不是“清洗一下”那么简单,而是八项全能的综合考验:
格式规范:不同医院、不同系统的数据格式千差万别,同一个药品可能有五种写法,同一个日期可能有四种含义。格式不规范,模型训练就是“垃圾进,垃圾出”。
安全合规:脱敏、匿名化、权限控制,这些不是后置动作,而是数据产品的“出厂标配”。带着敏感信息裸奔的数据,再“高质量”也是定时炸弹。
标注一致:医疗AI最怕的不是没标注,而是标注口径不一。“治疗有效”怎么定义?“疾病进展”看影像还是看记录?规则不清,专家再多也是白搭。
结构完整:缺失不可怕,可怕的是不知道缺在哪、为什么缺。核心变量的缺失情况必须清清楚楚,不能一句“部分缺失”就糊弄过去。
内容真实:真实数据要能追溯源头,生成数据要能说明算法。合成数据混在真实数据里不标注,那就是“挂羊头卖狗肉”。
逻辑一致:检查时间晚于结局时间?用药记录和医嘱对不上?影像提示进展但标签写缓解?这些“小瑕疵”,足以让模型学到错误关系。
类型匹配:通识、行业通识、行业专识,不能光靠标题说了算。拿公开指南包装成医院专病数据,那是“李鬼装李逵”。
内容干净:文本要无乱码、图像要无重影、视频要无花屏、音频要无杂音。多模态数据的“干净度”,直接影响模型能力。