做临床研究,方法学部分其实可以总结成一张表。
今天把课程里的核心干货整理出来,建议收藏。
不管你做的是哪种数据库、哪种设计,方法学概论的骨架都是一样的:先判断变量类型,再做数据描述,然后组间比较,最后选回归。
听起来简单,但真正做起来,很多人第一步就错了。
一、变量类型只有两类
1. 计数资料(分类变量)
比如性别、种族、血型、是否患病、受教育程度。
它的特点是:把人群分成几类,统计的是数量、比例。
你可以叫它分类变量,也可以叫定性变量,名字很多,但本质就一个:看类别,不看数值。
2. 计量资料(连续型变量)
比如身高、体重、血压、血脂、维生素 C 水平。
它的特点是:连续变化,通常带单位。
你可以叫它定量变量,也可以叫连续型变量,本质就一个:看数值,不看类别。
这里有一个关键提醒:连续变量可以按界值转成分类变量。
比如血压 ≥140/90 就是高血压,否则就是非高血压。
但界值不能随便选,要来自指南、共识、高分文献或 WHO 标准。
如果没有标准,可以用三等分、四等分,最常见的是 Q1–Q4。
变量类型判断对了,后面描述、比较、回归自然就顺了。
这一步错了,后面全错。
二、描述与组间比较
计数资料:
描述:率 + 95% CI,或 n(%)
组间比较:卡方检验
计量资料:
先做正态性检验,再决定用哪种描述和比较。
注意几个细节:
第一,正态性检验不能跳过。
符合正态分布,才能用均数 ± 标准差 / 标准误,才能用 t 检验或方差分析。
不符合正态分布,只能用中位数(四分位间距),只能用非参数检验。
没做正态性检验,上来就用非参数检验,逻辑上是说不通的。
第二,t 检验只能两组。
大于两组,要用方差分析,或者线性回归。
文章写 t 检验,结果却是三组,审稿人一眼就能看出来。
第三,大样本可以默认正态。
如果最终纳入的数据量很大,比如几万例,删除样本不多,可以默认符合正态分布。
但如果最终只剩几千例甚至更少,稳当一点,还是做个正态性检验。
第四,Q1–Q4 到底是什么。
把连续变量四等分:
25% 百分位数是 Q1;
50% 是中位数,也叫 Q2;
75% 是 Q3;
100% 是 Q4。
落在第一段的人,归为 Q1 组;
落在第二段的人,归为 Q2 组;
以此类推。
所以 Q1 有时指一个数,有时指一个区间,看语境。
三、三大回归怎么选
回归选择,核心看Y 是什么类型。
线性回归:
Y 和 X 都必须是连续变量。
结果看 β 值,95% CI 以 0 为界。
都大于 0,正相关;都小于 0,负相关;跨过 0,没有显著相关。
逻辑回归:
Y 是二分类,比如患病 / 不患病,死亡 / 存活。
X 可以是任意类型。
结果看 OR 值,95% CI 以 1 为界。
Cox 回归:
Y 是二分类,同时还有随访时间。
常用于生存分析、发病率分析。
结果看 HR 值,95% CI 同样以 1 为界。
四、单因素 vs 多因素
单因素回归分析,是单个 X 和 Y 做回归,不加入协变量。
这叫模型一。
如果 X 加上部分协变量 Z1、Z2、Z3,再和 Y 做回归,这叫模型二,也叫微调整模型。
如果 X 加上全部要调整的混杂因素,再和 Y 做回归,这叫模型三,也叫全调整模型。
一般来说,单因素回归有意义,再进行多因素回归。
如果三个模型方向一致,都是正相关或都是负相关,说明 X 和 Y 的关系比较稳定,结论更有说服力。
五、一张表总结
临床研究并不难,难的是基础概念没打牢。
变量类型判断对了,描述、比较、回归自然就顺了。
如果你想系统掌握这套方法,科研会员里有完整的方法学概论 + 分论课程。
从变量类型到三大回归,再到文章实战,一步步带你做。
想发临床研究文章,欢迎加入科研会员。
科研会员每年更新,目的是把更优质的临床科研课程带给大家,如果 2026 年想发 SCI,你是 ——扫码,立即学习⬇️