诊疗时,有些患者会拿出从网上找到的健康信息问我:“这是真的吗?”有的文章说“队列研究已经证明”,有的说“临床试验结果显示”,还有的说“根据荟萃分析”。
医学研究有很多种,可靠程度也不同。医学上将这种可靠程度称为证据等级。1 下面介绍队列研究、临床试验、荟萃分析和系统综述分别是什么,以及怎样判断哪类医学研究更值得信赖。
证据等级一览
下图和表格中,越往上通常越值得信赖。1

| 证据等级 | 研究类型 | 特点 |
|---|---|---|
| 最高层 | 汇总多项临床试验的分析 (系统综述加荟萃分析) |
尽量找齐相关研究并综合统计结果,以弥补单项研究的局限 |
| 较高层 | 临床试验 (随机对照试验) |
随机分组后比较药物与安慰剂,是证明因果关系最有力的方法 |
| 中间层 | 观察性研究 (队列研究、病例对照研究) |
追踪特定人群,或回顾已有疾病者的过去;研究者不进行干预 |
| 较低层 | 病例报告、病例系列 | 描述少数患者的经历;有助于发现新现象,但难以推广 |
| 最低层 | 试管或动物研究、专家意见 | 仍处于应用于人体之前的阶段,或缺少系统研究而依赖经验 |
这座金字塔的核心很简单:在更严格的条件下比较更多人,证据通常就更强。2
下面逐层来看。
系统综述与荟萃分析有何不同?
证据金字塔的顶端是系统综述与荟萃分析。前者指尽量完整地收集相关论文、评价质量并整理结果的过程;后者指用统计方法合并这些论文中的数字结果。3
两者常被混淆,但承担不同任务。
| 系统综述 | 荟萃分析 | |
|---|---|---|
| 做什么 | 尽量找齐相关论文,评价质量并整理结果 | 用统计方法合并多项研究的数字结果 |
| 性质 | “过程”:如何收集和筛选论文 | “方法”:如何合并收集来的数字 |
| 比喻 | 收齐考试范围内的教科书,逐本阅读并挑选可靠的书 | 计算筛选后各本书成绩的平均值 |

现实中,两者几乎总是一起出现,很多论文标题也同时写上这两个词。因为先系统地收集论文(系统综述),再合并其结果(荟萃分析),通常是一套连续的工作。4
综合分析位于证据金字塔顶端,是因为它能弥补单项临床试验的局限。每项试验的人数、研究时间和测量方法都可能不同。只看一项试验时,难免怀疑“会不会只有这项研究得出这种结果?”如果把同一主题的 10~20 项研究合并,单项研究的误差便可能相互抵消。
但有一点要注意:综合分析并非一定可信。如果纳入的单项研究质量很差,即使合并很多项,结论的质量也不会提高。2016 年的一篇论文甚至建议,不应把综合分析固定放在金字塔顶端,而应把它视为观察证据的一枚“透镜”。5
我也同意这种看法。诊疗时制定治疗方针,如果有综合分析结果,我会优先参考,但也会检查其中研究的质量和一致性。
Cochrane:综合分析的国际标准
查找健康信息时,您可能看到“Cochrane 综述”。Cochrane 是 1993 年在英国成立的国际非营利组织,它收集特定治疗方法的相关临床试验,开展系统分析并发表综合报告。
Cochrane 综述受到医学界信赖,主要有三个原因。第一,它不接受制药公司赞助,利益冲突相对较少。第二,分析程序很严格,至少有两名独立评价者筛选论文并评价质量。第三,出现新研究后,综述会更新。
因此,想确认某种治疗方法的效果时,如果已有 Cochrane 综述,先看综述再看单项研究往往更有效率。我自己遇到疑问时,也会优先参考 Cochrane 综述。
临床试验阶段:从 I 期到 IV 期
临床试验是以人为对象,验证药物效果和安全性的研究。6 试验设计可从三个方面看。
第一,有没有对照组?
研究分为将药物与安慰剂或已有药物比较的对照试验,以及没有对照组、只给患者使用药物的单组试验。有了对照组,才能区分改善究竟来自药物,还是时间流逝后自然好转。单组试验通常用于 I 期等以观察药物本身反应、确认安全性为主要目的的阶段。
第二,如果有对照组,如何分组?
把患者分配到药物组和安慰剂组时,若由计算机随机分配,就是随机临床试验。随机分组有助于让两组的年龄、病情严重程度和基础疾病在统计上相近,从而更清楚地比较药物效果。若不随机,例如按住院先后顺序分组,两组自身特征的差异可能干扰结果,证据等级就较低。
第三,如果随机分组,谁知道接受了哪种治疗?
患者和医生都不知道谁拿到真正的药,称为双盲;两者都知道,则是开放标签。双盲试验会让真正的药和安慰剂外观相同,尽量避免心理和评价上的偏差。注射药与口服药等剂型不同、无法掩盖时,就会采用开放标签设计。

对照组、随机分配和双盲都具备,是最严格的临床试验形式,也是 III 期临床试验的标准。新药会经历 I 期至 IV 期,各阶段一般采用的设计有所不同。7
| 阶段 | 目的 | 规模 | 对照组 | 分组方式 | 盲法 |
|---|---|---|---|---|---|
| I 期 | 确定安全剂量范围 | 20~100 人 | 没有(单组) | — | — |
| II 期 | 探索效果及合适剂量 | 100~300 人 | 有(安慰剂等) | 随机 | 双盲或开放标签 |
| III 期 | 大规模证明效果;是 FDA 批准的重要依据 | 数百至数千人 | 有(安慰剂或已有药) | 随机 | 双盲 |
| IV 期 | 上市后追踪长期安全性 | 数千至数万人 | 不一定 | 不一定 | 主要为开放标签 |

新闻最常引用的是 III 期临床试验结果,因为它通常具备随机分配、对照组和双盲这些严格条件。8
IV 期在药物上市后开展。III 期以前的试验人数一般只有数千人,很难发现每 1 万人中才有 1 人遇到的罕见不良反应。IV 期会在真实处方环境中汇集数万人的资料,追踪 III 期没有发现的长期不良反应,或老年人、孕妇等特殊人群的反应。7 有时药品监管机构或 FDA 会要求必须进行 IV 期研究,也有药企自愿进行的情况。
观察性研究:队列研究、病例对照研究和病例报告
临床试验与观察性研究最大的区别是研究者是否进行干预。9 在临床试验中,研究者直接给患者用药;在观察性研究中,只观察已经发生的事,不介入治疗。
下面用例子说明几类常见的观察性研究。10 它们的核心区别是时间方向。
假设我们想知道:“小时候经常服用抗生素,会更容易患特应性皮炎吗?”
队列研究从现在走向未来。研究者招募 1 万名新生儿,追踪服用过抗生素和未服用过的孩子 10 年,观察谁患上特应性皮炎。因为时间顺序明确,可以推测“抗生素 → 特应性皮炎”的方向,但这需要大量时间和费用。
病例对照研究从现在回看过去。研究者招募 200 名患特应性皮炎的儿童(病例组)和 200 名未患病的儿童(对照组),比较过去的医疗记录,看看“患病孩子以前是否更常使用抗生素”。它速度快、费用低,尤其适合研究罕见疾病,但旧记录可能不准确,病例组回忆过去时也可能出现更严重的偏差。

病例报告详细描述 1 名或少数患者的经历。它有利于首次发现新疾病或罕见不良反应,但不能根据一两个病例推广到所有人,因此证据等级最低。
| 类型 | 时间方向 | 优点 | 局限 |
|---|---|---|---|
| 队列研究 | 现在 → 未来 | 有助于推断因果方向 | 耗时、费用高 |
| 病例对照研究 | 现在 → 过去 | 快、费用低,适合罕见疾病 | 回忆偏差 |
| 病例报告 | — | 首次发现新现象 | 不能推广 |
观察性研究的证据等级低于临床试验,是有原因的。研究者不随机分配受试者,所以可能有影响结果的其他因素——混杂变量——潜藏其中。9
例如,一项观察性研究发现“经常服用维生素 D 的人更健康”,但这些人可能本来就更关注健康,也会运动并注意饮食。此时无法分辨健康究竟来自维生素 D,还是健康的生活方式。
不过,队列研究等观察性研究绝非毫无价值。在伦理上不能做临床试验时,例如不能为了验证“吸烟是否致癌”而故意让人吸烟,观察性研究便是唯一的选择。如果多项队列研究反复得出一致结果,也能形成有力证据。
阅读健康信息时,请检查这些要点
根据前面的内容,下面列出阅读健康新闻或博客文章时可以使用的检查要点。我写特应性皮炎与饮食的关系等博客文章时,也尽量标注所引用资料的证据等级。
1. 当文章说“研究已经证明”,它是哪种研究?
动物实验、小型观察性研究和大型临床试验的证据分量不同。只写“研究结果”,无法判断它是队列研究还是临床试验。
2. 有多少受试者?
一项 20 人的研究,与一项 2,000 人的研究,可信度不可能完全一样。
3. 有没有对照对象?
要看的不是“吃了这种药后好转”,而是“服药组比安慰剂组好转得更多”。没有对照组,就无法判断是自然恢复还是药物起效。6
4. 多项研究是否得出了相同结论?
多项研究反复确认的结果,比单项研究的发现更有力。若有汇总多项临床试验的综合分析,应优先参考它,而不是只看单项试验。11
5. 有没有注明来源?
可靠的健康信息会列出论文出处、指南名称和研究规模。若只有“专家表示”“据悉”等笼统说法,却没有具体来源,就值得再核查一次。
常见问题
只有队列研究支持的健康信息就不可信吗?
不是。观察性研究也非常有用。只是与临床试验相比,其他因素更可能干扰结果,因此证据等级通常低一级。如果多项观察性研究都得出相同结论,证据也可以相当有力。
药物通过 III 期临床试验就安全了吗?
III 期通常以数百到数千人为对象,验证效果和安全性。但极罕见的不良反应,例如每 1 万人中有 1 人发生的情况,可能在 III 期发现不了。因此,上市后还有 IV 期研究。开始用药后,与医生讨论并持续监测也很重要。
有荟萃分析,就一定要遵循它的结论吗?
不一定。综合分析的质量取决于它纳入的单项研究。如果只是把质量低的研究合并,结论仍会不确定。有综合分析时可以优先参考,但也要检查其中研究的规模和质量。
参考文献
- Burns PB, Rohrich RJ, Chung KC. The levels of evidence and their role in evidence-based medicine. Plast Reconstr Surg. 2011;128(1):305-310.
- Sackett DL, Rosenberg WM, Gray JA, et al. Evidence based medicine: what it is and what it isn’t. BMJ. 1996;312(7023):71-72.
- Linares-Espinos E, Hernandez V, Dominguez-Escrig JL, et al. Methodology of a systematic review. Actas Urol Esp (Engl Ed). 2018;42(8):499-506.
- Cumpston M, Li T, Page MJ, et al. Updated guidance for trusted systematic reviews: a new edition of the Cochrane Handbook for Systematic Reviews of Interventions. Cochrane Database Syst Rev. 2019;10(10):ED000142.
- Murad MH, Asi N, Alsawas M, et al. New evidence pyramid. Evid Based Med. 2016;21(4):125-127.
- Zabor EC, Kaizer AM, Hobbs BP. Randomized Controlled Trials. Chest. 2020;158(1S):S79-S87.
- Umscheid CA, Margolis DJ, Grossman CE. Key concepts of clinical trials: a narrative review. Postgrad Med. 2011;123(5):194-204.
- Bhide A, Shah PS, Acharya G. A simplified guide to randomized controlled trials. Acta Obstet Gynecol Scand. 2018;97(4):380-387.
- von Elm E, Altman DG, Egger M, et al. The Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) statement: guidelines for reporting observational studies. J Clin Epidemiol. 2008;61(4):344-349.
- Munnangi S, Boktor SW. Epidemiology Of Study Design. StatPearls. 2024.
- Balshem H, Helfand M, Schunemann HJ, et al. GRADE guidelines: 3. Rating the quality of evidence. J Clin Epidemiol. 2011;64(4):401-406.




