Trong buổi khám, có người cho tôi xem thông tin sức khỏe tìm trên mạng và hỏi: “Điều này có thật không?” Bài viết này nói “nghiên cứu đoàn hệ đã chứng minh”, bài khác nói “theo thử nghiệm lâm sàng”, còn bài khác lại dẫn “phân tích gộp”.

Nghiên cứu y học có nhiều loại với độ tin cậy khác nhau, thường gọi là mức độ bằng chứng.1 Dưới đây là ý nghĩa của từng loại và cách đánh giá nên tin đến đâu.

Nhìn nhanh các mức bằng chứng

Trong hình và bảng dưới, càng lên cao thì mức đáng tin thường càng lớn.1

Sơ đồ kim tự tháp mức bằng chứng y học gồm nghiên cứu đoàn hệ, thử nghiệm, tổng quan hệ thống và phân tích gộp, giúp so sánh độ tin cậy

Mức bằng chứng Loại nghiên cứu Đặc điểm
Cao nhất Phân tích tổng hợp nhiều thử nghiệm
(tổng quan hệ thống và phân tích gộp)
Thu thập đầy đủ nghiên cứu liên quan và gộp kết quả thống kê, giảm hạn chế của từng nghiên cứu
Cao Thử nghiệm lâm sàng
(ngẫu nhiên có đối chứng)
Phân nhóm ngẫu nhiên, so thuốc với giả dược; mạnh nhất để đánh giá quan hệ nhân quả
Trung bình Nghiên cứu quan sát
(đoàn hệ, bệnh-chứng)
Theo dõi nhóm người hoặc nhìn lại quá khứ của người đã mắc bệnh; nhà nghiên cứu không can thiệp
Thấp Báo cáo ca bệnh, loạt ca Mô tả ít người; hữu ích để phát hiện hiện tượng mới nhưng khó khái quát
Thấp nhất Nghiên cứu ống nghiệm, động vật; ý kiến chuyên gia Giai đoạn trước áp dụng ở người hoặc ý kiến dựa kinh nghiệm chưa có nghiên cứu hệ thống

Ý chính của kim tự tháp: càng so sánh nhiều người trong điều kiện chặt chẽ, bằng chứng càng mạnh.2 Hãy xem từng tầng.

Tổng quan hệ thống khác phân tích gộp thế nào?

Đỉnh kim tự tháp gồm tổng quan hệ thống, tức tìm đầy đủ các nghiên cứu liên quan rồi đánh giá chất lượng và tổng hợp nội dung, và phân tích gộp, tức kết hợp các kết quả số bằng thống kê.3

Hai khái niệm thường bị nhầm nhưng vai trò khác nhau.

Tổng quan hệ thống Phân tích gộp
Làm gì? Tìm đầy đủ bài liên quan, đánh giá chất lượng, tổng hợp kết quả Gộp kết quả số của nhiều nghiên cứu bằng thống kê
Bản chất “Quy trình” tìm và chọn bài “Phương pháp” kết hợp các con số
Ví dụ dễ hình dung Gom tất cả sách thuộc phạm vi thi và chọn quyển đáng tin Tính điểm chung từ những quyển đã chọn

Đồ họa quá trình tổng quan hệ thống Cochrane và phân tích gộp: chọn nhiều thử nghiệm riêng lẻ, gộp thống kê để đi đến kết luận

Trên thực tế, chúng thường xuất hiện cùng nhau: sau khi tìm bài một cách hệ thống sẽ gộp kết quả của chúng.4

Phân tích tổng hợp ở trên cùng vì giúp bù hạn chế của từng thử nghiệm. Mỗi thử nghiệm khác số người, thời gian và cách đo. Một nghiên cứu riêng có thể cho kết quả tình cờ, còn khi gộp 10~20 nghiên cứu cùng chủ đề, một phần sai số riêng được triệt tiêu.

Tuy nhiên, tổng hợp không tự động đáng tin. Nếu nghiên cứu được đưa vào kém chất lượng, gộp nhiều cũng không cho kết luận tốt. Một bài năm 2016 đề nghị xem phân tích tổng hợp như “thấu kính” nhìn vào bằng chứng thay vì mặc định đặt trên đỉnh kim tự tháp.5

Tôi đồng ý: khi quyết định điều trị, tôi ưu tiên xem phân tích tổng hợp nếu có, đồng thời kiểm tra chất lượng và sự nhất quán của các nghiên cứu bên trong.

Cochrane: chuẩn quốc tế của phân tích tổng hợp

Khi tìm thông tin y tế, bạn có thể gặp “tổng quan Cochrane”. Cochrane là tổ chức phi lợi nhuận quốc tế thành lập tại Anh năm 1993, tìm các thử nghiệm về phương pháp điều trị, phân tích có hệ thống và xuất bản báo cáo tổng hợp.

Có ba lý do khiến tổng quan Cochrane được tin cậy. Thứ nhất, tổ chức không nhận tài trợ từ công ty dược nên ít xung đột lợi ích. Thứ hai, quy trình rất chặt, ít nhất hai người đánh giá độc lập chọn bài và xét chất lượng. Thứ ba, báo cáo được cập nhật khi có nghiên cứu mới.

Vì vậy, nếu muốn biết một phương pháp hiệu quả hay không, có thể xem tổng quan Cochrane trước các nghiên cứu riêng. Tôi cũng thường tìm nguồn này đầu tiên khi gặp câu hỏi mới.

Bốn giai đoạn thử nghiệm lâm sàng

Thử nghiệm lâm sàng nghiên cứu hiệu quả và an toàn của thuốc trên người.6 Có ba yếu tố thiết kế cần phân biệt.

Thứ nhất, có nhóm so sánh không?

Nghiên cứu có đối chứng so với giả dược hoặc thuốc cũ; nghiên cứu một nhóm chỉ cho tất cả dùng thuốc. Cần nhóm so sánh để biết người bệnh khá lên nhờ thuốc hay tự hồi phục theo thời gian. Nghiên cứu một nhóm thường dùng ở giai đoạn 1 để xem phản ứng và an toàn ban đầu hơn là so sánh.

Thứ hai, nếu có đối chứng, chia nhóm thế nào?

Máy tính phân người bệnh ngẫu nhiên vào nhóm thuốc hoặc giả dược thì đó là thử nghiệm ngẫu nhiên. Phân ngẫu nhiên giúp tuổi, mức bệnh và bệnh nền của hai nhóm tương tự về thống kê, nên dễ tách tác dụng thuốc. Nếu chia theo thứ tự nhập viện, khác biệt vốn có giữa nhóm có thể làm sai lệch kết quả.

Thứ ba, nếu ngẫu nhiên, ai biết người dùng thuốc thật?

Nếu cả người bệnh và bác sĩ đều không biết, đó là mù đôi; nếu đều biết, đó là nhãn mở. Mù đôi làm thuốc thật và giả dược trông giống nhau để giảm sai lệch tâm lý và đánh giá. Nếu hai phương pháp có hình thức khác hẳn như tiêm so với uống, đôi khi phải dùng thiết kế nhãn mở.

Sơ đồ cây thiết kế thử nghiệm: có hoặc không đối chứng, phân nhóm ngẫu nhiên, mù đôi hay nhãn mở, phân biệt với nghiên cứu quan sát

Đối chứng, ngẫu nhiên và mù đôi kết hợp thành dạng thử nghiệm chặt chẽ nhất, là tiêu chuẩn thường thấy của giai đoạn 3. Thuốc mới đi qua giai đoạn 1 đến 4 với mục đích và thiết kế điển hình khác nhau.7

Giai đoạn Mục đích Quy mô Đối chứng Phân nhóm Làm mù
1 Xác định khoảng liều an toàn 20~100 người Thường không, một nhóm — —
2 Tìm tín hiệu hiệu quả và liều phù hợp 100~300 người Có, như giả dược Ngẫu nhiên Mù đôi hoặc nhãn mở
3 Chứng minh hiệu quả quy mô lớn, cốt lõi để FDA xem xét Hàng trăm đến hàng nghìn Có, giả dược hoặc thuốc cũ Ngẫu nhiên Mù đôi
4 Theo dõi an toàn lâu dài sau lưu hành Hàng nghìn đến hàng chục nghìn Đa dạng Đa dạng Chủ yếu nhãn mở

Sơ đồ dòng giai đoạn 1 đến 4 của thử nghiệm lâm sàng với số người và mục tiêu mỗi giai đoạn, phân biệt với nghiên cứu quan sát

Tin tức thường dẫn kết quả giai đoạn 3 vì thiết kế đối chứng, ngẫu nhiên và mù đôi chặt chẽ.8

Giai đoạn 4 diễn ra sau khi thuốc ra thị trường. Thử nghiệm giai đoạn 3 thường chỉ có vài nghìn người nên khó phát hiện tác dụng phụ hiếm, ví dụ một ca trên 10.000 người. Giai đoạn 4 thu thập dữ liệu của hàng chục nghìn người dùng thực tế để tìm tác dụng lâu dài hoặc phản ứng ở nhóm đặc biệt như người cao tuổi, phụ nữ mang thai.7 Cơ quan quản lý có thể bắt buộc nghiên cứu này khi cấp phép, hoặc hãng tự thực hiện.

Nghiên cứu quan sát: đoàn hệ, bệnh-chứng và báo cáo ca

Khác biệt lớn nhất giữa thử nghiệm và quan sát là nhà nghiên cứu có can thiệp không.9 Trong thử nghiệm, họ chủ động cho thuốc; trong quan sát, họ chỉ xem những gì đã xảy ra mà không điều khiển điều trị.

Các loại quan sát điển hình khác nhau chủ yếu ở hướng thời gian.10 Giả sử muốn biết “uống nhiều kháng sinh lúc nhỏ có làm trẻ dễ mắc viêm da cơ địa không?”.

Nghiên cứu đoàn hệ đi từ hiện tại đến tương lai: tuyển 10.000 trẻ sơ sinh, theo dõi trẻ có hoặc không dùng kháng sinh trong 10 năm và xem ai mắc bệnh. Thứ tự thời gian rõ nên có thể suy luận hướng “kháng sinh → viêm da cơ địa”, nhưng tốn thời gian và chi phí.

Nghiên cứu bệnh-chứng đi từ hiện tại về quá khứ: tuyển 200 trẻ mắc bệnh và 200 trẻ không mắc, so sánh hồ sơ điều trị cũ. Cách này nhanh, rẻ, hữu ích với bệnh hiếm, nhưng hồ sơ quá khứ có thể không chính xác hoặc nhóm mắc bệnh nhớ lại việc dùng thuốc khác nhóm kia.

Sơ đồ so sánh hướng thời gian: nghiên cứu đoàn hệ từ hiện tại tới tương lai, nghiên cứu bệnh-chứng từ hiện tại nhìn về quá khứ, với ví dụ kháng sinh và viêm da cơ địa

Báo cáo ca bệnh mô tả chi tiết một hoặc vài người. Nó giúp nhận ra bệnh mới hay tác dụng phụ hiếm, nhưng không thể khái quát từ một hai ca nên mức bằng chứng thấp.

Loại Hướng thời gian Ưu điểm Hạn chế
Đoàn hệ Hiện tại → tương lai Có thể suy luận hướng quan hệ nhân quả Tốn thời gian và chi phí
Bệnh-chứng Hiện tại → quá khứ Nhanh, rẻ, hữu ích với bệnh hiếm Sai lệch hồi tưởng
Báo cáo ca — Phát hiện hiện tượng mới Không thể khái quát

Nghiên cứu quan sát thường có mức bằng chứng thấp hơn thử nghiệm vì đối tượng không được phân ngẫu nhiên; những yếu tố khác ảnh hưởng kết quả, gọi là biến gây nhiễu, có thể bị bỏ sót.9

Ví dụ, nếu nghiên cứu quan sát thấy người uống nhiều vitamin D khỏe hơn, có thể họ vốn quan tâm sức khỏe nên tập thể dục và ăn uống tốt. Khó biết do vitamin D hay lối sống.

Dù vậy, nghiên cứu quan sát rất có ích. Khi không thể làm thử nghiệm vì đạo đức, chẳng hạn không thể bắt người tham gia hút thuốc để kiểm tra ung thư, quan sát là lựa chọn cần thiết. Nếu nhiều nghiên cứu đoàn hệ nhất quán, bằng chứng có thể mạnh.

Năm điều nên kiểm tra khi đọc thông tin sức khỏe

Dựa trên những điểm trên, đây là cách tôi kiểm tra tin sức khỏe hoặc bài viết. Khi viết các bài như mối liên hệ giữa viêm da cơ địa và thực phẩm, tôi cũng cố ghi mức bằng chứng của từng nguồn.

1. “Nghiên cứu chứng minh” là nghiên cứu loại nào?

Ống nghiệm, động vật, quan sát nhỏ hay thử nghiệm lớn có sức nặng khác nhau. Chỉ từ chữ “kết quả nghiên cứu” không thể biết đó là đoàn hệ hay thử nghiệm.

2. Có bao nhiêu người tham gia?

Nghiên cứu 20 người và 2.000 người không thể mặc định tin cậy như nhau.

3. Có nhóm so sánh không?

Cần xem “nhóm dùng thuốc cải thiện hơn nhóm giả dược” chứ không chỉ “người uống thuốc khá lên”. Không có nhóm đối chứng thì khó biết tự khỏi hay nhờ thuốc.6

4. Nhiều nghiên cứu có cùng kết luận không?

Kết quả lặp lại nhiều lần mạnh hơn một nghiên cứu riêng. Nếu có phân tích tổng hợp nhiều thử nghiệm, nên kiểm tra trước từng nghiên cứu đơn lẻ.11

5. Có ghi nguồn cụ thể không?

Thông tin đáng tin thường nêu bài nghiên cứu, tên hướng dẫn và quy mô. Nếu chỉ nói “theo chuyên gia” hoặc “được biết” mà không dẫn nguồn, cần xem xét kỹ hơn.

Câu hỏi thường gặp

Thông tin chỉ dựa trên nghiên cứu đoàn hệ là không đáng tin sao?

Không. Quan sát vẫn rất hữu ích. Chỉ là vì yếu tố gây nhiễu có thể tham gia, mức bằng chứng thường thấp hơn thử nghiệm. Nếu nhiều nghiên cứu quan sát độc lập cho kết luận giống nhau, đó có thể là bằng chứng khá mạnh.

Thuốc đã qua thử nghiệm giai đoạn 3 có chắc an toàn không?

Giai đoạn 3 đánh giá hiệu quả và an toàn trên hàng trăm đến hàng nghìn người, nhưng có thể bỏ sót tác dụng phụ rất hiếm, như một trên 10.000. Vì thế có nghiên cứu giai đoạn 4 sau lưu hành; khi dùng thuốc, cần trao đổi với bác sĩ và theo dõi.

Nếu có phân tích gộp thì phải theo kết luận của nó?

Không nhất thiết. Chất lượng phân tích phụ thuộc từng nghiên cứu đưa vào. Gộp những nghiên cứu yếu vẫn cho kết luận không chắc chắn. Hãy ưu tiên xem phân tích gộp nhưng cũng kiểm tra quy mô và chất lượng nghiên cứu bên trong.

Tài liệu tham khảo

  1. Burns PB, Rohrich RJ, Chung KC. The levels of evidence and their role in evidence-based medicine. Plast Reconstr Surg. 2011;128(1):305-310.
  2. Sackett DL, Rosenberg WM, Gray JA, et al. Evidence based medicine: what it is and what it isn’t. BMJ. 1996;312(7023):71-72.
  3. Linares-Espinos E, Hernandez V, Dominguez-Escrig JL, et al. Methodology of a systematic review. Actas Urol Esp (Engl Ed). 2018;42(8):499-506.
  4. Cumpston M, Li T, Page MJ, et al. Updated guidance for trusted systematic reviews: a new edition of the Cochrane Handbook for Systematic Reviews of Interventions. Cochrane Database Syst Rev. 2019;10(10):ED000142.
  5. Murad MH, Asi N, Alsawas M, et al. New evidence pyramid. Evid Based Med. 2016;21(4):125-127.
  6. Zabor EC, Kaizer AM, Hobbs BP. Randomized Controlled Trials. Chest. 2020;158(1S):S79-S87.
  7. Umscheid CA, Margolis DJ, Grossman CE. Key concepts of clinical trials: a narrative review. Postgrad Med. 2011;123(5):194-204.
  8. Bhide A, Shah PS, Acharya G. A simplified guide to randomized controlled trials. Acta Obstet Gynecol Scand. 2018;97(4):380-387.
  9. von Elm E, Altman DG, Egger M, et al. The Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) statement: guidelines for reporting observational studies. J Clin Epidemiol. 2008;61(4):344-349.
  10. Munnangi S, Boktor SW. Epidemiology Of Study Design. StatPearls. 2024.
  11. Balshem H, Helfand M, Schunemann HJ, et al. GRADE guidelines: 3. Rating the quality of evidence. J Clin Epidemiol. 2011;64(4):401-406.