Skip to content
Quay lại BlogResearch Methods

Báo cáo effect size và confidence interval như thế nào?

18 phút đọc3,550 từ

Báo cáo effect size và confidence interval nghĩa là cho người đọc thấy kết quả của bạn lớn tới đâu và được ước lượng chính xác tới đâu, thay vì chỉ cho thấy nó có vượt qua một ngưỡng p-value hay không. Với nhà nghiên cứu Việt Nam đang chuẩn bị bài nộp Q1 hoặc Q2 đầu tiên, thói quen này thường là thứ tách một bản thảo đọc lên có độ chín về thống kê khỏi một bản thảo bị người phản biện yêu cầu "sửa lại cách báo cáo".

Bài viết này giúp bạn chọn đúng effect size cho phép phân tích mình đang dùng, viết confidence interval theo đúng định dạng mà người phản biện tạp chí quốc tế chờ đợi, đọc độ lớn của hiệu ứng mà không dán nhãn máy móc, và đặt các con số ấy vào đúng chỗ trong bài. Mỗi phần đi kèm một ví dụ lấy từ những câu hỏi mà nhà nghiên cứu Việt Nam hay mang tới cố vấn công bố của MAAS khi chuyển từ lối viết chỉ dựa vào p-value sang một phần kết quả đầy đủ.

Tác giả: Ban Biên tập MAAS
Cập nhật lần cuối: 2026-07-07
Chuyên mục: research-methods

Một nhà nghiên cứu đang đo mẫu trong phòng thí nghiệm
Ảnh minh hoạ


Báo cáo một effect size và một confidence interval nghĩa là gì?

Trả lời trực tiếp: Effect size là con số diễn đạt độ lớn của kết quả, tức khác biệt lớn tới đâu hay liên hệ mạnh tới đâu, trên một thang đã chuẩn hoá hoặc có ý nghĩa. Confidence interval, viết tắt CI, cho khoảng giá trị hợp lý của hiệu ứng đó. Chúng trả lời bao nhiêu và chắc tới đâu, còn p-value chỉ cho biết kết quả có khó xảy ra không nếu hiệu ứng thật bằng không.

Bằng chứng: Sullivan và Feinn (2012) lập luận rằng p-value chỉ cho bạn biết một hiệu ứng có tồn tại hay không chứ không cho biết nó lớn bao nhiêu, và rằng effect size mới là "main finding of a quantitative study", tức phát hiện chính của một nghiên cứu định lượng. Nakagawa và Cuthill (2007) cho thấy khi ghép một effect size với confidence interval của nó, tác giả truyền đạt được cả độ lớn lẫn mức chính xác trong cùng một phát biểu, điều mà một kiểm định ý nghĩa đứng riêng không làm được.

Ví dụ: Một khách hàng ngành điều dưỡng dùng dịch vụ Cố vấn Công bố của MAAS ban đầu chỉ viết rằng nhóm can thiệp cải thiện có ý nghĩa thống kê với p = 0,02. Cố vấn gợi ý bạn ấy diễn đạt lại kết quả thành một khác biệt trung bình 4,1 điểm, 95% CI [0,8 đến 7,4], Cohen's d = 0,52. Khi bạn ấy tự viết lại như vậy, người phản biện nhìn thấy ngay hiệu ứng ở mức trung bình và được ước lượng kèm một mức bất định có thật.


Vì sao chỉ một p-value là chưa đủ?

Trả lời trực tiếp: Một p-value phụ thuộc nhiều vào cỡ mẫu, nên một hiệu ứng nhỏ nhặt vẫn có thể có ý nghĩa thống kê trong một nghiên cứu lớn, còn một hiệu ứng quan trọng lại không đạt ý nghĩa trong một nghiên cứu nhỏ. Báo cáo effect size cùng CI tách tầm quan trọng thực tiễn ra khỏi cỡ mẫu, đúng điều mà biên tập viên và người phản biện hiện chờ bạn chứng minh.

Bằng chứng: Tuyên bố chính thức của American Statistical Association do Wasserstein và Lazar (2016) chấp bút cảnh báo rằng p-value không đo độ lớn của một hiệu ứng, và nhấn mạnh: "Scientific conclusions and business or policy decisions should not be based only on whether a p-value passes a specific threshold" (Wasserstein & Lazar, 2016, p. 131). Câu này nghĩa là kết luận khoa học hay quyết định kinh doanh và chính sách không nên dựa duy nhất vào chuyện một p-value có vượt một ngưỡng cụ thể hay không. Cumming (2014) đưa ra cùng lập luận dưới tên gọi "the new statistics", thúc giục tác giả báo cáo ước lượng và khoảng thay vì dựa vào phán quyết nhị phân có hay không có ý nghĩa.

Ví dụ: Một nghiên cứu sinh người Việt ngành giáo dục có bộ dữ liệu khảo sát trong đó gần như mọi tương quan đều có ý nghĩa thống kê. Cố vấn MAAS chỉ cho bạn ấy thấy nhiều tương quan có giá trị r quanh 0,08, tức có ý nghĩa thống kê nhưng trên thực tế gần như không đáng kể. Khi báo cáo thêm effect size, bạn ấy đưa được ba mối liên hệ thật sự quan trọng lên trước, và người phản biện khen sự tiết chế đó.


Nên báo cáo effect size nào cho kiểm định thống kê của bạn?

Trả lời trực tiếp: Hãy ghép effect size với phép phân tích của bạn, dùng khác biệt trung bình đã chuẩn hoá cho so sánh nhóm, các thước thuộc họ tương quan cho liên hệ, và các thước phần phương sai giải thích được cho mô hình. Hãy báo cáo effect size mà lĩnh vực của tạp chí bạn nhắm tới dùng nhiều nhất, và nói rõ bạn đã chọn thước nào để người đọc diễn giải cho đúng.

Bằng chứng: Lakens (2013) viết một cẩm nang thực hành nối các kiểm định t và ANOVA với Cohen's d và eta bình phương, đồng thời nhấn mạnh rằng tác giả phải nêu rõ ước lượng cụ thể mình đã dùng, vì cùng một tên gọi có thể ứng với nhiều công thức. Khung gốc của Cohen (1988) tới nay vẫn là điểm quy chiếu cho các họ thước đã chuẩn hoá mà nhiều ngành còn trích dẫn.

Ví dụ: Một nhà nghiên cứu ngành quản trị được MAAS đồng hành chỉ báo cáo các hệ số beta từ một mô hình hồi quy. Cố vấn chỉ ra rằng bài còn thiếu R² cho cả mô hình và beta đã chuẩn hoá cho từng biến dự báo, rồi bạn ấy tự bổ sung hai thước này. Nhờ vậy bài truyền đạt được cả sức giải thích tổng thể lẫn trọng số tương đối của từng biến, đúng độ sâu mà tạp chí Q2 bạn ấy nhắm tới chờ đợi.

Bảng dưới đây nối các phép phân tích thường gặp với effect size mà phần lớn người phản biện chờ đợi.

Phép phân tích của bạn Effect size thường dùng Nó diễn đạt điều gì
So sánh hai nhóm (kiểm định t) Cohen's d hoặc Hedges' g Khác biệt đã chuẩn hoá giữa hai trung bình
So sánh từ 3 nhóm trở lên (ANOVA) Eta bình phương (η²) hoặc omega bình phương (ω²) Tỷ lệ phương sai do nhân tố đó giải thích
Tương quan giữa hai biến Pearson r hoặc Spearman ρ Độ mạnh và chiều của một mối liên hệ
Mô hình hồi quy R² và β đã chuẩn hoá Phần phương sai giải thích được, trọng số từng biến dự báo
Kết cục phân loại dạng 2×2 Tỷ số odds hoặc tỷ số nguy cơ Khả năng tương đối xảy ra một kết cục
So sánh nhóm phi tham số Rank-biserial r hoặc Cliff's delta Khác biệt đã chuẩn hoá mà không cần giả định phân phối chuẩn

Báo cáo một confidence interval cho đúng bằng cách nào?

Trả lời trực tiếp: Hãy nêu mức tin cậy, thường là 95%, đưa ước lượng điểm trước rồi tới khoảng trong ngoặc vuông, ví dụ d = 0,52, 95% CI [0,14 đến 0,90]. Hãy đọc độ rộng như mức chính xác, khoảng hẹp nghĩa là hiệu ứng được ước lượng tốt, khoảng rộng nghĩa là nghiên cứu chưa ghim được nó. Đừng bao giờ mô tả một CI là xác suất giá trị thật nằm bên trong.

Bằng chứng: Nakagawa và Cuthill (2007) khuyến nghị báo cáo confidence interval cho mọi hiệu ứng then chốt và đọc độ rộng của khoảng như mức chính xác mà nghiên cứu đạt được. Cumming (2014) cho thấy một khoảng phủ qua số không mang cùng thông tin với một kiểm định không có ý nghĩa, nhưng nói thêm được nhiều điều hơn hẳn về những độ lớn hiệu ứng vẫn còn hợp lý.

Ví dụ: Một cố vấn MAAS đọc một bản thảo tâm lý học báo cáo d = 0,6 mà không kèm khoảng tin cậy nào. Khi tác giả bổ sung 95% CI [−0,05 đến 1,25], câu chuyện đổi hẳn, vì khoảng rộng cắt qua số không cho thấy nghiên cứu thiếu lực thống kê. Tác giả vì thế đóng khung lại kết quả như một phát hiện sơ bộ thay vì một phát hiện khẳng định.

Nếu chính phần phân tích đứng sau những con số này mới là chỗ bạn chưa chắc tay, dịch vụ Dữ liệu và Lập trình đồng hành cùng bạn qua khâu thiết kế phương pháp, cách dùng phần mềm và cách diễn giải kết quả, để bạn tự bảo vệ được mọi con số mình báo cáo.


Diễn giải độ lớn của effect size ra sao mà không lạm dụng mốc của Cohen?

Trả lời trực tiếp: Nhãn của Cohen, đại khái 0,2 nhỏ, 0,5 trung bình, 0,8 lớn với d, là điểm khởi đầu, không phải phán quyết. Hãy đọc độ lớn dựa trên hiệu ứng thường thấy trong lĩnh vực của bạn và mức hệ trọng thực tế của kết cục. Một d nhỏ vẫn quan trọng trong can thiệp lâm sàng hay giáo dục, còn d lớn thành tầm thường nếu kết cục ít đáng kể.

Sơ đồ thang các mốc quy ước của Cohen cho effect size d, nhỏ quanh 0,2, trung bình quanh 0,5, lớn quanh 0,8
Một d lớn có thể tầm thường, và một d nhỏ có thể quan trọng, tuỳ vào kết cục

Bằng chứng: Chính Cohen (1988) coi các ngưỡng ấy là quy ước, chỉ nên dùng khi lĩnh vực chưa có mốc quy chiếu riêng. Sullivan và Feinn (2012) cảnh báo rằng dán nhãn máy móc dễ làm người đọc hiểu lầm, và khuyên tác giả diễn giải hiệu ứng trong bối cảnh các nghiên cứu đi trước cùng mức liên quan tới thực tế.

Ví dụ: Một nhà nghiên cứu y tế công cộng người Việt tìm ra d bằng 0,3 cho một biện pháp nhắc nhở thay đổi hành vi chi phí thấp, và lo rằng con số này "quá nhỏ để đăng". Cố vấn MAAS gợi ý bạn ấy đối chiếu với các thử nghiệm tương đương, và bạn ấy thấy các hiệu ứng từ 0,2 đến 0,3 là mức thường gặp, lại được coi trọng vì can thiệp rẻ và dễ nhân rộng. Khi được đặt vào bối cảnh đó, hiệu ứng khiêm tốn lại trở thành điểm mạnh nhất của bài.


Trong một bài Q1, effect size và confidence interval nằm ở đâu?

Trả lời trực tiếp: Hãy đặt effect size chính cùng CI vào phần tóm tắt, nhắc lại chúng cho mọi so sánh then chốt ở phần kết quả, và dẫn lại khi bạn cân tầm quan trọng thực tiễn ở phần thảo luận. Hãy giữ thống kê thô đi kèm, gồm trị số kiểm định, bậc tự do và p chính xác, để người đọc thấy cả mức ý nghĩa lẫn độ lớn thay vì phải chọn một.

Bằng chứng: Lang và Altman (2015), trong bộ hướng dẫn SAMPL, yêu cầu tác giả báo cáo độ lớn của các hiệu ứng kèm confidence interval, và ghi giá trị p chính xác thay vì chỉ ghi ngưỡng. Khi phần tóm tắt mở đầu bằng ước lượng và khoảng, phát hiện chủ đạo của bài trở thành một độ lớn cụ thể chứ không còn là một phán quyết có hay không.

Ví dụ: Phần tóm tắt của một khách hàng dùng dịch vụ Cố vấn Công bố của MAAS ban đầu chỉ nói rằng các khác biệt có ý nghĩa thống kê. Cố vấn góp ý rằng câu then chốt nên nêu độ lớn, và bạn ấy tự viết lại thành chương trình nâng điểm số thêm 4,1 điểm, 95% CI [0,8 đến 7,4], d = 0,52. Khi cách viết đó được lặp lại nhất quán ở phần kết quả và phần thảo luận, một người phản biện đã khen cách báo cáo là minh bạch.


Người phản biện hay bắt lỗi nào nhất khi báo cáo effect size?

Trả lời trực tiếp: Các lỗi thường gặp là báo cáo mức ý nghĩa mà không có effect size, đưa effect size mà thiếu confidence interval, trộn lẫn những thước không tương thích trong cùng một bài, coi nhãn của Cohen như một phát hiện, và làm tròn khoảng tin cậy mạnh tay tới mức mất nghĩa. Mỗi lỗi đều rẻ để sửa trước khi nộp và đắt để sửa sau khi người phản biện bắt được.

Bằng chứng: Lang và Altman (2015) xếp việc bỏ sót độ lớn hiệu ứng và bỏ sót confidence interval vào nhóm những lỗi phổ biến nhất khi báo cáo thống kê trên các tạp chí y sinh. Wasserstein và Lazar (2016) chỉ đích danh thói quen dựa quá nhiều vào ngưỡng 0,05 thay cho lối ước lượng như một vấn đề cứ lặp đi lặp lại.

Ví dụ: Một cố vấn MAAS đồng hành cùng một học viên cao học người Việt qua ba lượt rà phần thống kê. Ở lượt đầu, bạn ấy chốt effect size nào đi với giả thuyết nào, ở lượt thứ hai bạn ấy bổ sung mọi confidence interval còn thiếu, và ở lượt cuối bạn ấy thống nhất định dạng xuyên suốt phần tóm tắt, bảng biểu và thân bài. Học viên đó là tác giả trong suốt quá trình, còn cố vấn góp ý chứ không chạy phân tích thay.


Câu hỏi thường gặp

Tôi có cần báo cáo effect size cho mọi kiểm định thống kê không?
Hãy báo cáo effect size cho mọi kết quả mà bạn diễn giải như một phát hiện, gồm từng so sánh then chốt, từng tương quan và từng mô hình. Bạn không cần effect size cho các kiểm tra thuần mô tả như kiểm định phân phối chuẩn, nhưng bất kỳ kết quả nào bạn đem ra bàn như bằng chứng đều nên có một độ lớn đi kèm và, khi làm được, một confidence interval.

Tôi nên dùng mức tin cậy nào, 95% hay 99%?
Hãy dùng 95% trừ khi lĩnh vực hoặc tạp chí của bạn quy định khác, vì đây gần như là mặc định chung và giúp người phản biện so khoảng của bạn với các nghiên cứu khác. Một mức cao hơn như 99% sẽ cho khoảng rộng hơn, nên chỉ đổi khi bạn có lý do đã nêu rõ, và lần nào cũng ghi mức tin cậy ra.

Tôi có thể báo cáo confidence interval thay cho p-value không?
Bạn có thể, và nhiều nhà thống kê khuyến khích đặt khoảng lên trước, nhưng phần lớn tạp chí vẫn muốn thấy giá trị p chính xác đi kèm ước lượng. Cách an toàn nhất là báo cáo effect size, confidence interval của nó và giá trị p chính xác cùng nhau, để mức ý nghĩa và độ lớn cùng hiện ra trên một dòng.

Làm sao lấy effect size và confidence interval ra từ phần mềm của tôi?
SPSS, R, Stata và JASP đều xuất được effect size cùng khoảng tin cậy, đôi khi dưới dạng một tuỳ chọn bạn phải tự bật. Trong R, các gói thuộc họ effect size trả về các thước đã chuẩn hoá kèm khoảng, còn các phiên bản SPSS gần đây in chúng ngay trong kết quả. Hãy nêu tên và phiên bản phần mềm trong phần phương pháp.

Một effect size có còn ý nghĩa không nếu kết quả của tôi không có ý nghĩa thống kê?
Có. Một kết quả không có ý nghĩa thống kê vẫn có một effect size ước lượng được và một confidence interval, và báo cáo chúng trung thực hơn là viết rằng không có hiệu ứng. Một khoảng rộng cắt qua số không cho người đọc biết nghiên cứu của bạn chưa đủ sức xác định hiệu ứng, và đó là thông tin hữu ích cho các phân tích gộp về sau.

MAAS có giúp tôi báo cáo effect size và confidence interval cho bài Scopus không?
Có. Cố vấn Công bố của MAAS đồng hành cùng nhà nghiên cứu Việt Nam qua khâu lập kế hoạch phân tích, chọn effect size, báo cáo confidence interval và viết phần kết quả theo mô hình đi từng chặng, với phản hồi phát triển từ các cố vấn trình độ tiến sĩ. Bạn vẫn là người viết bài, và bạn có thể đặt lịch tư vấn qua trang liên hệ của chúng tôi.


Sẵn sàng đưa phần thống kê của bạn lên chuẩn Q1?

Effect size và confidence interval được quyết định ngay lúc bạn lập kế hoạch phân tích chứ không phải lắp thêm vào lúc cuối, và bạn dễ làm đúng hơn nhiều khi có một cố vấn mà bài của chính họ đã qua vòng bình duyệt. Cố vấn Công bố của MAAS đọc và góp ý bản thảo theo từng phần, bắt đầu từ tóm tắt, bảng biểu và hình rồi tới phương pháp và kết quả, cũng là những phần bạn báo cáo effect size và khoảng tin cậy. Mỗi cố vấn có nhiều bài Q1 hoặc Q2 đứng tên chính mình, và 23% chuyên gia của MAAS có học vị Tiến sĩ. Khi mạng lưới đã có người đúng lĩnh vực, MAAS ghép cố vấn trong vòng 48 giờ, còn khi chưa có, MAAS mở một đợt tuyển riêng cho hồ sơ của bạn và việc này thường mất khoảng hai tuần. Mọi thứ bắt đầu từ một buổi tư vấn miễn phí 15 phút, và bạn vẫn là tác giả ở từng bước.

Đặt lịch tư vấn Cố vấn Công bố cùng MAAS →


Bài liên quan


References

  • Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum Associates.
  • Cumming, G. (2014). The new statistics: Why and how. Psychological Science, 25(1), 7–29. https://doi.org/10.1177/0956797613504966
  • Lakens, D. (2013). Calculating and reporting effect sizes to facilitate cumulative science: A practical primer for t-tests and ANOVAs. Frontiers in Psychology, 4, Article 863. https://doi.org/10.3389/fpsyg.2013.00863
  • Lang, T. A., & Altman, D. G. (2015). Basic statistical reporting for articles published in biomedical journals: The "Statistical Analyses and Methods in the Published Literature" or the SAMPL guidelines. International Journal of Nursing Studies, 52(1), 5–9. https://doi.org/10.1016/j.ijnurstu.2014.09.006
  • Nakagawa, S., & Cuthill, I. C. (2007). Effect size, confidence interval and statistical significance: A practical guide for biologists. Biological Reviews, 82(4), 591–605. https://doi.org/10.1111/j.1469-185X.2007.00027.x
  • Sullivan, G. M., & Feinn, R. (2012). Using effect size – or why the P value is not enough. Journal of Graduate Medical Education, 4(3), 279–282. https://doi.org/10.4300/JGME-D-12-00156.1
  • Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108

Bài viết này thuộc chuỗi MAAS Journal dành cho học viên cao học và nhà nghiên cứu Việt Nam đang học tập ở nước ngoài. Cố vấn Công bố của MAAS là một đối tác cố vấn, chúng tôi đồng hành cùng tác giả theo mô hình đi từng chặng, với phản hồi phát triển từ các cố vấn trình độ tiến sĩ đã công bố trên Scopus. Chúng tôi không viết, không nộp bài, và không bảo đảm bài được chấp nhận thay cho tác giả.

Chia sẻ bài viếtFacebookLinkedInZaloEmail
Cần áp dụng vào bài của bạn?

Từ bài viết này
đến bài của bạn.

Trong một buổi tư vấn miễn phí 15 phút, chuyên gia Tiến sĩ và Thạc sĩ của MAAS nghe đề bài hoặc đề tài của bạn cùng yêu cầu của người hướng dẫn, rồi gợi ý cách áp dụng nội dung bài này vào đúng trường hợp đó.