Skip to content
Quay lại BlogResearch Methods

Xử lý số liệu SPSS gồm những bước nào và làm theo trình tự ra sao?

14 phút đọc2,740 từNEW
Bảng đối chiếu định nghĩa, cách phát hiện và hướng xử lý của giá trị ngoài khoảng và giá trị ngoại lai trong SPSS

Xử lý số liệu SPSS là chuỗi bước làm sạch dữ liệu, từ kiểm tra biến đến xử lý giá trị thiếu và ngoại lai, trước khi chạy bất kỳ thống kê nào.

Cập nhật lần cuối: 2026-09-21
Chuyên mục: research-methods

Máy tính xách tay, biểu đồ in và báo cáo bày ra cho một buổi phân tích dữ liệu
Ảnh minh hoạ

Xử lý số liệu SPSS là gì, gồm những bước nào?

Trả lời thẳng: Xử lý số liệu SPSS là bước chuẩn bị dữ liệu trước phân tích, đi từ kiểm tra định dạng cột đến việc gọi tên đúng bốn nhóm việc cần làm, đó là dọn lỗi cấu trúc, dọn giá trị ngoài khoảng, dọn ngoại lai và dọn giá trị thiếu. Không kiểm định nào trong SPSS nên chạy trước khi bốn nhóm việc này hoàn tất.

Bằng chứng: Weber (n.d.) của Baylor University Libraries mô tả làm sạch dữ liệu là quá trình chuẩn bị dữ liệu cho phân tích, gồm kiểm tra dữ liệu đúng cột và trường, loại ca không đầy đủ, phát hiện và xoá dữ liệu trùng hoặc cột không cần, sửa lỗi định dạng và chính tả, xử lý dữ liệu thiếu, gán nhãn văn bản cho biến mã hoá bằng số, tái mã hoá biến, và nếu cần thì xoá thông tin định danh cá nhân khỏi tập dữ liệu. EZ SPSS Tutorials (2023) chia các kỹ thuật làm sạch dữ liệu SPSS phổ biến thành bốn nhóm: lỗi cấu trúc, giá trị ngoài khoảng, giá trị ngoại lai và giá trị thiếu.

Ví dụ: Một tập dữ liệu khảo sát 200 sinh viên có thể có vài ca ghi tuổi là "0" do lỗi nhập liệu, vài ô trống ở câu hỏi thu nhập gia đình, và một biến giới tính mã hoá bằng số 1/2 chưa gán nhãn Nam/Nữ. Ba vấn đề này thuộc ba nhóm khác nhau trong bốn nhóm trên, và mỗi nhóm cần một cách xử lý riêng, không thể xử lý chung một quy tắc.

Trước khi làm sạch, cần chuẩn bị gì trong SPSS?

Trả lời thẳng: Ba việc cần làm trước khi bắt tay vào làm sạch là giữ lại một bản dữ liệu chưa động tới, gắn cho mỗi ca một mã số riêng, và viết ra những gì mình sắp sửa để sau này còn nhớ. Thêm một việc dễ bỏ sót là dò lại mức đo (Measure) SPSS tự gán cho từng biến, vì phần mềm đoán không phải lúc nào cũng đúng.

Bằng chứng: EZ SPSS Tutorials (2023) khuyến nghị ba bước chuẩn bị trước khi làm sạch dữ liệu trong SPSS: sao lưu tập dữ liệu gốc, đảm bảo mỗi ca có một mã định danh duy nhất để có thể khôi phục thứ tự ban đầu sau khi sắp xếp, và ghi lại toàn bộ quá trình làm sạch. Weber (n.d.) lưu ý rằng khi nhập một tập dữ liệu vào SPSS, phần mềm tự đoán mức đo cho từng biến, và đôi khi đoán sai, nên người dùng cần tự kiểm tra và sửa mức đo trong Variable View khi phát hiện sai.

Ví dụ: Nếu bạn nhập một biến mã vùng miền dạng số (1 = Bắc, 2 = Trung, 3 = Nam) nhưng SPSS tự gán mức đo là Scale thay vì Nominal, các phép tính trung bình vô nghĩa vẫn có thể chạy được mà không báo lỗi. Sửa mức đo về Nominal trong Variable View trước khi phân tích là bước tránh được lỗi này. Các loại thang đo trong SPSS giải thích vì sao ba lựa chọn Measure của SPSS tương ứng với bốn loại thang đo lý thuyết, cùng cách chọn đúng cho từng biến.

Giá trị ngoài khoảng và giá trị ngoại lai trong SPSS khác nhau thế nào, xử lý ra sao?

Trả lời thẳng: Hai loại này không giống nhau, dù hay bị gộp chung. Ghi 150 tuổi là lỗi chắc chắn, gọi là giá trị ngoài khoảng, chỉ có hai đường đi là sửa lại hoặc xoá. Còn một mức chi tiêu bất thường cao có thể là thật, gọi là ngoại lai, và với ngoại lai người viết còn hai lựa chọn nữa ngoài sửa với xoá, đó là giữ nguyên hoặc thay bằng một giá trị lân cận.

Bảng đối chiếu định nghĩa, cách phát hiện và hướng xử lý của giá trị ngoài khoảng và giá trị ngoại lai trong SPSS

Bằng chứng: EZ SPSS Tutorials (2023) phân biệt out-of-range là giá trị nằm ngoài khoảng hợp lệ của biến, phát hiện bằng cách chạy Frequencies và xem hai chỉ số Minimum, Maximum, sửa lại nếu xác định được giá trị đúng qua hồ sơ gốc, xoá nếu không xác định được. Nguồn này cũng lưu ý bước sắp xếp biến để dò lỗi chỉ nên làm sau khi đã gắn mã định danh cho từng ca, vì SPSS không hoàn tác được một lần sắp xếp. Cùng nguồn này giải thích outlier khác out-of-range ở chỗ không nhất thiết là lỗi nhập liệu, cách phát hiện phổ biến là dựng boxplot cho biến liên tục, và có bốn hướng xử lý: sửa nếu xác định được giá trị đúng, xoá nếu là lỗi nhưng không xác định được giá trị đúng, giữ nguyên nếu là quan sát hợp lệ, hoặc thay thế bằng giá trị gần nhất không phải ngoại lai. Stephen (2016) phân biệt thêm outlier đơn biến, tức giá trị cực đoan trên một biến, với outlier đa biến, tức ca có tổ hợp giá trị bất thường trên nhiều biến, thường phân tích bằng khoảng cách Mahalanobis.

Ví dụ: Một biến điểm thi ghi giá trị 15 trong thang điểm 10 là out-of-range, chắc chắn là lỗi nhập liệu và cần sửa hoặc xoá. Nhưng một sinh viên có mức chi tiêu tháng cao gấp năm lần trung vị nhóm có thể là outlier hợp lệ, không phải lỗi nhập, nên quyết định giữ hay xoá phụ thuộc vào việc giá trị đó có ảnh hưởng tới giả định của kiểm định sắp chạy hay không. EZ SPSS Tutorials (2023) lưu ý nếu loại bỏ hoặc thay thế một ngoại lai không phải do lỗi nhập liệu, người viết cần giải trình quyết định đó khi báo cáo kết quả nghiên cứu.

Giá trị thiếu trong SPSS xử lý thế nào, khi nào nên xoá, khi nào nên điền?

Trả lời thẳng: Không có một câu trả lời chung cho mọi tình huống thiếu dữ liệu, quyết định phụ thuộc vào tỷ lệ ô trống và việc chúng có rơi ngẫu nhiên hay không. Ô trống chiếm phần nhỏ và rải ngẫu nhiên thì bỏ hẳn những ca đó là cách an toàn. Ô trống chiếm phần lớn hơn, hoặc rơi có quy luật vào một nhóm cụ thể, thì nên chuyển sang điền giá trị thay vì bỏ.

Bằng chứng: IBM (n.d.) ghi nhận rằng khi dữ liệu thiếu ít và thiếu ngẫu nhiên hoàn toàn, listwise deletion, tức loại bỏ toàn bộ ca có ô trống, tương đối an toàn. Cùng nguồn này mô tả hai nhóm thủ tục SPSS xử lý dữ liệu thiếu: Missing Value Analysis, công cụ mô tả gồm kiểm định Little's MCAR và các phương pháp điền đơn, và Multiple Imputation, tạo nhiều bản dữ liệu điền giá trị khác nhau rồi gộp ước lượng, mặc định tạo 5 bản mỗi lần chạy. Hai thủ tục này chỉ có trong bản SPSS Statistics Premium Edition hoặc khi mua thêm tuỳ chọn Missing Values, chứ không có sẵn trên bản GradPack tiêu chuẩn. Stephen (2016) liệt kê hai lựa chọn xử lý giá trị thiếu ngoài việc không làm gì: xoá ca có giá trị thiếu, hoặc thay thế bằng Mean Substitution, Multiple Imputation hay thuật toán Expectation Maximization, và lưu ý Mean Substitution bị phê bình nhiều vì làm sai lệch tương quan giữa các biến. Để xác định giá trị thiếu, EZ SPSS Tutorials (2023) hướng dẫn vào Analyze, Descriptive Statistics, Frequencies, và lưu ý SPSS đánh dấu ô trống ở biến số là "system missing" trong bảng Statistics, nhưng không đánh dấu ô trống ở biến chuỗi theo cách đó, phải kiểm tra bảng tần suất mới thấy.

Ví dụ: Một khảo sát 300 sinh viên có 8 ca bỏ trống câu hỏi thu nhập gia đình, tương đương dưới 3% tổng số ca. Nếu không có dấu hiệu nhóm bỏ trống này khác biệt hệ thống so với nhóm trả lời, loại bỏ 8 ca đó khi chạy riêng biến thu nhập là lựa chọn hợp lý. Nhưng nếu một câu hỏi nhạy cảm hơn, ví dụ mức chi tiêu, bị bỏ trống tới 40 ca, xoá hết sẽ làm giảm cỡ mẫu đáng kể, và cân nhắc Multiple Imputation phù hợp hơn xoá.

Loại vấn đề Ví dụ Cách phát hiện trong SPSS Cách xử lý
Lỗi cấu trúc Chính tả, viết hoa/thường không nhất quán ở biến định tính Xem bảng tần suất (Frequencies) của biến định tính Chuẩn hoá lại nhãn cho nhất quán
Giá trị ngoài khoảng Tuổi ghi 150, điểm ghi 15 trên thang 10 Frequencies, xem Minimum và Maximum Sửa nếu xác định được giá trị đúng, xoá nếu không
Giá trị ngoại lai Chi tiêu cao gấp nhiều lần trung vị nhóm Dựng boxplot cho biến liên tục Sửa, xoá, giữ nguyên hoặc thay thế, tuỳ nguồn gốc giá trị
Giá trị thiếu Ô trống ở câu hỏi khảo sát Analyze, Descriptive Statistics, Frequencies Loại bỏ nếu thiếu ít và ngẫu nhiên, điền giá trị nếu thiếu nhiều

Sau khi làm sạch, bước tiếp theo trong xử lý số liệu SPSS là gì?

Trả lời thẳng: Sau khi làm sạch xong bốn nhóm vấn đề trên, bước tiếp theo là chạy thống kê mô tả để xem đặc điểm chung của mẫu, trước khi chuyển sang các kiểm định giả thuyết như so sánh trung bình hay tương quan hồi quy. Thống kê mô tả cũng là bước để phát hiện thêm những bất thường mà bước làm sạch trước đó có thể đã bỏ sót.

Bằng chứng: Kent State University Libraries (n.d.-b) chia nội dung SPSS thành bốn phần theo trình tự, trong đó khám phá dữ liệu bằng thống kê mô tả, bảng tần suất và đồ thị phân phối đứng trước phần phân tích dữ liệu bằng kiểm định giả thuyết. Kent State University Libraries (n.d.-a) lưu ý khi chạy thủ tục Explore, "you can't pick and choose which of these descriptive statistics to view" (Kent State University Libraries, n.d.-a), tức người dùng nhận trọn gói chỉ số thống kê mô tả chứ không lọc riêng từng chỉ số như ở Descriptives. Georgia State University Library (n.d.) minh hoạ cú pháp lệnh Descriptives để chọn đúng các chỉ số mô tả cần xuất, một bước thường chạy ngay sau khi dữ liệu đã được làm sạch.

Ví dụ: Nếu chạy thống kê mô tả và thấy độ lệch chuẩn của một biến lớn bất thường so với các biến khác trong cùng thang đo, đó có thể là dấu hiệu vẫn còn giá trị ngoài khoảng hoặc ngoại lai chưa được xử lý hết ở bước trước, và cần quay lại kiểm tra. Toàn bộ cách chạy và đọc bảng thống kê mô tả, gồm mean, median, mode và bảng tần suất, được trình bày riêng ở cách chạy thống kê mô tả SPSS.

Câu hỏi thường gặp

Xử lý số liệu SPSS mất bao lâu?
Không có con số cố định, vì thời gian phụ thuộc vào độ lớn của tập dữ liệu và mức độ sạch của dữ liệu gốc. Một tập dữ liệu khảo sát online với ràng buộc nhập liệu chặt thường mất ít thời gian làm sạch hơn một tập dữ liệu nhập tay từ phiếu giấy.

Có bắt buộc phải xoá toàn bộ giá trị thiếu trước khi chạy SPSS không?
Không. IBM (n.d.) và Stephen (2016) đều nhấn mạnh quyết định phụ thuộc vào tỷ lệ thiếu và việc thiếu có ngẫu nhiên hay không, chứ không phải một quy tắc cứng áp dụng cho mọi trường hợp.

Ngoại lai có luôn phải xoá khỏi dữ liệu SPSS không?
Không. Theo EZ SPSS Tutorials (2023), một ngoại lai có thể là quan sát hợp lệ, và trong trường hợp đó nên giữ nguyên, dù có thể cần cân nhắc chuyển sang kiểm định phi tham số nếu ngoại lai ảnh hưởng tới giả định của kiểm định.

Làm sao biết một giá trị là lỗi nhập liệu hay ngoại lai thật?
Giá trị ngoài khoảng luôn kiểm tra được qua khoảng giá trị hợp lệ đã biết trước, ví dụ tuổi không thể âm hoặc quá 120. Ngoại lai cần đối chiếu với hồ sơ gốc hoặc bối cảnh thu thập dữ liệu để xác định có phải lỗi hay không.

Nên làm sạch dữ liệu trên bản gốc hay bản sao?
Nên làm trên bản sao. EZ SPSS Tutorials (2023) khuyến nghị sao lưu tập dữ liệu gốc trước khi bắt đầu, để có thể đối chiếu lại và khôi phục nếu một quyết định làm sạch sau này cần xem lại.

MAAS hỗ trợ gì cho sinh viên đang xử lý số liệu SPSS?
Một chuyên gia MAAS làm việc cùng bạn về phương pháp, code và cách diễn giải kết quả bằng SPSS, R, Python, Tableau hoặc Excel, mục tiêu là bạn nắm được phân tích của chính mình chứ không nhận một file hoàn chỉnh mà không giải thích được. MAAS không nhận làm trọn dự án dữ liệu hay lập trình thay bạn. Buổi tư vấn đầu tiên kéo dài 15 phút và không tính phí.

Nên làm gì tiếp theo

Xử lý số liệu SPSS là bước nền trước khi chạy bất kỳ thống kê nào, và một quyết định làm sạch sai, ví dụ xoá nhầm một outlier hợp lệ hoặc giữ lại một giá trị ngoài khoảng, có thể làm lệch toàn bộ kết quả phía sau. Nếu bạn muốn có người kiểm tra lại cách bạn đang làm sạch dữ liệu và chọn kiểm định tiếp theo cho đúng câu hỏi nghiên cứu, một chuyên gia MAAS sẽ đi cùng bạn qua từng bước, từ làm sạch tới diễn giải kết quả, để chính bạn nắm và trình bày lại được phân tích khi cần. Xem thêm tại dịch vụ hướng dẫn chạy SPSS và Python, hoặc đặt lịch tư vấn miễn phí 15 phút tại đây.

Sau khi làm sạch xong, bước kế tiếp là chạy thống kê mô tả, xem cách chạy thống kê mô tả SPSS để biết cách chạy và đọc bảng Descriptives, Frequencies đầy đủ. Nếu bạn cần hiểu rõ hơn cách phân loại biến độc lập và biến phụ thuộc trước khi tái mã hoá, xem biến độc lập và biến phụ thuộc trong SPSS khác nhau thế nào. Để hiểu ba mức đo trên giao diện SPSS tương ứng bốn thang đo lý thuyết, xem các loại thang đo trong SPSS. Nếu bạn chưa nắm tổng quan về phần mềm này, xem SPSS là gì trước khi đi vào từng bước xử lý số liệu.

References

Chia sẻ bài viếtFacebookLinkedInZaloEmail
Muốn được đồng hành như vậy?

Từ bài viết này
đến luận án của bạn.

Một buổi tư vấn khám phá 15 phút, chuyên gia Tiến sĩ và Thạc sĩ của MAAS sẽ chuyển khung phương pháp này vào đúng đề tài của bạn và kỳ vọng của giảng viên hướng dẫn.