Veri temizleme, analizin görünmeyen ama en belirleyici aşamasıdır. Kirli veriyle yapılan en gelişmiş analiz bile yanlış sonuç üretir. Bu rehber, ham veriden analize hazır veri setine geçişin sekiz adımını içerir.
Adım 1: Veri setini tanıyın
SPSS’te Analyze > Descriptive Statistics > Frequencies ile tüm değişkenlerin frekans tablosunu alın. Şunları kontrol edin:
- Toplam N beklediğiniz kadar mı?
- Her değişkende geçerli ve kayıp sayısı ne?
- Minimum ve maksimum değerler mantıklı mı?
- Beklenmeyen kodlar var mı? (5’li ölçekte 7 değeri gibi)
Adım 2: Kodlama hatalarını düzeltin
Sık görülen hatalar:
| Hata | Örnek | Çözüm |
| Aralık dışı değer | 5’li ölçekte 6 veya 55 | Orijinal forma bakıp düzeltin, yoksa kayıp işaretleyin |
| Metin/sayı karışıklığı | Yaş sütununda “otuz beş” | Sayıya çevirin |
| Tutarsız kategori | “Kadın”, “kadın”, “K” | Tek biçime getirin |
| Ondalık ayracı | “3.5” ve “3,5” karışık | Tek biçime getirin |
Adım 3: Eksik veriyi analiz edin
Eksikliğin türünü belirleyin
- MCAR (tamamen rastgele): Eksiklik hiçbir değişkenle ilişkili değil. En iyi senaryo.
- MAR (rastgele): Eksiklik başka bir gözlenen değişkenle ilişkili. Örneğin erkekler gelir sorusunu daha az yanıtlıyor.
- MNAR (rastgele değil): Eksiklik, eksik değerin kendisiyle ilişkili. Örneğin yüksek gelirliler geliri hiç yazmıyor. En sorunlu durum.
Ele alma yöntemleri
| Eksiklik oranı | Önerilen yöntem |
| < %5 | Gözlemi çıkarma (listwise deletion) |
| %5 – 15 | Ortalama/medyan ile doldurma veya regresyon temelli doldurma |
| %15 – 25 | Çoklu doldurma (multiple imputation) |
| > %25 | O değişkeni analizden çıkarmayı değerlendirin |
Katılımcı bazlı kural: Bir katılımcı maddelerin %20’sinden fazlasını boş bıraktıysa o gözlemi tamamen çıkarın.
Adım 4: Uç değerleri tespit edin
Tek değişkenli uç değerler
- Z puanı yöntemi: |z| > 3,29 olan değerler uç kabul edilir.
- Kutu grafiği: Analyze > Descriptive Statistics > Explore > Plots > Boxplot.
- Çeyrekler arası aralık: Q1 − 1,5×IQR ile Q3 + 1,5×IQR dışındaki değerler.
Çok değişkenli uç değerler
Mahalanobis uzaklığı ile tespit edilir. Regresyon analizinde bağımsız değişkenleri modele koyup Mahalanobis uzaklığını kaydedin; ki-kare tablosundan kritik değeri aşan gözlemler uç değerdir.
Uç değerle ne yapmalı?
- Veri giriş hatası mı? → Düzeltin veya silin.
- Gerçek ama aşırı bir gözlem mi? → Silmeyin. İsterseniz winsorize edin (uç değeri en yakın kabul edilebilir değere çekin).
- Emin değil misiniz? → Hem dâhil hem hariç analiz yapın; sonuç değişmiyorsa dâhil edin ve durumu raporlayın.
Adım 5: Dikkatsiz yanıtlayıcıları belirleyin
Bu adım, anket verisinin kalitesini en çok etkileyen ama en çok atlanan adımdır.
Süre kontrolü
Doldurma süresi, tahmini sürenin %25’inin altındaysa yanıt şüphelidir. 10 dakikalık bir anketi 2 dakikada bitiren kişi soruları okumamıştır.
Düz çizgi (straight-lining) tespiti
Katılımcının ölçek maddelerine verdiği yanıtların standart sapmasını hesaplayın:
Transform > Compute Variable → SD(madde1, madde2, ..., maddeN)
Standart sapma 0 ise tüm maddelere aynı yanıt verilmiştir. 0,3’ün altındaki değerler de şüphelidir.
Ters madde tutarsızlığı
Ters kodlanmış maddeleri çevirdikten sonra, bir katılımcının bu maddelerle diğerleri arasında sistematik çelişki gösterip göstermediğine bakın.
Dikkat kontrol maddesi
Anketinize “Bu soruya lütfen ‘Katılmıyorum’ işaretleyin” gibi bir madde eklediyseniz, yanlış işaretleyenleri belirleyin.
tezanketim.com üzerinden toplanan yanıtlarda bu kontroller otomatik yapılır; işaretlenen yanıtlar teslimata dâhil edilmez ve size faturalanmaz.
Adım 6: Ters maddeleri çevirin
Transform > Recode into Different Variables
5’li ölçek için: 1→5, 2→4, 3→3, 4→2, 5→1
Bu adımı atlamak, Cronbach alfa değerinizi dramatik biçimde düşürür ve en sık yapılan analiz hatasıdır.
Adım 7: Bileşik değişkenleri oluşturun
Transform > Compute Variable
is_tatmini_toplam = MEAN(is_tatmini_1, is_tatmini_2, is_tatmini_3, is_tatmini_4)
Toplam yerine MEAN kullanmak, puanın orijinal ölçek aralığında kalmasını sağlar ve yorumu kolaylaştırır. Ayrıca birkaç maddesi eksik olan katılımcılar için de değer üretir.
Adım 8: Son kontrol ve belgeleme
- Yeni oluşturulan değişkenlerin frekanslarını kontrol edin.
- Betimsel istatistikleri gözden geçirin (ortalama, SS, çarpıklık, basıklık).
- Temizlenmiş veri setini ayrı bir dosya olarak kaydedin; ham veriyi asla üzerine yazmayın.
- Yaptığınız tüm işlemleri bir sözdizimi (.sps) dosyasına kaydedin — böylece süreç tekrar üretilebilir olur.
Yöntem bölümünde raporlama
“Veri toplama sürecinde 412 yanıt elde edilmiştir. Analiz öncesinde veri seti temizlenmiş; maddelerin %20’sinden fazlasını boş bırakan 14 katılımcı, tahmini doldurma süresinin %25’inin altında yanıt veren 9 katılımcı ve tüm ölçek maddelerine aynı yanıtı veren 6 katılımcı analiz dışı bırakılmıştır. Ayrıca Mahalanobis uzaklığı ölçütüne göre 3 çok değişkenli uç değer tespit edilerek çıkarılmıştır. Nihai analizler 380 katılımcı üzerinden yürütülmüştür.”
Etik uyarı
Temizleme ölçütlerinizi veriyi analiz etmeden önce belirleyin ve tüm katılımcılara aynı şekilde uygulayın. Hipotezinizi desteklemeyen gözlemleri seçerek çıkarmak (data dredging), ciddi bir bilimsel etik ihlalidir.
Sonuç
Veri temizleme, analiz sonuçlarınızın güvenilirliğini belirleyen görünmez temeldir. Sekiz adımı sırayla uygulayın, her kararınızı kaydedin ve yöntem bölümünde şeffaf biçimde raporlayın.
Analiz ve raporlamayı devretmek isterseniz anket analizi hizmetimiz veri temizlemeden APA formatında rapora kadar tüm süreci kapsar.