2026'da Veri Bilimi İçin İstatistik: Olasılık, Hipotez Testi ve Mülakat Soruları
Veri bilimi için kapsamlı istatistik rehberi: olasılık dağılımları, hipotez testleri, güven aralıkları ve Python örnekleriyle sık sorulan mülakat soruları.

İstatistik, her veri bilimi rolünün matematiksel temelini oluşturur. Google, Meta ve Netflix gibi şirketlerdeki mülakatçılar istatistiksel muhakemeyi test eder çünkü bu, model oluşturabilen adayları bu modellerin neden çalıştığını anlayan adaylardan ayırır.
İstatistik soruları üç yeteneği değerlendirir: iş problemlerini istatistiksel çerçevelere dönüştürme, veriler için doğru testi seçme ve sonuçları aşırı yorum yapmadan yorumlama.
Her Veri Bilimcinin Bilmesi Gereken Olasılık Dağılımları
Olasılık dağılımları, veri noktalarının olası değerler arasında nasıl yayıldığını tanımlar. Mülakatçılar bu dağılımlarda akıcılık bekler çünkü bunlar örnekleme, A/B testleri ve model varsayımlarının temelini oluşturur.
Normal dağılım (Gauss) her yerde karşımıza çıkar: ölçüm hataları, boy, test puanları. Çan eğrisi ortalama etrafında toplanır ve verilerin %68'i bir standart sapma içinde, %95'i iki standart sapma içinde yer alır. Örneklem büyüklüğü 30'u aştığında, Merkezi Limit Teoremi örneklem ortalamalarının orijinal popülasyon şeklinden bağımsız olarak normal dağılım izleyeceğini garanti eder.
Binom dağılımı başarı/başarısızlık denemelerini modeller. Tıklama oranları, dönüşüm olayları ve geçti/kaldı kalite kontrolleri binom kalıplarını izler. n deneme ve p başarı olasılığı için beklenen değer np ve varyans np(1-p)'dir.
Poisson dağılımı sabit aralıklardaki nadir olayları sayar: dakikadaki web sitesi ziyaretleri, partideki kusurlar, saatteki aramalar. Tek parametresi λ hem ortalamayı hem de varyansı temsil eder. Olaylar sabit bir ortalama hızda bağımsız olarak gerçekleştiğinde Poisson uygundur.
# distributions_demo.py
import numpy as np
from scipy import stats
# Normal: customer spend follows N(μ=50, σ=15)
normal_samples = stats.norm.rvs(loc=50, scale=15, size=1000)
prob_above_80 = 1 - stats.norm.cdf(80, loc=50, scale=15) # P(X > 80)
# Binomial: 100 users, 5% conversion rate
binom_samples = stats.binom.rvs(n=100, p=0.05, size=1000)
prob_at_least_10 = 1 - stats.binom.cdf(9, n=100, p=0.05) # P(X >= 10)
# Poisson: 3 support tickets per hour on average
poisson_samples = stats.poisson.rvs(mu=3, size=1000)
prob_zero_tickets = stats.poisson.pmf(0, mu=3) # P(X = 0)Bu üç dağılım pratik senaryoların çoğunu kapsar. Mülakatçılar genellikle hangi dağılımın belirli bir iş bağlamına uyduğunu sorar, bu nedenle gerçek problemleri doğru modele eşleme pratiği yapmak önemlidir.
Hipotez Testi: A/B Testlerinin Arkasındaki Çerçeve
Hipotez testi, verilerden karar vermek için resmi bir yapı sağlar. Süreç, etki veya fark olmadığını temsil eden sıfır hipotezi (H₀) ve deneyin tespit etmeyi amaçladığı şeyi temsil eden alternatif hipotez (H₁) ile başlar.
Tipik bir A/B testi sıfır hipotezi şöyle der: "Yeni özelliğin dönüşüm oranı üzerinde etkisi yoktur." Alternatif ise bir etki olduğunu iddia eder. Test, sıfır hipotezi doğru olsaydı gözlemlenen verilerin ne kadar olası olacağını hesaplar.
p-değeri bu olasılığı ölçer. 0,03'lük bir p-değeri, sıfır hipotezi geçerliyse bu kadar aşırı sonuçlar görme şansının %3 olduğu anlamına gelir. p-değeri anlamlılık düzeyinin (genellikle α = 0,05) altına düştüğünde, sıfır hipotezi reddedilir.
# ab_test_analysis.py
import numpy as np
from scipy import stats
# A/B test data: control vs treatment conversion rates
control_conversions = 120
control_visitors = 2000
treatment_conversions = 145
treatment_visitors = 2000
# Proportions
p_control = control_conversions / control_visitors # 0.060
p_treatment = treatment_conversions / treatment_visitors # 0.0725
# Pooled proportion under null hypothesis
p_pooled = (control_conversions + treatment_conversions) / (control_visitors + treatment_visitors)
# Standard error
se = np.sqrt(p_pooled * (1 - p_pooled) * (1/control_visitors + 1/treatment_visitors))
# Z-statistic
z_stat = (p_treatment - p_control) / se
# Two-tailed p-value
p_value = 2 * (1 - stats.norm.cdf(abs(z_stat)))
print(f"Z-statistic: {z_stat:.3f}") # Z-statistic: 1.681
print(f"P-value: {p_value:.4f}") # P-value: 0.09280,0928'lik bir p-değeri ile bu test, α = 0,05'te sıfır hipotezini reddetmez. Gözlemlenen fark rastgele değişkenlik olabilir. İstatistiksel anlamlılığa ulaşmak için daha fazla veri veya daha büyük bir etki boyutu gereklidir.
Tip I ve Tip II Hatalar: Mülakatçıların Araştırdığı Dengeler
İstatistiksel testler iki tür hata arasında denge kurar. Tip I hata (yanlış pozitif) doğru bir sıfır hipotezi reddedildiğinde oluşur. Tip II hata (yanlış negatif) yanlış bir sıfır hipotezi reddedilmediğinde oluşur.
Anlamlılık düzeyi α, Tip I hata olasılığını doğrudan kontrol eder. α = 0,05 ayarlamak, %5 yanlış pozitif şansını kabul etmek demektir. α'yı 0,01'e düşürmek yanlış pozitifleri azaltır ancak yanlış negatifleri artırır.
İstatistiksel güç (1 - β), yanlış bir sıfır hipotezini doğru bir şekilde reddetme olasılığını ölçer. Güç, etki boyutuna, örneklem büyüklüğüne ve anlamlılık düzeyine bağlıdır. Endüstri standardı %80 güçtür, bu da gerçek etkileri kaçırma şansının %20 olduğu anlamına gelir.
Adaylar genellikle "anlamlı fark yok" ile "fark yok" ifadelerini karıştırır. Sıfır hipotezini reddetmemek, sıfır hipotezinin doğru olduğunu kanıtlamaz. Test, küçük ama gerçek bir etkiyi tespit edecek güçten yoksun olabilir.
Örneklem büyüklüğü hesaplamaları bu endişeleri dengeler. %80 güç ve α = 0,05 ile dönüşümde %2'lik bir artışı (%5'ten %7'ye) hedefleyen bir A/B testi için:
# sample_size_calculation.py
from statsmodels.stats.power import zt_ind_solve_power
import numpy as np
# Baseline conversion: 5%, expected lift: 2 percentage points
baseline = 0.05
expected = 0.07
effect_size = (expected - baseline) / np.sqrt(baseline * (1 - baseline)) # Cohen's h
# Required sample size per group
n_per_group = zt_ind_solve_power(
effect_size=effect_size,
alpha=0.05,
power=0.80,
alternative='two-sided'
)
print(f"Sample size per group: {int(np.ceil(n_per_group))}") # ~1,570 per groupYetersiz güçlü testler, gerçekçi etkileri tespit edemeyen deneyler yürüterek kaynakları israf eder.
Güven Aralıkları: Belirsizliği Ölçümleme
%95 güven aralığı şu anlama gelir: aynı örnekleme süreci birçok kez tekrarlansaydı, oluşturulan aralıkların %95'i gerçek parametreyi içerirdi. Güven aralıkları, belirsizliği nokta tahminlerinden daha iyi iletir.
Bilinen popülasyon varyansı olan ortalamalar için aralık z-dağılımını kullanır. Küçük örneklemler veya bilinmeyen varyans için t-dağılımı uygulanır. t-dağılımı normalden daha kalın kuyruklara sahiptir ve ek belirsizliği hesaba katan daha geniş aralıklar üretir.
# confidence_intervals.py
import numpy as np
from scipy import stats
# Sample data: response times in milliseconds
response_times = np.array([245, 312, 278, 299, 256, 334, 287, 301, 265, 289])
n = len(response_times)
mean = np.mean(response_times) # 286.6
std_err = stats.sem(response_times) # Standard error of the mean
# 95% confidence interval using t-distribution (df = n-1)
t_critical = stats.t.ppf(0.975, df=n-1)
margin_of_error = t_critical * std_err
ci_lower = mean - margin_of_error
ci_upper = mean + margin_of_error
print(f"Mean: {mean:.1f}ms") # Mean: 286.6ms
print(f"95% CI: [{ci_lower:.1f}, {ci_upper:.1f}]ms") # 95% CI: [265.4, 307.8]msDaha dar aralıklar daha kesin tahminleri gösterir. Örneklem büyüklüğü kesinliği artırır: n'yi dört katına çıkarmak hata payını yarıya indirir.
Data Science & ML mülakatlarında başarılı olmaya hazır mısın?
İnteraktif simülatörler, flashcards ve teknik testlerle pratik yap.
Bayesian vs Frequentist: İstatistik Felsefesi Üzerine Mülakat Soruları
Mülakatçılar bazen rakip istatistiksel paradigmaların anlaşılmasını araştırır. Frequentist istatistik olasılığı uzun vadeli frekans olarak ele alır: parametreler sabittir ve veriler tekrarlanan deneylerde değişir. p-değerleri ve güven aralıkları bu gelenekten gelir.
Bayesian istatistik olasılığı inanç derecesi olarak ele alır: önceki bilgi verilerle birleşerek sonraki inançları oluşturur. Bu yaklaşım alan uzmanlığını dahil etmeye izin verir ve doğrudan parametreler hakkında olasılık ifadeleri üretir.
A/B testleri giderek daha fazla Bayesian yöntemler kullanır çünkü paydaşların gerçekte sorduğu soruyu yanıtlarlar: "B tedavisinin A tedavisinden daha iyi performans gösterme olasılığı nedir?" yerine "Hiç fark olmasaydı bu veriler ne kadar şaşırtıcı olurdu?"
# bayesian_ab_test.py
import numpy as np
from scipy import stats
# Prior: Beta(1, 1) = uniform prior for conversion rate
# Posterior: Beta(alpha + successes, beta + failures)
control_successes, control_failures = 120, 1880
treatment_successes, treatment_failures = 145, 1855
# Posterior distributions
posterior_control = stats.beta(1 + control_successes, 1 + control_failures)
posterior_treatment = stats.beta(1 + treatment_successes, 1 + treatment_failures)
# Monte Carlo estimation: P(treatment > control)
samples_control = posterior_control.rvs(100000)
samples_treatment = posterior_treatment.rvs(100000)
prob_treatment_better = np.mean(samples_treatment > samples_control)
print(f"P(treatment > control): {prob_treatment_better:.2%}") # ~95%Bayesian sonuçlar doğrudan iletişim kurar: "Tedavi dönüşüm oranının kontrol oranını aşma olasılığı %95'tir." Frequentist sonuçlar daha dikkatli yorumlama gerektirir.
İstatistiksel Çıkarım Üzerine Yaygın Mülakat Soruları
Bu sorular teknoloji şirketlerindeki veri bilimi mülakatlarında sıkça ortaya çıkar. Her biri belirli bir istatistiksel kavramı test eder.
"Merkezi Limit Teoremini ve neden önemli olduğunu açıklayın."
MLT, herhangi bir popülasyondan (sonlu varyanslı) alınan örneklem ortalamalarının örneklem büyüklüğü arttıkça normal dağılıma yaklaştığını belirtir. Bu önemlidir çünkü hipotez testlerindeki normallik varsayımları, temel dağılımdan bağımsız olarak büyük örneklemler için geçerlidir. 30+ örneklem büyüklükleri genellikle yeterlidir.
"p-hacking nedir ve nasıl önlenir?"
p-hacking, anlamlılık bulunana kadar birden fazla hipotezi test ederek veya sonuçlar anlamlı hale geldiğinde veri toplamayı durdurarak yanlış pozitif oranlarını şişirir. Önleme stratejileri: analiz planlarını önceden kaydetme, çoklu karşılaştırma düzeltmeleri uygulama (Bonferroni, FDR) ve veri toplamadan önce örneklem büyüklüklerini belirleme.
"t-testi mi yoksa Mann-Whitney U testi mi ne zaman kullanılır?"
t-testi normal dağılımlı verileri (veya MLT aracılığıyla büyük örneklemleri) varsayar ve ortalamaları karşılaştırır. Mann-Whitney U normallik varsayımları olmadan dağılımları karşılaştıran parametrik olmayan bir alternatiftir. Açıkça normal olmayan verilerle küçük örneklemler için veya sıralı ölçümleri karşılaştırırken Mann-Whitney kullanılmalıdır.
"A/B testlerinde çoklu karşılaştırmalar nasıl ele alınır?"
Birden fazla varyantı test etmek Tip I hatasını şişirir. α = 0,05'te 20 karşılaştırma ile en az bir yanlış pozitif olasılığı %60'ı aşar. Bonferroni düzeltmesi α'yı test sayısına böler. Benjamini-Hochberg prosedürü, Bonferroni'den daha fazla güç korurken yanlış keşif oranını kontrol eder.
Simpson Paradoksu: Favori Bir Mülakat Konusu
Simpson paradoksu, toplu verilerdeki eğilimler alt grup düzeyinde tersine döndüğünde ortaya çıkar. Mülakatçılar bu konuyu sever çünkü sadece istatistiksel mekanikler değil, nedensel muhakemeyi test eder.
Klasik bir örnek: A Hastanesi, B Hastanesi'nden daha yüksek genel ölüm oranına sahiptir. Ancak A Hastanesi hem hafif hem de ağır vakalar için daha düşük ölüm oranına sahiptir. Paradoks, A Hastanesi'nin hastane kalitesinden bağımsız olarak daha yüksek ölüm oranına sahip olan daha fazla ağır vakayı tedavi etmesinden kaynaklanır.
# simpsons_paradox.py
import pandas as pd
# Hospital mortality data
data = {
'Hospital': ['A', 'A', 'B', 'B'],
'Severity': ['Mild', 'Severe', 'Mild', 'Severe'],
'Patients': [200, 800, 800, 200],
'Deaths': [10, 160, 48, 50]
}
df = pd.DataFrame(data)
df['Mortality'] = df['Deaths'] / df['Patients']
# Subgroup mortality
print(df[['Hospital', 'Severity', 'Mortality']])
# Hospital A: Mild 5%, Severe 20%
# Hospital B: Mild 6%, Severe 25%
# Aggregate mortality
agg = df.groupby('Hospital').agg({'Deaths': 'sum', 'Patients': 'sum'})
agg['Mortality'] = agg['Deaths'] / agg['Patients']
print(agg['Mortality'])
# Hospital A: 17%, Hospital B: 9.8%Çözüm, karıştırıcı değişkeni (şiddet) tanımlamayı ve alt grupları ayrı ayrı analiz etmeyi gerektirir. Alt grup oranları farklı olduğunda toplu analiz yanıltıcıdır.
Özellik Mühendisliği İçin İstatistiksel Kavramlar
İstatistik bilgisi doğrudan özellik mühendisliğini geliştirir. Dağılımları anlamak dönüşümlere rehberlik eder; ilişkileri anlamak özellik oluşturmaya rehberlik eder.
Çarpıklık dağılım asimetrisini ölçer. Sağa çarpık veriler (gelir, fiyatlar) dağılımı normalleştiren ve model performansını artıran logaritmik dönüşümlerden faydalanır. Sola çarpık veriler kare veya üstel dönüşümler kullanır.
Korelasyon doğrusal ilişkileri ölçer. Pearson korelasyonu normallik ve doğrusallık varsayar. Spearman korelasyonu monotonik doğrusal olmayan ilişkileri ele alır. Yüksek korelasyonlu özellikler doğrusal modellerde çoklu doğrusallığa neden olur, bu nedenle biri genellikle çıkarılır.
Aykırı değerler ortalama ve standart sapmaları orantısız şekilde etkiler. Sağlam istatistikler (medyan, IQR) aykırı değer etkisine direnir. Karar: aykırı değerlerin hataları mı yoksa gerçek aşırı değerleri mi temsil ettiğine bağlı olarak kaldırma, sınırlama veya dönüştürme.
Bu kavramları makine öğrenimi modellerine uygulama hakkında daha fazla bilgi için özellik mühendisliği mülakat rehberine bakılabilir ve çıkarımsal istatistik pratik modülü incelenebilir.
Pratik yapmaya başla!
Mülakat simülatörleri ve teknik testlerle bilgini test et.
İstatistik Sorularında Güçlü Adayları Ayıran Özellikler
Veri bilimi mülakatlarında istatistiksel yetkinlik, ders kitabı tanımlarından daha fazlasını gerektirir. Güçlü adaylar şu yetenekleri sergiler:
- İstatistiği iş sonuçlarına bağlama: A/B test sonuçlarını sadece p-değerleri değil, gelir etkisi veya kullanıcı etkileşimi açısından çerçeveleme
- Varsayımları bilme: her testin koşulları vardır (bağımsızlık, normallik, eşit varyans) ve adaylar bu koşulların ne zaman başarısız olabileceğini belirtmelidir
- Belirsizliği ölçümleme: güven aralıkları veya güvenilir aralıklar olmadan nokta tahminleri, paydaşları güvenilirlik konusunda tahmin yapmaya bırakır
- Nedensellik sınırlarını tanıma: gözlemsel veriler korelasyon gösterir ve adaylar hangi deneysel tasarımın nedenselliği kuracağını ifade etmelidir
- Doğru testi seçme: veri türünü (sürekli vs kategorik), örneklem büyüklüğünü ve araştırma sorusunu uygun istatistiksel yönteme eşleştirme
- Sonuçları açıkça iletme: istatistiksel bulguları teknik olmayan paydaşların anlayabileceği ve uygulayabileceği uygulanabilir önerilere dönüştürme
Data Science & ML kodundaki hatayı bulabilir misin?
Gerçek bir kod parçası, gizli bir hata, günde bir deneme. Denemek için hesap gerekmez.

Yazan:
Anthony Fillion-MailletSharpSkill kurucusu
10 yılı aşkın süredir fullstack geliştirici. SharpSkill’i yönetiyor ve burada yayımlanan her şeyden sorumlu.
21 Ağustos 2026 tarihinde güncellendi
Paylaş
İlgili makaleler

2026'da PyTorch ile Bilgisayarla Görü: CNN, Transfer Öğrenme ve Mülakat Soruları
PyTorch kullanarak bilgisayarla görü üzerine kapsamlı rehber. Evrişimli sinir ağları (CNN), transfer öğrenme tekniklerini öğrenin ve iş mülakatlarına hazırlanın.

Veri Bilimciler için LangChain 2026: LLM'ler, Ajanlar ve Mülakat Soruları
Veri bilimciler için kapsamlı LangChain eğitimi. LCEL, RAG kalıpları, ReAct ajanları ve pratik Python kod örnekleriyle en sık sorulan mülakat sorularını öğrenin.

2026'da MLOps: MLflow, Model Registry ve Teknik Mülakat Soruları
ML yaşam döngüsü, MLflow deney izleme, model registry terfisi, dağıtım desenleri, kayma gözlemleme ve sistem tasarımını 2026 için kapsayan MLOps mülakat soruları; Python kodu ve yanıtlarıyla.