# 2026'da Veri Bilimi İçin İstatistik: Olasılık, Hipotez Testi ve Mülakat Soruları > Veri bilimi için kapsamlı istatistik rehberi: olasılık dağılımları, hipotez testleri, güven aralıkları ve Python örnekleriyle sık sorulan mülakat soruları. - Published: 2026-08-21 - Updated: 2026-08-21 - Author: Anthony Fillion-Maillet - Reading time: 5 min --- İstatistik, her veri bilimi rolünün matematiksel temelini oluşturur. Google, Meta ve Netflix gibi şirketlerdeki mülakatçılar istatistiksel muhakemeyi test eder çünkü bu, model oluşturabilen adayları bu modellerin neden çalıştığını anlayan adaylardan ayırır. > **Mülakatçılar Ne Arar** > > İstatistik soruları üç yeteneği değerlendirir: iş problemlerini istatistiksel çerçevelere dönüştürme, veriler için doğru testi seçme ve sonuçları aşırı yorum yapmadan yorumlama. ## Her Veri Bilimcinin Bilmesi Gereken Olasılık Dağılımları Olasılık dağılımları, veri noktalarının olası değerler arasında nasıl yayıldığını tanımlar. Mülakatçılar bu dağılımlarda akıcılık bekler çünkü bunlar örnekleme, A/B testleri ve model varsayımlarının temelini oluşturur. **Normal dağılım** (Gauss) her yerde karşımıza çıkar: ölçüm hataları, boy, test puanları. Çan eğrisi ortalama etrafında toplanır ve verilerin %68'i bir standart sapma içinde, %95'i iki standart sapma içinde yer alır. Örneklem büyüklüğü 30'u aştığında, Merkezi Limit Teoremi örneklem ortalamalarının orijinal popülasyon şeklinden bağımsız olarak normal dağılım izleyeceğini garanti eder. **Binom dağılımı** başarı/başarısızlık denemelerini modeller. Tıklama oranları, dönüşüm olayları ve geçti/kaldı kalite kontrolleri binom kalıplarını izler. n deneme ve p başarı olasılığı için beklenen değer np ve varyans np(1-p)'dir. **Poisson dağılımı** sabit aralıklardaki nadir olayları sayar: dakikadaki web sitesi ziyaretleri, partideki kusurlar, saatteki aramalar. Tek parametresi λ hem ortalamayı hem de varyansı temsil eder. Olaylar sabit bir ortalama hızda bağımsız olarak gerçekleştiğinde Poisson uygundur. ```python # distributions_demo.py import numpy as np from scipy import stats # Normal: customer spend follows N(μ=50, σ=15) normal_samples = stats.norm.rvs(loc=50, scale=15, size=1000) prob_above_80 = 1 - stats.norm.cdf(80, loc=50, scale=15) # P(X > 80) # Binomial: 100 users, 5% conversion rate binom_samples = stats.binom.rvs(n=100, p=0.05, size=1000) prob_at_least_10 = 1 - stats.binom.cdf(9, n=100, p=0.05) # P(X >= 10) # Poisson: 3 support tickets per hour on average poisson_samples = stats.poisson.rvs(mu=3, size=1000) prob_zero_tickets = stats.poisson.pmf(0, mu=3) # P(X = 0) ``` Bu üç dağılım pratik senaryoların çoğunu kapsar. Mülakatçılar genellikle hangi dağılımın belirli bir iş bağlamına uyduğunu sorar, bu nedenle gerçek problemleri doğru modele eşleme pratiği yapmak önemlidir. ## Hipotez Testi: A/B Testlerinin Arkasındaki Çerçeve Hipotez testi, verilerden karar vermek için resmi bir yapı sağlar. Süreç, etki veya fark olmadığını temsil eden sıfır hipotezi (H₀) ve deneyin tespit etmeyi amaçladığı şeyi temsil eden alternatif hipotez (H₁) ile başlar. Tipik bir A/B testi sıfır hipotezi şöyle der: "Yeni özelliğin dönüşüm oranı üzerinde etkisi yoktur." Alternatif ise bir etki olduğunu iddia eder. Test, sıfır hipotezi doğru olsaydı gözlemlenen verilerin ne kadar olası olacağını hesaplar. **p-değeri** bu olasılığı ölçer. 0,03'lük bir p-değeri, sıfır hipotezi geçerliyse bu kadar aşırı sonuçlar görme şansının %3 olduğu anlamına gelir. p-değeri anlamlılık düzeyinin (genellikle α = 0,05) altına düştüğünde, sıfır hipotezi reddedilir. ```python # ab_test_analysis.py import numpy as np from scipy import stats # A/B test data: control vs treatment conversion rates control_conversions = 120 control_visitors = 2000 treatment_conversions = 145 treatment_visitors = 2000 # Proportions p_control = control_conversions / control_visitors # 0.060 p_treatment = treatment_conversions / treatment_visitors # 0.0725 # Pooled proportion under null hypothesis p_pooled = (control_conversions + treatment_conversions) / (control_visitors + treatment_visitors) # Standard error se = np.sqrt(p_pooled * (1 - p_pooled) * (1/control_visitors + 1/treatment_visitors)) # Z-statistic z_stat = (p_treatment - p_control) / se # Two-tailed p-value p_value = 2 * (1 - stats.norm.cdf(abs(z_stat))) print(f"Z-statistic: {z_stat:.3f}") # Z-statistic: 1.681 print(f"P-value: {p_value:.4f}") # P-value: 0.0928 ``` 0,0928'lik bir p-değeri ile bu test, α = 0,05'te sıfır hipotezini reddetmez. Gözlemlenen fark rastgele değişkenlik olabilir. İstatistiksel anlamlılığa ulaşmak için daha fazla veri veya daha büyük bir etki boyutu gereklidir. ## Tip I ve Tip II Hatalar: Mülakatçıların Araştırdığı Dengeler İstatistiksel testler iki tür hata arasında denge kurar. **Tip I hata** (yanlış pozitif) doğru bir sıfır hipotezi reddedildiğinde oluşur. **Tip II hata** (yanlış negatif) yanlış bir sıfır hipotezi reddedilmediğinde oluşur. Anlamlılık düzeyi α, Tip I hata olasılığını doğrudan kontrol eder. α = 0,05 ayarlamak, %5 yanlış pozitif şansını kabul etmek demektir. α'yı 0,01'e düşürmek yanlış pozitifleri azaltır ancak yanlış negatifleri artırır. **İstatistiksel güç** (1 - β), yanlış bir sıfır hipotezini doğru bir şekilde reddetme olasılığını ölçer. Güç, etki boyutuna, örneklem büyüklüğüne ve anlamlılık düzeyine bağlıdır. Endüstri standardı %80 güçtür, bu da gerçek etkileri kaçırma şansının %20 olduğu anlamına gelir. > **Mülakat Tuzağı** > > Adaylar genellikle "anlamlı fark yok" ile "fark yok" ifadelerini karıştırır. Sıfır hipotezini reddetmemek, sıfır hipotezinin doğru olduğunu kanıtlamaz. Test, küçük ama gerçek bir etkiyi tespit edecek güçten yoksun olabilir. Örneklem büyüklüğü hesaplamaları bu endişeleri dengeler. %80 güç ve α = 0,05 ile dönüşümde %2'lik bir artışı (%5'ten %7'ye) hedefleyen bir A/B testi için: ```python # sample_size_calculation.py from statsmodels.stats.power import zt_ind_solve_power import numpy as np # Baseline conversion: 5%, expected lift: 2 percentage points baseline = 0.05 expected = 0.07 effect_size = (expected - baseline) / np.sqrt(baseline * (1 - baseline)) # Cohen's h # Required sample size per group n_per_group = zt_ind_solve_power( effect_size=effect_size, alpha=0.05, power=0.80, alternative='two-sided' ) print(f"Sample size per group: {int(np.ceil(n_per_group))}") # ~1,570 per group ``` Yetersiz güçlü testler, gerçekçi etkileri tespit edemeyen deneyler yürüterek kaynakları israf eder. ## Güven Aralıkları: Belirsizliği Ölçümleme %95 güven aralığı şu anlama gelir: aynı örnekleme süreci birçok kez tekrarlansaydı, oluşturulan aralıkların %95'i gerçek parametreyi içerirdi. Güven aralıkları, belirsizliği nokta tahminlerinden daha iyi iletir. Bilinen popülasyon varyansı olan ortalamalar için aralık z-dağılımını kullanır. Küçük örneklemler veya bilinmeyen varyans için t-dağılımı uygulanır. t-dağılımı normalden daha kalın kuyruklara sahiptir ve ek belirsizliği hesaba katan daha geniş aralıklar üretir. ```python # confidence_intervals.py import numpy as np from scipy import stats # Sample data: response times in milliseconds response_times = np.array([245, 312, 278, 299, 256, 334, 287, 301, 265, 289]) n = len(response_times) mean = np.mean(response_times) # 286.6 std_err = stats.sem(response_times) # Standard error of the mean # 95% confidence interval using t-distribution (df = n-1) t_critical = stats.t.ppf(0.975, df=n-1) margin_of_error = t_critical * std_err ci_lower = mean - margin_of_error ci_upper = mean + margin_of_error print(f"Mean: {mean:.1f}ms") # Mean: 286.6ms print(f"95% CI: [{ci_lower:.1f}, {ci_upper:.1f}]ms") # 95% CI: [265.4, 307.8]ms ``` Daha dar aralıklar daha kesin tahminleri gösterir. Örneklem büyüklüğü kesinliği artırır: n'yi dört katına çıkarmak hata payını yarıya indirir. ## Bayesian vs Frequentist: İstatistik Felsefesi Üzerine Mülakat Soruları Mülakatçılar bazen rakip istatistiksel paradigmaların anlaşılmasını araştırır. **Frequentist istatistik** olasılığı uzun vadeli frekans olarak ele alır: parametreler sabittir ve veriler tekrarlanan deneylerde değişir. p-değerleri ve güven aralıkları bu gelenekten gelir. **Bayesian istatistik** olasılığı inanç derecesi olarak ele alır: önceki bilgi verilerle birleşerek sonraki inançları oluşturur. Bu yaklaşım alan uzmanlığını dahil etmeye izin verir ve doğrudan parametreler hakkında olasılık ifadeleri üretir. A/B testleri giderek daha fazla Bayesian yöntemler kullanır çünkü paydaşların gerçekte sorduğu soruyu yanıtlarlar: "B tedavisinin A tedavisinden daha iyi performans gösterme olasılığı nedir?" yerine "Hiç fark olmasaydı bu veriler ne kadar şaşırtıcı olurdu?" ```python # bayesian_ab_test.py import numpy as np from scipy import stats # Prior: Beta(1, 1) = uniform prior for conversion rate # Posterior: Beta(alpha + successes, beta + failures) control_successes, control_failures = 120, 1880 treatment_successes, treatment_failures = 145, 1855 # Posterior distributions posterior_control = stats.beta(1 + control_successes, 1 + control_failures) posterior_treatment = stats.beta(1 + treatment_successes, 1 + treatment_failures) # Monte Carlo estimation: P(treatment > control) samples_control = posterior_control.rvs(100000) samples_treatment = posterior_treatment.rvs(100000) prob_treatment_better = np.mean(samples_treatment > samples_control) print(f"P(treatment > control): {prob_treatment_better:.2%}") # ~95% ``` Bayesian sonuçlar doğrudan iletişim kurar: "Tedavi dönüşüm oranının kontrol oranını aşma olasılığı %95'tir." Frequentist sonuçlar daha dikkatli yorumlama gerektirir. ## İstatistiksel Çıkarım Üzerine Yaygın Mülakat Soruları Bu sorular teknoloji şirketlerindeki veri bilimi mülakatlarında sıkça ortaya çıkar. Her biri belirli bir istatistiksel kavramı test eder. **"Merkezi Limit Teoremini ve neden önemli olduğunu açıklayın."** MLT, herhangi bir popülasyondan (sonlu varyanslı) alınan örneklem ortalamalarının örneklem büyüklüğü arttıkça normal dağılıma yaklaştığını belirtir. Bu önemlidir çünkü hipotez testlerindeki normallik varsayımları, temel dağılımdan bağımsız olarak büyük örneklemler için geçerlidir. 30+ örneklem büyüklükleri genellikle yeterlidir. **"p-hacking nedir ve nasıl önlenir?"** p-hacking, anlamlılık bulunana kadar birden fazla hipotezi test ederek veya sonuçlar anlamlı hale geldiğinde veri toplamayı durdurarak yanlış pozitif oranlarını şişirir. Önleme stratejileri: analiz planlarını önceden kaydetme, çoklu karşılaştırma düzeltmeleri uygulama (Bonferroni, FDR) ve veri toplamadan önce örneklem büyüklüklerini belirleme. **"t-testi mi yoksa Mann-Whitney U testi mi ne zaman kullanılır?"** t-testi normal dağılımlı verileri (veya MLT aracılığıyla büyük örneklemleri) varsayar ve ortalamaları karşılaştırır. [Mann-Whitney U](https://en.wikipedia.org/wiki/Mann%E2%80%93Whitney_U_test) normallik varsayımları olmadan dağılımları karşılaştıran parametrik olmayan bir alternatiftir. Açıkça normal olmayan verilerle küçük örneklemler için veya sıralı ölçümleri karşılaştırırken Mann-Whitney kullanılmalıdır. **"A/B testlerinde çoklu karşılaştırmalar nasıl ele alınır?"** Birden fazla varyantı test etmek Tip I hatasını şişirir. α = 0,05'te 20 karşılaştırma ile en az bir yanlış pozitif olasılığı %60'ı aşar. Bonferroni düzeltmesi α'yı test sayısına böler. Benjamini-Hochberg prosedürü, Bonferroni'den daha fazla güç korurken yanlış keşif oranını kontrol eder. ## Simpson Paradoksu: Favori Bir Mülakat Konusu [Simpson paradoksu](https://en.wikipedia.org/wiki/Simpson%27s_paradox), toplu verilerdeki eğilimler alt grup düzeyinde tersine döndüğünde ortaya çıkar. Mülakatçılar bu konuyu sever çünkü sadece istatistiksel mekanikler değil, nedensel muhakemeyi test eder. Klasik bir örnek: A Hastanesi, B Hastanesi'nden daha yüksek genel ölüm oranına sahiptir. Ancak A Hastanesi hem hafif hem de ağır vakalar için daha düşük ölüm oranına sahiptir. Paradoks, A Hastanesi'nin hastane kalitesinden bağımsız olarak daha yüksek ölüm oranına sahip olan daha fazla ağır vakayı tedavi etmesinden kaynaklanır. ```python # simpsons_paradox.py import pandas as pd # Hospital mortality data data = { 'Hospital': ['A', 'A', 'B', 'B'], 'Severity': ['Mild', 'Severe', 'Mild', 'Severe'], 'Patients': [200, 800, 800, 200], 'Deaths': [10, 160, 48, 50] } df = pd.DataFrame(data) df['Mortality'] = df['Deaths'] / df['Patients'] # Subgroup mortality print(df[['Hospital', 'Severity', 'Mortality']]) # Hospital A: Mild 5%, Severe 20% # Hospital B: Mild 6%, Severe 25% # Aggregate mortality agg = df.groupby('Hospital').agg({'Deaths': 'sum', 'Patients': 'sum'}) agg['Mortality'] = agg['Deaths'] / agg['Patients'] print(agg['Mortality']) # Hospital A: 17%, Hospital B: 9.8% ``` Çözüm, karıştırıcı değişkeni (şiddet) tanımlamayı ve alt grupları ayrı ayrı analiz etmeyi gerektirir. Alt grup oranları farklı olduğunda toplu analiz yanıltıcıdır. ## Özellik Mühendisliği İçin İstatistiksel Kavramlar İstatistik bilgisi doğrudan özellik mühendisliğini geliştirir. Dağılımları anlamak dönüşümlere rehberlik eder; ilişkileri anlamak özellik oluşturmaya rehberlik eder. **Çarpıklık** dağılım asimetrisini ölçer. Sağa çarpık veriler (gelir, fiyatlar) dağılımı normalleştiren ve model performansını artıran logaritmik dönüşümlerden faydalanır. Sola çarpık veriler kare veya üstel dönüşümler kullanır. **Korelasyon** doğrusal ilişkileri ölçer. Pearson korelasyonu normallik ve doğrusallık varsayar. Spearman korelasyonu monotonik doğrusal olmayan ilişkileri ele alır. Yüksek korelasyonlu özellikler doğrusal modellerde çoklu doğrusallığa neden olur, bu nedenle biri genellikle çıkarılır. **Aykırı değerler** ortalama ve standart sapmaları orantısız şekilde etkiler. Sağlam istatistikler (medyan, IQR) aykırı değer etkisine direnir. Karar: aykırı değerlerin hataları mı yoksa gerçek aşırı değerleri mi temsil ettiğine bağlı olarak kaldırma, sınırlama veya dönüştürme. Bu kavramları makine öğrenimi modellerine uygulama hakkında daha fazla bilgi için [özellik mühendisliği mülakat rehberine](/blog/data-science/feature-engineering-machine-learning-techniques-interview-2026) bakılabilir ve [çıkarımsal istatistik pratik modülü](/technologies/data-science/interview-questions/statistics-inferential) incelenebilir. ## İstatistik Sorularında Güçlü Adayları Ayıran Özellikler Veri bilimi mülakatlarında istatistiksel yetkinlik, ders kitabı tanımlarından daha fazlasını gerektirir. Güçlü adaylar şu yetenekleri sergiler: - **İstatistiği iş sonuçlarına bağlama**: A/B test sonuçlarını sadece p-değerleri değil, gelir etkisi veya kullanıcı etkileşimi açısından çerçeveleme - **Varsayımları bilme**: her testin koşulları vardır (bağımsızlık, normallik, eşit varyans) ve adaylar bu koşulların ne zaman başarısız olabileceğini belirtmelidir - **Belirsizliği ölçümleme**: güven aralıkları veya güvenilir aralıklar olmadan nokta tahminleri, paydaşları güvenilirlik konusunda tahmin yapmaya bırakır - **Nedensellik sınırlarını tanıma**: gözlemsel veriler korelasyon gösterir ve adaylar hangi deneysel tasarımın nedenselliği kuracağını ifade etmelidir - **Doğru testi seçme**: veri türünü (sürekli vs kategorik), örneklem büyüklüğünü ve araştırma sorusunu uygun istatistiksel yönteme eşleştirme - **Sonuçları açıkça iletme**: istatistiksel bulguları teknik olmayan paydaşların anlayabileceği ve uygulayabileceği uygulanabilir önerilere dönüştürme --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/tr/blog/data-science/statistics-data-science-probability-hypothesis-testing-interview-2026