# Estadística para Data Science en 2026: Probabilidad, Pruebas de Hipótesis y Preguntas de Entrevista > Guía completa sobre estadística para entrevistas de data science: distribuciones de probabilidad, pruebas de hipótesis, p-values y preguntas frecuentes de los reclutadores. - Published: 2026-08-21 - Updated: 2026-08-21 - Author: Anthony Fillion-Maillet - Reading time: 5 min --- La estadística constituye la columna vertebral matemática de todo puesto en data science. Los reclutadores de empresas como Google, Meta o Netflix evalúan el razonamiento estadístico porque distingue a los candidatos capaces de construir modelos de aquellos que comprenden por qué funcionan esos modelos. > **Lo que buscan los reclutadores** > > Las preguntas de estadística evalúan tres habilidades: traducir problemas de negocio en marcos estadísticos, elegir la prueba adecuada para los datos e interpretar resultados sin extraer conclusiones precipitadas. ## Distribuciones de Probabilidad que Todo Data Scientist Debe Conocer Las distribuciones de probabilidad describen cómo se dispersan los puntos de datos a través de los valores posibles. Los reclutadores esperan fluidez con estas distribuciones porque sustentan el muestreo, las pruebas A/B y los supuestos de los modelos. La **distribución normal** (gaussiana) aparece en todas partes: errores de medición, altura, puntajes de exámenes. Su curva de campana se centra en la media, con el 68% de los datos dentro de una desviación estándar y el 95% dentro de dos. Cuando el tamaño de la muestra supera 30, el Teorema del Límite Central garantiza que las medias muestrales siguen una distribución normal independientemente de la forma de la población original. La **distribución binomial** modela ensayos de éxito/fracaso. Las tasas de clics, eventos de conversión y controles de calidad aprobado/reprobado siguen patrones binomiales. Para n ensayos con probabilidad p de éxito, el valor esperado es np y la varianza es np(1-p). La **distribución de Poisson** cuenta eventos raros en intervalos fijos: visitas al sitio por minuto, defectos por lote, llamadas por hora. Su único parámetro λ representa tanto la media como la varianza. Cuando los eventos ocurren independientemente a una tasa promedio constante, Poisson aplica. ```python # distributions_demo.py import numpy as np from scipy import stats # Normal: customer spend follows N(μ=50, σ=15) normal_samples = stats.norm.rvs(loc=50, scale=15, size=1000) prob_above_80 = 1 - stats.norm.cdf(80, loc=50, scale=15) # P(X > 80) # Binomial: 100 users, 5% conversion rate binom_samples = stats.binom.rvs(n=100, p=0.05, size=1000) prob_at_least_10 = 1 - stats.binom.cdf(9, n=100, p=0.05) # P(X >= 10) # Poisson: 3 support tickets per hour on average poisson_samples = stats.poisson.rvs(mu=3, size=1000) prob_zero_tickets = stats.poisson.pmf(0, mu=3) # P(X = 0) ``` Estas tres distribuciones cubren la mayoría de los escenarios prácticos. Los reclutadores frecuentemente preguntan qué distribución se ajusta a un contexto de negocio dado, por lo que es importante practicar la asociación de problemas reales con el modelo correcto. ## Pruebas de Hipótesis: El Marco Detrás de las Pruebas A/B Las pruebas de hipótesis proporcionan una estructura formal para tomar decisiones a partir de datos. El marco comienza con una hipótesis nula (H₀) que representa ningún efecto o diferencia, y una hipótesis alternativa (H₁) que representa lo que el experimento busca detectar. Una hipótesis nula típica de prueba A/B establece: «La nueva funcionalidad no tiene efecto sobre la tasa de conversión.» La alternativa afirma que existe un efecto. La prueba calcula qué tan probable sería observar los datos si la hipótesis nula fuera verdadera. El **p-value** cuantifica esta probabilidad. Un p-value de 0.03 significa que hay un 3% de probabilidad de ver resultados tan extremos si la hipótesis nula es verdadera. Cuando el p-value cae por debajo del nivel de significancia (comúnmente α = 0.05), la hipótesis nula se rechaza. ```python # ab_test_analysis.py import numpy as np from scipy import stats # A/B test data: control vs treatment conversion rates control_conversions = 120 control_visitors = 2000 treatment_conversions = 145 treatment_visitors = 2000 # Proportions p_control = control_conversions / control_visitors # 0.060 p_treatment = treatment_conversions / treatment_visitors # 0.0725 # Pooled proportion under null hypothesis p_pooled = (control_conversions + treatment_conversions) / (control_visitors + treatment_visitors) # Standard error se = np.sqrt(p_pooled * (1 - p_pooled) * (1/control_visitors + 1/treatment_visitors)) # Z-statistic z_stat = (p_treatment - p_control) / se # Two-tailed p-value p_value = 2 * (1 - stats.norm.cdf(abs(z_stat))) print(f"Z-statistic: {z_stat:.3f}") # Z-statistic: 1.681 print(f"P-value: {p_value:.4f}") # P-value: 0.0928 ``` Con un p-value de 0.0928, esta prueba no rechaza la hipótesis nula a α = 0.05. La diferencia observada podría ser variación aleatoria. Se necesitarían más datos o un tamaño de efecto mayor para alcanzar significancia estadística. ## Errores Tipo I y Tipo II: Los Compromisos que Exploran en Entrevistas Las pruebas estadísticas equilibran dos tipos de errores. Un **error Tipo I** (falso positivo) ocurre cuando se rechaza una hipótesis nula verdadera. Un **error Tipo II** (falso negativo) ocurre cuando no se rechaza una hipótesis nula falsa. El nivel de significancia α controla directamente la probabilidad de error Tipo I. Establecer α = 0.05 significa aceptar un 5% de probabilidad de falsos positivos. Reducir α a 0.01 disminuye los falsos positivos pero aumenta los falsos negativos. La **potencia estadística** (1 - β) mide la probabilidad de rechazar correctamente una hipótesis nula falsa. La potencia depende del tamaño del efecto, el tamaño de la muestra y el nivel de significancia. El estándar de la industria apunta a 80% de potencia, lo que significa un 20% de probabilidad de pasar por alto efectos reales. > **Trampa de entrevista** > > Los candidatos frecuentemente confunden «sin diferencia significativa» con «no existe diferencia». No rechazar la hipótesis nula no prueba que sea verdadera. La prueba puede carecer de potencia para detectar un efecto pequeño pero real. Los cálculos de tamaño de muestra equilibran estas preocupaciones. Para una prueba A/B que apunta a un aumento del 2% en conversión (del 5% al 7%) con 80% de potencia y α = 0.05: ```python # sample_size_calculation.py from statsmodels.stats.power import zt_ind_solve_power # Baseline conversion: 5%, expected lift: 2 percentage points baseline = 0.05 expected = 0.07 effect_size = (expected - baseline) / np.sqrt(baseline * (1 - baseline)) # Cohen's h # Required sample size per group n_per_group = zt_ind_solve_power( effect_size=effect_size, alpha=0.05, power=0.80, alternative='two-sided' ) print(f"Sample size per group: {int(np.ceil(n_per_group))}") # ~1,570 per group ``` Las pruebas con potencia insuficiente desperdician recursos al ejecutar experimentos incapaces de detectar efectos realistas. ## Intervalos de Confianza: Cuantificar la Incertidumbre Un intervalo de confianza del 95% significa: si el mismo proceso de muestreo se repitiera muchas veces, el 95% de los intervalos construidos contendrían el parámetro verdadero. Los intervalos de confianza comunican la incertidumbre mejor que las estimaciones puntuales solas. Para medias con varianza poblacional conocida, el intervalo usa la distribución z. Para muestras pequeñas o varianza desconocida, se aplica la distribución t. La distribución t tiene colas más pesadas que la normal, produciendo intervalos más amplios que consideran la incertidumbre adicional. ```python # confidence_intervals.py import numpy as np from scipy import stats # Sample data: response times in milliseconds response_times = np.array([245, 312, 278, 299, 256, 334, 287, 301, 265, 289]) n = len(response_times) mean = np.mean(response_times) # 286.6 std_err = stats.sem(response_times) # Standard error of the mean # 95% confidence interval using t-distribution (df = n-1) t_critical = stats.t.ppf(0.975, df=n-1) margin_of_error = t_critical * std_err ci_lower = mean - margin_of_error ci_upper = mean + margin_of_error print(f"Mean: {mean:.1f}ms") # Mean: 286.6ms print(f"95% CI: [{ci_lower:.1f}, {ci_upper:.1f}]ms") # 95% CI: [265.4, 307.8]ms ``` Intervalos más estrechos indican estimaciones más precisas. El tamaño de la muestra determina la precisión: cuadruplicar n reduce el margen de error a la mitad. ## Bayesiano vs Frecuentista: Preguntas de Entrevista sobre Filosofía Estadística Los reclutadores a veces exploran la comprensión de paradigmas estadísticos competidores. La **estadística frecuentista** trata la probabilidad como frecuencia a largo plazo: los parámetros son fijos y los datos varían a través de experimentos repetidos. Los p-values e intervalos de confianza provienen de esta tradición. La **estadística bayesiana** trata la probabilidad como grado de creencia: el conocimiento previo se combina con los datos para producir creencias posteriores. El marco permite incorporar experiencia del dominio y produce directamente enunciados de probabilidad sobre los parámetros. Las pruebas A/B usan cada vez más métodos bayesianos porque responden la pregunta que realmente hacen las partes interesadas: «¿Cuál es la probabilidad de que el tratamiento B supere al tratamiento A?» en lugar de «¿Qué tan sorprendentes son estos datos si no hubiera diferencia?» ```python # bayesian_ab_test.py import numpy as np from scipy import stats # Prior: Beta(1, 1) = uniform prior for conversion rate # Posterior: Beta(alpha + successes, beta + failures) control_successes, control_failures = 120, 1880 treatment_successes, treatment_failures = 145, 1855 # Posterior distributions posterior_control = stats.beta(1 + control_successes, 1 + control_failures) posterior_treatment = stats.beta(1 + treatment_successes, 1 + treatment_failures) # Monte Carlo estimation: P(treatment > control) samples_control = posterior_control.rvs(100000) samples_treatment = posterior_treatment.rvs(100000) prob_treatment_better = np.mean(samples_treatment > samples_control) print(f"P(treatment > control): {prob_treatment_better:.2%}") # ~95% ``` Los resultados bayesianos comunican directamente: «Hay un 95% de probabilidad de que la tasa de conversión del tratamiento supere a la del control.» Los resultados frecuentistas requieren una interpretación más cuidadosa. ## Preguntas de Entrevista Comunes sobre Inferencia Estadística Estas preguntas aparecen frecuentemente en entrevistas de data science en empresas tecnológicas. Cada una evalúa un concepto estadístico específico. **«Explique el Teorema del Límite Central y por qué es importante.»** El TLC establece que las medias muestrales de cualquier población (con varianza finita) se aproximan a una distribución normal a medida que aumenta el tamaño de la muestra. Esto importa porque los supuestos de normalidad en las pruebas de hipótesis se mantienen para muestras grandes independientemente de la distribución subyacente. Tamaños de muestra de 30+ generalmente son suficientes. **«¿Qué es el p-hacking y cómo se previene?»** El p-hacking infla las tasas de falsos positivos al probar múltiples hipótesis hasta encontrar significancia, o al detener la recolección de datos cuando los resultados se vuelven significativos. Estrategias de prevención: pre-registrar planes de análisis, aplicar correcciones por comparaciones múltiples (Bonferroni, FDR) y establecer tamaños de muestra antes de recolectar datos. **«¿Cuándo usar una prueba t vs una prueba de Mann-Whitney U?»** La prueba t asume datos normalmente distribuidos (o muestras grandes vía TLC) y compara medias. [Mann-Whitney U](https://en.wikipedia.org/wiki/Mann%E2%80%93Whitney_U_test) es una alternativa no paramétrica que compara distribuciones sin supuestos de normalidad. Usar Mann-Whitney para muestras pequeñas con datos claramente no normales o al comparar mediciones ordinales. **«¿Cómo manejar comparaciones múltiples en pruebas A/B?»** Probar múltiples variantes infla el error Tipo I. Con 20 comparaciones a α = 0.05, la probabilidad de al menos un falso positivo supera el 60%. La corrección de Bonferroni divide α por el número de pruebas. El procedimiento de Benjamini-Hochberg controla la tasa de descubrimientos falsos mientras mantiene más potencia que Bonferroni. ## La Paradoja de Simpson: Un Tema Favorito en Entrevistas La [paradoja de Simpson](https://en.wikipedia.org/wiki/Simpson%27s_paradox) ocurre cuando las tendencias en datos agregados se revierten a nivel de subgrupos. Los reclutadores adoran este tema porque evalúa el razonamiento causal, no solo la mecánica estadística. Un ejemplo clásico: el Hospital A tiene una tasa de mortalidad general más alta que el Hospital B. Pero el Hospital A tiene menor mortalidad tanto para casos leves como severos. La paradoja surge porque el Hospital A trata más casos severos, que tienen mayor mortalidad independientemente de la calidad del hospital. ```python # simpsons_paradox.py import pandas as pd # Hospital mortality data data = { 'Hospital': ['A', 'A', 'B', 'B'], 'Severity': ['Mild', 'Severe', 'Mild', 'Severe'], 'Patients': [200, 800, 800, 200], 'Deaths': [10, 160, 48, 50] } df = pd.DataFrame(data) df['Mortality'] = df['Deaths'] / df['Patients'] # Subgroup mortality print(df[['Hospital', 'Severity', 'Mortality']]) # Hospital A: Mild 5%, Severe 20% # Hospital B: Mild 6%, Severe 25% # Aggregate mortality agg = df.groupby('Hospital').agg({'Deaths': 'sum', 'Patients': 'sum'}) agg['Mortality'] = agg['Deaths'] / agg['Patients'] print(agg['Mortality']) # Hospital A: 17%, Hospital B: 9.8% ``` La resolución requiere identificar la variable de confusión (severidad) y analizar los subgrupos por separado. El análisis agregado es engañoso cuando las proporciones de subgrupos difieren. ## Conceptos Estadísticos para Feature Engineering El conocimiento estadístico mejora directamente el feature engineering. Comprender las distribuciones guía las transformaciones; comprender las relaciones guía la creación de features. La **asimetría** (skewness) mide la asimetría de la distribución. Los datos sesgados a la derecha (ingresos, precios) se benefician de transformaciones logarítmicas que normalizan la distribución y mejoran el rendimiento del modelo. Los datos sesgados a la izquierda usan transformaciones cuadráticas o exponenciales. La **correlación** cuantifica relaciones lineales. La correlación de Pearson asume normalidad y linealidad. La correlación de Spearman maneja relaciones no lineales monotónicas. Las features altamente correlacionadas causan multicolinealidad en modelos lineales, por lo que generalmente se elimina una. Los **valores atípicos** afectan medias y desviaciones estándar de manera desproporcionada. Las estadísticas robustas (mediana, IQR) resisten la influencia de valores atípicos. Decisión: eliminar, limitar o transformar valores atípicos dependiendo de si representan errores o valores extremos genuinos. Para más información sobre la aplicación de estos conceptos a modelos de machine learning, consulte la [guía de entrevista sobre feature engineering](/blog/data-science/feature-engineering-machine-learning-techniques-interview-2026) y explore el [módulo de práctica de estadística inferencial](/technologies/data-science/interview-questions/statistics-inferential). ## Lo Que Distingue a los Candidatos Destacados en Preguntas de Estadística La competencia estadística en entrevistas de data science requiere más que definiciones de libro de texto. Los candidatos destacados demuestran estas habilidades: - **Conectar la estadística con resultados de negocio**: formular resultados de pruebas A/B en términos de impacto en ingresos o engagement de usuarios, no solo en p-values - **Conocer los supuestos**: cada prueba tiene condiciones (independencia, normalidad, varianza igual) y los candidatos deben indicar cuándo esas condiciones podrían fallar - **Cuantificar la incertidumbre**: las estimaciones puntuales sin intervalos de confianza o intervalos creíbles dejan a las partes interesadas adivinando sobre la confiabilidad - **Reconocer los límites de la causalidad**: los datos observacionales muestran correlación, y los candidatos deben articular qué diseño experimental establecería causalidad - **Elegir la prueba correcta**: hacer coincidir el tipo de datos (continuo vs categórico), tamaño de muestra y pregunta de investigación con el método estadístico apropiado - **Comunicar resultados claramente**: traducir hallazgos estadísticos en recomendaciones accionables que las partes interesadas no técnicas puedan entender y sobre las cuales actuar --- Source: SharpSkill (https://sharpskill.dev), tech interview preparation for your real stack. HTML version of this page: https://sharpskill.dev/es/blog/data-science/statistics-data-science-probability-hypothesis-testing-interview-2026