Comparaciones múltiples y p-hacking
Por qué hacer muchas pruebas garantiza encontrar algo, las decisiones que inflan el error sin que nadie lo note, y cómo se corrige.
1 · El problema
Con , cada prueba tiene un 5 % de probabilidad de dar un falso positivo. Haciendo muchas, la probabilidad de que alguna lo dé se vuelve casi certeza:
| Pruebas | Probabilidad |
|---|---|
| 1 | 5 % |
| 5 | 23 % |
| 10 | 40 % |
| 20 | 64 % |
| 50 | 92 % |
| 100 | 99,4 % |
2 · Dónde aparece sin que se note
Lo grave no son las comparaciones explícitas —esas se corrigen— sino las decisiones que multiplican las pruebas de manera invisible:
- Muchas variables de resultado. Se miden 15 indicadores y se reporta el que dio.
- Muchos subgrupos. “No dio en general, pero sí en mujeres de más de 50”.
- Varias formas de medir lo mismo. Puntaje total, subescalas, dicotomizado.
- Varios momentos de medición.
- Distintos criterios de exclusión. Sacar atípicos, o no.
- Distintos modelos. Con y sin covariables, hasta que una dé.
- Parar de recolectar cuando el resultado se vuelve significativo.
- Elegir unilateral después de ver que bilateral no daba.
3 · P-hacking
Es explorar variantes del análisis hasta que el resultado cruce el umbral. Rara vez es deliberado: lo habitual es una cadena de decisiones razonables, cada una tomada mirando el resultado.
La evidencia de que ocurre es estadística: en la literatura publicada hay un exceso de valores p apenas por debajo de 0,05, un escalón que ninguna distribución real produciría.
4 · Las correcciones
Controlar la tasa de error por familia (FWER): la probabilidad de al menos un falso positivo.
| Método | Cómo |
|---|---|
| Bonferroni | umbral |
| Holm | secuencial; misma garantía y más potencia |
| Tukey | específico para todos los pares de un ANOVA |
Controlar la tasa de falsos descubrimientos (FDR): la proporción esperada de falsos positivos entre los rechazados.
| Método | Cómo |
|---|---|
| Benjamini-Hochberg | secuencial, mucho menos exigente |
5 · Lo que no es corregible
Corregir sirve cuando las pruebas están declaradas. No hay corrección posible para las pruebas que no se cuentan. Si se hicieron cuarenta análisis y se reportan tres, ninguna fórmula arregla eso.
Por eso las soluciones reales son de procedimiento:
| Práctica | Qué resuelve |
|---|---|
| Preregistro | fija las hipótesis y el análisis antes de ver los datos |
| Plan de análisis | define resultado primario y secundarios |
| Distinguir confirmatorio de exploratorio | los hallazgos exploratorios se declaran como tales |
| Reportar todo | incluidas las pruebas que no dieron |
| Replicación | la prueba definitiva |
6 · Cuándo no corregir
No siempre corresponde:
- Cuando las pruebas responden preguntas independientes y cada una se interpreta por separado.
- Cuando hay una sola hipótesis primaria declarada de antemano y el resto son secundarias, así etiquetadas.
- En análisis declaradamente exploratorios, donde corregir a Bonferroni eliminaría todo.
Corregir siempre y por todo también tiene un costo: potencia. La decisión se declara y se justifica.
7 · Errores frecuentes
- No corregir con muchas comparaciones.
- Reportar solo lo significativo.
- Buscar subgrupos hasta encontrar un efecto.
- Parar la recolección al alcanzar significación.
- Presentar un hallazgo exploratorio como si fuera confirmatorio.
- Corregir dos veces por error, combinando métodos.
- Aplicar Bonferroni a cientos de pruebas, donde corresponde FDR.
- Creer que el problema se arregla con la corrección, cuando la mayoría de las pruebas no se declaró.
8 · En el software
# R — ajustar un vector de valores p
p <- c(0.001, 0.013, 0.021, 0.032, 0.048, 0.31)
p.adjust(p, method = "bonferroni")
p.adjust(p, method = "holm") # el recomendado para FWER
p.adjust(p, method = "BH") # Benjamini-Hochberg, para FDR
# Cuántos sobreviven a cada criterio
sum(p.adjust(p, "holm") < 0.05)
sum(p.adjust(p, "BH") < 0.05)
# Python
from statsmodels.stats.multitest import multipletests
multipletests(p, alpha=0.05, method='holm')
multipletests(p, alpha=0.05, method='fdr_bh')Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Comparaciones múltiples y p-hacking. estadistica.ar. https://estadistica.ar/conceptos/comparaciones-multiples-y-p-hacking
BibTeX
@misc{estadistica_ar_comparaciones_multiples_y_p_hacking,
author = {Montivero, Jorge Luis},
title = {{Comparaciones múltiples y p-hacking}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/comparaciones-multiples-y-p-hacking}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.