Ir al contenido
σestadistica.ar
M10 · HipótesisTroncalInterpretación

Comparaciones múltiples y p-hacking

Por qué hacer muchas pruebas garantiza encontrar algo, las decisiones que inflan el error sin que nadie lo note, y cómo se corrige.

1 · El problema

Con α=0,05\alpha = 0{,}05, cada prueba tiene un 5 % de probabilidad de dar un falso positivo. Haciendo muchas, la probabilidad de que alguna lo dé se vuelve casi certeza:

P(al menos un falso positivo)=1(1α)mP(\text{al menos un falso positivo}) = 1 - (1-\alpha)^{m}
PruebasProbabilidad
15 %
523 %
1040 %
2064 %
5092 %
10099,4 %

2 · Dónde aparece sin que se note

Lo grave no son las comparaciones explícitas —esas se corrigen— sino las decisiones que multiplican las pruebas de manera invisible:

  • Muchas variables de resultado. Se miden 15 indicadores y se reporta el que dio.
  • Muchos subgrupos. “No dio en general, pero sí en mujeres de más de 50”.
  • Varias formas de medir lo mismo. Puntaje total, subescalas, dicotomizado.
  • Varios momentos de medición.
  • Distintos criterios de exclusión. Sacar atípicos, o no.
  • Distintos modelos. Con y sin covariables, hasta que una dé.
  • Parar de recolectar cuando el resultado se vuelve significativo.
  • Elegir unilateral después de ver que bilateral no daba.

3 · P-hacking

Es explorar variantes del análisis hasta que el resultado cruce el umbral. Rara vez es deliberado: lo habitual es una cadena de decisiones razonables, cada una tomada mirando el resultado.

La evidencia de que ocurre es estadística: en la literatura publicada hay un exceso de valores p apenas por debajo de 0,05, un escalón que ninguna distribución real produciría.

4 · Las correcciones

Controlar la tasa de error por familia (FWER): la probabilidad de al menos un falso positivo.

MétodoCómo
Bonferroniumbral α/m\alpha/m
Holmsecuencial; misma garantía y más potencia
Tukeyespecífico para todos los pares de un ANOVA

Controlar la tasa de falsos descubrimientos (FDR): la proporción esperada de falsos positivos entre los rechazados.

MétodoCómo
Benjamini-Hochbergsecuencial, mucho menos exigente

5 · Lo que no es corregible

Corregir sirve cuando las pruebas están declaradas. No hay corrección posible para las pruebas que no se cuentan. Si se hicieron cuarenta análisis y se reportan tres, ninguna fórmula arregla eso.

Por eso las soluciones reales son de procedimiento:

PrácticaQué resuelve
Preregistrofija las hipótesis y el análisis antes de ver los datos
Plan de análisisdefine resultado primario y secundarios
Distinguir confirmatorio de exploratoriolos hallazgos exploratorios se declaran como tales
Reportar todoincluidas las pruebas que no dieron
Replicaciónla prueba definitiva

6 · Cuándo no corregir

No siempre corresponde:

  • Cuando las pruebas responden preguntas independientes y cada una se interpreta por separado.
  • Cuando hay una sola hipótesis primaria declarada de antemano y el resto son secundarias, así etiquetadas.
  • En análisis declaradamente exploratorios, donde corregir a Bonferroni eliminaría todo.

Corregir siempre y por todo también tiene un costo: potencia. La decisión se declara y se justifica.

7 · Errores frecuentes

  • No corregir con muchas comparaciones.
  • Reportar solo lo significativo.
  • Buscar subgrupos hasta encontrar un efecto.
  • Parar la recolección al alcanzar significación.
  • Presentar un hallazgo exploratorio como si fuera confirmatorio.
  • Corregir dos veces por error, combinando métodos.
  • Aplicar Bonferroni a cientos de pruebas, donde corresponde FDR.
  • Creer que el problema se arregla con la corrección, cuando la mayoría de las pruebas no se declaró.

8 · En el software

# R — ajustar un vector de valores p
p <- c(0.001, 0.013, 0.021, 0.032, 0.048, 0.31)

p.adjust(p, method = "bonferroni")
p.adjust(p, method = "holm")        # el recomendado para FWER
p.adjust(p, method = "BH")          # Benjamini-Hochberg, para FDR

# Cuántos sobreviven a cada criterio
sum(p.adjust(p, "holm") < 0.05)
sum(p.adjust(p, "BH")   < 0.05)
# Python
from statsmodels.stats.multitest import multipletests
multipletests(p, alpha=0.05, method='holm')
multipletests(p, alpha=0.05, method='fdr_bh')
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Comparaciones múltiples y p-hacking. estadistica.ar. https://estadistica.ar/conceptos/comparaciones-multiples-y-p-hacking

BibTeX

@misc{estadistica_ar_comparaciones_multiples_y_p_hacking,
  author       = {Montivero, Jorge Luis},
  title        = {{Comparaciones múltiples y p-hacking}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/comparaciones-multiples-y-p-hacking}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.