Ir al contenido
σestadistica.ar

Caso con datos reales

Cuánto se equivocan los errores estándar de este sitio

El efecto de diseño real de la EPH, calculado por bootstrap de conglomerados: los intervalos de las fórmulas simples son la mitad de anchos de lo que deberían.

La advertencia que este caso cuantifica

Todas las entradas de este sitio que usan la EPH llevan la misma nota al pie: los cálculos suponen muestreo aleatorio simple, cuando en realidad la EPH es una encuesta por conglomerados, y por lo tanto los errores estándar están subestimados.

El método

Se compara, para cinco indicadores:

  • El error estándar de la fórmula simple, s/ns/\sqrt{n}.
  • El error estándar por bootstrap de conglomerados: 2.000 remuestras en las que se sortean viviendas completas con reposición, no personas sueltas.

El cociente de sus varianzas es el efecto de diseño.

Los resultados

IndicadorEE simpleEE con diseñoRazóndeff
Ingreso medio$8.076$17.9952,234,96
Proporción de menores de 150,00180,00392,134,54
Proporción con secundario+0,00260,00521,993,97
Edad media0,10610,22352,114,44
Tasa de desocupación0,00170,00321,853,42

El tamaño de muestra efectivo

nefectivo=ndeffn_{\text{efectivo}} = \frac{n}{\text{deff}}
Indicadornnnn efectivo
Ingreso medio15.4483.112
Menores de 1543.4539.575
Desocupación20.9886.138
Edad media43.4539.797

Por qué pasa: dos efectos, no uno

La conglomeración. Las personas de una misma vivienda se parecen entre sí: comparten ingreso, educación, barrio y edad en buena medida. Entrevistar a dos personas del mismo hogar aporta menos información que entrevistar a dos hogares distintos.

deffconglomeracioˊn1+(m1)ρ\text{deff}_{\text{conglomeración}} \approx 1 + (m - 1)\,\rho

La ponderación desigual. Y acá está la otra mitad del asunto: el error estándar simple se calcula sin ponderar, mientras que el bootstrap replica la estimación ponderada. Cuando los ponderadores varían mucho entre casos, eso agrega variabilidad por sí solo.

Qué cambia en la práctica

Un ejemplo con el ingreso medio:

IC 95 %
Fórmula simple$1.079.332 a $1.110.992
Con diseño complejo$1.059.893 a $1.130.431

Qué hacer con esto

Para aprender el procedimiento, las fórmulas simples están bien y son las que usa todo el sitio: lo que se enseña es cómo se construye un intervalo, no cuál es el intervalo exacto del ingreso argentino.

Para publicar, hay que usar métodos de diseño complejo: el paquete survey de R o samplics en Python, declarando estrato, conglomerado y ponderador.

Reproducirlo

# R — el camino correcto para publicar
library(survey)
dis <- svydesign(ids = ~CODUSU, strata = ~AGLOMERADO,
                 weights = ~PONDERA, data = eph, nest = TRUE)

svymean(~P21, dis, na.rm = TRUE)
confint(svymean(~P21, dis, na.rm = TRUE))
svyby(~P21, ~AGLOMERADO, dis, svymean, na.rm = TRUE)

# El efecto de diseño, directamente
svymean(~P21, dis, na.rm = TRUE, deff = TRUE)
# Python — bootstrap de conglomerados, que es lo que hace este caso
viviendas = d.CODUSU.unique()
reps = []
for _ in range(2000):
    elegidas = rng.choice(viviendas, len(viviendas), replace=True)
    m = d[d.CODUSU.isin(elegidas)]     # versión simplificada
    reps.append((m.P21 * m.PONDERA).sum() / m.PONDERA.sum())
np.std(reps, ddof=1)

El script completo es datos/eph/preparar-diseno-complejo-m17.py, con semilla 2026 y 2.000 remuestras.