Caso con datos reales
Cuánto se equivocan los errores estándar de este sitio
El efecto de diseño real de la EPH, calculado por bootstrap de conglomerados: los intervalos de las fórmulas simples son la mitad de anchos de lo que deberían.
La advertencia que este caso cuantifica
Todas las entradas de este sitio que usan la EPH llevan la misma nota al pie: los cálculos suponen muestreo aleatorio simple, cuando en realidad la EPH es una encuesta por conglomerados, y por lo tanto los errores estándar están subestimados.
El método
Se compara, para cinco indicadores:
- El error estándar de la fórmula simple, .
- El error estándar por bootstrap de conglomerados: 2.000 remuestras en las que se sortean viviendas completas con reposición, no personas sueltas.
El cociente de sus varianzas es el efecto de diseño.
Los resultados
| Indicador | EE simple | EE con diseño | Razón | deff |
|---|---|---|---|---|
| Ingreso medio | $8.076 | $17.995 | 2,23 | 4,96 |
| Proporción de menores de 15 | 0,0018 | 0,0039 | 2,13 | 4,54 |
| Proporción con secundario+ | 0,0026 | 0,0052 | 1,99 | 3,97 |
| Edad media | 0,1061 | 0,2235 | 2,11 | 4,44 |
| Tasa de desocupación | 0,0017 | 0,0032 | 1,85 | 3,42 |
El tamaño de muestra efectivo
| Indicador | efectivo | |
|---|---|---|
| Ingreso medio | 15.448 | 3.112 |
| Menores de 15 | 43.453 | 9.575 |
| Desocupación | 20.988 | 6.138 |
| Edad media | 43.453 | 9.797 |
Por qué pasa: dos efectos, no uno
La conglomeración. Las personas de una misma vivienda se parecen entre sí: comparten ingreso, educación, barrio y edad en buena medida. Entrevistar a dos personas del mismo hogar aporta menos información que entrevistar a dos hogares distintos.
La ponderación desigual. Y acá está la otra mitad del asunto: el error estándar simple se calcula sin ponderar, mientras que el bootstrap replica la estimación ponderada. Cuando los ponderadores varían mucho entre casos, eso agrega variabilidad por sí solo.
Qué cambia en la práctica
Un ejemplo con el ingreso medio:
| IC 95 % | |
|---|---|
| Fórmula simple | $1.079.332 a $1.110.992 |
| Con diseño complejo | $1.059.893 a $1.130.431 |
Qué hacer con esto
Para aprender el procedimiento, las fórmulas simples están bien y son las que usa todo el sitio: lo que se enseña es cómo se construye un intervalo, no cuál es el intervalo exacto del ingreso argentino.
Para publicar, hay que usar métodos de diseño complejo: el paquete survey de
R o samplics en Python, declarando estrato, conglomerado y ponderador.
Reproducirlo
# R — el camino correcto para publicar
library(survey)
dis <- svydesign(ids = ~CODUSU, strata = ~AGLOMERADO,
weights = ~PONDERA, data = eph, nest = TRUE)
svymean(~P21, dis, na.rm = TRUE)
confint(svymean(~P21, dis, na.rm = TRUE))
svyby(~P21, ~AGLOMERADO, dis, svymean, na.rm = TRUE)
# El efecto de diseño, directamente
svymean(~P21, dis, na.rm = TRUE, deff = TRUE)
# Python — bootstrap de conglomerados, que es lo que hace este caso
viviendas = d.CODUSU.unique()
reps = []
for _ in range(2000):
elegidas = rng.choice(viviendas, len(viviendas), replace=True)
m = d[d.CODUSU.isin(elegidas)] # versión simplificada
reps.append((m.P21 * m.PONDERA).sum() / m.PONDERA.sum())
np.std(reps, ddof=1)
El script completo es datos/eph/preparar-diseno-complejo-m17.py, con semilla
2026 y 2.000 remuestras.