Ir al contenido
σestadistica.ar

Caso con datos reales

Educación y empleo registrado: una tabla para toda la probabilidad

Una sola tabla de dos por dos con datos reales de la EPH alcanza para ver probabilidad conjunta, condicional, independencia, Bayes y valor predictivo.

La tabla

Todo el módulo de probabilidad se puede recorrer con una sola tabla. Esta sale de la EPH del primer trimestre de 2026, sobre los asalariados de 18 años o más que declararon si les descuentan jubilación: 13.864 casos en la muestra, que representan a 9.613.294 personas.

Dos variables, dos categorías cada una:

  • XX — nivel educativo: hasta secundario incompleto o secundario completo o más.
  • YY — condición del empleo: no registrado (sin descuento jubilatorio) o registrado.

Personas, en miles:

No registradoRegistradoTotal
Hasta secundario incompleto1.4361.0012.437
Secundario completo o más2.1834.9947.177
Total3.6195.9959.613

Probabilidades, que es la misma tabla dividida por el total:

Y=0Y=0 no reg.Y=1Y=1 reg.Marginal
X=1X=1 hasta sec. incompleto0,14940,10420,2535
X=2X=2 secundario completo+0,22710,51940,7465
Marginal0,37640,62361,0000

Qué se lee en cada casilla

Probabilidad conjunta. Elegida una persona al azar, la probabilidad de que tenga a la vez secundario incompleto y empleo no registrado es 0,1494. Son las celdas del interior.

Probabilidad marginal. La probabilidad de que no esté registrada, sin importar su educación, es 0,3764. Son los bordes.

Probabilidad condicional. Acá aparece lo que la tabla tiene para decir:

P(registradosecundario completo)=0,51940,7465=0,6958P(\text{registrado} \mid \text{secundario completo}) = \frac{0{,}5194}{0{,}7465} = 0{,}6958 P(registradosec. incompleto)=0,10420,2535=0,4109P(\text{registrado} \mid \text{sec. incompleto}) = \frac{0{,}1042}{0{,}2535} = 0{,}4109

Casi 70 % contra 41 %. Condicionar por el nivel educativo cambia la probabilidad en 29 puntos porcentuales.

Por qué no son independientes

Si la educación y la registración fueran independientes, cada celda sería el producto de sus marginales. Para la primera:

0,2535×0,3764=0,09540{,}2535 \times 0{,}3764 = 0{,}0954

y la celda observada vale 0,1494, un 57 % más. Hay más personas con secundario incompleto y empleo no registrado de las que habría si las dos cosas no tuvieran relación.

Dar vuelta el condicionamiento

Las condicionales en el otro sentido responden otra pregunta:

P(sec. incompletono registrado)=0,14940,3764=0,3968P(\text{sec. incompleto} \mid \text{no registrado}) = \frac{0{,}1494}{0{,}3764} = 0{,}3968 P(no registradosec. incompleto)=0,14940,2535=0,5891P(\text{no registrado} \mid \text{sec. incompleto}) = \frac{0{,}1494}{0{,}2535} = 0{,}5891

Los dos números salen de la misma celda y no son iguales: 40 % contra 59 %. El primero describe la composición educativa de los no registrados; el segundo, el riesgo de no estar registrado entre quienes no terminaron el secundario. Confundir uno con otro es el error que el teorema de Bayes viene a corregir.

La misma tabla como prueba diagnóstica

Si se usara “no haber terminado el secundario” como señal para detectar quién tiene un empleo no registrado, la tabla daría:

IndicadorValorQué significa
Prevalencia0,3764Proporción de no registrados
Sensibilidad0,3968De los no registrados, cuántos detecta la señal
Especificidad0,8330De los registrados, cuántos descarta bien
Valor predictivo positivo0,5891Dada la señal, probabilidad de no registrado
Valor predictivo negativo0,6958Sin la señal, probabilidad de registrado

La señal tiene especificidad alta y sensibilidad baja: casi todos los que terminaron el secundario quedan bien clasificados, pero se le escapan seis de cada diez trabajadores no registrados. Es un mal detector, y la tabla lo muestra sin necesidad de ninguna prueba estadística.

Reproducirlo

# R
library(dplyr)
d <- eph |>
  filter(ESTADO == 1, CAT_OCUP == 3, CH06 >= 18, PP07H %in% c(1, 2)) |>
  mutate(sec = NIVEL_ED %in% 4:6, reg = PP07H == 1)

# Tabla conjunta ponderada
tab <- xtabs(PONDERA ~ sec + reg, data = d)
prop.table(tab)            # conjunta
prop.table(tab, 1)         # condicional por nivel educativo
# Python
import pandas as pd
tab = pd.crosstab(d.sec, d.reg, values=d.PONDERA, aggfunc="sum")
tab / tab.values.sum()                    # conjunta
tab.div(tab.sum(axis=1), axis=0)          # condicional

El script completo es datos/eph/preparar-probabilidad-m06.py y escribe datos/eph/probabilidad-m06.json con todos los valores citados acá.