Caso con datos reales
El ingreso de los ocupados, según la EPH
Un solo conjunto de datos reales para entender por qué la media y la mediana no coinciden, qué es la asimetría y cuándo un valor alto es un dato y no un error.
La pregunta
¿Cuánto gana un trabajador argentino?
Parece una pregunta con una sola respuesta numérica. No la tiene, y entender por qué es la mitad de la estadística descriptiva.
Los datos
Encuesta Permanente de Hogares del INDEC, base usuario del 1º trimestre de 2026, total de los 31 aglomerados urbanos que releva la encuesta.
El universo son las personas ocupadas que declararon un ingreso por su ocupación principal: 15.448 casos en la muestra, que representan a 13.127.975 personas.
Cómo se reparte el ingreso
La forma dice casi todo. No es una campana simétrica: hay un amontonamiento a la izquierda y una cola larga a la derecha. Eso es una distribución asimétrica a la derecha, y es la forma habitual de cualquier variable de ingreso, en cualquier país y en cualquier época.
Media y mediana no coinciden
| Medida | Valor |
|---|---|
| Media | $1.104.227 |
| Mediana | $900.000 |
| Razón entre ambas | 1,23 |
La media es un 23 % más alta que la mediana. Y de ahí sale el dato que conviene tener siempre a mano:
No es una paradoja ni un error de cálculo. La media suma todos los ingresos y los reparte en partes iguales, así que un puñado de ingresos muy altos la empuja hacia arriba sin mover a nadie de lugar. La mediana, en cambio, parte a la población al medio: la mitad gana menos de $900.000 y la mitad gana más.
Por eso, cuando la distribución es asimétrica, la mediana describe mejor “el caso típico”. Y por eso el INDEC informa la mediana del ingreso, no el promedio, cuando quiere describir a la persona de en medio.
Los deciles
| Decil | Hasta |
|---|---|
| D1 | $240.000 |
| D2 | $400.000 |
| D3 | $600.000 |
| D4 | $750.000 |
| D5 (mediana) | $900.000 |
| D6 | $1.000.000 |
| D7 | $1.200.000 |
| D8 | $1.500.000 |
| D9 | $2.000.000 |
El 10 % que menos gana no llega a $240.000. El 10 % que más gana arranca en $2.000.000 y se queda con el 36,8 % de la masa total de ingresos.
Cuánto varían
| Medida | Valor |
|---|---|
| Desvío estándar | $1.063.114 |
| Coeficiente de variación | 0,96 |
| Rango intercuartílico (RIC) | $900.000 |
| Asimetría | +5,46 |
El coeficiente de variación de 0,96 significa que el desvío estándar es casi tan grande como la media: una dispersión enorme. El coeficiente de asimetría positivo y grande confirma numéricamente lo que se ve en el gráfico.
Fijate que el desvío estándar ($1.063.114) es más grande que la mediana ($900.000). Cuando eso pasa, informar “media ± desvío” es directamente engañoso: sugiere que hay gente con ingreso negativo. En distribuciones así se informa mediana y rango intercuartílico, no media y desvío.
Atípicos, o simplemente la cola
La regla habitual del diagrama de caja marca como atípico todo lo que supere , que acá da $2.750.000. Por encima de ese límite hay un 5,5 % de los ocupados.
Es la lección más importante del caso. “Atípico” es una categoría estadística, no un veredicto sobre la calidad del dato. Borrar esos casos para que la distribución quede más linda es falsificar el resultado: haría desaparecer justamente la desigualdad que la variable está midiendo.
Un valor se descarta cuando hay motivo sustantivo para creer que está mal — un ingreso de $40.000.000 merece que uno lo mire de cerca—, nunca porque una fórmula lo señaló.
Cómo se informa
Entre los ocupados de los 31 aglomerados urbanos relevados por la EPH, el ingreso mediano de la ocupación principal fue de $900.000 en el primer trimestre de 2026 (RIC: $500.000 – $1.400.000; n = 15.448). La distribución resultó marcadamente asimétrica a la derecha (asimetría = 5,46), con una media de $1.104.227, superior a la mediana en un 23 %: el 65,5 % de los ocupados percibió ingresos por debajo del promedio.
Tres cosas que no pueden faltar: la medida de posición acompañada de una de dispersión, el y el universo al que se refiere.
Rehacer las cuentas
El extracto reducido está en el panel de la derecha. Tiene una fila por persona
y las columnas ingreso_ocup_principal y ponderador, que son las que
importan.
# R
library(dplyr)
d <- read.csv("ingresos-eph.csv")
# Sin ponderar da distinto — y da mal
mean(d$ingreso_ocup_principal)
# Con ponderadores
weighted.mean(d$ingreso_ocup_principal, d$ponderador)
# Mediana y cuartiles ponderados
library(Hmisc)
wtd.quantile(d$ingreso_ocup_principal, d$ponderador, probs = c(.25, .5, .75))
# Python
import numpy as np
import pandas as pd
d = pd.read_csv("ingresos-eph.csv")
x = d["ingreso_ocup_principal"].to_numpy(float)
w = d["ponderador"].to_numpy(float)
media = (w * x).sum() / w.sum()
def cuantil_ponderado(x, w, q):
o = np.argsort(x)
xs, ws = x[o], w[o]
p = (np.cumsum(ws) - 0.5 * ws) / ws.sum()
return np.interp(q, p, xs)
cuantil_ponderado(x, w, [0.25, 0.50, 0.75])
Ficha técnica
| Fuente | INDEC, Encuesta Permanente de Hogares, base usuario |
| Período | 1º trimestre de 2026 |
| Cobertura | 31 aglomerados urbanos |
| Universo | Ocupados con ingreso declarado de la ocupación principal |
| Variable | P21 — ingreso de la ocupación principal |
| Ponderador | PONDIIO |
| Casos | 15.448 (muestra) · 13.127.975 (población representada) |
| Procesamiento | Cálculo propio. El script que genera este caso está en datos/eph/ |
Los datos originales son de acceso público y se descargan del sitio del INDEC. El extracto publicado acá conserva solo las variables usadas en este caso.