Ir al contenido
σestadistica.ar
M02 · DescriptivaTroncalInterpretación

Valores atípicos: detección y tratamiento

Cómo se identifica un valor extremo, por qué 'atípico' no significa 'erróneo' y cuál es el único criterio legítimo para descartar un dato.

1 · Definición

Un valor atípico es una observación que se aparta notoriamente del resto del conjunto.

2 · Por qué importan

Porque afectan mucho a algunas medidas y nada a otras. La media, el desvío estándar, el rango y la correlación se mueven con un solo valor extremo; la mediana, el rango intercuartílico y los cuantiles, prácticamente no.

Y porque a veces son el dato más importante del conjunto: un caso de una enfermedad rara, una empresa que concentra la mitad del mercado, un mes con un salto de precios. Descartarlos por sistema es tirar la información que más explica.

3 · Los dos criterios de detección

Regla del rango intercuartílico. Es la más usada y la que dibuja el diagrama de caja:

x<Q11,5RICox>Q3+1,5RICx < Q_1 - 1{,}5 \cdot \mathrm{RIC} \qquad\text{o}\qquad x > Q_3 + 1{,}5 \cdot \mathrm{RIC}

Con un factor de 3 en lugar de 1,5 se marcan los “extremos”.

Regla del puntaje z. Se considera atípico un valor con z>3|z| > 3.

Ninguno de los dos umbrales —el 1,5 y el 3— tiene fundamento teórico: son convenciones que funcionan razonablemente bien en la práctica.

4 · Un ejemplo

Con el ingreso de la ocupación principal (EPH, 1T 2026):

Q3+1,5RIC=1.400.000+1,5×900.000=2.750.000Q_3 + 1{,}5 \cdot \mathrm{RIC} = 1.400.000 + 1{,}5 \times 900.000 = 2.750.000

Por encima de ese límite hay un 5,5 % de los ocupados. Más de medio millón de personas.

Es el ejemplo perfecto de por qué la regla señala y no condena. Si se eliminaran esos casos “para limpiar la distribución”, desaparecería exactamente la desigualdad que la variable está midiendo, y el ingreso medio caería artificialmente.

Compará con la edad de los mismos ocupados: el límite superior da 78,5 años y ningún caso lo supera. Cero atípicos. Misma base, misma regla, resultados opuestos, porque una distribución tiene cola larga y la otra no.

5 · Qué hacer con uno

El orden correcto, y no hay atajos:

1 · Verificar. ¿Es un error de carga, de codificación o de unidad? Una edad de 187, un peso de 0,07 kg, un ingreso con tres ceros de más. Si se puede corregir contra el instrumento original, se corrige.

2 · Entender. Si el dato es correcto, ¿por qué es distinto? A veces revela que el caso no pertenece a la población definida —una empresa multinacional en un relevamiento de pymes— y ahí sí corresponde excluirlo, por criterio sustantivo y declarándolo.

3 · Decidir el tratamiento. Si el dato es válido y pertenece a la población, se queda. Las opciones son:

  • Mantenerlo y usar medidas robustas: mediana, RIC, métodos no paramétricos.
  • Transformar la variable —el logaritmo es lo habitual con ingresos— para comprimir la cola.
  • Analizar con y sin él y reportar las dos versiones. Es lo más transparente cuando un solo caso cambia la conclusión.

4 · Documentar. Todo lo que se excluyó, con cuántos casos y por qué.

6 · La única regla que importa

“Estaba fuera de 1,5 · RIC” no es una justificación. “El instrumento estaba descalibrado ese día” sí lo es. “El caso no pertenece a la población definida”, también.

Eliminar valores extremos porque molestan tiene nombre en metodología, y no es limpieza de datos.

7 · Errores frecuentes

  • Eliminar por regla automática. El error central. La regla detecta, la persona decide.
  • No declarar las exclusiones. Si se sacaron casos, va cuántos y por qué. Un trabajo donde el nn del análisis no coincide con el del relevamiento y nadie lo explica es un trabajo que no se puede evaluar.
  • Usar la regla del zz en distribuciones asimétricas. Da resultados absurdos: con el ingreso, el límite inferior queda en negativo.
  • Confundir atípico con influyente. En regresión son cosas distintas: un valor puede ser extremo y no afectar el modelo, o ser moderado y cambiarlo entero.
  • Buscar atípicos antes de mirar la distribución. Si la variable es asimétrica por naturaleza, la “cola de atípicos” es la forma esperable, no una anomalía.
  • Winsorizar o recortar sin decirlo. Reemplazar los extremos por el percentil 5 y 95 es una técnica legítima; hacerlo en silencio, no.
  • Suponer que un atípico es un error porque es grande. El ingreso máximo declarado en la EPH es de $40.000.000 y es perfectamente posible.

8 · En el software

# R — los límites y los casos
q <- quantile(datos$ingreso, c(0.25, 0.75))
lim <- q + c(-1.5, 1.5) * IQR(datos$ingreso)
which(datos$ingreso < lim[1] | datos$ingreso > lim[2])

# boxplot() los devuelve directamente
boxplot.stats(datos$ingreso)$out
# Python
q1, q3 = datos["ingreso"].quantile([0.25, 0.75])
ric = q3 - q1
mask = (datos["ingreso"] < q1 - 1.5*ric) | (datos["ingreso"] > q3 + 1.5*ric)
datos[mask]
SPSS:     Explorar › Gráficos  (el boxplot etiqueta cada atípico con
          su número de caso, que es lo que hace falta para ir a revisarlo)
InfoStat: Gráficos › Diagrama de caja

Herramientas de este tema

Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Valores atípicos: detección y tratamiento. estadistica.ar. https://estadistica.ar/conceptos/valores-atipicos

BibTeX

@misc{estadistica_ar_valores_atipicos,
  author       = {Montivero, Jorge Luis},
  title        = {{Valores atípicos: detección y tratamiento}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/valores-atipicos}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.