Valores atípicos: detección y tratamiento
Cómo se identifica un valor extremo, por qué 'atípico' no significa 'erróneo' y cuál es el único criterio legítimo para descartar un dato.
1 · Definición
Un valor atípico es una observación que se aparta notoriamente del resto del conjunto.
2 · Por qué importan
Porque afectan mucho a algunas medidas y nada a otras. La media, el desvío estándar, el rango y la correlación se mueven con un solo valor extremo; la mediana, el rango intercuartílico y los cuantiles, prácticamente no.
Y porque a veces son el dato más importante del conjunto: un caso de una enfermedad rara, una empresa que concentra la mitad del mercado, un mes con un salto de precios. Descartarlos por sistema es tirar la información que más explica.
3 · Los dos criterios de detección
Regla del rango intercuartílico. Es la más usada y la que dibuja el diagrama de caja:
Con un factor de 3 en lugar de 1,5 se marcan los “extremos”.
Regla del puntaje z. Se considera atípico un valor con .
Ninguno de los dos umbrales —el 1,5 y el 3— tiene fundamento teórico: son convenciones que funcionan razonablemente bien en la práctica.
4 · Un ejemplo
Con el ingreso de la ocupación principal (EPH, 1T 2026):
Por encima de ese límite hay un 5,5 % de los ocupados. Más de medio millón de personas.
Es el ejemplo perfecto de por qué la regla señala y no condena. Si se eliminaran esos casos “para limpiar la distribución”, desaparecería exactamente la desigualdad que la variable está midiendo, y el ingreso medio caería artificialmente.
Compará con la edad de los mismos ocupados: el límite superior da 78,5 años y ningún caso lo supera. Cero atípicos. Misma base, misma regla, resultados opuestos, porque una distribución tiene cola larga y la otra no.
5 · Qué hacer con uno
El orden correcto, y no hay atajos:
1 · Verificar. ¿Es un error de carga, de codificación o de unidad? Una edad de 187, un peso de 0,07 kg, un ingreso con tres ceros de más. Si se puede corregir contra el instrumento original, se corrige.
2 · Entender. Si el dato es correcto, ¿por qué es distinto? A veces revela que el caso no pertenece a la población definida —una empresa multinacional en un relevamiento de pymes— y ahí sí corresponde excluirlo, por criterio sustantivo y declarándolo.
3 · Decidir el tratamiento. Si el dato es válido y pertenece a la población, se queda. Las opciones son:
- Mantenerlo y usar medidas robustas: mediana, RIC, métodos no paramétricos.
- Transformar la variable —el logaritmo es lo habitual con ingresos— para comprimir la cola.
- Analizar con y sin él y reportar las dos versiones. Es lo más transparente cuando un solo caso cambia la conclusión.
4 · Documentar. Todo lo que se excluyó, con cuántos casos y por qué.
6 · La única regla que importa
“Estaba fuera de 1,5 · RIC” no es una justificación. “El instrumento estaba descalibrado ese día” sí lo es. “El caso no pertenece a la población definida”, también.
Eliminar valores extremos porque molestan tiene nombre en metodología, y no es limpieza de datos.
7 · Errores frecuentes
- Eliminar por regla automática. El error central. La regla detecta, la persona decide.
- No declarar las exclusiones. Si se sacaron casos, va cuántos y por qué. Un trabajo donde el del análisis no coincide con el del relevamiento y nadie lo explica es un trabajo que no se puede evaluar.
- Usar la regla del en distribuciones asimétricas. Da resultados absurdos: con el ingreso, el límite inferior queda en negativo.
- Confundir atípico con influyente. En regresión son cosas distintas: un valor puede ser extremo y no afectar el modelo, o ser moderado y cambiarlo entero.
- Buscar atípicos antes de mirar la distribución. Si la variable es asimétrica por naturaleza, la “cola de atípicos” es la forma esperable, no una anomalía.
- Winsorizar o recortar sin decirlo. Reemplazar los extremos por el percentil 5 y 95 es una técnica legítima; hacerlo en silencio, no.
- Suponer que un atípico es un error porque es grande. El ingreso máximo declarado en la EPH es de $40.000.000 y es perfectamente posible.
8 · En el software
# R — los límites y los casos
q <- quantile(datos$ingreso, c(0.25, 0.75))
lim <- q + c(-1.5, 1.5) * IQR(datos$ingreso)
which(datos$ingreso < lim[1] | datos$ingreso > lim[2])
# boxplot() los devuelve directamente
boxplot.stats(datos$ingreso)$out
# Python
q1, q3 = datos["ingreso"].quantile([0.25, 0.75])
ric = q3 - q1
mask = (datos["ingreso"] < q1 - 1.5*ric) | (datos["ingreso"] > q3 + 1.5*ric)
datos[mask]
SPSS: Explorar › Gráficos (el boxplot etiqueta cada atípico con
su número de caso, que es lo que hace falta para ir a revisarlo)
InfoStat: Gráficos › Diagrama de cajaHerramientas de este tema
- CalculadoraDescriptivos desde datos pegados
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Valores atípicos: detección y tratamiento. estadistica.ar. https://estadistica.ar/conceptos/valores-atipicos
BibTeX
@misc{estadistica_ar_valores_atipicos,
author = {Montivero, Jorge Luis},
title = {{Valores atípicos: detección y tratamiento}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/valores-atipicos}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.