Ir al contenido
σestadistica.ar
M16 · CómputoIntermedioInterpretación

Datos faltantes: qué hacer

Los tres tipos de faltante, por qué importa distinguirlos y cuáles son las opciones reales de tratamiento, incluida la de no hacer nada.

1 · Definición

Un dato faltante es una celda sin valor. Pero no todas las celdas vacías significan lo mismo, y esa distinción es lo primero.

TipoQué pasóCómo se trata
No correspondeLa pregunta no se le hacía a ese casoNo es un faltante: es correcto que esté vacío
No respondióSe le preguntó y no contestóEs el faltante genuino
No se cargóError de procesamientoSe recupera del original

2 · Por qué importa el mecanismo

Porque lo que determina el riesgo no es cuántos faltan, sino quiénes.

Si los faltantes son aleatorios, se pierde precisión pero no se distorsiona nada. Si faltan sistemáticamente los casos de un cierto tipo —los de ingresos altos, los de la localidad más lejana, los que están peor— entonces hay sesgo, y ninguna cantidad de casos restantes lo corrige.

La literatura distingue tres mecanismos:

MCAR (completamente al azar). La ausencia no depende de nada. Es el caso benigno y el más raro.

MAR (al azar condicional). La ausencia depende de variables observadas: por ejemplo, los más jóvenes responden menos, pero dentro de cada grupo de edad la ausencia es aleatoria. Se puede corregir con métodos que usen la edad.

MNAR (no al azar). La ausencia depende del valor que falta: los que ganan más no declaran su ingreso. Es el caso grave, no se puede corregir con los datos disponibles, y solo se puede declarar.

3 · Un ejemplo

En la EPH, P21 == -9 indica que la persona no respondió cuánto gana. En el primer trimestre de 2026 son 3.726 casos de 19.573 ocupados: casi el 19 %.

¿Es aleatorio? Casi con seguridad no: la literatura muestra que la no respuesta de ingresos se concentra en los extremos, sobre todo en los altos. Es un caso de MNAR de manual.

Lo que hace el INDEC es interesante: esos casos vienen con ponderador cero en PONDIIO, y el peso que les correspondía se redistribuye entre quienes sí respondieron dentro de grupos similares. No es magia —si la no respuesta es MNAR, el ajuste no la corrige del todo— pero es mucho mejor que las dos alternativas obvias: descartarlos sin más o tratarlos como ingreso cero.

4 · Las opciones de tratamiento

Análisis de casos completos. Se descartan los casos con algún faltante. Es lo que hace el software por defecto. Es válido si los faltantes son pocos y aleatorios; si son muchos, se pierde una parte importante de la muestra y puede introducir sesgo.

Análisis por pares. Cada cálculo usa los casos que tienen las variables que ese cálculo necesita. Aprovecha más información, pero produce análisis con distinto nn, lo que hace difícil comparar resultados entre sí.

Imputación simple. Se reemplaza el faltante por un valor: la media, la mediana, el valor del caso más parecido. Es fácil y tiene un problema serio: subestima la variabilidad, porque agrega casos artificialmente idénticos al centro. Los intervalos de confianza salen más angostos de lo que corresponde.

Imputación múltiple. Se generan varias versiones completas de la base, cada una con valores imputados distintos, se analiza cada una y se combinan los resultados. Es lo correcto desde el punto de vista teórico y lo que usan los organismos estadísticos. Requiere más trabajo y más conocimiento.

Ponderación. Se reasigna el peso de los que no respondieron entre los que sí, dentro de grupos parecidos. Es lo que hace la EPH.

5 · Qué hacer en la práctica

Para un trabajo de tesis, tres pasos honestos valen más que una técnica sofisticada mal aplicada:

  1. Contar y declarar. Cuántos faltantes tiene cada variable, en número y en porcentaje.
  2. Comparar. ¿Los casos con faltante se parecen a los completos en las variables que sí están? Si difieren en edad, sexo o nivel educativo, hay indicio de sesgo y hay que decirlo.
  3. Elegir y justificar. Con pocos faltantes, casos completos y listo. Con muchos, evaluar imputación y explicar el criterio.

6 · Errores frecuentes

  • Tratar el faltante como cero. El peor error del tema.
  • No distinguir “no corresponde” de “no respondió”. Si ingreso está vacío para los inactivos, eso no es no respuesta: es que la pregunta no les correspondía.
  • No declarar cuántos faltantes hubo. El lector no puede evaluar el riesgo.
  • Imputar con la media sin decirlo. Reduce artificialmente la dispersión y angosta los intervalos de confianza.
  • Dejar que el software los descarte en silencio. pandas ignora los NaN sin avisar; R devuelve NA y obliga a decidir. El segundo comportamiento es más seguro.
  • Usar códigos numéricos sin declararlos como faltantes. Si “no sabe” es 99 y no se lo declara, el 99 entra en los promedios como si fuera una edad.
  • Suponer que los faltantes son aleatorios porque son pocos. Pocos y sesgados sigue siendo sesgado.

7 · En el software

# R — cuántos y dónde
colSums(is.na(datos))
datos[!complete.cases(datos), ]

# ¿Los que faltan se parecen a los que están?
datos |>
  mutate(falta = is.na(ingreso)) |>
  group_by(falta) |>
  summarise(edad = mean(edad), n = n())

# Imputación múltiple
library(mice)
imp <- mice(datos, m = 5)
# Python
datos.isna().sum()
datos[datos["ingreso"].isna()].describe()

from sklearn.experimental import enable_iterative_imputer
from sklearn.impute import IterativeImputer
Excel:    =CONTAR.BLANCO(rango)
SPSS:     Analizar › Analizar valores perdidos
          Datos › Definir propiedades de variables › Valores perdidos

Herramientas de este tema

  • ScriptImportar, revisar y limpiar· en preparación
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Datos faltantes: qué hacer. estadistica.ar. https://estadistica.ar/conceptos/datos-faltantes

BibTeX

@misc{estadistica_ar_datos_faltantes,
  author       = {Montivero, Jorge Luis},
  title        = {{Datos faltantes: qué hacer}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/datos-faltantes}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.