Limpieza de datos
La etapa más larga de cualquier trabajo con datos: qué se revisa, en qué orden, y por qué toda corrección tiene que quedar registrada.
1 · Definición
La limpieza de datos es el conjunto de controles y correcciones que llevan una base cruda a un estado en el que se puede analizar con confianza.
2 · Para qué sirve
Porque ningún análisis compensa datos sucios. Un valor mal codificado, una categoría escrita de tres formas o un caso duplicado producen resultados que el software calcula sin protestar y que están mal.
Y porque la limpieza es donde uno conoce los datos. Quien limpia una base sabe qué preguntas se pueden hacer con ella y cuáles no; quien recibe la base limpia, no.
3 · El orden de los controles
1 · Estructura. ¿Coincide la cantidad de filas con la de casos relevados? ¿Hay identificadores duplicados? ¿Las columnas son las que dice el diccionario?
2 · Tipos. ¿Cada columna tiene el tipo que corresponde? Una columna numérica leída como texto —porque alguien escribió “45 kg” en una celda— rompe todos los cálculos y no siempre avisa.
3 · Rangos. Mínimos y máximos de cada variable numérica. Edades de 187, pesos de 0,07, porcentajes de 150.
4 · Categorías. Tabla de frecuencias de cada variable cualitativa. Ahí saltan “Femenino”, “femenino”, “F” y ” Femenino” con un espacio adelante, que para el software son cuatro categorías distintas.
5 · Consistencia entre variables. Es el control que más errores encuentra y el que más se saltea:
- Un varón con antecedentes obstétricos.
- Alguien de 12 años con nivel universitario completo.
- Una fecha de alta anterior a la de ingreso.
- Un inactivo con ingreso de la ocupación principal.
6 · Faltantes. Cuántos hay por columna y de qué tipo. Se trata en datos faltantes.
7 · Duplicados. No solo por identificador: también casos idénticos en todas las variables, que suelen ser una fila cargada dos veces.
4 · La regla que sostiene todo
Esto no es un capricho metodológico: es lo que permite volver atrás, entender qué se hizo y rehacerlo cuando aparece un dato nuevo.
Editar la planilla a mano significa que dentro de un mes nadie —incluido vos— puede responder por qué el caso 47 tiene un valor distinto del que tenía el cuestionario. Con un script, la respuesta está escrita.
El flujo correcto:
datos-crudos.csv → [script de limpieza] → datos-limpios.csv → análisis
(no se toca) (se versiona) (se regenera)
5 · Qué se documenta
Al terminar, el informe tiene que poder responder:
- Cuántos casos entraron y cuántos quedaron.
- Qué casos se excluyeron y por qué.
- Qué correcciones se hicieron y con qué criterio.
- Cómo se trataron los faltantes.
Un trabajo donde el del análisis no coincide con el del relevamiento y nadie lo explica es un trabajo que no se puede evaluar.
6 · Errores frecuentes
- Corregir a mano sobre la planilla. El error estructural de este tema.
- Borrar casos sin registro. Si desaparecen 30 casos entre el relevamiento y el análisis, tiene que estar escrito por qué.
- Confundir limpieza con maquillaje. Sacar los valores que no gustan no es limpiar.
- Saltear el control de consistencia entre variables. Los errores más graves no están dentro de una columna sino en la relación entre dos.
- No mirar los espacios en blanco.
"Femenino "y"Femenino"son categorías distintas para cualquier programa. - Limpiar sin conocer el instrumento. Sin el cuestionario a mano, es imposible saber si un vacío es “no corresponde” o un dato perdido.
- Hacerlo al final. La limpieza va antes del análisis, no cuando los resultados salen raros.
7 · En el software
# R — controles de consistencia con dplyr
library(dplyr)
# Casos imposibles
datos |> filter(sexo == "V", embarazos > 0)
datos |> filter(edad < 18, nivel_ed == "Universitario completo")
# Categorías con espacios o mayúsculas inconsistentes
datos |> count(sexo)
datos <- datos |> mutate(sexo = trimws(toupper(sexo)))
# Duplicados completos
datos |> filter(duplicated(datos))
# Python
datos.query("sexo == 'V' and embarazos > 0")
datos["sexo"] = datos["sexo"].str.strip().str.upper()
datos[datos.duplicated()]
datos.dtypes # verificar tipos
Excel: Datos › Quitar duplicados
=ESPACIOS(celda) para limpiar espacios sobrantes
Formato condicional › Reglas para resaltar valores fuera de rango
SPSS: Datos › Identificar casos duplicados
Transformar › Recodificar (siempre "en distintas variables",
nunca "en las mismas": conserva el original)
Herramientas de este tema
- ScriptImportar, revisar y limpiar· en preparación
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Limpieza de datos. estadistica.ar. https://estadistica.ar/conceptos/limpieza-de-datos
BibTeX
@misc{estadistica_ar_limpieza_de_datos,
author = {Montivero, Jorge Luis},
title = {{Limpieza de datos}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/limpieza-de-datos}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.