El diccionario de variables
El documento que traduce cada columna de la base a su definición, sus categorías y su origen: lo primero que se arma y lo único que sobrevive al olvido.
1 · Definición
El diccionario de variables —o libro de códigos— es el documento que describe cada columna de la base: qué mide, cómo se llama, qué valores puede tomar y qué significa cada código.
2 · Para qué sirve
Porque dentro de seis meses no vas a acordarte de si p21 era el ingreso de la
ocupación principal o el ingreso total, ni de si 9 significaba “no sabe” o
“nueve”.
Y porque sin él, nadie más puede usar tus datos: ni el director de tesis, ni el jurado, ni vos mismo el año que viene. Un relevamiento sin diccionario es un relevamiento que se pierde.
Además, escribirlo antes del trabajo de campo obliga a resolver decisiones que después serían irreversibles: qué categorías admite cada pregunta, cómo se codifica la no respuesta, en qué unidad se mide cada cosa.
3 · Qué lleva cada fila
Una fila por variable, y estas columnas como mínimo:
| Campo | Qué va | Ejemplo |
|---|---|---|
| Nombre | El de la columna en la base, exacto | nivel_ed |
| Etiqueta | Cómo se llama en el informe | Máximo nivel educativo alcanzado |
| Definición | Qué mide, sin ambigüedad | Nivel más alto que cursó y si lo finalizó |
| Tipo | Numérica, texto, fecha | Numérica entera |
| Escala | Nominal, ordinal, intervalo, razón | Ordinal |
| Valores | Códigos y su significado | 1 = Primario incompleto … 7 = Sin instrucción |
| Faltantes | Cómo se codifican | 9 = Ns/Nc · vacío = no corresponde |
| Unidad | Si aplica | Pesos corrientes |
| Origen | Pregunta del cuestionario o fuente | P8 y P9 combinadas |
| Universo | A quiénes se les preguntó | Personas de 3 años y más |
Ese último campo es el que más se olvida y el que más problemas evita: no todas
las variables se le preguntan a todo el mundo. Si ingreso solo tiene sentido
para ocupados, el diccionario tiene que decirlo, porque si no los vacíos de los
inactivos parecen datos perdidos.
4 · Un ejemplo
Así documenta el INDEC la variable de condición de actividad de la EPH:
| Campo | Contenido |
|---|---|
| Nombre | ESTADO |
| Etiqueta | Condición de actividad |
| Valores | 0 = Entrevista no realizada · 1 = Ocupado · 2 = Desocupado · 3 = Inactivo · 4 = Menor de 10 años |
| Universo | Todas las personas del hogar |
Sin esa tabla, un ESTADO = 4 parecería una categoría de actividad más. Con
ella queda claro que son menores a los que no se les aplica el módulo.
El mismo criterio vale para P21 = -9, que es “no respondió” y no un ingreso
negativo, como se explica en el
caso de los ingresos.
5 · Cuándo se escribe
Antes de relevar, junto con el cuestionario. Se completa con los nombres de variable y las categorías previstas.
Durante el procesamiento se actualiza: cada variable derivada que se construye —un grupo de edad, un índice, una recodificación— se agrega con su fórmula.
Al cerrar, se revisa que coincida con la base real. Una variable en el diccionario que no está en la base, o al revés, es un error que hay que encontrar antes de entregar.
6 · Errores frecuentes
- No hacerlo. El error por defecto. Se posterga hasta que el trabajo termina y para entonces ya nadie se acuerda de la mitad de las decisiones.
- Documentar solo las variables “importantes”. Las que no se documentan son las que después generan dudas.
- No distinguir tipos de faltante. “No contestó”, “no corresponde” y “no se cargó” son tres cosas distintas y se tratan distinto. Si comparten código, la distinción se pierde para siempre.
- Cambiar un nombre de variable y no actualizar el diccionario. A partir de ahí el documento miente, que es peor que no tenerlo.
- Guardarlo dentro de la misma planilla que los datos. Va en una hoja aparte o en un archivo aparte; nunca arriba de la matriz de datos.
- Omitir el universo de cada variable. Sin él, los vacíos legítimos se confunden con datos perdidos.
7 · En el software
# R — las etiquetas viajan con el objeto si se usa labelled
library(labelled)
var_label(datos$nivel_ed) <- "Máximo nivel educativo alcanzado"
val_labels(datos$nivel_ed) <- c("Primario incompleto" = 1, "Primario completo" = 2)
# Exportar el diccionario a una tabla
look_for(datos)
# Python — pandas no guarda etiquetas; se mantiene aparte
diccionario = pd.read_csv("diccionario.csv")
datos["nivel_ed"] = datos["nivel_ed"].map(
dict(zip(diccionario.codigo, diccionario.etiqueta))
)
Excel: Una hoja "Diccionario" en el mismo libro, nunca en la hoja de datos
SPSS: Vista de variables: etiqueta, valores y perdidos por variable.
Es de las pocas herramientas donde el diccionario vive en el archivo
Herramientas de este tema
- PlantillaPlanilla de carga con validaciones· en preparación
- PlantillaLibro de códigos de una encuesta· en preparación
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). El diccionario de variables. estadistica.ar. https://estadistica.ar/conceptos/diccionario-de-variables
BibTeX
@misc{estadistica_ar_diccionario_de_variables,
author = {Montivero, Jorge Luis},
title = {{El diccionario de variables}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/diccionario-de-variables}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.