Ir al contenido
σestadistica.ar
M16 · CómputoTroncalProcedimiento

El diccionario de variables

El documento que traduce cada columna de la base a su definición, sus categorías y su origen: lo primero que se arma y lo único que sobrevive al olvido.

1 · Definición

El diccionario de variables —o libro de códigos— es el documento que describe cada columna de la base: qué mide, cómo se llama, qué valores puede tomar y qué significa cada código.

2 · Para qué sirve

Porque dentro de seis meses no vas a acordarte de si p21 era el ingreso de la ocupación principal o el ingreso total, ni de si 9 significaba “no sabe” o “nueve”.

Y porque sin él, nadie más puede usar tus datos: ni el director de tesis, ni el jurado, ni vos mismo el año que viene. Un relevamiento sin diccionario es un relevamiento que se pierde.

Además, escribirlo antes del trabajo de campo obliga a resolver decisiones que después serían irreversibles: qué categorías admite cada pregunta, cómo se codifica la no respuesta, en qué unidad se mide cada cosa.

3 · Qué lleva cada fila

Una fila por variable, y estas columnas como mínimo:

CampoQué vaEjemplo
NombreEl de la columna en la base, exactonivel_ed
EtiquetaCómo se llama en el informeMáximo nivel educativo alcanzado
DefiniciónQué mide, sin ambigüedadNivel más alto que cursó y si lo finalizó
TipoNumérica, texto, fechaNumérica entera
EscalaNominal, ordinal, intervalo, razónOrdinal
ValoresCódigos y su significado1 = Primario incompleto … 7 = Sin instrucción
FaltantesCómo se codifican9 = Ns/Nc · vacío = no corresponde
UnidadSi aplicaPesos corrientes
OrigenPregunta del cuestionario o fuenteP8 y P9 combinadas
UniversoA quiénes se les preguntóPersonas de 3 años y más

Ese último campo es el que más se olvida y el que más problemas evita: no todas las variables se le preguntan a todo el mundo. Si ingreso solo tiene sentido para ocupados, el diccionario tiene que decirlo, porque si no los vacíos de los inactivos parecen datos perdidos.

4 · Un ejemplo

Así documenta el INDEC la variable de condición de actividad de la EPH:

CampoContenido
NombreESTADO
EtiquetaCondición de actividad
Valores0 = Entrevista no realizada · 1 = Ocupado · 2 = Desocupado · 3 = Inactivo · 4 = Menor de 10 años
UniversoTodas las personas del hogar

Sin esa tabla, un ESTADO = 4 parecería una categoría de actividad más. Con ella queda claro que son menores a los que no se les aplica el módulo.

El mismo criterio vale para P21 = -9, que es “no respondió” y no un ingreso negativo, como se explica en el caso de los ingresos.

5 · Cuándo se escribe

Antes de relevar, junto con el cuestionario. Se completa con los nombres de variable y las categorías previstas.

Durante el procesamiento se actualiza: cada variable derivada que se construye —un grupo de edad, un índice, una recodificación— se agrega con su fórmula.

Al cerrar, se revisa que coincida con la base real. Una variable en el diccionario que no está en la base, o al revés, es un error que hay que encontrar antes de entregar.

6 · Errores frecuentes

  • No hacerlo. El error por defecto. Se posterga hasta que el trabajo termina y para entonces ya nadie se acuerda de la mitad de las decisiones.
  • Documentar solo las variables “importantes”. Las que no se documentan son las que después generan dudas.
  • No distinguir tipos de faltante. “No contestó”, “no corresponde” y “no se cargó” son tres cosas distintas y se tratan distinto. Si comparten código, la distinción se pierde para siempre.
  • Cambiar un nombre de variable y no actualizar el diccionario. A partir de ahí el documento miente, que es peor que no tenerlo.
  • Guardarlo dentro de la misma planilla que los datos. Va en una hoja aparte o en un archivo aparte; nunca arriba de la matriz de datos.
  • Omitir el universo de cada variable. Sin él, los vacíos legítimos se confunden con datos perdidos.

7 · En el software

# R — las etiquetas viajan con el objeto si se usa labelled
library(labelled)
var_label(datos$nivel_ed) <- "Máximo nivel educativo alcanzado"
val_labels(datos$nivel_ed) <- c("Primario incompleto" = 1, "Primario completo" = 2)

# Exportar el diccionario a una tabla
look_for(datos)
# Python — pandas no guarda etiquetas; se mantiene aparte
diccionario = pd.read_csv("diccionario.csv")
datos["nivel_ed"] = datos["nivel_ed"].map(
    dict(zip(diccionario.codigo, diccionario.etiqueta))
)
Excel:    Una hoja "Diccionario" en el mismo libro, nunca en la hoja de datos
SPSS:     Vista de variables: etiqueta, valores y perdidos por variable.
          Es de las pocas herramientas donde el diccionario vive en el archivo

Herramientas de este tema

  • PlantillaPlanilla de carga con validaciones· en preparación
  • PlantillaLibro de códigos de una encuesta· en preparación
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). El diccionario de variables. estadistica.ar. https://estadistica.ar/conceptos/diccionario-de-variables

BibTeX

@misc{estadistica_ar_diccionario_de_variables,
  author       = {Montivero, Jorge Luis},
  title        = {{El diccionario de variables}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/diccionario-de-variables}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.