Ir al contenido
σestadistica.ar
M13 · RegresiónIntermedioProcedimiento

Variables dummy

Cómo entran las variables categóricas en un modelo: la categoría de referencia, la trampa de las dummy y cómo se leen los coeficientes.

1 · Qué son

Variables que valen 0 o 1 y representan la pertenencia a una categoría.

Con kk categorías se crean k1k - 1 dummy. La categoría que no recibe dummy es la de referencia, y todos los coeficientes se leen contra ella.

2 · La trampa de las dummy

Si se incluyen todas las categorías más la constante, el modelo es indeterminado: las dummy suman exactamente 1 en cada caso, que es lo que vale la columna de la constante.

d1+d2++dk=1=constanted_1 + d_2 + \dots + d_k = 1 = \text{constante}

3 · El ejemplo

Nivel educativo en tres categorías, con primario como referencia:

Categoríasecundariosuperior
Hasta primario completo00
Secundario10
Superior01
CoeficienteValorLectura
secundario+249.541contra primario
superior+726.490contra primario
Diferencia entre ellos476.949por resta

4 · Cómo elegir la referencia

CriterioEjemplo
La categoría más frecuenteda errores estándar más chicos
El grupo controlen un experimento
Un orden naturalla categoría más baja, en variables ordinales
La más interpretablela que el lector espera como base

La elección no cambia el ajuste del modelo —el R2R^2, los predichos y el FF son idénticos— pero sí cambia qué comparaciones son directas.

5 · Dummy y ANOVA son lo mismo

Una regresión con solo dummy es exactamente un ANOVA de un factor:

ANOVARegresión con dummy
FF del factorFF del bloque de dummy
Medias de cada grupoconstante + coeficiente de cada dummy
η2\eta^2R2R^2

6 · Las otras codificaciones

CodificaciónLos coeficientes comparan contra
Tratamiento (dummy 0/1)la categoría de referencia
Suma (efecto)la media general
Helmertcada categoría contra la media de las anteriores
Polinómicatendencias lineal, cuadrática… en variables ordinales

La de tratamiento es la que usan R y Python por defecto y la que se interpreta más fácil. La polinómica es útil cuando la categórica tiene un orden con espaciado razonable.

7 · Errores frecuentes

  • Incluir las kk dummy con constante.
  • No declarar cuál es la referencia al reportar.
  • Tratar una categórica codificada 1, 2, 3 como numérica. El modelo supone entonces que el paso de 1 a 2 vale lo mismo que de 2 a 3, y estima un solo coeficiente en lugar de k1k-1.
  • Comparar dos categorías no de referencia sin recalcular el error estándar.
  • Crear dummy con categorías de muy pocos casos.
  • Olvidar que los coeficientes cambian si cambia la referencia.

8 · En el software

# R — declarar como factor y listo
d$nivel <- factor(d$nivel, levels = c("Primario", "Secundario", "Superior"))
modelo <- lm(ingreso ~ horas + nivel, data = d)   # crea las dummy solo

# Cambiar la referencia
d$nivel <- relevel(d$nivel, ref = "Superior")

# Contrastes distintos
contrasts(d$nivel) <- contr.sum(3)
# Python — C() marca la categórica
smf.ols("ingreso ~ horas + C(nivel)", data=d).fit()
smf.ols("ingreso ~ horas + C(nivel, Treatment(reference='Superior'))",
        data=d).fit()

pd.get_dummies(d.nivel, drop_first=True)    # a mano
SPSS:     Regresión lineal no crea dummy solo:
          hay que generarlas con Transformar › Recodificar
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Variables dummy. estadistica.ar. https://estadistica.ar/conceptos/variables-dummy

BibTeX

@misc{estadistica_ar_variables_dummy,
  author       = {Montivero, Jorge Luis},
  title        = {{Variables dummy}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/variables-dummy}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.