Ir al contenido
σestadistica.ar
M13 · RegresiónIntermedioProcedimiento

Regresión logística

El modelo para variables de respuesta binaria: por qué no sirve la regresión lineal, qué es el logit y cómo se evalúa el ajuste.

1 · Por qué no sirve la regresión lineal

Con YY binaria —0 o 1— el modelo lineal falla en todo:

  • Predice fuera del rango: probabilidades negativas o mayores que 1.
  • Los errores no son normales: solo pueden tomar dos valores.
  • Hay heterocedasticidad por construcción: la varianza de una Bernoulli es p(1p)p(1-p), que depende de pp.
  • La relación no es lineal: cerca de 0 y de 1 los efectos se aplanan.

2 · La solución: el logit

En lugar de modelar la probabilidad, se modela el logaritmo de la chance:

ln(p1p)=β0+β1x1++βkxk\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 x_1 + \dots + \beta_k x_k

Despejando:

p=11+e(β0+β1x1+)p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \dots)}}

que es la curva logística: una S que se aplana en 0 y en 1.

3 · El ejemplo

¿Quién tiene empleo registrado? Sobre 13.864 asalariados de la EPH, de los cuales el 62,6 % está registrado:

TérminobbOdds ratioIC 95 % del OR
Constante−2,28410,1020,084 – 0,123
Edad0,04601,0471,044 – 1,051
Mujer−0,48120,6180,573 – 0,667
Secundario0,92802,5302,244 – 2,852
Superior1,99547,3556,470 – 8,363
  • Cada año de edad multiplica la chance de estar registrado por 1,047.
  • Ser mujer la multiplica por 0,618: una reducción del 38 %.
  • Tener nivel superior la multiplica por 7,4 frente a primario.

Los coeficientes crudos —en escala logit— no se interpretan directamente: se los exponencia para obtener odds ratios.

4 · Cómo se estima

No por mínimos cuadrados sino por máxima verosimilitud: se busca el conjunto de coeficientes que hace más probables los datos observados. Ver métodos de estimación.

Eso trae dos consecuencias: la estimación es iterativa —puede no converger— y la inferencia se basa en propiedades asintóticas, así que necesita muestras razonables.

5 · Cómo se evalúa el ajuste

No hay R2R^2. Existen varios pseudo-R2R^2, y todos son análogos imperfectos:

MedidaComentario
McFaddenel más usado; valores de 0,2 a 0,4 ya indican buen ajuste
Nagelkerkereescalado para llegar a 1
Cox-Snellno puede alcanzar 1

En el ejemplo, McFadden vale 0,104, que para datos individuales es razonable.

El porcentaje de aciertos, con una advertencia grande:

Valor
Acierto del modelo68,2 %
Acierto prediciendo siempre “registrado”62,6 %

La prueba de Hosmer-Lemeshow evalúa calibración, con el problema habitual: con nn grande rechaza siempre.

6 · Sus supuestos

  1. Independencia de las observaciones.
  2. Linealidad en el logit: el efecto de una predictora continua es lineal en escala logit, no en probabilidad.
  3. Sin multicolinealidad fuerte.
  4. Suficientes eventos: 10 a 20 del resultado menos frecuente por predictora.

7 · Errores frecuentes

  • Interpretar los coeficientes crudos sin exponenciar.
  • Leer el odds ratio como riesgo relativo. Ver cómo se interpreta un odds ratio.
  • Reportar solo el porcentaje de aciertos con clases desbalanceadas.
  • Interpretar el pseudo-R2R^2 como el R2R^2 lineal.
  • Contar el nn total en lugar de los eventos, al evaluar si alcanza la muestra.
  • Verificar normalidad de los residuos.
  • Dicotomizar una variable continua para poder usar logística, perdiendo información.

8 · En el software

# R
modelo <- glm(registrado ~ edad + mujer + secundario + superior,
              data = a, family = binomial)
summary(modelo)

exp(cbind(OR = coef(modelo), confint(modelo)))    # odds ratios con IC

# Ajuste y clasificación
DescTools::PseudoR2(modelo, "McFadden")
pred <- ifelse(predict(modelo, type = "response") > 0.5, 1, 0)
table(pred, a$registrado)

pROC::roc(a$registrado, predict(modelo, type = "response"))
# Python
import statsmodels.formula.api as smf
modelo = smf.logit("registrado ~ edad + mujer + secundario + superior",
                   data=a).fit()
modelo.summary()
np.exp(modelo.params)
SPSS:     Analizar › Regresión › Logística binaria
          (la columna Exp(B) es el odds ratio)
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Regresión logística. estadistica.ar. https://estadistica.ar/conceptos/regresion-logistica

BibTeX

@misc{estadistica_ar_regresion_logistica,
  author       = {Montivero, Jorge Luis},
  title        = {{Regresión logística}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/regresion-logistica}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.