Regresión lineal múltiple
Varias predictoras a la vez: qué significa 'controlar por', cuánto aporta cada variable y los problemas que aparecen al agregarlas.
1 · El modelo
2 · Qué significa “controlar por”
Es la idea central del módulo y merece decirse con precisión.
es el cambio esperado en por una unidad de entre casos que tienen el mismo valor en todas las demás variables del modelo.
3 · El ejemplo
| Término | Lectura | |
|---|---|---|
| Horas semanales | 14.557 | a igual edad, sexo y educación |
| Edad | 10.076 | por año |
| Mujer | −269.859 | frente a un varón con iguales horas, edad y educación |
| Secundario | 249.541 | frente a primario |
| Superior | 726.490 | frente a primario |
El pasó de 0,062 —solo horas— a 0,146. Sumar cuatro variables duplicó la capacidad explicativa, y aun así el modelo explica el 15 %.
4 · Cómo cambian los coeficientes al agregar variables
Es lo más informativo del proceso:
| Modelo | Coeficiente de horas |
|---|---|
| Solo horas | 15.610 |
| Con edad, sexo y educación | 14.557 |
La pendiente de las horas baja un 7 % al controlar. Parte de lo que parecía efecto de las horas era en realidad efecto de las otras variables, correlacionadas con ellas.
5 · Qué se puede meter en el modelo
| Tipo | Cómo entra |
|---|---|
| Cuantitativa | directamente |
| Categórica | como variables dummy |
| Relación curva | con , o splines |
| Efecto que depende de otra | como interacción |
Por eso el modelo lineal es mucho más flexible de lo que su nombre sugiere: lo lineal son los parámetros, no la forma de la relación.
6 · Los problemas que aparecen
| Problema | Entrada |
|---|---|
| Predictoras muy correlacionadas | multicolinealidad |
| Demasiadas variables | sobreajuste |
| Cuáles incluir | selección de variables |
| Controlar lo que no se debe | mediadores y colisionadores |
7 · Cuántos casos hacen falta
Reglas prácticas: entre 10 y 20 casos por predictora como mínimo, y bastante más si se buscan interacciones o si las predictoras están correlacionadas.
Con 14.129 casos y 5 predictoras, el ejemplo está holgado. Con 60 casos y 8 predictoras, el modelo estaría contando ruido.
8 · Errores frecuentes
- Interpretar los coeficientes sin el “manteniendo constante”.
- Controlar por mediadores y concluir que no hay efecto.
- Meter todas las variables disponibles sin un orden causal pensado.
- Concluir causalidad por haber “controlado”.
- Ignorar la multicolinealidad.
- Comparar coeficientes de distintas unidades sin estandarizar.
- Usar el crudo para comparar modelos con distinta cantidad de variables.
9 · En el software
# R
modelo <- lm(ingreso ~ horas + edad + mujer + secundario + superior, data = d)
summary(modelo)
confint(modelo)
# Comparar el crudo con el ajustado
coef(lm(ingreso ~ horas, data = d))["horas"] # 15610
coef(modelo)["horas"] # 14557
car::vif(modelo)
# Python
import statsmodels.formula.api as smf
modelo = smf.ols("ingreso ~ horas + edad + mujer + secundario + superior",
data=d).fit()
modelo.summary()
SPSS: Analizar › Regresión › Lineales, con varias independientesCómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Regresión lineal múltiple. estadistica.ar. https://estadistica.ar/conceptos/regresion-lineal-multiple
BibTeX
@misc{estadistica_ar_regresion_lineal_multiple,
author = {Montivero, Jorge Luis},
title = {{Regresión lineal múltiple}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/regresion-lineal-multiple}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.