Sobreajuste y validación
Cuando el modelo aprende el ruido de la muestra: cómo se detecta, cómo se mide la capacidad predictiva real y por qué el R² no alcanza.
1 · Qué es
Un modelo sobreajustado aprende no solo la estructura de la población sino también el ruido específico de esta muestra. Ajusta muy bien a los datos con los que se lo construyó y falla con datos nuevos.
Llevado al extremo, un polinomio de grado pasa exactamente por puntos: y cero capacidad predictiva.
2 · Cuándo aparece
| Factor | Riesgo |
|---|---|
| Muchas variables respecto de los casos | alto |
| Muestra chica | alto |
| Selección de variables mirando los datos | alto |
| Modelos flexibles: polinomios, árboles, redes | alto |
| Pocas variables y grande | bajo |
La regla de los 10 a 20 casos por variable es una defensa de primer orden.
3 · Cómo se detecta
Partiendo los datos: se ajusta con una parte y se evalúa con la otra.
| Entrenamiento | 9.890 | 0,139 |
| Prueba | 4.239 | 0,173 |
Que el de prueba sea mayor que el de entrenamiento no es raro: es variabilidad muestral. Lo preocupante es lo inverso, y por un margen grande.
4 · Las estrategias de validación
| Método | Cómo | Cuándo |
|---|---|---|
| Partición simple | 70/30 o 80/20 | grande |
| Validación cruzada en partes | rotar cuál es la de prueba | el estándar; o 10 |
| Leave-one-out | chico | |
| Conjunto de validación separado | tres partes: entrenar, ajustar, probar | si se comparan muchos modelos |
| Validación externa | otra muestra, otro lugar, otro momento | la prueba definitiva |
5 · Lo que la validación no resuelve
No arregla un mal diseño. Si la muestra está sesgada, el modelo va a predecir bien dentro de ese sesgo y mal en la población real.
No garantiza validez externa. Un modelo validado en Buenos Aires puede fallar en Catamarca: la validación cruzada usa datos del mismo conjunto, con la misma estructura.
No dice nada sobre causalidad. Un modelo puede predecir excelentemente sin que ninguna de sus variables cause nada.
6 · El equilibrio sesgo-varianza
| Modelo | Sesgo | Varianza | Problema |
|---|---|---|---|
| Demasiado simple | alto | baja | subajuste |
| Demasiado complejo | bajo | alta | sobreajuste |
| Equilibrado | moderado | moderada | — |
El error de predicción se descompone en esos dos términos más el ruido irreducible. Elegir un modelo es elegir un punto en ese equilibrio, y por eso “el modelo que mejor ajusta” casi nunca es “el que mejor predice”.
7 · Errores frecuentes
- Evaluar el modelo con los datos de entrenamiento.
- Usar el conjunto de prueba para elegir y después reportarlo como validación.
- Hacer la selección de variables antes de partir los datos. La selección también tiene que estar dentro de la validación cruzada.
- Confiar en el como medida de capacidad predictiva.
- Partir datos con estructura —series de tiempo, conglomerados— al azar: hay que respetar la estructura.
- No fijar la semilla.
8 · En el software
# R — partición simple
set.seed(2026)
i <- sample(nrow(d), 0.7 * nrow(d))
ent <- d[i, ]; prue <- d[-i, ]
m <- lm(ingreso ~ horas + edad + mujer, data = ent)
pred <- predict(m, prue)
1 - sum((prue$ingreso - pred)^2) / sum((prue$ingreso - mean(ent$ingreso))^2)
# Validación cruzada
library(caret)
train(ingreso ~ horas + edad + mujer, data = d, method = "lm",
trControl = trainControl(method = "cv", number = 10))
# Python
from sklearn.model_selection import train_test_split, cross_val_score
X_ent, X_pru, y_ent, y_pru = train_test_split(X, y, test_size=0.3,
random_state=2026)
cross_val_score(modelo, X, y, cv=10, scoring='r2')Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Sobreajuste y validación. estadistica.ar. https://estadistica.ar/conceptos/sobreajuste-y-validacion
BibTeX
@misc{estadistica_ar_sobreajuste_y_validacion,
author = {Montivero, Jorge Luis},
title = {{Sobreajuste y validación}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/sobreajuste-y-validacion}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.