Estandarizar antes de analizar
Por qué casi ningún método multivariado funciona sin estandarizar, qué transformación usar y cuándo no corresponde.
1 · El problema
En la matriz de aglomerados conviven variables como estas:
| Variable | Rango aproximado |
|---|---|
| Coeficiente de Gini | 0,3 a 0,5 |
| Tasa de desocupación | 3 a 10 |
| Edad media | 30 a 40 |
| Ingreso medio | 800.000 a 1.700.000 |
2 · La transformación estándar
Deja cada variable con media 0 y desvío 1, así que todas pesan igual. Es el mismo puntaje z de la descriptiva, aplicado a cada columna.
3 · Las alternativas
| Método | Fórmula | Resultado | Cuándo |
|---|---|---|---|
| Estandarización (z) | media 0, desvío 1 | la habitual | |
| Normalización min-max | entre 0 y 1 | redes neuronales, índices | |
| Robusta | centrada en la mediana | con atípicos | |
| Solo centrar | media 0, escala original | cuando la escala sí importa |
4 · Qué métodos la necesitan
| Método | ¿Estandarizar? |
|---|---|
| Componentes principales | sí, salvo que las unidades sean comparables |
| Conglomerados, k-medias | sí, siempre |
| Distancias | sí |
| Regresión | no hace falta |
| Árboles de decisión | no |
| Regresión penalizada (lasso, ridge) | sí |
5 · Cuándo NO estandarizar
- Cuando todas las variables están en la misma unidad y sus diferencias de escala son informativas: un cuestionario donde todos los ítems van de 1 a 5.
- Cuando se quiere que una variable pese más a propósito, con una justificación declarada.
- Cuando la variabilidad relativa es el objeto de estudio.
6 · El detalle que arruina un análisis
7 · Errores frecuentes
- No estandarizar cuando el método lo requiere.
- Estandarizar cuando no corresponde, borrando diferencias de escala que importaban.
- Usar min-max con atípicos.
- Estandarizar la variable respuesta en una regresión sin necesidad, lo que complica la interpretación.
- Calcular media y desvío con todo el conjunto en un esquema de validación.
- Estandarizar variables dummy, que ya están en una escala común.
- No guardar los parámetros usados, lo que impide aplicar el modelo a datos nuevos.
8 · En el software
# R
Z <- scale(X) # z por defecto
attr(Z, "scaled:center") # las medias usadas
attr(Z, "scaled:scale") # los desvíos
# Otras versiones
apply(X, 2, function(v) (v - min(v)) / diff(range(v))) # min-max
apply(X, 2, function(v) (v - median(v)) / IQR(v)) # robusta
# Python — el escalador guarda los parámetros
from sklearn.preprocessing import StandardScaler, MinMaxScaler, RobustScaler
esc = StandardScaler().fit(X_entrenamiento)
Z_ent = esc.transform(X_entrenamiento)
Z_pru = esc.transform(X_prueba) # los mismos parámetrosCómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Estandarizar antes de analizar. estadistica.ar. https://estadistica.ar/conceptos/estandarizacion-de-variables
BibTeX
@misc{estadistica_ar_estandarizacion_de_variables,
author = {Montivero, Jorge Luis},
title = {{Estandarizar antes de analizar}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/estandarizacion-de-variables}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.