Ir al contenido
σestadistica.ar
M02 · DescriptivaTroncalConcepto

Varianza y desvío estándar

Las dos medidas de dispersión más usadas: cómo se calculan, qué significan y por qué una se informa y la otra casi nunca.

1 · Definición

La varianza es el promedio de los desvíos respecto de la media, elevados al cuadrado. El desvío estándar es su raíz cuadrada.

s2=i=1n(xixˉ)2n1s=s2s^2 = \frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n-1} \qquad s = \sqrt{s^2}

2 · Para qué sirven

Una medida de posición sola no describe nada. Dos grupos pueden tener el mismo ingreso medio y realidades completamente distintas: en uno todos ganan parecido, en el otro hay pobreza y riqueza.

El desvío estándar cuantifica esa diferencia. Y además es la base de casi toda la estadística posterior: el puntaje z, el error estándar, los intervalos de confianza y las pruebas de hipótesis están todos construidos sobre él.

3 · Por qué se elevan al cuadrado los desvíos

Porque sin el cuadrado la cuenta daría siempre cero. Es una propiedad de la media:

i=1n(xixˉ)=0\sum_{i=1}^{n} (x_i - \bar{x}) = 0

Los apartamientos hacia arriba compensan exactamente a los de abajo. Hay dos formas de evitar esa compensación: tomar el valor absoluto —lo que da el desvío medio— o elevar al cuadrado.

Se elige el cuadrado por dos razones: es derivable, lo que permite trabajar algebraicamente con él, y penaliza más los apartamientos grandes, lo que resulta deseable en muchos contextos. El costo es que exagera el efecto de los valores extremos.

4 · Por qué se informa el desvío y no la varianza

Por las unidades. Si la variable está en pesos, la varianza está en pesos al cuadrado, que no significa nada. La raíz cuadrada devuelve la medida a la escala original y la vuelve interpretable.

La varianza aparece igual en todas las fórmulas —es la que tiene las propiedades matemáticas útiles— pero en un informe va el desvío estándar.

5 · El procedimiento

Paso 1. Calculá la media. Paso 2. Restá la media a cada valor: esos son los desvíos. Paso 3. Elevá cada desvío al cuadrado. Paso 4. Sumalos. Paso 5. Dividí por n1n-1 (ver por qué). Paso 6. Sacá la raíz cuadrada.

6 · Un ejemplo

Dos variables de la EPH del primer trimestre de 2026:

IngresoEdad
Media$1.104.22741,0 años
Desvío estándar$1.063.11412,9 años
Coeficiente de variación96,3 %31,4 %

El desvío del ingreso es casi igual a su media: la dispersión es enorme. El de la edad es menos de un tercio de la media: los ocupados son mucho más parecidos entre sí en edad que en ingreso.

Esa comparación no se puede hacer directamente con los desvíos —uno está en pesos y el otro en años—: hace falta el coeficiente de variación, que los vuelve comparables.

7 · Cómo se informa

xˉ±s\bar{x} \pm s

La edad media fue de 41,0 años (DE = 12,9).

Se usa “DE” o “SD”, y siempre entre paréntesis después de la media. Escribir “41,0 ± 12,9” también es correcto, pero tiene un riesgo: se confunde con un intervalo de confianza, que es otra cosa. Conviene aclarar qué es lo que sigue al signo.

8 · Errores frecuentes

  • Confundir desvío estándar con error estándar. El desvío describe la dispersión de los datos; el error estándar, la de la media muestral. El segundo es mucho más chico y se achica al crecer nn. Es la confusión más frecuente de toda la materia.
  • Informar la varianza. Está en unidades al cuadrado. Va el desvío.
  • Informar “media ± desvío” en distribuciones muy asimétricas. Sugiere un rango simétrico que no existe.
  • Comparar desvíos de variables en distintas unidades. Para eso está el coeficiente de variación.
  • Usar la fórmula con nn cuando corresponde n1n-1. Excel tiene funciones separadas y elegir mal la función es un error silencioso.
  • Olvidar que no es robusto. Un solo valor extremo lo infla mucho. Si el desvío parece desproporcionado, revisá los extremos antes de interpretarlo.

9 · En el software

# R — usa n−1 siempre
sd(datos$edad)
var(datos$edad)

# Con ponderadores
sqrt(Hmisc::wtd.var(datos$ingreso, datos$ponderador))
# Python — ojo con el grado de libertad
datos["edad"].std()        # pandas usa n−1 por defecto
np.std(datos["edad"])          # NumPy usa n por defecto
np.std(datos["edad"], ddof=1)  # para que coincida con pandas y R
Excel:    =DESVEST.M(rango)   muestra, n−1   ← la que casi siempre va
          =DESVEST.P(rango)   población, n
          =VAR.M / =VAR.P     lo mismo para la varianza
SPSS:     Descriptivos › Desviación estándar  (usa n−1)
InfoStat: Estadísticas › Medidas resumen › D.E.

Herramientas de este tema

Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Varianza y desvío estándar. estadistica.ar. https://estadistica.ar/conceptos/varianza-y-desvio-estandar

BibTeX

@misc{estadistica_ar_varianza_y_desvio_estandar,
  author       = {Montivero, Jorge Luis},
  title        = {{Varianza y desvío estándar}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/varianza-y-desvio-estandar}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.