Cálculos con datos agrupados
Cómo se calculan la media, la mediana y el desvío cuando lo único que se tiene es una tabla de frecuencias, y cuánto se pierde en el camino.
1 · Definición
Los datos agrupados son los que solo están disponibles como tabla de frecuencias por intervalos, sin los valores individuales.
2 · Cuándo hace falta
Cada vez menos, pero todavía pasa:
- Cuando la fuente publica una tabla y no la base. Muchos anuarios estadísticos e informes antiguos son así.
- Cuando se trabaja con datos históricos de los que solo sobrevivió el tabulado.
- En un ejercicio de examen, donde el objetivo es entender el mecanismo.
Fuera de esos casos, agrupar para después calcular es tirar precisión sin ganar nada.
3 · El supuesto que hace todo posible
Todos los métodos de esta entrada descansan en una sola suposición:
Ese supuesto es razonable cuando los intervalos son angostos y la distribución no cambia bruscamente dentro de ellos. Es malo cuando los intervalos son muy anchos o cuando hay mucha concentración en un extremo del intervalo — que es lo que pasa con el último intervalo de una distribución de ingresos.
4 · La media
Se trata cada intervalo como si todos sus casos valieran la marca de clase, y se promedia ponderando por la frecuencia:
donde es la marca de clase del intervalo y su frecuencia. Es exactamente una media ponderada.
5 · La mediana
Se ubica el intervalo donde la frecuencia acumulada cruza el 50 % —el intervalo mediano— y se interpola dentro de él:
donde es el límite inferior del intervalo mediano, la acumulada hasta el intervalo anterior, la frecuencia del intervalo mediano y su amplitud.
Se lee así: arrancá en el borde del intervalo y avanzá la fracción que falta para llegar a la mitad de los casos.
6 · Un ejemplo
Con la edad de los ocupados de la EPH agrupada en tramos de diez años:
| Intervalo | (miles) | (miles) | |
|---|---|---|---|
| [15, 25) | 20 | 1.368 | 1.368 |
| [25, 35) | 30 | 3.280 | 4.648 |
| [35, 45) | 40 | 3.434 | 8.082 |
| [45, 55) | 50 | 3.019 | 11.101 |
| [55, 65) | 60 | 1.734 | 12.835 |
| [65, 75) | 70 | 524 | 13.360 |
Media agrupada. Ponderando las marcas de clase por las frecuencias se obtiene 41,5 años.
Mediana agrupada. La mitad de 13.359 es 6.680, que cae en el intervalo [35, 45). Entonces:
Los valores exactos, calculados sobre los datos sin agrupar, son 41,0 años de media y 40,0 de mediana.
| Agrupado | Exacto | Error | |
|---|---|---|---|
| Media | 41,5 | 41,0 | +0,5 |
| Mediana | 40,9 | 40,0 | +0,9 |
Las dos aproximaciones se van para arriba, y la mediana casi un año. Con intervalos de diez años el error ya es perceptible, y crece con la amplitud: es el precio de haber perdido los datos originales.
7 · El desvío estándar
Mismo principio, usando las marcas de clase:
Este es el cálculo que peor se porta de los tres, porque la dispersión dentro de cada intervalo se pierde por completo. El resultado tiende a subestimar la dispersión real.
8 · Errores frecuentes
- Calcular con datos agrupados teniendo los originales. Es el error de concepto: se pierde precisión a cambio de nada.
- Presentar el resultado como exacto. Siempre lleva “aproximadamente”.
- Usar el límite inferior en vez de la marca de clase. Subestima la media de manera sistemática.
- Intentarlo con un intervalo abierto. “65 y más” no tiene marca de clase. O se le asigna un valor razonable y se declara, o no se puede calcular la media.
- Interpolar la mediana con la marca de clase. La fórmula arranca en el límite inferior del intervalo mediano, no en su centro.
- Olvidar que el supuesto de uniformidad falla en las colas. En una distribución asimétrica, el último intervalo casi nunca tiene sus casos repartidos de manera uniforme.
9 · En el software
# R — a partir de marcas de clase y frecuencias
marcas <- c(20, 30, 40, 50, 60, 70)
frec <- c(1368, 3280, 3434, 3019, 1734, 524)
media <- weighted.mean(marcas, frec)
desvio <- sqrt(sum(frec * (marcas - media)^2) / (sum(frec) - 1))
# Python
import numpy as np
marcas = np.array([20, 30, 40, 50, 60, 70])
frec = np.array([1368, 3280, 3434, 3019, 1734, 524])
media = np.average(marcas, weights=frec)
desvio = np.sqrt(np.average((marcas - media)**2, weights=frec))
Excel: =SUMAPRODUCTO(marcas; frecuencias) / SUMA(frecuencias)Herramientas de este tema
- CalculadoraTabla de frecuencias e histograma
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Cálculos con datos agrupados. estadistica.ar. https://estadistica.ar/conceptos/datos-agrupados-y-sin-agrupar
BibTeX
@misc{estadistica_ar_datos_agrupados_y_sin_agrupar,
author = {Montivero, Jorge Luis},
title = {{Cálculos con datos agrupados}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/datos-agrupados-y-sin-agrupar}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.