Ir al contenido
σestadistica.ar
M09 · EstimaciónAvanzadoProcedimiento

Método de momentos y máxima verosimilitud

De dónde salen las fórmulas de los estimadores: los dos procedimientos generales que las producen, sin demostraciones.

1 · La pregunta

Hasta acá los estimadores aparecieron dados: la media muestral estima a μ\mu, la proporción observada estima a π\pi. ¿De dónde salen esas fórmulas, y qué se hace cuando el parámetro no tiene un estimador obvio?

2 · Método de momentos

Es el más antiguo y el más simple de entender.

La idea: igualar los momentos teóricos de la distribución —que dependen de los parámetros— a los momentos observados en la muestra, y despejar.

E(X)=xˉE(X2)=1nxi2E(X) = \bar{x} \qquad E(X^2) = \frac{1}{n}\sum x_i^2 \qquad \ldots

Se plantean tantas ecuaciones como parámetros haya que estimar.

Ejemplo. Para una distribución de Poisson, el único parámetro es λ\lambda y su esperanza es E(X)=λE(X) = \lambda. Igualando:

λ^=xˉ\hat{\lambda} = \bar{x}

El estimador de momentos del parámetro de una Poisson es simplemente la media muestral. Para la normal, el mismo procedimiento devuelve μ^=xˉ\hat{\mu} = \bar{x} y σ^2=\hat{\sigma}^2 = la varianza muestral con denominador nn.

Ventaja: es directo y casi siempre se puede resolver. Límite: los estimadores que produce no siempre son los más eficientes.

3 · Máxima verosimilitud

Es el método dominante en la estadística moderna.

La idea: elegir el valor del parámetro que hace más probable lo que efectivamente se observó.

Se construye la función de verosimilitud, que es la probabilidad de los datos observados vista como función del parámetro:

L(θ)=i=1nf(xiθ)L(\theta) = \prod_{i=1}^{n} f(x_i \mid \theta)

y se busca el θ\theta que la maximiza. En la práctica se maximiza el logaritmo de LL, porque convierte el producto en suma y es mucho más manejable —el máximo está en el mismo lugar—.

Un ejemplo intuitivo. Se tiran 10 monedas y salen 7 caras. ¿Qué valor de π\pi hace más probable ese resultado?

π\piProbabilidad de 7 caras en 10
0,30,009
0,50,117
0,70,267
0,90,057

El máximo está en 0,7, que es exactamente 7/107/10: la proporción observada. El estimador de máxima verosimilitud de una proporción es la proporción muestral, y ahora se sabe de dónde sale.

4 · Por qué domina la máxima verosimilitud

Tiene propiedades asintóticas muy buenas: con nn grande, los estimadores de máxima verosimilitud son consistentes, asintóticamente insesgados y asintóticamente eficientes —ningún otro estimador logra menor varianza—.

Además es completamente general: sirve para cualquier modelo en el que se pueda escribir la probabilidad de los datos. Por eso está detrás de casi todo lo moderno:

5 · Cuándo importa esto en la práctica

Para estadística descriptiva e inferencia básica, nunca: las fórmulas ya están resueltas.

Importa cuando aparece un mensaje de error que solo se entiende conociendo el método:

  • “El modelo no convergió.” El algoritmo que busca el máximo de la verosimilitud no lo encontró. El resultado que muestra no sirve.
  • “Separación completa.” En regresión logística, cuando una variable predice perfectamente el resultado, el máximo está en el infinito y no hay solución finita.
  • AIC y BIC, que se usan para comparar modelos, se construyen sobre el valor de la log-verosimilitud.

6 · Errores frecuentes

  • Confundir verosimilitud con probabilidad. La probabilidad va de parámetro a datos; la verosimilitud, de datos a parámetro. No es una distribución de probabilidad sobre θ\theta.
  • Creer que máxima verosimilitud garantiza insesgadez. Con muestras chicas puede tener sesgo.
  • Interpretar un modelo que no convergió.
  • Comparar verosimilitudes de modelos ajustados sobre datos distintos. Solo se comparan sobre el mismo conjunto.
  • Suponer que el método elige el modelo. Estima los parámetros dado el modelo; si el modelo está mal especificado, estima muy bien parámetros de algo equivocado.

7 · En el software

# R — maximizar una log-verosimilitud a mano
logvero <- function(lambda, x) sum(dpois(x, lambda, log = TRUE))
optimize(logvero, interval = c(0, 100), x = datos, maximum = TRUE)

# En la práctica, los modelos ya lo hacen internamente
modelo <- glm(y ~ x, family = binomial)
logLik(modelo)
AIC(modelo)
# Python
from scipy.optimize import minimize
from scipy import stats
neg_loglik = lambda p: -stats.poisson.logpmf(datos, p[0]).sum()
minimize(neg_loglik, x0=[1.0])
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Método de momentos y máxima verosimilitud. estadistica.ar. https://estadistica.ar/conceptos/metodos-de-estimacion

BibTeX

@misc{estadistica_ar_metodos_de_estimacion,
  author       = {Montivero, Jorge Luis},
  title        = {{Método de momentos y máxima verosimilitud}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/metodos-de-estimacion}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.