Muestreo, población y estimación
8. Variabilidad entre muestras y error muestral: idea inicial
Variabilidad entre muestras y error muestral: idea inicial
Objetivo de aprendizaje
- Comprender que distintas muestras de una misma población pueden producir distintos resultados.
- Interpretar el error muestral como la diferencia entre un estadístico muestral y el parámetro poblacional que se desea estimar, cuando ese parámetro es conocido.
- Reconocer que la variabilidad entre muestras es una razón importante para interpretar las estimaciones con cuidado.
Variabilidad entre muestras
Si se toman varias muestras de una misma población, es normal que sus medias o proporciones no sean exactamente iguales.
Esto ocurre porque cada muestra puede contener individuos distintos. Por eso, los estadísticos calculados a partir de ellas pueden variar.
Esta variación no significa necesariamente que haya un error de cálculo. Es parte natural del trabajo con muestras.
Error muestral como idea inicial
El error muestral es la diferencia entre un estadístico calculado en una muestra y el parámetro real de la población.
Si se estima una media poblacional \(\mu\) usando una media muestral \(\bar{x}\), el error muestral puede expresarse como:
\[ \bar{x}-\mu \]
Si interesa solo la distancia entre la estimación y el parámetro, se usa el valor absoluto:
\[ |\bar{x}-\mu| \]
Esta idea ayuda a comprender que una estimación puede quedar por encima o por debajo del valor real de la población.
Atención
En la práctica, muchas veces el parámetro poblacional no se conoce. Por eso, no siempre se puede calcular exactamente el error muestral.
En este libro usaremos algunos casos donde el parámetro se entrega para comprender la idea. Más adelante se estudiará cómo cuantificar la incertidumbre cuando el parámetro no se conoce.
Ejemplo 1: error muestral en una media
Supongamos que la media real de horas de sueño de una población es:
\[ \mu=7{,}0 \]
Una muestra entrega una media muestral de:
\[ \bar{x}=7{,}3 \]
Calculamos el error muestral:
\[ \bar{x}-\mu=7{,}3-7{,}0=0{,}3 \]
Esto significa que la media de la muestra quedó \(0{,}3\) horas por sobre la media real de la población.
La distancia entre la estimación y el parámetro es:
\[ |\bar{x}-\mu|=|0{,}3|=0{,}3 \]
Ejemplo 2: distintas muestras, distintos resultados
Se toman tres muestras aleatorias de estudiantes de una misma población y se calcula el promedio de horas de estudio semanal.
| Muestra | Media muestral |
|---|---|
| Muestra 1 | \(5{,}8\) horas |
| Muestra 2 | \(6{,}1\) horas |
| Muestra 3 | \(5{,}6\) horas |
El siguiente gráfico permite visualizar la variabilidad entre las medias muestrales:
Las medias son diferentes porque las muestras no contienen exactamente a los mismos estudiantes.
Esto muestra que una media muestral es una estimación que puede cambiar de una muestra a otra.
Idea clave
La variabilidad entre muestras es una razón importante para no interpretar una estimación muestral como si fuera una verdad exacta.
Una muestra puede entregar una buena aproximación, pero siempre debe interpretarse con cuidado.
Ejercicios progresivos a desafiantes
Ejercicio 1: calcular error muestral
La media real de edad de una población es \(\mu=16{,}4\) años.
Una muestra entrega una media muestral de \(\bar{x}=16{,}7\) años.
Calcula el error muestral e interpreta el resultado.
Usamos la expresión:
\[ \bar{x}-\mu \]
Reemplazamos:
\[ 16{,}7-16{,}4=0{,}3 \]
El error muestral es \(0{,}3\) años.
Como el resultado es positivo, la media muestral quedó por encima de la media real de la población.
El error muestral es \(0{,}3\) años; la muestra sobreestimó la media poblacional en \(0{,}3\) años.
Ejercicio 2: error negativo
La media real de puntaje de una población es \(\mu=68\) puntos.
Una muestra entrega una media muestral de \(\bar{x}=65\) puntos.
Calcula el error muestral e interpreta su signo.
Calculamos:
\[ \bar{x}-\mu=65-68=-3 \]
El error muestral es \(-3\) puntos.
El signo negativo indica que la media muestral quedó bajo la media real de la población.
La distancia entre la estimación y el parámetro es:
\[ |-3|=3 \]
El error muestral es \(-3\) puntos; la muestra subestimó la media poblacional en \(3\) puntos.
Ejercicio 3: distancia entre estimación y parámetro
La proporción real de hogares de una comuna que reciclan es \(p=0{,}58\).
Una muestra entrega una proporción muestral de \(\hat{p}=0{,}62\).
- Calcula \(\hat{p}-p\).
- Calcula \(|\hat{p}-p|\).
- Interpreta ambos resultados.
Calculamos la diferencia:
\[ \hat{p}-p=0{,}62-0{,}58=0{,}04 \]
Ahora calculamos la distancia:
\[ |\hat{p}-p|=|0{,}04|=0{,}04 \]
La diferencia positiva indica que la proporción muestral quedó por sobre la proporción real.
La distancia \(0{,}04\) equivale a \(4\) puntos porcentuales.
La muestra sobreestimó la proporción poblacional en \(0{,}04\), es decir, en \(4\) puntos porcentuales.
Ejercicio 4: comparar varias muestras
La media real de horas de lectura semanal de una población es \(\mu=4{,}5\) horas.
Se toman tres muestras y se obtienen las siguientes medias:
| Muestra | Media muestral |
|---|---|
| Muestra A | \(4{,}7\) |
| Muestra B | \(4{,}1\) |
| Muestra C | \(4{,}6\) |
Calcula el error muestral de cada muestra usando \(\bar{x}-\mu\).
Para la Muestra A:
\[ 4{,}7-4{,}5=0{,}2 \]
La Muestra A sobreestima la media en \(0{,}2\) horas.
Para la Muestra B:
\[ 4{,}1-4{,}5=-0{,}4 \]
La Muestra B subestima la media en \(0{,}4\) horas.
Para la Muestra C:
\[ 4{,}6-4{,}5=0{,}1 \]
La Muestra C sobreestima la media en \(0{,}1\) horas.
Errores: A \(=0{,}2\), B \(=-0{,}4\), C \(=0{,}1\).
Ejercicio 5: interpretar variabilidad entre muestras
Dos muestras aleatorias de una misma población entregan medias distintas:
\[ \bar{x}_1=12{,}8,\qquad \bar{x}_2=13{,}1 \]
Un estudiante afirma: “Una de las dos muestras debe estar mal, porque ambas deberían dar el mismo promedio”.
Explica por qué esta afirmación es incorrecta.
La afirmación es incorrecta porque dos muestras distintas pueden contener individuos diferentes.
Por eso, sus medias muestrales no tienen por qué coincidir exactamente.
Esta diferencia puede deberse a la variabilidad natural entre muestras, no necesariamente a un error de cálculo.
Ambas muestras podrían estar bien tomadas y aun así entregar resultados distintos.
Las medias pueden diferir porque cada muestra contiene datos distintos.
Ejercicio 6: analizar una estimación
Una muestra de \(100\) estudiantes entrega una media de \(6{,}8\) horas de sueño.
Otra muestra de \(100\) estudiantes de la misma población entrega una media de \(7{,}1\) horas.
¿Cuál de las dos medias es la media real de la población? Justifica.
No podemos saber cuál es la media real de la población solo con esos datos.
Las dos medias son estadísticas muestrales, porque fueron calculadas desde muestras.
La media real de la población podría coincidir con una de ellas, estar entre ambas o incluso ser otro valor cercano.
Lo importante es reconocer que ambas son estimaciones y que pueden variar entre muestras.
Ninguna puede afirmarse automáticamente como la media real; ambas son estimaciones muestrales.
Ejercicio 7: caso desafiante
La media real de gasto mensual en transporte de una población es:
\[ \mu=\$38\,000 \]
Se toman cuatro muestras y se obtienen las siguientes medias muestrales:
| Muestra | Media muestral |
|---|---|
| A | \(\$39\,500\) |
| B | \(\$36\,800\) |
| C | \(\$38\,200\) |
| D | \(\$40\,100\) |
- Calcula el error muestral de cada muestra.
- Indica cuál muestra tuvo menor distancia respecto del parámetro.
- Explica por qué las medias no son iguales entre sí.
Calculamos el error muestral usando \(\bar{x}-\mu\).
Muestra A:
\[ 39\,500-38\,000=1\,500 \]
Muestra B:
\[ 36\,800-38\,000=-1\,200 \]
Muestra C:
\[ 38\,200-38\,000=200 \]
Muestra D:
\[ 40\,100-38\,000=2\,100 \]
Ahora comparamos las distancias:
\[ |1\,500|=1\,500,\quad |-1\,200|=1\,200,\quad |200|=200,\quad |2\,100|=2\,100 \]
La menor distancia corresponde a la Muestra C, con \(200\) pesos de diferencia respecto de la media poblacional.
Las medias no son iguales porque cada muestra puede contener personas distintas. Esa variación es parte natural del muestreo.
Errores: A \(=1\,500\), B \(=-1\,200\), C \(=200\), D \(=2\,100\). La muestra C fue la más cercana al parámetro.