Libro de las inferencias estadísticas
1. ¿Qué es inferir estadísticamente?
Objetivo de aprendizaje
- Comprender la inferencia estadística como el proceso de usar datos muestrales para obtener conclusiones razonables sobre una población.
- Distinguir entre describir una muestra e inferir sobre una población.
- Reconocer que una conclusión inferencial siempre se formula con incertidumbre, no como certeza absoluta.
De una muestra a una conclusión
En estadística, muchas veces no es posible estudiar a toda una población. Por eso se selecciona una muestra y se calculan estadísticos, como una media muestral \(\bar{x}\) o una proporción muestral \(\hat{p}\).
La inferencia estadística usa esos estadísticos para decir algo razonable sobre parámetros poblacionales desconocidos, como una media poblacional \(\mu\) o una proporción poblacional \(p\).
Inferir no significa demostrar una verdad absoluta. Significa usar evidencia muestral para estimar, comparar o tomar decisiones considerando que existe incertidumbre.
Idea general de la inferencia
La inferencia estadística conecta una muestra con una población:
\[ \text{muestra} \longrightarrow \text{estadístico muestral} \longrightarrow \text{conclusión sobre un parámetro} \]
Por ejemplo:
\[ \bar{x} \longrightarrow \mu \]
\[ \hat{p} \longrightarrow p \]
La media muestral \(\bar{x}\) puede usarse para estimar una media poblacional \(\mu\), y la proporción muestral \(\hat{p}\) puede usarse para estimar una proporción poblacional \(p\).
Idea central
La inferencia estadística permite concluir con evidencia, pero no con certeza absoluta.
Por eso, una conclusión inferencial debe reconocer que se basa en una muestra y que puede existir error o variabilidad muestral.
Ejemplo 1: describir una muestra e inferir sobre una población
Una orientadora selecciona aleatoriamente a \(80\) estudiantes de enseñanza media de un colegio y registra sus horas de sueño. La media muestral obtenida es:
\[ \bar{x}=7{,}1 \]
Una descripción sería:
“Los \(80\) estudiantes encuestados duermen en promedio \(7{,}1\) horas”.
Una inferencia sería:
“Como la muestra fue seleccionada aleatoriamente, la media muestral de \(7{,}1\) horas puede usarse como estimación del promedio de horas de sueño de los estudiantes de enseñanza media del colegio”.
La segunda afirmación es una inferencia porque usa la muestra para hablar de una población más grande.
Ejemplo 2: estimar una proporción poblacional
En una muestra aleatoria de \(200\) hogares de una comuna, \(128\) declaran separar residuos reciclables.
La proporción muestral es:
\[ \hat{p}=\frac{128}{200}=0{,}64 \]
Esto significa que, en la muestra, el \(64\%\) de los hogares separa residuos reciclables.
Una inferencia cuidadosa sería:
“El \(64\%\) observado en la muestra puede usarse como estimación de la proporción de hogares de la comuna que separan residuos reciclables”.
No se debe afirmar que exactamente el \(64\%\) de todos los hogares de la comuna cumple esa característica.
Ejemplo 3: inferir para tomar una decisión
Una empresa quiere saber si sus envases tienen una masa promedio cercana a \(500\) g.
Como no puede revisar todos los envases producidos, selecciona una muestra aleatoria y calcula una media muestral.
Si la muestra tiene media \(\bar{x}=497\) g, ese valor sirve como evidencia para evaluar el proceso de producción.
Sin embargo, la empresa no debería concluir inmediatamente que la media real es exactamente \(497\) g. La inferencia estadística permitirá estudiar qué tan razonable es esa diferencia respecto del valor esperado.
Error frecuente
No se debe confundir una conclusión inferencial con una certeza.
Decir “la muestra sugiere que la media poblacional está cerca de cierto valor” no es lo mismo que decir “la media poblacional es exactamente ese valor”.
Ejercicios progresivos a desafiantes
Ejercicio 1: reconocer una inferencia
En una muestra aleatoria de \(60\) estudiantes, la media de horas de estudio semanal es \(5{,}6\).
Indica cuál afirmación corresponde a una inferencia estadística:
- “Los \(60\) estudiantes encuestados estudiaron en promedio \(5{,}6\) horas semanales”.
- “La media muestral de \(5{,}6\) horas puede usarse para estimar el promedio de horas de estudio de los estudiantes de la población”.
La primera afirmación describe solamente a los \(60\) estudiantes encuestados.
La segunda afirmación usa la media de la muestra para decir algo sobre una población más grande.
Por eso, la segunda afirmación corresponde a una inferencia estadística.
La afirmación 2 corresponde a una inferencia estadística.
Ejercicio 2: identificar estadístico y parámetro
Una encuesta aleatoria a \(150\) hogares entrega que el \(58\%\) declara usar calefacción eléctrica durante el invierno.
- ¿Cuál es el estadístico muestral?
- ¿Qué parámetro poblacional se quiere estimar?
El estadístico muestral es la proporción observada en la muestra:
\[ \hat{p}=0{,}58 \]
El parámetro poblacional que se quiere estimar es la proporción real de hogares de la población que usan calefacción eléctrica durante el invierno.
Ese parámetro se representa por \(p\).
El estadístico es \(\hat{p}=0{,}58\), y estima la proporción poblacional \(p\).
Ejercicio 3: redactar una conclusión cuidadosa
Una muestra aleatoria de \(100\) estudiantes de un colegio entrega que \(72\) usan internet para estudiar.
Redacta una conclusión inferencial cuidadosa.
Primero calculamos la proporción muestral:
\[ \hat{p}=\frac{72}{100}=0{,}72 \]
Como porcentaje:
\[ 0{,}72=72\% \]
Una conclusión cuidadosa sería:
“En la muestra aleatoria, el \(72\%\) de los estudiantes declaró usar internet para estudiar. Este porcentaje puede usarse como estimación de la proporción de estudiantes del colegio que usan internet para estudiar”.
La conclusión es cuidadosa porque no afirma que el \(72\%\) sea exactamente el valor real de toda la población.
Una conclusión válida debe presentar el \(72\%\) como estimación, no como certeza absoluta.
Ejercicio 4: detectar una afirmación demasiado fuerte
En una muestra aleatoria de \(40\) estudiantes, la media de horas de sueño es \(\bar{x}=6{,}9\).
Un estudiante afirma:
“La media real de horas de sueño de todos los estudiantes es exactamente \(6{,}9\)”.
Explica por qué esta afirmación es demasiado fuerte.
La afirmación es demasiado fuerte porque trata la media muestral como si fuera necesariamente igual a la media poblacional.
El valor \(6{,}9\) fue calculado desde una muestra de \(40\) estudiantes.
En inferencia estadística, una media muestral se usa como estimación de la media poblacional, pero puede variar de una muestra a otra.
Una afirmación más adecuada sería:
“La media muestral de \(6{,}9\) horas puede usarse como estimación de la media poblacional, si la muestra representa adecuadamente a la población”.
El error es presentar una estimación muestral como si fuera una certeza exacta.
Ejercicio 5: describir o inferir
Clasifica cada afirmación como descripción o inferencia:
- “En la muestra, \(45\) de \(80\) estudiantes prefieren clases prácticas”.
- “La proporción observada en la muestra puede estimar la proporción de estudiantes del colegio que prefieren clases prácticas”.
- “El promedio de edad de las personas encuestadas fue \(34{,}5\) años”.
- “La media muestral sugiere que la edad promedio de la población está cerca de \(34{,}5\) años”.
Analizamos cada afirmación:
- Es una descripción, porque habla solo de la muestra.
- Es una inferencia, porque usa la muestra para estimar una proporción poblacional.
- Es una descripción, porque informa un resultado observado en las personas encuestadas.
- Es una inferencia, porque usa la media muestral para hablar de la población.
Las afirmaciones 1 y 3 son descripciones; las afirmaciones 2 y 4 son inferencias.
Ejercicio 6: inferencia y decisión
Una empresa afirma que la masa promedio de sus paquetes es cercana a \(1000\) g.
Una muestra aleatoria de paquetes entrega una media muestral de \(985\) g.
- ¿Qué parámetro se quiere estudiar?
- ¿Qué estadístico se observó?
- ¿Por qué no basta mirar solo \(985\) para tomar una decisión definitiva?
El parámetro que se quiere estudiar es la masa promedio real de todos los paquetes producidos por la empresa. Ese parámetro es \(\mu\).
El estadístico observado es la media muestral:
\[ \bar{x}=985 \]
No basta mirar solo \(985\) para tomar una decisión definitiva porque una media muestral puede variar de una muestra a otra.
Además, necesitamos evaluar si la diferencia entre \(985\) g y \(1000\) g puede explicarse por variabilidad muestral o si entrega evidencia suficiente de un problema en el proceso.
Se quiere estudiar \(\mu\), se observó \(\bar{x}=985\), y se necesita considerar la incertidumbre antes de decidir.
Ejercicio 7: caso desafiante
Una municipalidad quiere estimar la proporción de hogares de una comuna que reciclan. Se selecciona una muestra aleatoria de \(300\) hogares y \(195\) declaran separar residuos reciclables.
- Calcula la proporción muestral.
- Identifica el parámetro que se quiere estimar.
- Redacta una conclusión inferencial cuidadosa.
- Explica por qué esta conclusión no debe interpretarse como certeza absoluta.
Calculamos la proporción muestral:
\[ \hat{p}=\frac{195}{300}=0{,}65 \]
Como porcentaje:
\[ 0{,}65=65\% \]
El parámetro que se quiere estimar es la proporción real de hogares de la comuna que separan residuos reciclables. Ese parámetro se representa por \(p\).
Una conclusión inferencial cuidadosa sería:
“En la muestra aleatoria, el \(65\%\) de los hogares declaró separar residuos reciclables. Este resultado puede usarse como estimación de la proporción de hogares de la comuna que separan residuos reciclables”.
Esta conclusión no debe interpretarse como certeza absoluta porque se basa en una muestra. Otra muestra aleatoria podría entregar una proporción algo distinta.
\(\hat{p}=0{,}65\). Este valor estima a \(p\), pero no lo determina con certeza absoluta.