Muestreo, población y estimación
10. Taller: ¿qué conclusiones son válidas?
Taller: ¿qué conclusiones son válidas?
Objetivo de aprendizaje
- Evaluar la validez de conclusiones estadísticas basadas en muestras.
- Distinguir entre conclusiones descriptivas, inferencias razonables e inferencias no justificadas.
- Redactar conclusiones cuidadosas respetando el alcance real de los datos.
Propósito del taller
En este taller se analiza si una conclusión estadística está justificada según la forma en que se obtuvo la muestra.
El foco está en la validez de la conclusión: población estudiada, representatividad, posible sesgo y alcance de los datos.
Aún no se usarán procedimientos formales como intervalos de confianza, niveles de significancia o pruebas de hipótesis. Esos temas se estudiarán en el libro de inferencia estadística.
Preguntas para evaluar una conclusión
- ¿Cuál es la población sobre la que se quiere concluir?
- ¿La muestra proviene de esa población?
- ¿Cómo fue seleccionada la muestra?
- ¿Hay algún grupo que pudo quedar fuera o estar poco representado?
- ¿La conclusión reconoce que el resultado muestral es una estimación?
Ruta para decidir si una conclusión es válida
Para analizar una conclusión estadística basada en una muestra, se puede seguir esta ruta:
- Leer la conclusión.
- Identificar si habla solo de los datos observados o si intenta hablar de una población mayor.
- Si solo habla de los datos observados, es una conclusión descriptiva.
- Si intenta hablar de una población mayor, revisar si la muestra proviene de esa población.
- Revisar si la muestra parece representativa y si pudo haber sesgos.
- Verificar si la conclusión se expresa como estimación y no como certeza absoluta.
Ejemplo 1: conclusión descriptiva
En una encuesta aplicada a \(50\) estudiantes de un curso, \(35\) declaran que prefieren trabajar en grupo.
La afirmación:
“En el curso encuestado, \(35\) de los \(50\) estudiantes prefieren trabajar en grupo”
es una conclusión descriptiva, porque se refiere solamente al grupo observado.
No está intentando concluir sobre todos los estudiantes del colegio ni sobre otros cursos.
Ejemplo 2: inferencia razonable con cuidado
Se selecciona aleatoriamente a \(150\) estudiantes de enseñanza media de un colegio. El \(58\%\) declara que prefiere clases con apoyo de recursos digitales.
Una conclusión razonable sería:
“En la muestra, el \(58\%\) de los estudiantes prefiere clases con apoyo de recursos digitales. Como la muestra fue seleccionada aleatoriamente desde enseñanza media del colegio, este porcentaje puede usarse como estimación de la proporción correspondiente en esa población”.
La conclusión es cuidadosa porque no afirma que el \(58\%\) sea una verdad exacta.
Ejemplo 3: conclusión no justificada
Un estudiante encuesta a \(40\) personas en la entrada de un gimnasio. El \(90\%\) dice que realiza actividad física al menos tres veces por semana.
Una conclusión incorrecta sería:
“El \(90\%\) de los habitantes de la comuna realiza actividad física al menos tres veces por semana”.
La conclusión no es válida, porque la muestra está formada solo por personas que asisten a un gimnasio.
Ese grupo no representa necesariamente a todos los habitantes de la comuna.
Error frecuente
No se debe ampliar una conclusión más allá de la población que la muestra puede representar.
Si la muestra proviene de un curso, no se puede concluir directamente sobre todo el colegio. Si proviene de un colegio, no se puede concluir directamente sobre todo el país.
Conclusión cuidadosa
Una conclusión estadística cuidadosa debe indicar el alcance real de los datos.
Por ejemplo, no es lo mismo decir:
“El \(70\%\) de todos los estudiantes prefiere estudiar con música”.
que decir:
“En la muestra, el \(70\%\) de los estudiantes prefiere estudiar con música. Si la muestra representa adecuadamente a la población, este porcentaje puede usarse como estimación de la proporción poblacional”.
Ejercicios progresivos a desafiantes
Ejercicio 1: conclusión descriptiva
En una encuesta aplicada a \(50\) estudiantes de un curso, \(35\) declaran que prefieren trabajar en grupo.
Evalúa si la siguiente conclusión es válida:
“En el curso encuestado, \(35\) de los \(50\) estudiantes prefieren trabajar en grupo”.
La conclusión es válida como descripción, porque habla solo del curso encuestado.
No intenta sacar una conclusión sobre otros cursos ni sobre todos los estudiantes del colegio.
Además, usa directamente los datos observados: \(35\) de \(50\) estudiantes.
La conclusión es válida como conclusión descriptiva.
Ejercicio 2: inferencia razonable
Una encuesta se aplica a \(100\) estudiantes elegidos al azar entre todos los cursos de enseñanza media de un colegio. El \(72\%\) responde que usa internet para estudiar.
Evalúa si la siguiente conclusión es razonable:
“Aproximadamente el \(72\%\) de los estudiantes de enseñanza media de este colegio usa internet para estudiar”.
La conclusión puede ser razonable, porque la muestra fue seleccionada al azar desde todos los cursos de enseñanza media del colegio.
Eso hace que la muestra pueda representar mejor a la población estudiada.
Sin embargo, la conclusión debería expresarse como una estimación, no como una certeza exacta.
Una redacción más cuidadosa sería:
“En la muestra, el \(72\%\) declaró usar internet para estudiar. Como la muestra fue seleccionada al azar desde enseñanza media del colegio, este porcentaje puede usarse como estimación de la proporción correspondiente en esa población”.
La conclusión es razonable si se interpreta como estimación.
Ejercicio 3: conclusión demasiado amplia
Un colegio encuesta a \(80\) estudiantes de segundo medio y obtiene que el \(65\%\) prefiere evaluaciones con trabajos grupales.
Luego se afirma:
“El \(65\%\) de todos los estudiantes de Chile prefiere evaluaciones con trabajos grupales”.
¿La conclusión es válida? Justifica.
La conclusión no es válida porque amplía demasiado el alcance de la muestra.
La muestra proviene solo de estudiantes de segundo medio de un colegio.
Con esos datos no se puede concluir directamente sobre todos los estudiantes de Chile.
Una conclusión más cuidadosa sería:
“En la muestra de \(80\) estudiantes de segundo medio, el \(65\%\) prefiere evaluaciones con trabajos grupales”.
No es válida, porque la muestra no representa a todos los estudiantes de Chile.
Ejercicio 4: muestra sesgada
Un estudiante quiere saber si los alumnos del colegio están de acuerdo con aumentar el tiempo de recreo. Para ello encuesta solo a estudiantes que están jugando fútbol en la cancha.
El \(88\%\) de los encuestados está de acuerdo.
Evalúa la conclusión:
“El \(88\%\) de los estudiantes del colegio está de acuerdo con aumentar el tiempo de recreo”.
La conclusión no es válida como conclusión sobre todo el colegio.
La muestra está formada solo por estudiantes que estaban jugando fútbol en la cancha.
Ese grupo puede tener una opinión distinta a la de otros estudiantes, por ejemplo quienes estaban en biblioteca, casino, sala o patio.
Por lo tanto, la muestra puede estar sesgada.
Una conclusión más cuidadosa sería:
“Entre los estudiantes encuestados en la cancha, el \(88\%\) estuvo de acuerdo con aumentar el tiempo de recreo”.
La conclusión no es válida para todo el colegio, porque la muestra puede estar sesgada.
Ejercicio 5: cálculo e interpretación
En una muestra aleatoria de \(250\) hogares de una comuna, \(165\) declaran separar residuos reciclables.
- Calcula la proporción muestral.
- Exprésala como porcentaje.
- Escribe una conclusión válida y cuidadosa.
La proporción muestral se calcula como:
\[ \hat{p}=\frac{x}{n} \]
En este caso, \(x=165\) y \(n=250\):
\[ \hat{p}=\frac{165}{250}=0{,}66 \]
Como porcentaje:
\[ 0{,}66=66\% \]
Una conclusión válida y cuidadosa sería:
“En la muestra aleatoria, el \(66\%\) de los hogares declaró separar residuos reciclables. Como la muestra fue seleccionada aleatoriamente desde la comuna, este porcentaje puede usarse como estimación de la proporción de hogares de la comuna que separan residuos reciclables”.
La proporción muestral es \(\hat{p}=0{,}66\), es decir, \(66\%\).
Ejercicio 6: corregir una interpretación
Una muestra aleatoria de \(40\) estudiantes entrega una media de horas de sueño de \(\bar{x}=7{,}2\).
Un estudiante afirma:
“La media real de horas de sueño de toda la población es exactamente \(7{,}2\) horas”.
Explica el error de interpretación y escribe una conclusión más adecuada.
El error consiste en tratar la media muestral como si fuera exactamente la media real de toda la población.
El valor \(7{,}2\) fue calculado desde una muestra, por lo que debe interpretarse como una estimación.
Una conclusión más adecuada sería:
“En la muestra aleatoria de \(40\) estudiantes, la media de horas de sueño fue \(7{,}2\). Si la muestra representa adecuadamente a la población, este valor puede usarse como estimación de la media poblacional de horas de sueño”.
El valor \(7{,}2\) es una estimación muestral, no necesariamente el valor exacto de la población.
Ejercicio 7: comparar conclusiones
Se selecciona aleatoriamente una muestra de \(300\) estudiantes de enseñanza media de una ciudad. El \(54\%\) declara estudiar al menos una hora diaria fuera del horario de clases.
Compara las siguientes conclusiones e indica cuál es más adecuada:
- “El \(54\%\) de todos los estudiantes del país estudia al menos una hora diaria”.
- “En la muestra, el \(54\%\) declaró estudiar al menos una hora diaria. Este porcentaje puede estimar la proporción de estudiantes de enseñanza media de la ciudad que cumple esa característica”.
La conclusión más adecuada es la segunda.
La primera conclusión no es adecuada porque amplía el resultado a todos los estudiantes del país, aunque la muestra proviene de estudiantes de enseñanza media de una ciudad.
La segunda conclusión respeta mejor el alcance de la muestra: habla de la muestra y luego propone una estimación para la población correspondiente.
Además, no presenta el \(54\%\) como una certeza exacta.
La conclusión 2 es más adecuada.
Ejercicio 8: caso desafiante
Una investigación quiere estimar la proporción de estudiantes universitarios de una ciudad que trabajan además de estudiar.
Se aplica una encuesta a \(600\) estudiantes, pero todos pertenecen a carreras vespertinas de dos instituciones. El \(61\%\) declara trabajar.
El informe concluye:
“El \(61\%\) de los estudiantes universitarios de la ciudad trabaja además de estudiar”.
- Identifica el estadístico obtenido.
- Explica un problema de representatividad.
- Reescribe la conclusión de forma cuidadosa.
El estadístico obtenido es la proporción muestral:
\[ \hat{p}=0{,}61 \]
Es decir, el \(61\%\) de los estudiantes encuestados declaró trabajar además de estudiar.
El problema de representatividad es que todos los encuestados pertenecen a carreras vespertinas de solo dos instituciones.
Ese grupo puede tener una proporción de estudiantes trabajadores distinta a la de estudiantes diurnos, de otras instituciones o de otras carreras.
Una conclusión más cuidadosa sería:
“En la muestra de \(600\) estudiantes de carreras vespertinas de dos instituciones, el \(61\%\) declaró trabajar además de estudiar. Este resultado describe a la muestra y podría no representar a todos los estudiantes universitarios de la ciudad”.
El estadístico es \(\hat{p}=0{,}61\), pero la conclusión original no es válida para toda la ciudad por problemas de representatividad.
Cierre
Una conclusión estadística válida debe respetar el alcance de la muestra.
Una muestra permite estimar características de una población, pero no convierte automáticamente un resultado muestral en una verdad exacta.
En el siguiente libro se estudiará cómo cuantificar la incertidumbre de estas estimaciones mediante herramientas de inferencia estadística.