Los datos estan dispersos?

6. Interpretación y Comparación con Medidas de Dispersión

Repaso: Medidas de Dispersión

Medidas de dispersión

Las medidas de dispersión, como el rango, la varianza y la desviación estándar, indican qué tan esparcidos o concentrados están los datos alrededor de un valor central, como la media.

Estas medidas son fundamentales para comprender la variabilidad de un conjunto de datos.

Interpretación Conjunta de Media y Desviación Estándar

Media y desviación estándar

La media y la desviación estándar se interpretan juntas para tener una idea más completa de la distribución de los datos. La media indica el centro y la desviación estándar indica qué tan dispersos están los datos alrededor de ese centro.

Ejemplo: misma media, distinta dispersión

  • Conjunto A: media \(=50\), desviación estándar \(=5\).
  • Conjunto B: media \(=50\), desviación estándar \(=15\).

Ambos conjuntos tienen la misma media, pero el conjunto B tiene una desviación estándar mayor.

  • En el conjunto A, la mayoría de los datos estarán relativamente cerca de \(50\).
  • En el conjunto B, los datos estarán mucho más dispersos. Es más probable encontrar valores bastante alejados de \(50\).

Comparación de Conjuntos de Datos

Comparar con la media y la desviación estándar

Podemos usar la media y la desviación estándar para comparar distintos conjuntos de datos. Cuando los datos están en las mismas unidades, una desviación estándar menor indica mayor homogeneidad o consistencia.

Ejemplo: comparación de dos clases

Dos clases rinden el mismo examen:

  • Clase X: media \(=75\), desviación estándar \(=8\).
  • Clase Y: media \(=75\), desviación estándar \(=3\).

Ambas clases tienen el mismo promedio, pero la clase Y tiene notas más homogéneas, porque su desviación estándar es menor.

Ejemplo: comparación en contextos diferentes

Se comparan las edades de dos grupos:

  • Grupo P: media \(=25\) años, desviación estándar \(=2\) años.
  • Grupo Q: media \(=60\) años, desviación estándar \(=10\) años.

El grupo P es más joven que el grupo Q. Además, las edades del grupo P son más homogéneas, porque su desviación estándar es menor.

Diagramas de Caja y Bigotes (Boxplots)

Interpretación de boxplots

Los diagramas de caja y bigotes, o boxplots, son una forma visual de representar la dispersión de un conjunto de datos. No es necesario construirlos siempre a mano, pero sí es importante interpretarlos correctamente.

Elementos de un boxplot

  • Mediana: línea dentro de la caja.
  • Primer cuartil \(Q_1\): borde inferior de la caja.
  • Tercer cuartil \(Q_3\): borde superior de la caja.
  • Rango intercuartílico: \(IQR=Q_3-Q_1\).
  • Bigotes: líneas que se extienden desde la caja hacia valores menores y mayores.
  • Valores atípicos: valores inusualmente bajos o altos respecto del resto de los datos.

Ejemplo: lectura de un boxplot

45505560657075808590Q1: 55, Mediana: 60, Q3: 65Mediana: 60Minimo: 50Maximo: 70

Lectura:

  • La mediana está en \(60\).
  • El primer cuartil está en \(55\).
  • El tercer cuartil está en \(65\).
  • Los bigotes se extienden desde \(50\) hasta \(70\).
  • Existe un valor atípico alto en \(85\), aunque no pertenece al bigote principal.

Interpretación: el valor típico de los datos está alrededor de \(60\). El \(50\%\) central de los datos está entre \(55\) y \(65\). La mayoría de los datos está entre \(50\) y \(70\), pero existe un valor inusualmente alto.

Valores Atípicos

Identificación

Regla de \(1{,}5\cdot IQR\)

  1. Calcula el rango intercuartílico: \[ IQR=Q_3-Q_1 \]
  2. Calcula los límites: \[ LI=Q_1-1{,}5\cdot IQR \] \[ LS=Q_3+1{,}5\cdot IQR \]
  3. Cualquier valor menor que \(LI\) o mayor que \(LS\) se considera valor atípico.

Ejemplo: identificación de un valor atípico

Consideremos los datos:

\[ 2,\ 3,\ 5,\ 7,\ 8,\ 9,\ 10,\ 12,\ 15,\ 25 \]

Dividimos el conjunto en dos mitades:

  • Primera mitad: \(2,\ 3,\ 5,\ 7,\ 8\), por lo tanto \(Q_1=5\).
  • Segunda mitad: \(9,\ 10,\ 12,\ 15,\ 25\), por lo tanto \(Q_3=12\).

Calculamos:

\[ IQR=12-5=7 \]

\[ LI=5-1{,}5\cdot 7=5-10{,}5=-5{,}5 \]

\[ LS=12+1{,}5\cdot 7=12+10{,}5=22{,}5 \]

El valor \(25\) es atípico, porque es mayor que \(22{,}5\).

Importancia

¿Por qué revisar los valores atípicos?

Los valores atípicos pueden deberse a errores de medición, errores de registro o a valores válidos pero inusuales.

  • Pueden distorsionar la media y las medidas de dispersión.
  • Pueden entregar información importante sobre el fenómeno estudiado.

No siempre se deben eliminar. Primero hay que analizar el contexto y decidir si corresponde corregirlos, eliminarlos o mantenerlos.

Ejercicios y Problemas

Ejercicio 1: Interpretación de media y desviación estándar

Dados los siguientes conjuntos de datos, interpreta la media y la desviación estándar en términos de dispersión:

  1. Conjunto X: media \(=10\), desviación estándar \(=2\).
  2. Conjunto Y: media \(=10\), desviación estándar \(=8\).
  3. Conjunto Z: media \(=100\), desviación estándar \(=10\).

Ejercicio 2: Comparación de boxplots

Observa los siguientes diagramas de caja y bigotes.

Boxplot A

2030405060708090Q1: 45, Mediana: 50, Q3: 55Mediana: 50Minimo: 40Maximo: 60

Boxplot B

2030405060708090Q1: 40, Mediana: 50, Q3: 60Mediana: 50Minimo: 30Maximo: 70

Además, el boxplot B presenta un valor atípico en \(80\).

  1. ¿Qué boxplot representa datos con mayor dispersión?
  2. ¿Cuál boxplot indica la presencia de un valor atípico?

Ejercicio 3: Regla de \(1{,}5\cdot IQR\)

Para el siguiente conjunto de datos, identifica si hay valores atípicos usando la regla de \(1{,}5\cdot IQR\):

\[ 1,\ 3,\ 5,\ 7,\ 8,\ 9,\ 10,\ 12,\ 14,\ 30 \]

Problema 1: Comparación de empresas

Dos empresas, A y B, fabrican bombillas. Se prueban muestras de bombillas de cada empresa y se registra su duración, en horas:

  • Empresa A: media \(=1000\) horas, desviación estándar \(=50\) horas.
  • Empresa B: media \(=1000\) horas, desviación estándar \(=150\) horas.
  1. ¿Qué empresa produce bombillas con una duración más consistente?
  2. Si quieres comprar bombillas que duren alrededor de \(1000\) horas, ¿qué empresa elegirías? ¿Por qué?
  3. Si necesitas buscar bombillas que duren más de \(1100\) horas, ¿qué empresa elegirías? ¿Por qué?

Problema 2: Alturas de dos clases

Se registran las alturas, en centímetros, de los estudiantes de dos clases:

  • Clase 1: \(160,\ 165,\ 170,\ 175,\ 180\)
  • Clase 2: \(150,\ 160,\ 170,\ 180,\ 190\)
  1. Calcula la media y la desviación estándar muestral para cada clase.
  2. ¿Qué clase tiene mayor variabilidad en las alturas?
  3. Si se agrega un estudiante de \(200\) cm a la clase 1, ¿cómo afectaría esto a la media y a la desviación estándar? ¿Y si se agrega a la clase 2?

Problema 3: Tiempos de atención en un banco

Aplicación real

Este tipo de análisis es útil para la gestión de servicios. Un banco podría usar estos datos para decidir si necesita contratar más personal, mejorar sus procesos o redistribuir empleados para que los tiempos de espera sean más consistentes.

Se realiza un estudio sobre el tiempo, en minutos, que tardan los clientes en ser atendidos en dos sucursales de un banco. Los datos se consideran una muestra.

Sucursal A:

Tiempo (min) Frecuencia
\([0,\ 5)\) \(10\)
\([5,\ 10)\) \(15\)
\([10,\ 15)\) \(8\)
\([15,\ 20)\) \(5\)
\([20,\ 25)\) \(2\)

Sucursal B:

Tiempo (min) Frecuencia
\([0,\ 5)\) \(5\)
\([5,\ 10)\) \(10\)
\([10,\ 15)\) \(15\)
\([15,\ 20)\) \(12\)
\([20,\ 25)\) \(8\)
  1. Calcula la media y la desviación estándar para cada sucursal.
  2. ¿En qué sucursal los tiempos de atención son más consistentes? Justifica con los datos.
  3. Si fueras un cliente, ¿en qué sucursal es más probable que tengas que esperar más de \(15\) minutos? Justifica.