Los datos estan dispersos?
4. Medidas de Dispersión: Rango, Varianza y Desviación Estándar
Repaso: ¿Qué es la Dispersión?
Dispersión
La dispersión, o variabilidad, indica qué tan esparcidos están los datos alrededor de un valor central, como la media. Una alta dispersión significa que los datos están muy alejados entre sí; una baja dispersión significa que los datos están agrupados cerca de la media.
El Rango
Definición de rango
El rango es la medida de dispersión más simple, ya que solo considera los valores extremos de un conjunto de datos.
Fórmula del rango
Se calcula como la diferencia entre el valor máximo y el valor mínimo del conjunto de datos.
\[ Rango = Valor\ máximo - Valor\ mínimo \]
Ejemplos de cálculo de rango
Conjunto 1: \(\{5,\ 8,\ 10,\ 12,\ 15\}\)
\[ Rango = 15-5=10 \]
Conjunto 2: \(\{23,\ 23,\ 24,\ 25,\ 26\}\)
\[ Rango = 26-23=3 \]
Limitaciones del rango
Aunque es fácil de calcular, el rango tiene una gran desventaja: es muy sensible a valores atípicos. Un solo dato extremo puede cambiar drásticamente el rango y dar una idea incompleta de la dispersión general, ya que ignora cómo se distribuyen todos los demás datos.
La Varianza \((s^2\) o \(\sigma^2)\)
Definición de varianza
La varianza es una medida de dispersión que considera todos los datos del conjunto. Mide qué tan alejados están los datos respecto de la media, pero usando las desviaciones elevadas al cuadrado.
Aunque sus unidades cuadradas, por ejemplo \(cm^2\), la hacen difícil de interpretar directamente, es la base para calcular la desviación estándar.
¿Por qué se eleva al cuadrado la distancia?
Si simplemente sumáramos las desviaciones respecto de la media, los valores negativos y positivos podrían cancelarse entre sí.
Por ejemplo, si la media es \(6\), entonces:
\[ 2-6=-4 \qquad \text{y} \qquad 10-6=4 \]
Al elevar cada desviación al cuadrado, todas aportan un valor positivo a la medida total de dispersión.
Procedimiento para calcular la varianza
- Calcular la media \(\bar{x}\): sumar todos los datos y dividir por la cantidad de datos.
- Calcular las desviaciones: restar la media a cada dato, es decir, \(x_i-\bar{x}\).
- Elevar al cuadrado cada desviación: calcular \((x_i-\bar{x})^2\).
- Sumar los cuadrados: obtener \(\sum(x_i-\bar{x})^2\).
- Dividir para promediar:
- Para una población completa, se divide por \(n\).
- Para una muestra, se divide por \(n-1\).
Uso de tablas para organizar el cálculo
Para conjuntos de datos más grandes, realizar el cálculo paso a paso puede ser desordenado. Usar una tabla es una estrategia eficiente para mantener los cálculos organizados y evitar errores.
Ejemplo de cálculo de varianza con tabla organizadora
Calculemos la varianza para los datos:
\[ \{2,\ 4,\ 6,\ 8,\ 10\} \]
Paso 1: Calcular la media.
\[ \bar{x}=\frac{2+4+6+8+10}{5}=\frac{30}{5}=6 \]
Paso 2: Construir la tabla y completar los cálculos.
| Dato \(x_i\) | Desviación \(x_i-\bar{x}\) | Desviación al cuadrado \((x_i-\bar{x})^2\) |
|---|---|---|
| 2 | \(2-6=-4\) | \((-4)^2=16\) |
| 4 | \(4-6=-2\) | \((-2)^2=4\) |
| 6 | \(6-6=0\) | \(0^2=0\) |
| 8 | \(8-6=2\) | \(2^2=4\) |
| 10 | \(10-6=4\) | \(4^2=16\) |
| Total | \(16+4+0+4+16=40\) |
Paso 3: Calcular la varianza.
Varianza muestral: se divide por \(n-1\).
\[ s^2=\frac{40}{5-1}=\frac{40}{4}=10 \]
Varianza poblacional: se divide por \(n\).
\[ \sigma^2=\frac{40}{5}=8 \]
Fórmulas de la varianza
Varianza muestral:
\[ s^2=\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1} \]
Varianza poblacional:
\[ \sigma^2=\frac{\sum_{i=1}^{n}(x_i-\mu)^2}{n} \]
Donde \(s^2\) es la varianza muestral, \(\sigma^2\) es la varianza poblacional, \(x_i\) son los datos, \(\bar{x}\) es la media de la muestra, \(\mu\) es la media de la población y \(n\) es el número de datos.
Desviación Típica (o Estándar)
Definición de desviación estándar
La desviación típica, o desviación estándar, es una de las medidas de dispersión más utilizadas. Su gran ventaja es que, al ser la raíz cuadrada de la varianza, se expresa en las mismas unidades que los datos originales, como centímetros, kilogramos o notas.
¿Por qué usar la desviación estándar?
Si la media de las notas de un curso es \(5{,}5\) y la desviación estándar es \(0{,}5\), podemos decir que, en promedio, las notas de los estudiantes se desvían aproximadamente \(0{,}5\) puntos de la media.
Esta interpretación es más clara que decir que la varianza es \(0{,}25\) notas al cuadrado.
Fórmulas de la desviación estándar
La desviación estándar es la raíz cuadrada de la varianza correspondiente.
Muestra:
\[ s=\sqrt{s^2}=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}} \]
Población:
\[ \sigma=\sqrt{\sigma^2}=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\mu)^2}{n}} \]
Ejemplo de cálculo de desviación estándar
Usando las varianzas calculadas en el ejemplo anterior:
Desviación estándar muestral:
\[ s=\sqrt{10}\approx 3{,}16 \]
Desviación estándar poblacional:
\[ \sigma=\sqrt{8}\approx 2{,}83 \]
Interpretación en un contexto real
Imagina que un estudio sobre la altura de un curso arroja una media de \(170\) cm y una desviación estándar de \(5\) cm.
- ¿Qué significa \(5\) cm? No significa que todos los estudiantes midan exactamente \(5\) cm más o menos que la media. Significa que \(5\) cm es una medida representativa de la dispersión general del grupo.
- ¿Es mucho o poco? El valor de la desviación estándar se interpreta siempre en contexto. Se vuelve útil al comparar con otros grupos o con un objetivo específico.
Regla general de interpretación
- Desviación estándar baja: indica que los datos son más consistentes y están agrupados cerca de la media.
- Desviación estándar alta: indica que los datos están más dispersos y son menos predecibles.
Ejercicios y Problemas Propuestos
Ejercicio 1: rango
Calcula el rango de los siguientes conjuntos de datos:
- \(50,\ 60,\ 70,\ 80,\ 90\)
- \(1,\ 3,\ 2,\ 7,\ 5,\ 4\)
- \(120,\ 125,\ 118,\ 122,\ 124\)
- El valor máximo es \(90\) y el mínimo es \(50\), entonces: \[ Rango=90-50=40 \]
- El valor máximo es \(7\) y el mínimo es \(1\), entonces: \[ Rango=7-1=6 \]
- El valor máximo es \(125\) y el mínimo es \(118\), entonces: \[ Rango=125-118=7 \]
Ejercicio 2: varianza muestral
Calcula la varianza muestral \(s^2\) de los datos:
\[ \{3,\ 5,\ 7,\ 9,\ 11\} \]
1. Calculamos la media:
\[ \bar{x}=\frac{3+5+7+9+11}{5}=\frac{35}{5}=7 \]
2. Calculamos las desviaciones y sus cuadrados:
| Dato \(x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) |
|---|---|---|
| 3 | \(3-7=-4\) | \((-4)^2=16\) |
| 5 | \(5-7=-2\) | \((-2)^2=4\) |
| 7 | \(7-7=0\) | \(0^2=0\) |
| 9 | \(9-7=2\) | \(2^2=4\) |
| 11 | \(11-7=4\) | \(4^2=16\) |
| Total | \(40\) |
3. Calculamos la varianza muestral:
\[ s^2=\frac{40}{5-1}=\frac{40}{4}=10 \]
Respuesta: la varianza muestral es \(10\).
Ejercicio 3: desviación estándar muestral
A partir del resultado del Ejercicio 2, calcula la desviación estándar muestral \(s\).
Del Ejercicio 2 sabemos que:
\[ s^2=10 \]
La desviación estándar es la raíz cuadrada de la varianza:
\[ s=\sqrt{10}\approx 3{,}16 \]
Respuesta: la desviación estándar muestral es aproximadamente \(3{,}16\).
Problema 1: comparación de grupos
Las edades de dos grupos de amigos son:
Grupo A: \(\{18,\ 19,\ 20,\ 21,\ 22\}\)
Grupo B: \(\{15,\ 20,\ 18,\ 25,\ 17\}\)
- Calcula la media, el rango, la varianza y la desviación estándar muestral para cada grupo.
- ¿Qué grupo tiene edades más homogéneas? Justifica usando los resultados.
Grupo A:
\[ \bar{x}_A=\frac{18+19+20+21+22}{5}=\frac{100}{5}=20 \]
\[ Rango_A=22-18=4 \]
Las desviaciones respecto de la media son:
\[ -2,\ -1,\ 0,\ 1,\ 2 \]
Sus cuadrados son:
\[ 4,\ 1,\ 0,\ 1,\ 4 \]
La suma de cuadrados es \(10\), entonces:
\[ s_A^2=\frac{10}{5-1}=\frac{10}{4}=2{,}5 \]
\[ s_A=\sqrt{2{,}5}\approx 1{,}58 \]
Grupo B:
\[ \bar{x}_B=\frac{15+20+18+25+17}{5}=\frac{95}{5}=19 \]
\[ Rango_B=25-15=10 \]
Las desviaciones respecto de la media son:
\[ -4,\ 1,\ -1,\ 6,\ -2 \]
Sus cuadrados son:
\[ 16,\ 1,\ 1,\ 36,\ 4 \]
La suma de cuadrados es \(58\), entonces:
\[ s_B^2=\frac{58}{5-1}=\frac{58}{4}=14{,}5 \]
\[ s_B=\sqrt{14{,}5}\approx 3{,}81 \]
Conclusión: el Grupo A tiene edades más homogéneas. Su rango y su desviación estándar son menores, lo que indica que sus edades están más agrupadas alrededor de la media.
Problema 2: control de calidad
Se mide la longitud, en centímetros, de 10 tornillos producidos por una máquina:
\[ \{5{,}0,\ 5{,}1,\ 4{,}9,\ 5{,}2,\ 5{,}0,\ 4{,}8,\ 5{,}1,\ 5{,}3,\ 4{,}9,\ 5{,}0\} \]
- Calcula la media, la varianza y la desviación estándar muestral.
- Si se consideran aceptables los tornillos dentro de una desviación estándar de la media, es decir, \(\bar{x}\pm s\), ¿cuál es el rango de longitudes aceptable?
- ¿Cuántos de los tornillos medidos están dentro de ese rango?
a) Media, varianza y desviación estándar muestral
Calculamos la media:
\[ \bar{x}=\frac{5{,}0+5{,}1+4{,}9+5{,}2+5{,}0+4{,}8+5{,}1+5{,}3+4{,}9+5{,}0}{10} \]
\[ \bar{x}=\frac{50{,}3}{10}=5{,}03 \]
La suma de los cuadrados de las desviaciones respecto de la media es:
\[ \sum(x_i-\bar{x})^2=0{,}201 \]
Como se pide varianza muestral, dividimos por \(n-1=9\):
\[ s^2=\frac{0{,}201}{9}\approx 0{,}0223 \]
La desviación estándar muestral es:
\[ s=\sqrt{0{,}0223}\approx 0{,}15 \]
b) Rango aceptable
Se calcula usando \(\bar{x}\pm s\):
\[ 5{,}03-0{,}15=4{,}88 \]
\[ 5{,}03+0{,}15=5{,}18 \]
Por lo tanto, el rango aceptable es aproximadamente:
\[ [4{,}88,\ 5{,}18] \]
c) Conteo de tornillos dentro del rango
Comparamos cada medida con el intervalo \([4{,}88,\ 5{,}18]\). Los tornillos que miden \(4{,}8\), \(5{,}2\) y \(5{,}3\) están fuera del rango.
Por lo tanto, \(7\) de los \(10\) tornillos están dentro del rango aceptable.