Los datos estan dispersos?
3. Organización de Datos en Tablas e Interpretación Gráfica
Nota del profesor
Antes de poder analizar qué tan dispersos están nuestros datos, primero debemos ser capaces de ordenarlos y visualizarlos de manera efectiva. Las tablas y los gráficos son herramientas principales para transformar una lista de números en información útil.
Tipos de Tablas de Frecuencias
Organización de datos
Dependiendo de la naturaleza de los datos, usamos distintas tablas para organizarlos.
| Tipo de tabla | Uso principal | Ejemplo de datos |
|---|---|---|
| Tabla de registros o datos sueltos | Cuando hay un registro de cada uno de los datos y no han sido agrupados. | Sueldo específico de cada trabajador, registros de RUT. |
| Frecuencias para datos no agrupados | Cuando tenemos un número manejable de valores distintos que se repiten. | Notas de un curso, número de hijos por familia. |
| Frecuencias para datos agrupados | Cuando tenemos muchos valores distintos o datos continuos. | Alturas de personas, peso de objetos, tiempo de espera en una fila. |
Ejemplos de Tablas para Organizar Datos
Ejemplo: Tabla de datos simple
En estos registros de altura no hay valores repetidos.
Datos: alturas, en centímetros, de 5 estudiantes.
| Estudiante | Altura (cm) |
|---|---|
| 1 | 160 |
| 2 | 165 |
| 3 | 170 |
| 4 | 172 |
| 5 | 168 |
Ejemplo: Tabla de frecuencias para datos no agrupados
Aquí hay edades que se repiten, por lo que se muestra cada edad una sola vez y su frecuencia respectiva.
Datos: edades de 10 estudiantes: 20, 22, 20, 21, 22, 20, 23, 22, 20, 21.
| Edad | Frecuencia \(f\) | Frecuencia relativa |
|---|---|---|
| 20 | 4 | 40% |
| 21 | 2 | 20% |
| 22 | 3 | 30% |
| 23 | 1 | 10% |
| Total | 10 | 100% |
Ejemplo: Tabla de frecuencias para datos agrupados
Con 40 estudiantes hay muchas estaturas distintas, por lo que conviene agruparlas en intervalos o clases.
Datos: alturas, en centímetros, de 40 estudiantes.
| Intervalo de altura (cm) | Frecuencia \(f\) |
|---|---|
| 150 - 159 | 5 |
| 160 - 169 | 12 |
| 170 - 179 | 15 |
| 180 - 189 | 8 |
| Total | 40 |
¿Cuándo agrupar en intervalos?
Agrupar datos en intervalos o clases es útil para simplificar un conjunto de datos grande o continuo. Al hacerlo, recuerda estas reglas generales:
- Todos los intervalos deben tener la misma amplitud.
- Los intervalos no deben superponerse.
- Deben cubrir todo el rango de los datos, desde el mínimo hasta el máximo.
- Una práctica habitual es usar entre 5 y 15 intervalos, según el tamaño del conjunto de datos.
Interpretación Visual de la Dispersión
Gráficos y dispersión
Los gráficos permiten ver la dispersión de los datos de un solo vistazo.
Histogramas
Interpretación de histogramas
Un histograma muestra la forma de la distribución de los datos. Observando su forma, podemos estimar visualmente la dispersión:
- Un histograma alto y estrecho indica baja dispersión, porque los datos están concentrados.
- Un histograma ancho y plano indica alta dispersión, porque los datos están más esparcidos.
Diagramas de Caja (Boxplots)
Componentes de un diagrama de caja
- Mínimo: menor valor representado.
- Primer cuartil \(Q_1\): valor que deja aproximadamente el 25% de los datos por debajo.
- Mediana \(Q_2\): valor central del conjunto de datos.
- Tercer cuartil \(Q_3\): valor que deja aproximadamente el 75% de los datos por debajo.
- Máximo: mayor valor representado.
- Rango intercuartílico: corresponde a \(Q_3-Q_1\). Un rango intercuartílico mayor indica mayor dispersión en el centro de los datos.
Ejemplo: comparación de boxplots
Analicemos la dispersión de tres conjuntos de datos \(j\), \(k\) y \(l\) mediante sus diagramas de caja.
Conjunto \(j\)
Conjunto \(k\)
Conjunto \(l\)
| Característica | \(j\) | \(k\) | \(l\) |
|---|---|---|---|
| Rango | \(40-10=30\) | \(55-5=50\) | \(55-25=30\) |
| Rango intercuartílico | \(25-15=10\) | \(45-10=35\) | \(50-30=20\) |
| Conclusión | Menor dispersión central. | Mayor dispersión. | Dispersión intermedia. |
Ejercicios y Problemas
Ejercicio 1: Tabla de frecuencias
Las calificaciones de 20 estudiantes son: 7, 8, 6, 5, 9, 7, 8, 10, 6, 7, 7, 8, 9, 5, 6, 8, 7, 4, 9, 7. Organiza los datos en una tabla de frecuencias y calcula la frecuencia relativa de cada calificación.
Primero contamos cuántas veces aparece cada calificación. Luego dividimos cada frecuencia por el total de datos, que es 20.
| Calificación | Frecuencia absoluta | Frecuencia relativa |
|---|---|---|
| 4 | 1 | \(\frac{1}{20}=0{,}05=5\%\) |
| 5 | 2 | \(\frac{2}{20}=0{,}10=10\%\) |
| 6 | 3 | \(\frac{3}{20}=0{,}15=15\%\) |
| 7 | 6 | \(\frac{6}{20}=0{,}30=30\%\) |
| 8 | 4 | \(\frac{4}{20}=0{,}20=20\%\) |
| 9 | 3 | \(\frac{3}{20}=0{,}15=15\%\) |
| 10 | 1 | \(\frac{1}{20}=0{,}05=5\%\) |
| Total | 20 | 100% |
Ejercicio 2: Datos agrupados
Los pesos, en kilogramos, de 30 paquetes son: 1,2; 1,5; 1,8; 2,1; 1,3; 1,6; 1,9; 2,0; 1,4; 1,7; 1,2; 1,5; 2,3; 1,8; 1,6; 1,4; 1,7; 2,0; 1,9; 1,3; 1,5; 1,8; 2,2; 1,7; 1,4; 1,6; 2,1; 1,9; 1,5; 1,8.
Agrupa los datos en una tabla de frecuencias con intervalos de ancho \(0{,}4\) kg, comenzando en \(1{,}2\) kg.
Usaremos intervalos de amplitud \(0{,}4\):
- \([1{,}2,\ 1{,}6[\)
- \([1{,}6,\ 2{,}0[\)
- \([2{,}0,\ 2{,}4]\)
| Intervalo de peso (kg) | Frecuencia |
|---|---|
| \([1{,}2,\ 1{,}6[\) | 11 |
| \([1{,}6,\ 2{,}0[\) | 13 |
| \([2{,}0,\ 2{,}4]\) | 6 |
| Total | 30 |
Por lo tanto, el intervalo con mayor frecuencia es \([1{,}6,\ 2{,}0[\), con 13 paquetes.
Ejercicio 3: Interpretación de histogramas
Observa las siguientes descripciones:
- Histograma A: simétrico y estrecho, centrado en 50.
- Histograma B: sesgado a la derecha, con la mayoría de datos entre 20 y 40.
- Histograma C: ancho y plano, extendiéndose desde 10 hasta 90.
¿Qué histograma tiene la mayor desviación estándar? ¿Y la menor?
La desviación estándar mide qué tan alejados están los datos respecto de su centro.
- Mayor desviación estándar: histograma C, porque es el más ancho y plano, lo que indica mayor dispersión.
- Menor desviación estándar: histograma A, porque es el más estrecho, lo que indica menor dispersión.
Problema 1: Comparando la dispersión
Se presentan dos diagramas de caja:
Boxplot X
Boxplot Y
¿Qué boxplot representa datos con mayor dispersión? Justifica.
Calculamos el rango intercuartílico de cada boxplot:
\[ IQR_X = Q_3-Q_1 = 35-25=10 \]
\[ IQR_Y = Q_3-Q_1 = 40-20=20 \]
El Boxplot Y representa datos con mayor dispersión central, porque su rango intercuartílico es mayor. Además, su rango total también es mayor:
\[ R_X = 42-18=24 \]
\[ R_Y = 60-10=50 \]
Por lo tanto, los datos del boxplot Y están más esparcidos.
Problema 2: Análisis de consultorios
Observa los histogramas y diagramas de caja que representan los tiempos de espera, en minutos, de dos consultorios médicos.
Consultorio A
Consultorio B
- ¿Qué consultorio tiene, en promedio visual, tiempos de espera más largos?
- ¿En qué consultorio los tiempos son más variables?
- Si tuvieras prisa, ¿a qué consultorio irías y por qué?
- El Consultorio B tiene tiempos de espera más largos, porque su histograma y su diagrama de caja están desplazados hacia valores mayores.
- El Consultorio B tiene tiempos más variables. Su rango es \(85-15=70\), mientras que el del Consultorio A es \(32-10=22\). Además, su caja es más ancha.
- Conviene elegir el Consultorio A, porque tiene menor mediana y menor dispersión. Aunque no garantiza siempre la espera más corta, visualmente es la opción más segura para esperar menos.
Idea final
Las tablas permiten ordenar datos y los gráficos permiten interpretar rápidamente su comportamiento. Para analizar dispersión, conviene observar el ancho del histograma, el tamaño de la caja en un boxplot y la presencia de valores extremos.