Los datos estan dispersos?
| Sitio: | MATEMÁTICAS × Profe Arauco |
| Curso: | Media 3 |
| Libro: | Los datos estan dispersos? |
| Imprimido por: | Invitado |
| Día: | jueves, 23 de julio de 2026, 21:01 |
Tabla de contenidos
- 1. Recordemos cosas de la Estadística
- 2. Introducción a la Estadística y la Variabilidad
- 3. Organización de Datos en Tablas e Interpretación Gráfica
- 4. Medidas de Dispersión: Rango, Varianza y Desviación Estándar
- 5. Cálculo de Varianza y Desviación Estándar para Datos Agrupados
- 6. Interpretación y Comparación con Medidas de Dispersión
- 7. Aplicaciones y Toma de Decisiones con Medidas de Dispersión
- 8. Coeficiente de Variación (CV)
- 9. Coeficiente de Variación con Datos en Tablas
- 10. problemas interpretacion con datos agrupados en intervalos
- 11. La Desviación Media (optativo complementario)
- 12. Ejercicios de Selección Múltiple (Parte 1)
- 13. Ejercicios de Selección Múltiple (Parte 2)
1. Recordemos cosas de la Estadística
¿Qué es la estadística?
La estadística es la ciencia que recolecta, organiza, analiza, interpreta y presenta datos para obtener conclusiones y tomar decisiones. Es una herramienta fundamental en muchos campos.
Ejemplos en el mundo real
- Un laboratorio analiza muestras de sangre para determinar la prevalencia de una enfermedad en la población.
- Una encuestadora pregunta a personas sobre su intención de voto para predecir el resultado de las próximas elecciones.
- Un agricultor usa datos históricos de lluvia para decidir cuándo es el mejor momento para plantar sus cultivos.
Tipos de datos
Clasificación principal
Los datos son la materia prima de la estadística. Se clasifican principalmente en dos grandes grupos:
| Tipo de dato | Descripción | Subtipos y ejemplos |
|---|---|---|
| Cualitativos (o categóricos) | Describen características o cualidades que no pueden ser medidas con números. | Nominal: Categorías sin un orden específico (Ej: Estado civil, marca de auto). Ordinal: Categorías con un orden jerárquico (Ej: Nivel de educación, calificación de un servicio). |
| Cuantitativos (o numéricos) | Representan cantidades y se pueden medir numéricamente. | Discretos: Se pueden contar y toman valores enteros (Ej: Número de hijos, errores en un examen). Continuos: Pueden tomar cualquier valor dentro de un rango (Ej: Peso, temperatura). De intervalo: El cero es una referencia, no indica ausencia (Ej: Temperatura en °C, año de nacimiento). De razón: El cero es absoluto e indica ausencia total (Ej: Ingreso mensual, altura de un edificio). |
Ejercicio 1: Clasificación de datos
Clasifica los siguientes datos:
- Tipo de película favorita (comedia, drama, acción, etc.).
- Número de estudiantes ausentes en una clase.
- Temperatura máxima diaria en una ciudad.
- Nivel de acuerdo con una afirmación (totalmente en desacuerdo, en desacuerdo, neutral, de acuerdo, totalmente de acuerdo).
- Cantidad de dinero en una billetera.
- Año de fabricación de un auto.
- Peso de un paquete de arroz.
- Número de habitaciones en una casa.
- Cualitativo nominal.
- Cuantitativo discreto.
- Cuantitativo continuo (también podría considerarse de intervalo).
- Cualitativo ordinal.
- Cuantitativo de razón (continuo, aunque discreto en la práctica monetaria).
- Cuantitativo de intervalo.
- Cuantitativo de razón (continuo).
- Cuantitativo discreto.
Ejercicio 2: Creación de ejemplos
Para cada uno de los siguientes escenarios, proporciona un ejemplo de los tipos de datos indicados (nominal, ordinal, discreto, continuo, de intervalo y de razón):
- Escenario 1: Una encuesta en un supermercado.
- Escenario 2: El registro de pacientes en un consultorio médico.
- Escenario 3: La medición de la calidad del aire en una ciudad.
- Encuesta en un supermercado:
- Nominal: Marca de cereal favorita.
- Ordinal: Nivel de satisfacción (bueno, regular, malo).
- Discreto: Número de artículos comprados.
- Continuo: Peso de las frutas compradas.
- De intervalo: Hora de la compra.
- De razón: Gasto total en la compra.
- Registro de pacientes:
- Nominal: Grupo sanguíneo.
- Ordinal: Nivel de dolor (leve, moderado, severo).
- Discreto: Número de visitas previas.
- Continuo: Temperatura corporal.
- De intervalo: Año de la primera visita.
- De razón: Edad del paciente.
- Medición de calidad del aire:
- Nominal: Tipo de contaminante principal (ej. SO2, CO).
- Ordinal: Nivel de alerta (buena, regular, peligrosa).
- Discreto: Número de días con alta contaminación en un mes.
- Continuo: Concentración de partículas PM2.5 (µg/m³).
- De intervalo: Hora del día en que se registra.
- De razón: Índice de Calidad del Aire (ICA).
Medidas de tendencia central
Definición
Nos entregan un valor "típico" o representativo de un conjunto de datos.
Fórmulas clave
- Media (promedio): Es la suma de todos los datos dividida por el número total de datos. Se representa como \( \bar{x} \).
\[ \bar{x} = \frac{\sum_{i=1}^{n} x_i}{n} \]
- Mediana: Es el valor que se encuentra justo en el centro de los datos, una vez que han sido ordenados de menor a mayor.
- Moda: Es el valor que aparece con mayor frecuencia en el conjunto de datos. Un conjunto puede ser bimodal (dos modas) o multimodal.
Cuidado con los valores atípicos
La media es muy sensible a los valores extremos (muy altos o muy bajos). Un solo dato atípico puede "arrastrar" el promedio y hacer que no sea representativo del conjunto. La mediana, en cambio, es mucho más robusta frente a estos valores.
Ejemplo: Media (promedio)
Es el valor que se obtiene al sumar todos los datos y dividirlos por la cantidad total.
Caso A: Para el conjunto de datos \( x = \{1, 3, 5, 7\} \), la media es:
\[ \bar{x} = \frac{1+3+5+7}{4} = \frac{16}{4} = 4 \]
Caso B: Para el conjunto de datos \( y = \{100, 200, 600\} \), la media es:
\[ \bar{y} = \frac{100+200+600}{3} = \frac{900}{3} = 300 \ ]
Ejemplo: Mediana (valor central)
Es el valor que se encuentra justo en el centro de un conjunto de datos, una vez que estos han sido ordenados de menor a mayor.
Caso impar: Para el conjunto \( x = \{10, 50, 30, 40, 20\} \):
- Ordenar: \( \{10, 20, \mathbf{30}, 40, 50\} \)
- Identificar el centro: Con \( n=5 \) datos (un número impar), el valor central es el que está en la tercera posición. La mediana es 30.
Caso par: Para el conjunto \( y = \{4, 8, 2, 6\} \):
- Ordenar: \( \{2, \mathbf{4}, \mathbf{6}, 8\} \)
- Identificar los dos centrales: Con \( n=4 \) datos (un número par), los valores centrales son 4 y 6.
- Calcular el promedio: Se promedian los dos valores centrales: \[ \frac{4+6}{2} = 5 \] La mediana es 5.
Posición del dato central para la mediana
La forma de identificar el dato central depende directamente de si la cantidad total de datos (\( n \)) en el grupo es par o impar.
- Cuando el número de datos (\( n \)) es impar:
Hay un único valor central. La posición de este dato se encuentra con la fórmula: \[ \text{Posición} = \frac{n+1}{2} \] - Cuando el número de datos (\( n \)) es par:
Hay dos valores en el centro. La mediana será el promedio de los datos que se encuentran en las posiciones: \[ \frac{n}{2} \quad \text{y} \quad \frac{n}{2} + 1 \]
Ejemplo: Moda (valor más frecuente)
Es el valor o los valores que aparecen con mayor frecuencia dentro de un conjunto de datos.
Caso unimodal: En el conjunto \( \{2, \mathbf{2}, 3, 4, 5\} \), el número que más se repite es el 2. Por lo tanto, la moda es 2.
Caso bimodal: En el conjunto \( \{\mathbf{1}, \mathbf{1}, 2, \mathbf{3}, \mathbf{3}\} \), tanto el 1 como el 3 se repiten dos veces, siendo los más frecuentes. Por lo tanto, el conjunto es bimodal y sus modas son 1 y 3.
Problema 1: El efecto de un valor atípico
Se registró el tiempo (en minutos) que tardaron 10 personas en completar una tarea:
25, 30, 28, 32, 27, 29, 31, 26, 33, 29
- Calcula la media, mediana y moda de los tiempos.
- ¿Qué medida de tendencia central describe mejor el "tiempo típico"?
- Si una persona adicional completa la tarea en 60 minutos, ¿cómo afectaría esto a la media, mediana y moda? ¿Cuál sería la más afectada?
- Datos originales ordenados: 25, 26, 27, 28, 29, 29, 30, 31, 32, 33.
Media: 29 min.
Mediana: \( \frac{29 + 29}{2} = 29 \) min.
Moda: 29 min. - En este caso, las tres medidas son idénticas (29 min), por lo que cualquiera de ellas describe bien el tiempo típico.
- Con el dato extra de 60 minutos:
Nueva media: \( \approx 31{,}82 \) min.
Nueva mediana: 29 min.
Nueva moda: Sigue siendo 29 min.
La media es, por lejos, la medida más afectada, ya que es extremadamente sensible a los valores extremos (atípicos).
Problema 2: Representatividad de las medidas
Se pregunta a un grupo de personas cuántos libros leyeron en el último año. Las respuestas son:
2, 0, 5, 1, 3, 2, 1, 0, 4, 6, 2, 3, 1, 0, 40
- Calcula la media, mediana y moda.
- ¿Cuál es más representativa de la cantidad de libros que leyó la mayoría? Justifica.
- ¿Hay valores atípicos? ¿Cómo afectan a la media?
- Datos ordenados: 0, 0, 0, 1, 1, 1, 2, 2, 2, 3, 3, 4, 5, 6, 40.
Media: \( \approx 4{,}67 \) libros.
Mediana: 2 libros.
Moda: Este es un caso trimodal. Los valores más frecuentes son 0, 1 y 2 (todos aparecen 3 veces). - La mediana (2 libros) es la más representativa. La media (\( \approx 4{,}67 \)) se ve muy afectada por el valor extremo de 40, que no es típico del grupo encuestado.
- El valor 40 es claramente un valor atípico. "Jala" o sesga la media hacia un valor más alto, haciéndola menos representativa del comportamiento central de la mayoría.
2. Introducción a la Estadística y la Variabilidad
¿Qué es la variabilidad?
La variabilidad, o dispersión, nos indica qué tan "esparcidos" o "alejados" están los datos entre sí o respecto a un valor central. Es un concepto clave en estadística.
A menudo, cuando analizamos un conjunto de datos, nos centramos en la media (el promedio) para resumirlo todo en un solo número. Sin embargo, la media por sí sola puede ser muy engañosa. La variabilidad (o dispersión) nos cuenta el resto de la historia: cuán esparcidos o consistentes están los datos. Aquí te explicamos por qué es un concepto crucial.
1. La media sola puede ser engañosa
Dos conjuntos de datos pueden tener la misma media, pero contar historias completamente opuestas. La variabilidad revela la verdadera distribución de los datos.
Ejemplo: Notas de dos cursos
Imagina que calculas la nota promedio de dos cursos de 5 estudiantes y en ambos el promedio final es un 5,5.
- Curso A (baja variabilidad): Sus promedios de notas son
. El rendimiento es muy consistente y predecible. Sabes qué esperar de ellos.{ 5 , 5 ; 5 , 0 ; 6 , 0 ; 5 , 5 ; 5 , 5 } - Curso B (alta variabilidad): Sus promedios de notas son
. El rendimiento es impredecible y extremo. Tienes estudiantes con serias dificultades y otros que sobresalen.{ 2 , 0 ; 7 , 0 ; 4 , 5 ; 7 , 0 ; 7 , 0 }
Sin ver la dispersión, pensarías que ambos cursos son académicamente iguales, perdiendo información crucial para tomar decisiones pedagógicas (como ofrecer apoyo a los estudiantes del curso B que lo necesitan).
2. Mide la consistencia y la confiabilidad
Una baja variabilidad es sinónimo de calidad y predictibilidad. Esto es vital en la industria, las finanzas y la ciencia.
Ejemplo: Producción industrial
Una fábrica de tornillos busca que sus productos tengan un diámetro de
- Fábrica A (baja variabilidad): Produce tornillos que miden entre
y4 , 9 9 m m . Casi todos son perfectos, lo que se traduce en clientes satisfechos y cero devoluciones.5 , 0 1 m m - Fábrica B (alta variabilidad): Produce tornillos que miden entre
y4 , 8 0 m m . Muchos no encajarán en su destino, generando pérdidas económicas y dañando la reputación de la marca.5 , 2 0 m m
En esta situación, sería deseable la más baja variabilidad posible.
Ejemplo: Inversiones financieras
Dos fondos de inversión tienen un retorno promedio anual de un
- Fondo A (baja variabilidad): Su retorno anual ha oscilado entre el
y el2 % .6 % - Fondo B (alta variabilidad): Su retorno ha fluctuado entre un
(pérdida) y un− 1 0 % (ganancia).+ 1 8 %
Nuevamente, ambos fondos promedian el mismo
3. Permite comparaciones justas
Para decidir entre opciones, la variabilidad es tan importante como el promedio. Te dice cuál opción es más fiable en el mundo real.
Ejemplo: Contratar un proveedor de internet
Vas a contratar un proveedor de internet para tu casa. Ambos prometen
- Proveedor A (baja variabilidad): Tu velocidad casi siempre estará entre
y1 9 0 . Es una conexión estable para tus videollamadas o clases online.2 1 0 M b p s - Proveedor B (alta variabilidad): A veces tendrás
, pero otras veces caerá a4 0 0 M b p s , interrumpiendo tu trabajo justo en el momento más importante.1 0 M b p s
Si bien la idea de alcanzar
4. Ayuda a identificar valores atípicos (outliers)
Una variabilidad alta puede ser una "alarma" que te avisa de la existencia de datos anómalos (outliers) que están distorsionando la realidad y, por ende, el promedio.
Ejemplo: Tiempos de entrega
Analizas el tiempo de entrega de tus productos y el promedio es de
Al revisar los datos en detalle, descubres que el
Esos valores atípicos (los de 15 días) inflan artificialmente el promedio y la variabilidad. Sin detectarlos, podrías pensar que tu logística es mala en general, cuando en realidad el problema fue un evento aislado y específico que debes gestionar de forma diferente.
En resumen: ¿Por qué medir la variabilidad?
Con la misma media, dos grupos pueden comportarse muy distinto, pero si la dispersión difiere, entonces se afecta la confiabilidad de las predicciones de cada grupo.
- Nos ayuda a comparar conjuntos con datos de la misma naturaleza.
- Permite detectar si los datos que analizamos son consistentes o muy dispersos.
- Una media sin considerar la variabilidad puede ser engañosa.
Problema 1: Análisis de distribución
Observa la siguiente distribución de datos y responde:
- Indica la media de la distribución.
- Identifica los valores en los "extremos" de la distribución.
- Identifica el sector donde hay una mayor concentración de datos.
- La media se calcula sumando los valores y dividiendo por el total de datos (10):
¯ 𝑥 = 1 2 + 1 5 + 1 8 + 1 8 + 2 0 + 2 1 + 2 1 + 2 1 + 2 5 + 3 0 1 0 = 2 0 1 1 0 = 2 0 , 1 - Los valores en los extremos son el mínimo (
) y el máximo (1 2 ).3 0 - La mayor concentración de datos está alrededor del valor
(que es además la moda del conjunto).2 1
Problema 2: Rendimiento de equipos
Dos equipos de baloncesto registran sus puntajes en los últimos 5 partidos:
- Equipo A: 85, 90, 88, 92, 80
- Equipo B: 75, 105, 80, 95, 85
- Calcula la media de los puntajes de cada equipo.
- Argumenta: ¿qué equipo tiene mayor variabilidad en sus puntajes? ¿Por qué?
- Calculamos los promedios:
Equipo A: puntos.¯ 𝑥 𝐴 = 8 5 + 9 0 + 8 8 + 9 2 + 8 0 5 = 4 3 5 5 = 8 7
Equipo B: puntos.¯ 𝑥 𝐵 = 7 5 + 1 0 5 + 8 0 + 9 5 + 8 5 5 = 4 4 0 5 = 8 8 - El Equipo B tiene mayor variabilidad. Aunque su media es similar a la del Equipo A, sus puntajes individuales están mucho más dispersos (desde un mínimo de
a un máximo de7 5 ), mientras que los puntajes del Equipo A son más consistentes y agrupados, variando solo entre1 0 5 y8 0 .9 2
Problema 3: Grupos de estudiantes
Observa los siguientes gráficos que muestran las edades de los estudiantes en dos grupos:
| Grupo A | Grupo B |
|---|---|
- Argumenta: ¿qué grupo de estudiantes presenta una mayor variabilidad en sus edades? ¿Por qué?
- El Grupo B tiene mayor variabilidad. Aunque el Grupo A tiene un pico muy alto en la edad
, la mayoría de sus datos se agrupan firmemente cerca de ese valor. Eso significa que hay poca dispersión respecto al promedio, lo que se traduce en una varianza baja.1 4
En cambio, el Grupo B muestra una distribución mucho más pareja entre todas las edades. Como sus datos están más repartidos y hay una mayor cantidad de valores lejanos al centro, la distancia promedio respecto al valor central (la media) es más grande, lo que genera una mayor variabilidad o dispersión general.
3. Organización de Datos en Tablas e Interpretación Gráfica
Nota del profesor
Antes de poder analizar qué tan dispersos están nuestros datos, primero debemos ser capaces de ordenarlos y visualizarlos de manera efectiva. Las tablas y los gráficos son herramientas principales para transformar una lista de números en información útil.
Tipos de Tablas de Frecuencias
Organización de datos
Dependiendo de la naturaleza de los datos, usamos distintas tablas para organizarlos.
| Tipo de tabla | Uso principal | Ejemplo de datos |
|---|---|---|
| Tabla de registros o datos sueltos | Cuando hay un registro de cada uno de los datos y no han sido agrupados. | Sueldo específico de cada trabajador, registros de RUT. |
| Frecuencias para datos no agrupados | Cuando tenemos un número manejable de valores distintos que se repiten. | Notas de un curso, número de hijos por familia. |
| Frecuencias para datos agrupados | Cuando tenemos muchos valores distintos o datos continuos. | Alturas de personas, peso de objetos, tiempo de espera en una fila. |
Ejemplos de Tablas para Organizar Datos
Ejemplo: Tabla de datos simple
En estos registros de altura no hay valores repetidos.
Datos: alturas, en centímetros, de 5 estudiantes.
| Estudiante | Altura (cm) |
|---|---|
| 1 | 160 |
| 2 | 165 |
| 3 | 170 |
| 4 | 172 |
| 5 | 168 |
Ejemplo: Tabla de frecuencias para datos no agrupados
Aquí hay edades que se repiten, por lo que se muestra cada edad una sola vez y su frecuencia respectiva.
Datos: edades de 10 estudiantes: 20, 22, 20, 21, 22, 20, 23, 22, 20, 21.
| Edad | Frecuencia \(f\) | Frecuencia relativa |
|---|---|---|
| 20 | 4 | 40% |
| 21 | 2 | 20% |
| 22 | 3 | 30% |
| 23 | 1 | 10% |
| Total | 10 | 100% |
Ejemplo: Tabla de frecuencias para datos agrupados
Con 40 estudiantes hay muchas estaturas distintas, por lo que conviene agruparlas en intervalos o clases.
Datos: alturas, en centímetros, de 40 estudiantes.
| Intervalo de altura (cm) | Frecuencia \(f\) |
|---|---|
| 150 - 159 | 5 |
| 160 - 169 | 12 |
| 170 - 179 | 15 |
| 180 - 189 | 8 |
| Total | 40 |
¿Cuándo agrupar en intervalos?
Agrupar datos en intervalos o clases es útil para simplificar un conjunto de datos grande o continuo. Al hacerlo, recuerda estas reglas generales:
- Todos los intervalos deben tener la misma amplitud.
- Los intervalos no deben superponerse.
- Deben cubrir todo el rango de los datos, desde el mínimo hasta el máximo.
- Una práctica habitual es usar entre 5 y 15 intervalos, según el tamaño del conjunto de datos.
Interpretación Visual de la Dispersión
Gráficos y dispersión
Los gráficos permiten ver la dispersión de los datos de un solo vistazo.
Histogramas
Interpretación de histogramas
Un histograma muestra la forma de la distribución de los datos. Observando su forma, podemos estimar visualmente la dispersión:
- Un histograma alto y estrecho indica baja dispersión, porque los datos están concentrados.
- Un histograma ancho y plano indica alta dispersión, porque los datos están más esparcidos.
Diagramas de Caja (Boxplots)
Componentes de un diagrama de caja
- Mínimo: menor valor representado.
- Primer cuartil \(Q_1\): valor que deja aproximadamente el 25% de los datos por debajo.
- Mediana \(Q_2\): valor central del conjunto de datos.
- Tercer cuartil \(Q_3\): valor que deja aproximadamente el 75% de los datos por debajo.
- Máximo: mayor valor representado.
- Rango intercuartílico: corresponde a \(Q_3-Q_1\). Un rango intercuartílico mayor indica mayor dispersión en el centro de los datos.
Ejemplo: comparación de boxplots
Analicemos la dispersión de tres conjuntos de datos \(j\), \(k\) y \(l\) mediante sus diagramas de caja.
Conjunto \(j\)
Conjunto \(k\)
Conjunto \(l\)
| Característica | \(j\) | \(k\) | \(l\) |
|---|---|---|---|
| Rango | \(40-10=30\) | \(55-5=50\) | \(55-25=30\) |
| Rango intercuartílico | \(25-15=10\) | \(45-10=35\) | \(50-30=20\) |
| Conclusión | Menor dispersión central. | Mayor dispersión. | Dispersión intermedia. |
Ejercicios y Problemas
Ejercicio 1: Tabla de frecuencias
Las calificaciones de 20 estudiantes son: 7, 8, 6, 5, 9, 7, 8, 10, 6, 7, 7, 8, 9, 5, 6, 8, 7, 4, 9, 7. Organiza los datos en una tabla de frecuencias y calcula la frecuencia relativa de cada calificación.
Primero contamos cuántas veces aparece cada calificación. Luego dividimos cada frecuencia por el total de datos, que es 20.
| Calificación | Frecuencia absoluta | Frecuencia relativa |
|---|---|---|
| 4 | 1 | \(\frac{1}{20}=0{,}05=5\%\) |
| 5 | 2 | \(\frac{2}{20}=0{,}10=10\%\) |
| 6 | 3 | \(\frac{3}{20}=0{,}15=15\%\) |
| 7 | 6 | \(\frac{6}{20}=0{,}30=30\%\) |
| 8 | 4 | \(\frac{4}{20}=0{,}20=20\%\) |
| 9 | 3 | \(\frac{3}{20}=0{,}15=15\%\) |
| 10 | 1 | \(\frac{1}{20}=0{,}05=5\%\) |
| Total | 20 | 100% |
Ejercicio 2: Datos agrupados
Los pesos, en kilogramos, de 30 paquetes son: 1,2; 1,5; 1,8; 2,1; 1,3; 1,6; 1,9; 2,0; 1,4; 1,7; 1,2; 1,5; 2,3; 1,8; 1,6; 1,4; 1,7; 2,0; 1,9; 1,3; 1,5; 1,8; 2,2; 1,7; 1,4; 1,6; 2,1; 1,9; 1,5; 1,8.
Agrupa los datos en una tabla de frecuencias con intervalos de ancho \(0{,}4\) kg, comenzando en \(1{,}2\) kg.
Usaremos intervalos de amplitud \(0{,}4\):
- \([1{,}2,\ 1{,}6[\)
- \([1{,}6,\ 2{,}0[\)
- \([2{,}0,\ 2{,}4]\)
| Intervalo de peso (kg) | Frecuencia |
|---|---|
| \([1{,}2,\ 1{,}6[\) | 11 |
| \([1{,}6,\ 2{,}0[\) | 13 |
| \([2{,}0,\ 2{,}4]\) | 6 |
| Total | 30 |
Por lo tanto, el intervalo con mayor frecuencia es \([1{,}6,\ 2{,}0[\), con 13 paquetes.
Ejercicio 3: Interpretación de histogramas
Observa las siguientes descripciones:
- Histograma A: simétrico y estrecho, centrado en 50.
- Histograma B: sesgado a la derecha, con la mayoría de datos entre 20 y 40.
- Histograma C: ancho y plano, extendiéndose desde 10 hasta 90.
¿Qué histograma tiene la mayor desviación estándar? ¿Y la menor?
La desviación estándar mide qué tan alejados están los datos respecto de su centro.
- Mayor desviación estándar: histograma C, porque es el más ancho y plano, lo que indica mayor dispersión.
- Menor desviación estándar: histograma A, porque es el más estrecho, lo que indica menor dispersión.
Problema 1: Comparando la dispersión
Se presentan dos diagramas de caja:
Boxplot X
Boxplot Y
¿Qué boxplot representa datos con mayor dispersión? Justifica.
Calculamos el rango intercuartílico de cada boxplot:
\[ IQR_X = Q_3-Q_1 = 35-25=10 \]
\[ IQR_Y = Q_3-Q_1 = 40-20=20 \]
El Boxplot Y representa datos con mayor dispersión central, porque su rango intercuartílico es mayor. Además, su rango total también es mayor:
\[ R_X = 42-18=24 \]
\[ R_Y = 60-10=50 \]
Por lo tanto, los datos del boxplot Y están más esparcidos.
Problema 2: Análisis de consultorios
Observa los histogramas y diagramas de caja que representan los tiempos de espera, en minutos, de dos consultorios médicos.
Consultorio A
Consultorio B
- ¿Qué consultorio tiene, en promedio visual, tiempos de espera más largos?
- ¿En qué consultorio los tiempos son más variables?
- Si tuvieras prisa, ¿a qué consultorio irías y por qué?
- El Consultorio B tiene tiempos de espera más largos, porque su histograma y su diagrama de caja están desplazados hacia valores mayores.
- El Consultorio B tiene tiempos más variables. Su rango es \(85-15=70\), mientras que el del Consultorio A es \(32-10=22\). Además, su caja es más ancha.
- Conviene elegir el Consultorio A, porque tiene menor mediana y menor dispersión. Aunque no garantiza siempre la espera más corta, visualmente es la opción más segura para esperar menos.
Idea final
Las tablas permiten ordenar datos y los gráficos permiten interpretar rápidamente su comportamiento. Para analizar dispersión, conviene observar el ancho del histograma, el tamaño de la caja en un boxplot y la presencia de valores extremos.
4. Medidas de Dispersión: Rango, Varianza y Desviación Estándar
Repaso: ¿Qué es la Dispersión?
Dispersión
La dispersión, o variabilidad, indica qué tan esparcidos están los datos alrededor de un valor central, como la media. Una alta dispersión significa que los datos están muy alejados entre sí; una baja dispersión significa que los datos están agrupados cerca de la media.
El Rango
Definición de rango
El rango es la medida de dispersión más simple, ya que solo considera los valores extremos de un conjunto de datos.
Fórmula del rango
Se calcula como la diferencia entre el valor máximo y el valor mínimo del conjunto de datos.
\[ Rango = Valor\ máximo - Valor\ mínimo \]
Ejemplos de cálculo de rango
Conjunto 1: \(\{5,\ 8,\ 10,\ 12,\ 15\}\)
\[ Rango = 15-5=10 \]
Conjunto 2: \(\{23,\ 23,\ 24,\ 25,\ 26\}\)
\[ Rango = 26-23=3 \]
Limitaciones del rango
Aunque es fácil de calcular, el rango tiene una gran desventaja: es muy sensible a valores atípicos. Un solo dato extremo puede cambiar drásticamente el rango y dar una idea incompleta de la dispersión general, ya que ignora cómo se distribuyen todos los demás datos.
La Varianza \((s^2\) o \(\sigma^2)\)
Definición de varianza
La varianza es una medida de dispersión que considera todos los datos del conjunto. Mide qué tan alejados están los datos respecto de la media, pero usando las desviaciones elevadas al cuadrado.
Aunque sus unidades cuadradas, por ejemplo \(cm^2\), la hacen difícil de interpretar directamente, es la base para calcular la desviación estándar.
¿Por qué se eleva al cuadrado la distancia?
Si simplemente sumáramos las desviaciones respecto de la media, los valores negativos y positivos podrían cancelarse entre sí.
Por ejemplo, si la media es \(6\), entonces:
\[ 2-6=-4 \qquad \text{y} \qquad 10-6=4 \]
Al elevar cada desviación al cuadrado, todas aportan un valor positivo a la medida total de dispersión.
Procedimiento para calcular la varianza
- Calcular la media \(\bar{x}\): sumar todos los datos y dividir por la cantidad de datos.
- Calcular las desviaciones: restar la media a cada dato, es decir, \(x_i-\bar{x}\).
- Elevar al cuadrado cada desviación: calcular \((x_i-\bar{x})^2\).
- Sumar los cuadrados: obtener \(\sum(x_i-\bar{x})^2\).
- Dividir para promediar:
- Para una población completa, se divide por \(n\).
- Para una muestra, se divide por \(n-1\).
Uso de tablas para organizar el cálculo
Para conjuntos de datos más grandes, realizar el cálculo paso a paso puede ser desordenado. Usar una tabla es una estrategia eficiente para mantener los cálculos organizados y evitar errores.
Ejemplo de cálculo de varianza con tabla organizadora
Calculemos la varianza para los datos:
\[ \{2,\ 4,\ 6,\ 8,\ 10\} \]
Paso 1: Calcular la media.
\[ \bar{x}=\frac{2+4+6+8+10}{5}=\frac{30}{5}=6 \]
Paso 2: Construir la tabla y completar los cálculos.
| Dato \(x_i\) | Desviación \(x_i-\bar{x}\) | Desviación al cuadrado \((x_i-\bar{x})^2\) |
|---|---|---|
| 2 | \(2-6=-4\) | \((-4)^2=16\) |
| 4 | \(4-6=-2\) | \((-2)^2=4\) |
| 6 | \(6-6=0\) | \(0^2=0\) |
| 8 | \(8-6=2\) | \(2^2=4\) |
| 10 | \(10-6=4\) | \(4^2=16\) |
| Total | \(16+4+0+4+16=40\) |
Paso 3: Calcular la varianza.
Varianza muestral: se divide por \(n-1\).
\[ s^2=\frac{40}{5-1}=\frac{40}{4}=10 \]
Varianza poblacional: se divide por \(n\).
\[ \sigma^2=\frac{40}{5}=8 \]
Fórmulas de la varianza
Varianza muestral:
\[ s^2=\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1} \]
Varianza poblacional:
\[ \sigma^2=\frac{\sum_{i=1}^{n}(x_i-\mu)^2}{n} \]
Donde \(s^2\) es la varianza muestral, \(\sigma^2\) es la varianza poblacional, \(x_i\) son los datos, \(\bar{x}\) es la media de la muestra, \(\mu\) es la media de la población y \(n\) es el número de datos.
Desviación Típica (o Estándar)
Definición de desviación estándar
La desviación típica, o desviación estándar, es una de las medidas de dispersión más utilizadas. Su gran ventaja es que, al ser la raíz cuadrada de la varianza, se expresa en las mismas unidades que los datos originales, como centímetros, kilogramos o notas.
¿Por qué usar la desviación estándar?
Si la media de las notas de un curso es \(5{,}5\) y la desviación estándar es \(0{,}5\), podemos decir que, en promedio, las notas de los estudiantes se desvían aproximadamente \(0{,}5\) puntos de la media.
Esta interpretación es más clara que decir que la varianza es \(0{,}25\) notas al cuadrado.
Fórmulas de la desviación estándar
La desviación estándar es la raíz cuadrada de la varianza correspondiente.
Muestra:
\[ s=\sqrt{s^2}=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}} \]
Población:
\[ \sigma=\sqrt{\sigma^2}=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\mu)^2}{n}} \]
Ejemplo de cálculo de desviación estándar
Usando las varianzas calculadas en el ejemplo anterior:
Desviación estándar muestral:
\[ s=\sqrt{10}\approx 3{,}16 \]
Desviación estándar poblacional:
\[ \sigma=\sqrt{8}\approx 2{,}83 \]
Interpretación en un contexto real
Imagina que un estudio sobre la altura de un curso arroja una media de \(170\) cm y una desviación estándar de \(5\) cm.
- ¿Qué significa \(5\) cm? No significa que todos los estudiantes midan exactamente \(5\) cm más o menos que la media. Significa que \(5\) cm es una medida representativa de la dispersión general del grupo.
- ¿Es mucho o poco? El valor de la desviación estándar se interpreta siempre en contexto. Se vuelve útil al comparar con otros grupos o con un objetivo específico.
Regla general de interpretación
- Desviación estándar baja: indica que los datos son más consistentes y están agrupados cerca de la media.
- Desviación estándar alta: indica que los datos están más dispersos y son menos predecibles.
Ejercicios y Problemas Propuestos
Ejercicio 1: rango
Calcula el rango de los siguientes conjuntos de datos:
- \(50,\ 60,\ 70,\ 80,\ 90\)
- \(1,\ 3,\ 2,\ 7,\ 5,\ 4\)
- \(120,\ 125,\ 118,\ 122,\ 124\)
- El valor máximo es \(90\) y el mínimo es \(50\), entonces: \[ Rango=90-50=40 \]
- El valor máximo es \(7\) y el mínimo es \(1\), entonces: \[ Rango=7-1=6 \]
- El valor máximo es \(125\) y el mínimo es \(118\), entonces: \[ Rango=125-118=7 \]
Ejercicio 2: varianza muestral
Calcula la varianza muestral \(s^2\) de los datos:
\[ \{3,\ 5,\ 7,\ 9,\ 11\} \]
1. Calculamos la media:
\[ \bar{x}=\frac{3+5+7+9+11}{5}=\frac{35}{5}=7 \]
2. Calculamos las desviaciones y sus cuadrados:
| Dato \(x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) |
|---|---|---|
| 3 | \(3-7=-4\) | \((-4)^2=16\) |
| 5 | \(5-7=-2\) | \((-2)^2=4\) |
| 7 | \(7-7=0\) | \(0^2=0\) |
| 9 | \(9-7=2\) | \(2^2=4\) |
| 11 | \(11-7=4\) | \(4^2=16\) |
| Total | \(40\) |
3. Calculamos la varianza muestral:
\[ s^2=\frac{40}{5-1}=\frac{40}{4}=10 \]
Respuesta: la varianza muestral es \(10\).
Ejercicio 3: desviación estándar muestral
A partir del resultado del Ejercicio 2, calcula la desviación estándar muestral \(s\).
Del Ejercicio 2 sabemos que:
\[ s^2=10 \]
La desviación estándar es la raíz cuadrada de la varianza:
\[ s=\sqrt{10}\approx 3{,}16 \]
Respuesta: la desviación estándar muestral es aproximadamente \(3{,}16\).
Problema 1: comparación de grupos
Las edades de dos grupos de amigos son:
Grupo A: \(\{18,\ 19,\ 20,\ 21,\ 22\}\)
Grupo B: \(\{15,\ 20,\ 18,\ 25,\ 17\}\)
- Calcula la media, el rango, la varianza y la desviación estándar muestral para cada grupo.
- ¿Qué grupo tiene edades más homogéneas? Justifica usando los resultados.
Grupo A:
\[ \bar{x}_A=\frac{18+19+20+21+22}{5}=\frac{100}{5}=20 \]
\[ Rango_A=22-18=4 \]
Las desviaciones respecto de la media son:
\[ -2,\ -1,\ 0,\ 1,\ 2 \]
Sus cuadrados son:
\[ 4,\ 1,\ 0,\ 1,\ 4 \]
La suma de cuadrados es \(10\), entonces:
\[ s_A^2=\frac{10}{5-1}=\frac{10}{4}=2{,}5 \]
\[ s_A=\sqrt{2{,}5}\approx 1{,}58 \]
Grupo B:
\[ \bar{x}_B=\frac{15+20+18+25+17}{5}=\frac{95}{5}=19 \]
\[ Rango_B=25-15=10 \]
Las desviaciones respecto de la media son:
\[ -4,\ 1,\ -1,\ 6,\ -2 \]
Sus cuadrados son:
\[ 16,\ 1,\ 1,\ 36,\ 4 \]
La suma de cuadrados es \(58\), entonces:
\[ s_B^2=\frac{58}{5-1}=\frac{58}{4}=14{,}5 \]
\[ s_B=\sqrt{14{,}5}\approx 3{,}81 \]
Conclusión: el Grupo A tiene edades más homogéneas. Su rango y su desviación estándar son menores, lo que indica que sus edades están más agrupadas alrededor de la media.
Problema 2: control de calidad
Se mide la longitud, en centímetros, de 10 tornillos producidos por una máquina:
\[ \{5{,}0,\ 5{,}1,\ 4{,}9,\ 5{,}2,\ 5{,}0,\ 4{,}8,\ 5{,}1,\ 5{,}3,\ 4{,}9,\ 5{,}0\} \]
- Calcula la media, la varianza y la desviación estándar muestral.
- Si se consideran aceptables los tornillos dentro de una desviación estándar de la media, es decir, \(\bar{x}\pm s\), ¿cuál es el rango de longitudes aceptable?
- ¿Cuántos de los tornillos medidos están dentro de ese rango?
a) Media, varianza y desviación estándar muestral
Calculamos la media:
\[ \bar{x}=\frac{5{,}0+5{,}1+4{,}9+5{,}2+5{,}0+4{,}8+5{,}1+5{,}3+4{,}9+5{,}0}{10} \]
\[ \bar{x}=\frac{50{,}3}{10}=5{,}03 \]
La suma de los cuadrados de las desviaciones respecto de la media es:
\[ \sum(x_i-\bar{x})^2=0{,}201 \]
Como se pide varianza muestral, dividimos por \(n-1=9\):
\[ s^2=\frac{0{,}201}{9}\approx 0{,}0223 \]
La desviación estándar muestral es:
\[ s=\sqrt{0{,}0223}\approx 0{,}15 \]
b) Rango aceptable
Se calcula usando \(\bar{x}\pm s\):
\[ 5{,}03-0{,}15=4{,}88 \]
\[ 5{,}03+0{,}15=5{,}18 \]
Por lo tanto, el rango aceptable es aproximadamente:
\[ [4{,}88,\ 5{,}18] \]
c) Conteo de tornillos dentro del rango
Comparamos cada medida con el intervalo \([4{,}88,\ 5{,}18]\). Los tornillos que miden \(4{,}8\), \(5{,}2\) y \(5{,}3\) están fuera del rango.
Por lo tanto, \(7\) de los \(10\) tornillos están dentro del rango aceptable.
5. Cálculo de Varianza y Desviación Estándar para Datos Agrupados
Repaso
Datos agrupados y dispersión
La varianza \(s^2\) o \(\sigma^2\) y la desviación estándar \(s\) o \(\sigma\) son medidas que indican qué tan dispersos o alejados están los datos con respecto a la media.
Cuando trabajamos con datos agrupados en intervalos, no conocemos el valor exacto de cada dato. Por eso usamos un valor representativo para cada intervalo: la marca de clase.
Procedimientos y fórmulas clave
Para operar con datos agrupados, usamos la marca de clase \(x_i\), que corresponde al punto medio del intervalo.
\[ x_i=\frac{L_i+L_s}{2} \]
- \(L_i\): límite inferior del intervalo.
- \(L_s\): límite superior del intervalo.
- \(x_i\): marca de clase.
A partir de las marcas de clase, las fórmulas para una muestra son:
Media:
\[ \bar{x}=\frac{\sum f_i\cdot x_i}{n} \]
Varianza muestral:
\[ s^2=\frac{\sum f_i(x_i-\bar{x})^2}{n-1} \]
Desviación estándar muestral:
\[ s=\sqrt{s^2} \]
- \(f_i\): frecuencia de cada intervalo.
- \(n\): total de datos.
Cuidado con la división
Un error común es confundir la fórmula de la varianza para una muestra, donde se divide por \(n-1\), con la fórmula para una población, donde se divide por \(N\).
En la mayoría de los ejercicios prácticos trabajamos con muestras de una población más grande, por lo que usamos \(n-1\). Siempre revisa el enunciado.
Cálculo Paso a Paso (Ejemplo Guiado)
Ejemplo guiado: alturas de estudiantes
Datos: se midió la altura, en centímetros, de una muestra de \(40\) estudiantes, obteniendo la siguiente tabla de frecuencias.
| Intervalo (cm) | Frecuencia \(f_i\) |
|---|---|
| \([150,\ 160)\) | \(5\) |
| \([160,\ 170)\) | \(12\) |
| \([170,\ 180)\) | \(15\) |
| \([180,\ 190)\) | \(8\) |
| Total | \(40\) |
Para calcular la varianza y la desviación estándar, construiremos una tabla que organiza todos los cálculos.
Tabla de trabajo inicial:
| Intervalo | \(x_i\) | \(f_i\) | \(f_i\cdot x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) | \(f_i(x_i-\bar{x})^2\) |
|---|---|---|---|---|---|---|
| \([150,\ 160)\) | \(5\) | |||||
| \([160,\ 170)\) | \(12\) | |||||
| \([170,\ 180)\) | \(15\) | |||||
| \([180,\ 190)\) | \(8\) | |||||
| Total | \(40\) |
Tabla de cálculo completa:
| Intervalo | \(x_i\) | \(f_i\) | \(f_i\cdot x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) | \(f_i(x_i-\bar{x})^2\) |
|---|---|---|---|---|---|---|
| \([150,\ 160)\) | \(155\) | \(5\) | \(775\) | \(-16{,}5\) | \(272{,}25\) | \(1361{,}25\) |
| \([160,\ 170)\) | \(165\) | \(12\) | \(1980\) | \(-6{,}5\) | \(42{,}25\) | \(507\) |
| \([170,\ 180)\) | \(175\) | \(15\) | \(2625\) | \(3{,}5\) | \(12{,}25\) | \(183{,}75\) |
| \([180,\ 190)\) | \(185\) | \(8\) | \(1480\) | \(13{,}5\) | \(182{,}25\) | \(1458\) |
| Total | \(n=40\) | \(\sum f_i x_i=6860\) | \(\sum f_i(x_i-\bar{x})^2=3510\) |
Cálculos finales:
Media:
\[ \bar{x}=\frac{6860}{40}=171{,}5 \]
Varianza muestral:
\[ s^2=\frac{3510}{40-1}=\frac{3510}{39}=90 \]
Desviación estándar muestral:
\[ s=\sqrt{90}\approx 9{,}49 \]
Resultado: la altura promedio estimada es \(171{,}5\) cm, con una desviación estándar aproximada de \(9{,}49\) cm. Esto indica la dispersión típica de las alturas respecto del promedio.
¿Qué significa la desviación estándar en la práctica?
Una desviación estándar pequeña significa que la mayoría de los datos están agrupados cerca de la media. Una desviación estándar grande indica que los datos están más esparcidos y son más variables.
Esta medida es especialmente útil para comparar la consistencia entre diferentes conjuntos de datos.
Ejercicios y Problemas
Nivel 1:
Cálculos de varianza y desviación estándar
Ejercicio 1: Edades en una empresa
La siguiente tabla muestra la distribución de edades, en años, de los empleados de una empresa. Calcula la media, la varianza y la desviación estándar muestrales.
| Edad (años) | Frecuencia |
|---|---|
| \([20,\ 30)\) | \(10\) |
| \([30,\ 40)\) | \(15\) |
| \([40,\ 50)\) | \(12\) |
| \([50,\ 60)\) | \(8\) |
| \([60,\ 70)\) | \(5\) |
Tabla de cálculo:
| Intervalo | \(x_i\) | \(f_i\) | \(f_i\cdot x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) | \(f_i(x_i-\bar{x})^2\) |
|---|---|---|---|---|---|---|
| \([20,\ 30)\) | \(25\) | \(10\) | \(250\) | \(-16{,}6\) | \(275{,}56\) | \(2755{,}6\) |
| \([30,\ 40)\) | \(35\) | \(15\) | \(525\) | \(-6{,}6\) | \(43{,}56\) | \(653{,}4\) |
| \([40,\ 50)\) | \(45\) | \(12\) | \(540\) | \(3{,}4\) | \(11{,}56\) | \(138{,}72\) |
| \([50,\ 60)\) | \(55\) | \(8\) | \(440\) | \(13{,}4\) | \(179{,}56\) | \(1436{,}48\) |
| \([60,\ 70)\) | \(65\) | \(5\) | \(325\) | \(23{,}4\) | \(547{,}56\) | \(2737{,}8\) |
| Total | \(50\) | \(2080\) | \(7722\) |
Media:
\[ \bar{x}=\frac{2080}{50}=41{,}6 \]
Varianza muestral:
\[ s^2=\frac{7722}{50-1}=\frac{7722}{49}\approx 157{,}59 \]
Desviación estándar muestral:
\[ s=\sqrt{157{,}59}\approx 12{,}55 \]
Respuesta: la media estimada es \(41{,}6\) años, la varianza muestral es aproximadamente \(157{,}59\) años cuadrados y la desviación estándar muestral es aproximadamente \(12{,}55\) años.
Ejercicio 2: Calificaciones de un curso
Un profesor registra las calificaciones finales de su curso de estadística en la siguiente tabla. Considerando los datos como una muestra de todos sus estudiantes históricos, calcula la nota promedio, la varianza y la desviación estándar para evaluar el rendimiento y la consistencia del grupo.
| Calificación | Nº de estudiantes \(f_i\) |
|---|---|
| \([1{,}0,\ 2{,}0)\) | \(2\) |
| \([2{,}0,\ 3{,}0)\) | \(5\) |
| \([3{,}0,\ 4{,}0)\) | \(8\) |
| \([4{,}0,\ 5{,}0)\) | \(15\) |
| \([5{,}0,\ 6{,}0)\) | \(12\) |
| \([6{,}0,\ 7{,}0]\) | \(8\) |
Tabla de cálculo:
| Intervalo | \(x_i\) | \(f_i\) | \(f_i\cdot x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) | \(f_i(x_i-\bar{x})^2\) |
|---|---|---|---|---|---|---|
| \([1{,}0,\ 2{,}0)\) | \(1{,}5\) | \(2\) | \(3{,}0\) | \(-3{,}08\) | \(9{,}4864\) | \(18{,}9728\) |
| \([2{,}0,\ 3{,}0)\) | \(2{,}5\) | \(5\) | \(12{,}5\) | \(-2{,}08\) | \(4{,}3264\) | \(21{,}632\) |
| \([3{,}0,\ 4{,}0)\) | \(3{,}5\) | \(8\) | \(28{,}0\) | \(-1{,}08\) | \(1{,}1664\) | \(9{,}3312\) |
| \([4{,}0,\ 5{,}0)\) | \(4{,}5\) | \(15\) | \(67{,}5\) | \(-0{,}08\) | \(0{,}0064\) | \(0{,}096\) |
| \([5{,}0,\ 6{,}0)\) | \(5{,}5\) | \(12\) | \(66{,}0\) | \(0{,}92\) | \(0{,}8464\) | \(10{,}1568\) |
| \([6{,}0,\ 7{,}0]\) | \(6{,}5\) | \(8\) | \(52{,}0\) | \(1{,}92\) | \(3{,}6864\) | \(29{,}4912\) |
| Total | \(50\) | \(229\) | \(89{,}68\) |
Media:
\[ \bar{x}=\frac{229}{50}=4{,}58 \]
Varianza muestral:
\[ s^2=\frac{89{,}68}{50-1}=\frac{89{,}68}{49}\approx 1{,}83 \]
Desviación estándar muestral:
\[ s=\sqrt{1{,}83}\approx 1{,}35 \]
Respuesta: la nota promedio estimada es \(4{,}58\), la varianza muestral es aproximadamente \(1{,}83\) puntos cuadrados y la desviación estándar muestral es aproximadamente \(1{,}35\) puntos.
Ejercicio 3: Control de calidad en pesaje de café
Una empresa que envasa café toma una muestra de \(80\) paquetes de “\(250\) gramos” para verificar la consistencia de sus máquinas. Los pesos reales, en gramos, se registran en la siguiente tabla. Calcula la desviación estándar para determinar qué tan preciso es el proceso de envasado.
| Peso (gramos) | Nº de paquetes \(f_i\) |
|---|---|
| \([240,\ 244)\) | \(7\) |
| \([244,\ 248)\) | \(15\) |
| \([248,\ 252)\) | \(35\) |
| \([252,\ 256)\) | \(18\) |
| \([256,\ 260]\) | \(5\) |
Tabla de cálculo:
| Intervalo | \(x_i\) | \(f_i\) | \(f_i\cdot x_i\) | \(x_i-\bar{x}\) | \((x_i-\bar{x})^2\) | \(f_i(x_i-\bar{x})^2\) |
|---|---|---|---|---|---|---|
| \([240,\ 244)\) | \(242\) | \(7\) | \(1694\) | \(-7{,}95\) | \(63{,}2025\) | \(442{,}4175\) |
| \([244,\ 248)\) | \(246\) | \(15\) | \(3690\) | \(-3{,}95\) | \(15{,}6025\) | \(234{,}0375\) |
| \([248,\ 252)\) | \(250\) | \(35\) | \(8750\) | \(0{,}05\) | \(0{,}0025\) | \(0{,}0875\) |
| \([252,\ 256)\) | \(254\) | \(18\) | \(4572\) | \(4{,}05\) | \(16{,}4025\) | \(295{,}245\) |
| \([256,\ 260]\) | \(258\) | \(5\) | \(1290\) | \(8{,}05\) | \(64{,}8025\) | \(324{,}0125\) |
| Total | \(80\) | \(19996\) | \(1295{,}8\) |
Media:
\[ \bar{x}=\frac{19996}{80}=249{,}95 \]
Varianza muestral:
\[ s^2=\frac{1295{,}8}{80-1}=\frac{1295{,}8}{79}\approx 16{,}40 \]
Desviación estándar muestral:
\[ s=\sqrt{16{,}40}\approx 4{,}05 \]
Respuesta: la desviación estándar muestral es aproximadamente \(4{,}05\) gramos. Esto significa que los pesos de los paquetes se alejan típicamente alrededor de \(4{,}05\) gramos respecto de la media estimada de \(249{,}95\) gramos.
6. Interpretación y Comparación con Medidas de Dispersión
Repaso: Medidas de Dispersión
Medidas de dispersión
Las medidas de dispersión, como el rango, la varianza y la desviación estándar, indican qué tan esparcidos o concentrados están los datos alrededor de un valor central, como la media.
Estas medidas son fundamentales para comprender la variabilidad de un conjunto de datos.
Interpretación Conjunta de Media y Desviación Estándar
Media y desviación estándar
La media y la desviación estándar se interpretan juntas para tener una idea más completa de la distribución de los datos. La media indica el centro y la desviación estándar indica qué tan dispersos están los datos alrededor de ese centro.
Ejemplo: misma media, distinta dispersión
- Conjunto A: media \(=50\), desviación estándar \(=5\).
- Conjunto B: media \(=50\), desviación estándar \(=15\).
Ambos conjuntos tienen la misma media, pero el conjunto B tiene una desviación estándar mayor.
- En el conjunto A, la mayoría de los datos estarán relativamente cerca de \(50\).
- En el conjunto B, los datos estarán mucho más dispersos. Es más probable encontrar valores bastante alejados de \(50\).
Comparación de Conjuntos de Datos
Comparar con la media y la desviación estándar
Podemos usar la media y la desviación estándar para comparar distintos conjuntos de datos. Cuando los datos están en las mismas unidades, una desviación estándar menor indica mayor homogeneidad o consistencia.
Ejemplo: comparación de dos clases
Dos clases rinden el mismo examen:
- Clase X: media \(=75\), desviación estándar \(=8\).
- Clase Y: media \(=75\), desviación estándar \(=3\).
Ambas clases tienen el mismo promedio, pero la clase Y tiene notas más homogéneas, porque su desviación estándar es menor.
Ejemplo: comparación en contextos diferentes
Se comparan las edades de dos grupos:
- Grupo P: media \(=25\) años, desviación estándar \(=2\) años.
- Grupo Q: media \(=60\) años, desviación estándar \(=10\) años.
El grupo P es más joven que el grupo Q. Además, las edades del grupo P son más homogéneas, porque su desviación estándar es menor.
Diagramas de Caja y Bigotes (Boxplots)
Interpretación de boxplots
Los diagramas de caja y bigotes, o boxplots, son una forma visual de representar la dispersión de un conjunto de datos. No es necesario construirlos siempre a mano, pero sí es importante interpretarlos correctamente.
Elementos de un boxplot
- Mediana: línea dentro de la caja.
- Primer cuartil \(Q_1\): borde inferior de la caja.
- Tercer cuartil \(Q_3\): borde superior de la caja.
- Rango intercuartílico: \(IQR=Q_3-Q_1\).
- Bigotes: líneas que se extienden desde la caja hacia valores menores y mayores.
- Valores atípicos: valores inusualmente bajos o altos respecto del resto de los datos.
Ejemplo: lectura de un boxplot
Lectura:
- La mediana está en \(60\).
- El primer cuartil está en \(55\).
- El tercer cuartil está en \(65\).
- Los bigotes se extienden desde \(50\) hasta \(70\).
- Existe un valor atípico alto en \(85\), aunque no pertenece al bigote principal.
Interpretación: el valor típico de los datos está alrededor de \(60\). El \(50\%\) central de los datos está entre \(55\) y \(65\). La mayoría de los datos está entre \(50\) y \(70\), pero existe un valor inusualmente alto.
Valores Atípicos
Identificación
Regla de \(1{,}5\cdot IQR\)
- Calcula el rango intercuartílico: \[ IQR=Q_3-Q_1 \]
- Calcula los límites: \[ LI=Q_1-1{,}5\cdot IQR \] \[ LS=Q_3+1{,}5\cdot IQR \]
- Cualquier valor menor que \(LI\) o mayor que \(LS\) se considera valor atípico.
Ejemplo: identificación de un valor atípico
Consideremos los datos:
\[ 2,\ 3,\ 5,\ 7,\ 8,\ 9,\ 10,\ 12,\ 15,\ 25 \]
Dividimos el conjunto en dos mitades:
- Primera mitad: \(2,\ 3,\ 5,\ 7,\ 8\), por lo tanto \(Q_1=5\).
- Segunda mitad: \(9,\ 10,\ 12,\ 15,\ 25\), por lo tanto \(Q_3=12\).
Calculamos:
\[ IQR=12-5=7 \]
\[ LI=5-1{,}5\cdot 7=5-10{,}5=-5{,}5 \]
\[ LS=12+1{,}5\cdot 7=12+10{,}5=22{,}5 \]
El valor \(25\) es atípico, porque es mayor que \(22{,}5\).
Importancia
¿Por qué revisar los valores atípicos?
Los valores atípicos pueden deberse a errores de medición, errores de registro o a valores válidos pero inusuales.
- Pueden distorsionar la media y las medidas de dispersión.
- Pueden entregar información importante sobre el fenómeno estudiado.
No siempre se deben eliminar. Primero hay que analizar el contexto y decidir si corresponde corregirlos, eliminarlos o mantenerlos.
Ejercicios y Problemas
Ejercicio 1: Interpretación de media y desviación estándar
Dados los siguientes conjuntos de datos, interpreta la media y la desviación estándar en términos de dispersión:
- Conjunto X: media \(=10\), desviación estándar \(=2\).
- Conjunto Y: media \(=10\), desviación estándar \(=8\).
- Conjunto Z: media \(=100\), desviación estándar \(=10\).
- Conjunto X: los datos se alejan típicamente unas \(2\) unidades de la media \(10\), por lo que están relativamente agrupados.
- Conjunto Y: los datos se alejan típicamente unas \(8\) unidades de la media \(10\), por lo que están mucho más dispersos que en el conjunto X.
- Conjunto Z: los datos se alejan típicamente unas \(10\) unidades de la media \(100\). En términos absolutos la desviación es mayor que en X, pero en relación con su media representa una dispersión moderada.
Ejercicio 2: Comparación de boxplots
Observa los siguientes diagramas de caja y bigotes.
Boxplot A
Boxplot B
Además, el boxplot B presenta un valor atípico en \(80\).
- ¿Qué boxplot representa datos con mayor dispersión?
- ¿Cuál boxplot indica la presencia de un valor atípico?
Lectura:
- Boxplot A: mediana \(=50\), \(Q_1=45\), \(Q_3=55\), bigotes desde \(40\) hasta \(60\), sin valores atípicos.
- Boxplot B: mediana \(=50\), \(Q_1=40\), \(Q_3=60\), bigotes desde \(30\) hasta \(70\), con un valor atípico en \(80\).
- El boxplot B representa mayor dispersión, porque su caja es más ancha y sus bigotes se extienden más.
- El boxplot B indica la presencia de un valor atípico.
Ejercicio 3: Regla de \(1{,}5\cdot IQR\)
Para el siguiente conjunto de datos, identifica si hay valores atípicos usando la regla de \(1{,}5\cdot IQR\):
\[ 1,\ 3,\ 5,\ 7,\ 8,\ 9,\ 10,\ 12,\ 14,\ 30 \]
Los datos ya están ordenados:
\[ 1,\ 3,\ 5,\ 7,\ 8,\ 9,\ 10,\ 12,\ 14,\ 30 \]
Como hay \(10\) datos, separamos en dos mitades:
- Primera mitad: \(1,\ 3,\ 5,\ 7,\ 8\), entonces \(Q_1=5\).
- Segunda mitad: \(9,\ 10,\ 12,\ 14,\ 30\), entonces \(Q_3=12\).
Calculamos el rango intercuartílico:
\[ IQR=Q_3-Q_1=12-5=7 \]
Calculamos los límites:
\[ LI=Q_1-1{,}5\cdot IQR=5-1{,}5\cdot 7=5-10{,}5=-5{,}5 \]
\[ LS=Q_3+1{,}5\cdot IQR=12+1{,}5\cdot 7=12+10{,}5=22{,}5 \]
El valor \(30\) es un valor atípico, porque:
\[ 30>22{,}5 \]
Problema 1: Comparación de empresas
Dos empresas, A y B, fabrican bombillas. Se prueban muestras de bombillas de cada empresa y se registra su duración, en horas:
- Empresa A: media \(=1000\) horas, desviación estándar \(=50\) horas.
- Empresa B: media \(=1000\) horas, desviación estándar \(=150\) horas.
- ¿Qué empresa produce bombillas con una duración más consistente?
- Si quieres comprar bombillas que duren alrededor de \(1000\) horas, ¿qué empresa elegirías? ¿Por qué?
- Si necesitas buscar bombillas que duren más de \(1100\) horas, ¿qué empresa elegirías? ¿Por qué?
- La empresa A produce bombillas más consistentes, porque su desviación estándar es menor.
- Elegiría la empresa A, porque es más probable que sus bombillas duren cerca de \(1000\) horas.
- Si el objetivo es encontrar bombillas que duren más de \(1100\) horas, elegiría la empresa B. Como tiene mayor desviación estándar, sus duraciones son más variables, por lo que es más probable encontrar valores muy altos. Sin embargo, también es más probable encontrar valores muy bajos.
Problema 2: Alturas de dos clases
Se registran las alturas, en centímetros, de los estudiantes de dos clases:
- Clase 1: \(160,\ 165,\ 170,\ 175,\ 180\)
- Clase 2: \(150,\ 160,\ 170,\ 180,\ 190\)
- Calcula la media y la desviación estándar muestral para cada clase.
- ¿Qué clase tiene mayor variabilidad en las alturas?
- Si se agrega un estudiante de \(200\) cm a la clase 1, ¿cómo afectaría esto a la media y a la desviación estándar? ¿Y si se agrega a la clase 2?
a) Clase 1
\[ \bar{x}_1=\frac{160+165+170+175+180}{5}=\frac{850}{5}=170 \]
| Altura \(x_i\) | \(x_i-\bar{x}_1\) | \((x_i-\bar{x}_1)^2\) |
|---|---|---|
| \(160\) | \(-10\) | \(100\) |
| \(165\) | \(-5\) | \(25\) |
| \(170\) | \(0\) | \(0\) |
| \(175\) | \(5\) | \(25\) |
| \(180\) | \(10\) | \(100\) |
| Total | \(250\) |
\[ s_1^2=\frac{250}{5-1}=62{,}5 \]
\[ s_1=\sqrt{62{,}5}\approx 7{,}91 \]
Clase 2
\[ \bar{x}_2=\frac{150+160+170+180+190}{5}=\frac{850}{5}=170 \]
| Altura \(y_i\) | \(y_i-\bar{x}_2\) | \((y_i-\bar{x}_2)^2\) |
|---|---|---|
| \(150\) | \(-20\) | \(400\) |
| \(160\) | \(-10\) | \(100\) |
| \(170\) | \(0\) | \(0\) |
| \(180\) | \(10\) | \(100\) |
| \(190\) | \(20\) | \(400\) |
| Total | \(1000\) |
\[ s_2^2=\frac{1000}{5-1}=250 \]
\[ s_2=\sqrt{250}\approx 15{,}81 \]
b) La clase 2 tiene mayor variabilidad, porque su desviación estándar es mayor.
c) Al agregar un estudiante de \(200\) cm a la clase 1:
\[ \bar{x}'_1=\frac{850+200}{6}=\frac{1050}{6}=175 \]
La suma de cuadrados respecto de la nueva media es \(1000\), entonces:
\[ (s'_1)^2=\frac{1000}{6-1}=200 \]
\[ s'_1=\sqrt{200}\approx 14{,}14 \]
Al agregar un estudiante de \(200\) cm a la clase 2:
\[ \bar{x}'_2=\frac{850+200}{6}=175 \]
La suma de cuadrados respecto de la nueva media es \(1750\), entonces:
\[ (s'_2)^2=\frac{1750}{6-1}=350 \]
\[ s'_2=\sqrt{350}\approx 18{,}71 \]
Conclusión: en ambos casos la media aumenta a \(175\) cm. La desviación estándar también aumenta, pero el impacto relativo es mayor en la clase 1, porque originalmente era más homogénea.
Problema 3: Tiempos de atención en un banco
Aplicación real
Este tipo de análisis es útil para la gestión de servicios. Un banco podría usar estos datos para decidir si necesita contratar más personal, mejorar sus procesos o redistribuir empleados para que los tiempos de espera sean más consistentes.
Se realiza un estudio sobre el tiempo, en minutos, que tardan los clientes en ser atendidos en dos sucursales de un banco. Los datos se consideran una muestra.
Sucursal A:
| Tiempo (min) | Frecuencia |
|---|---|
| \([0,\ 5)\) | \(10\) |
| \([5,\ 10)\) | \(15\) |
| \([10,\ 15)\) | \(8\) |
| \([15,\ 20)\) | \(5\) |
| \([20,\ 25)\) | \(2\) |
Sucursal B:
| Tiempo (min) | Frecuencia |
|---|---|
| \([0,\ 5)\) | \(5\) |
| \([5,\ 10)\) | \(10\) |
| \([10,\ 15)\) | \(15\) |
| \([15,\ 20)\) | \(12\) |
| \([20,\ 25)\) | \(8\) |
- Calcula la media y la desviación estándar para cada sucursal.
- ¿En qué sucursal los tiempos de atención son más consistentes? Justifica con los datos.
- Si fueras un cliente, ¿en qué sucursal es más probable que tengas que esperar más de \(15\) minutos? Justifica.
Usamos las marcas de clase \(2{,}5\), \(7{,}5\), \(12{,}5\), \(17{,}5\) y \(22{,}5\).
Sucursal A:
\[ \bar{x}_A=\frac{10\cdot 2{,}5+15\cdot 7{,}5+8\cdot 12{,}5+5\cdot 17{,}5+2\cdot 22{,}5}{40} \]
\[ \bar{x}_A=\frac{370}{40}=9{,}25 \]
La suma ponderada de cuadrados respecto de la media es:
\[ \sum f_i(x_i-\bar{x}_A)^2=1277{,}5 \]
\[ s_A^2=\frac{1277{,}5}{40-1}\approx 32{,}76 \]
\[ s_A=\sqrt{32{,}76}\approx 5{,}72 \]
Sucursal B:
\[ \bar{x}_B=\frac{5\cdot 2{,}5+10\cdot 7{,}5+15\cdot 12{,}5+12\cdot 17{,}5+8\cdot 22{,}5}{50} \]
\[ \bar{x}_B=\frac{665}{50}=13{,}3 \]
La suma ponderada de cuadrados respecto de la media es:
\[ \sum f_i(x_i-\bar{x}_B)^2=1818 \]
\[ s_B^2=\frac{1818}{50-1}\approx 37{,}10 \]
\[ s_B=\sqrt{37{,}10}\approx 6{,}09 \]
b) La sucursal A tiene tiempos más consistentes, porque su desviación estándar es menor: \(5{,}72<6{,}09\).
c) Para esperar más de \(15\) minutos, contamos los intervalos desde \([15,\ 20)\) en adelante:
- Sucursal A: \(5+2=7\) clientes de \(40\), es decir: \[ \frac{7}{40}=0{,}175=17{,}5\% \]
- Sucursal B: \(12+8=20\) clientes de \(50\), es decir: \[ \frac{20}{50}=0{,}4=40\% \]
Por lo tanto, es más probable esperar más de \(15\) minutos en la sucursal B.
7. Aplicaciones y Toma de Decisiones con Medidas de Dispersión
Repaso: Media y Desviación Estándar
Media y desviación estándar
La media nos da un valor central o promedio de un conjunto de datos. La desviación estándar indica qué tan dispersos están los datos alrededor de esa media.
Aplicaciones en Diversos Campos
1. Control de Calidad
Control de calidad
En la fabricación de productos, la desviación estándar es útil para asegurar que los productos cumplan con ciertas especificaciones. Una desviación estándar baja indica que los productos son muy similares entre sí, lo cual suele ser deseable.
Ejemplo: una fábrica de tornillos quiere que los tornillos tengan una longitud de
2. Finanzas y Riesgo
Finanzas y riesgo
En finanzas, la desviación estándar se usa como una medida de riesgo o volatilidad. Una inversión con una desviación estándar alta en sus rendimientos es más variable: puede tener mayores ganancias, pero también mayores pérdidas.
Ejemplo:
- Acción A: rendimiento promedio anual
, desviación estándar= 8 % .= 2 % - Acción B: rendimiento promedio anual
, desviación estándar= 8 % .= 1 0 %
La acción B es mucho más volátil que la acción A. Aunque ambas tienen el mismo rendimiento promedio, los rendimientos de la acción B varían mucho más de un año a otro.
3. Medicina y Salud
Medicina y salud
Las medidas de dispersión se usan para analizar datos de salud, como presión arterial, colesterol, peso u otros indicadores. Ayudan a identificar valores atípicos y a evaluar la variabilidad de los datos.
Ejemplo: si la desviación estándar de la presión arterial en un grupo de pacientes es muy alta, podría indicar que algunos pacientes tienen valores muy alejados del promedio, lo que requiere mayor análisis.
4. Educación
Educación
En educación, las medidas de dispersión ayudan a comprender la variabilidad en el rendimiento de los estudiantes. Una desviación estándar alta en las calificaciones de un examen puede indicar grandes diferencias en el nivel de logro del curso.
Ejemplo: un profesor que encuentra una alta desviación estándar en las calificaciones podría revisar el material, reforzar contenidos o analizar si el instrumento de evaluación fue adecuado.
5. Deportes
Deportes
En deportes, las medidas de dispersión se usan para analizar la consistencia del rendimiento. Por ejemplo, se puede estudiar la variabilidad en los tiempos de un corredor o en los puntajes de un golfista.
Ejemplo: un golfista con baja desviación estándar en sus puntajes es más consistente que otro con alta desviación estándar, incluso si ambos tienen el mismo puntaje promedio.
Limitaciones de las Medidas de Dispersión
Limitaciones importantes
- Sensibilidad a valores extremos: el rango y, en menor medida, la desviación estándar pueden verse afectados por valores atípicos.
- No describen la forma de la distribución: dos conjuntos pueden tener la misma media y desviación estándar, pero distribuciones muy diferentes.
- Interpretación relativa: la importancia de una desviación estándar depende del contexto y de la magnitud de la media. Una desviación estándar de
puede ser grande si la media es1 0 , pero pequeña si la media es2 0 .1 0 0 0
Importancia del Contexto
Interpretar en contexto
Siempre es fundamental interpretar las medidas de dispersión en el contexto de los datos. No hay una regla universal para decir si una desviación estándar es alta o baja: depende de lo que se está midiendo y de las consecuencias prácticas de la variabilidad.
Introducción a la Significancia Estadística (Concepto General)
Concepto general
En estadística, muchas veces queremos saber si una diferencia observada entre dos grupos es real o si podría deberse al azar. La significancia estadística ayuda a evaluar esa situación.
Ejemplo: si comparamos las alturas promedio de dos grupos y observamos una diferencia, la pregunta es si esa diferencia es suficientemente importante como para considerarla significativa, o si podría explicarse por la variación natural de los datos.
No se realizarán cálculos de significancia estadística en esta página, pero es importante reconocer que este concepto existe y que es fundamental en investigación.
Ejercicios y Problemas
Ejercicio 1: fondos de inversión
Imagina que se comparan dos fondos de inversión. Ambos tienen un rendimiento promedio del
- Fondo A: desviación estándar
.= 5 % - Fondo B: desviación estándar
.= 1 5 %
¿Qué fondo elegirías si:
- Eres averso al riesgo y prefieres mayor seguridad.
- Estás dispuesto a asumir más riesgo a cambio de la posibilidad de mayores ganancias.
- Elegiría el Fondo A, porque tiene menor desviación estándar. Esto significa que sus rendimientos son más estables y menos riesgosos.
- Elegiría el Fondo B, porque tiene mayor desviación estándar. Esto implica más riesgo, pero también mayor posibilidad de obtener rendimientos muy altos. Sin embargo, también aumenta la posibilidad de rendimientos bajos.
Ejercicio 2: comparación de exámenes
Un profesor califica dos exámenes.
- Examen 1: media
, desviación estándar= 7 0 .= 1 0 - Examen 2: media
, desviación estándar= 7 0 .= 2
¿Qué examen tuvo resultados más homogéneos? ¿Qué implicaciones podría tener esto para el profesor?
El Examen 2 tuvo resultados más homogéneos, porque su desviación estándar es menor.
Esto significa que las calificaciones estuvieron más agrupadas alrededor de la media
Algunas posibles implicaciones para el profesor son:
- El Examen 2 pudo haber sido más claro o más parejo para el curso.
- Los estudiantes pudieron haber estado mejor preparados para el Examen 2.
- El profesor podría revisar el Examen 1 para identificar preguntas ambiguas, contenidos poco reforzados o diferencias importantes de comprensión entre estudiantes.
Problema 1: duración de baterías
Una empresa fabrica dos tipos de baterías, A y B. Se prueban muestras de cada tipo y se mide su duración, en horas:
- Batería A: media
horas, desviación estándar= 4 0 horas.= 5 - Batería B: media
horas, desviación estándar= 5 0 horas.= 1 0
- ¿Qué tipo de batería dura más, en promedio?
- ¿Qué tipo de batería tiene una duración más consistente?
- Si necesitas una batería que dure al menos
horas, ¿cuál elegirías? ¿Por qué?3 0 - Si necesitas una batería que dure alrededor de
horas, ¿cuál elegirías? ¿Por qué?4 5
- La Batería B dura más en promedio, porque su media es
horas, mientras que la media de la Batería A es5 0 horas.4 0 - La Batería A tiene una duración más consistente, porque su desviación estándar es menor.
- Elegiría la Batería B, porque su promedio está más alejado por sobre las
horas. Aunque es más variable, su media de3 0 horas sugiere mayor probabilidad de superar ese mínimo.5 0 - Depende de la prioridad. La Batería A es más consistente, pero se centra cerca de
horas. La Batería B tiene media4 0 horas, por lo que también puede estar cerca de5 0 , aunque con más variabilidad. Si se busca estabilidad, conviene A; si se busca mayor duración promedio, conviene B.4 5
Problema 2: alturas de equipos de baloncesto
Se miden las alturas, en centímetros, de los jugadores de dos equipos de baloncesto:
- Equipo X:
1 9 0 , 1 9 2 , 1 9 5 , 1 9 8 , 2 0 0 - Equipo Y:
1 8 0 , 1 8 5 , 1 9 5 , 2 0 5 , 2 1 0
- Calcula la media y la desviación estándar muestral para cada equipo.
- ¿Qué equipo tiene jugadores con alturas más similares entre sí?
- Un nuevo jugador se une al Equipo X. Su altura es de
cm. ¿Cómo afecta esto a la media y a la desviación estándar del Equipo X?2 2 0
a) Equipo X
| Altura |
||
|---|---|---|
| Total |
Equipo Y
| Altura |
||
|---|---|---|
| Total |
Resumen:
- Equipo X: media
cm, desviación estándar= 1 9 5 cm.𝑠 𝑋 ≈ 4 , 1 2 - Equipo Y: media
cm, desviación estándar= 1 9 5 cm.𝑠 𝑌 ≈ 1 2 , 7 5
b) El Equipo X tiene jugadores con alturas más similares entre sí, porque su desviación estándar es menor.
c) Efecto de agregar un jugador de
Las nuevas alturas son:
La nueva media es:
| Altura |
8. Coeficiente de Variación (CV)¿Por qué necesitamos otra medida de dispersión?Dispersión absoluta y dispersión relativaHemos visto que la desviación estándar mide la dispersión absoluta de los datos alrededor de la media. Sin embargo, cuando queremos comparar la variabilidad entre conjuntos de datos que tienen unidades diferentes o medias muy distintas, la desviación estándar por sí sola no siempre es suficiente. En esos casos usamos el coeficiente de variación \(CV\). Definición y FórmulaCoeficiente de variaciónEl coeficiente de variación \(CV\) es una medida de dispersión relativa. Expresa la desviación estándar como un porcentaje de la media. Fórmula para una muestra: \[ CV=\frac{s}{|\bar{x}|}\cdot 100\% \] Fórmula para una población: \[ CV=\frac{\sigma}{|\mu|}\cdot 100\% \]
ImportanteLa media debe ser distinta de cero para que el coeficiente de variación tenga sentido. No se puede dividir por cero. Cuando la media es negativa, se usa su valor absoluto para que el \(CV\) represente una proporción positiva de variabilidad. Interpretación¿Cómo se interpreta el CV?
Lectura rápidaUn \(CV\) de \(20\%\) significa que la desviación estándar equivale al \(20\%\) de la media. EjemplosEjemplo 1: comparación con diferentes unidadesQueremos comparar la variabilidad de la altura, en centímetros, y el peso, en kilogramos, de un grupo de personas:
No podemos comparar directamente \(10\) cm con \(14\) kg, porque corresponden a unidades distintas. Calculamos el coeficiente de variación. Alturas: \[ CV=\frac{10}{170}\cdot 100\%\approx 5{,}88\% \] Pesos: \[ CV=\frac{14}{70}\cdot 100\%=20\% \] Conclusión: el peso tiene mayor variabilidad relativa que la altura en este grupo. Ejemplo 2: comparación con medias muy diferentesQueremos comparar la variabilidad de los ingresos en dos grupos:
Aunque la desviación estándar del grupo B es mayor en términos absolutos, debemos comparar la variabilidad relativa. Grupo A: \[ CV=\frac{100}{500}\cdot 100\%=20\% \] Grupo B: \[ CV=\frac{500}{5000}\cdot 100\%=10\% \] Conclusión: los ingresos del grupo A tienen mayor variabilidad relativa que los del grupo B. EjerciciosEjercicio 1: cálculo directo del CVCalcula el coeficiente de variación para los siguientes conjuntos de datos:
Conclusión: el segundo conjunto tiene la mayor dispersión relativa, porque su \(CV\) es \(20\%\). Ejercicio 2: duración de bombillasUn investigador compara la variabilidad en la duración de dos tipos de bombillas.
¿Qué tipo de bombilla tiene mayor variabilidad relativa en su duración? Bombilla A: \[ CV_A=\frac{80}{800}\cdot 100\%=10\% \] Bombilla B: \[ CV_B=\frac{100}{1200}\cdot 100\%\approx 8{,}33\% \] Respuesta: la bombilla A tiene mayor variabilidad relativa, porque \(10\%>8{,}33\%\). Ejercicio 3: interpretación del coeficiente de variaciónExplica con tus propias palabras por qué el coeficiente de variación es útil para comparar la dispersión de conjuntos de datos que tienen diferentes unidades de medida. El coeficiente de variación es útil porque no tiene unidades. Al dividir la desviación estándar por la media, las unidades se cancelan. Luego, al multiplicar por \(100\%\), obtenemos un porcentaje que representa la dispersión relativa. Esto permite comparar conjuntos de datos que tienen unidades distintas, como alturas en centímetros y pesos en kilogramos. Ejemplo: no tiene sentido comparar directamente \(10\) cm con \(14\) kg, pero sí podemos comparar sus coeficientes de variación. 9. Coeficiente de Variación con Datos en TablasCoeficiente de Variación (CV) con Datos en TablasRepaso: Coeficiente de VariaciónEl coeficiente de variación (CV) es una medida de dispersión relativa. Expresa la desviación estándar como un porcentaje de la media. Es útil para comparar la variabilidad entre conjuntos de datos con diferentes unidades o medias. FórmulaPara una muestra: \[ CV=\frac{s}{\bar{x}}\cdot 100\% \] Para una población: \[ CV=\frac{\sigma}{\mu}\cdot 100\% \] CV con Datos en TablasCuando los datos están en tablas de frecuencias simples o con intervalos, calculamos la media \(\bar{x}\) y la desviación estándar \(s\), y luego aplicamos la fórmula del coeficiente de variación. Ejemplo 1: Tabla de Frecuencias SimpleDatos: Número de hermanos de un grupo de estudiantes:
Paso 1: Calcular la media. \[ \bar{x}=\frac{(0\cdot 6)+(1\cdot 12)+(2\cdot 7)+(3\cdot 3)}{28} \] \[ \bar{x}=\frac{0+12+14+9}{28}=\frac{35}{28}=1{,}25 \] Paso 2: Calcular la desviación estándar. Para este ejemplo, considerando desviación estándar muestral, se tiene: \[ s^2=\frac{6(0-1{,}25)^2+12(1-1{,}25)^2+7(2-1{,}25)^2+3(3-1{,}25)^2}{28-1} \] \[ s^2=\frac{23{,}25}{27}\approx 0{,}8611 \] \[ s=\sqrt{0{,}8611}\approx 0{,}93 \] Paso 3: Calcular el coeficiente de variación. \[ CV=\frac{s}{\bar{x}}\cdot 100\%=\frac{0{,}93}{1{,}25}\cdot 100\%\approx 74{,}4\% \] Interpretación: La desviación estándar del número de hermanos es aproximadamente el \(74{,}4\%\) de la media. Esto indica una variabilidad relativa alta. Ejemplo 2: Tabla de Frecuencias con IntervalosDatos: Tiempos de espera, en minutos, en una fila:
Para trabajar con intervalos, usamos la marca de clase de cada intervalo:
La media es: \[ \bar{x}=\frac{(2\cdot 8)+(7\cdot 14)+(12\cdot 10)+(17\cdot 6)+(22\cdot 2)}{40} \] \[ \bar{x}=\frac{16+98+120+102+44}{40}=\frac{380}{40}=9{,}5 \] La desviación estándar muestral es aproximadamente: \[ s\approx 5{,}66 \] Entonces, el coeficiente de variación es: \[ CV=\frac{5{,}66}{9{,}5}\cdot 100\%\approx 59{,}58\% \] Interpretación: La desviación estándar del tiempo de espera es aproximadamente el \(59{,}58\%\) de la media. Hay una variabilidad relativa considerable. EjerciciosEjercicio 1La siguiente tabla muestra la distribución de puntajes en una prueba:
Usamos la marca de clase de cada intervalo.
La media es: \[ \bar{x}=\frac{3805}{50}=76{,}1 \] La varianza muestral es: \[ s^2=\frac{7272}{50-1}=\frac{7272}{49}\approx 148{,}41 \] La desviación estándar muestral es: \[ s=\sqrt{148{,}41}\approx 12{,}18 \] El coeficiente de variación es: \[ CV=\frac{12{,}18}{76{,}1}\cdot 100\%\approx 16{,}01\% \] Interpretación: El CV es aproximadamente \(16{,}01\%\). Esto indica que los puntajes tienen una variabilidad relativa baja a moderada respecto de la media. Ejercicio 2Compara la variabilidad relativa de los tiempos de atención en las dos sucursales del banco del Problema 1 de la página 5, usando los resultados que ya calculaste. De la página 5, se tienen los siguientes resultados:
Calculamos el coeficiente de variación de cada sucursal: \[ CV_A=\frac{5{,}72}{8{,}75}\cdot 100\%\approx 65{,}37\% \] \[ CV_B=\frac{6{,}09}{12{,}8}\cdot 100\%\approx 47{,}58\% \] Conclusión: Aunque la Sucursal B tiene una desviación estándar absoluta ligeramente mayor, la Sucursal A tiene mayor variabilidad relativa en los tiempos de atención, porque su coeficiente de variación es más alto. 10. problemas interpretacion con datos agrupados en intervalosProblemas de interpretación de datos agrupados¿Cómo sé si la desviación es alta, baja o moderada?Una forma práctica de juzgar si la desviación estándar \(s\) es grande o pequeña es compararla directamente con la media \(\bar{x}\). Aunque no es una regla estricta, la siguiente guía es útil para comenzar a interpretar resultados:
Esta comparación se relaciona con una medida llamada coeficiente de variación, que estandariza la relación entre desviación estándar y media: \[ CV=\left(\frac{s}{|\bar{x}|}\right)\cdot 100\% \] Nivel Datos Agrupados:Cálculos que incluyen evaluación de los valores obtenidos en muestrasEjemplo guía: análisis de hábitos de lecturaContexto: se realiza un sondeo en un club de lectura para conocer el número de páginas que sus miembros leen por semana. Se obtiene una muestra de \(50\) miembros. Tareas:
a) Tabla de cálculo:
Media: \[ \bar{x}=\frac{5600}{50}=112 \] Varianza muestral: \[ s^2=\frac{119\,050}{50-1}=\frac{119\,050}{49}\approx 2429{,}59 \] Desviación estándar muestral: \[ s=\sqrt{2429{,}59}\approx 49{,}29 \] b) Interpretación: El número promedio de páginas leídas es \(112\). La desviación estándar es aproximadamente \(49{,}29\) páginas. Comparamos: \[ \frac{49{,}29}{112}\approx 0{,}44=44\% \] Como la desviación estándar equivale aproximadamente al \(44\%\) de la media, la variabilidad es alta. Esto indica que los hábitos de lectura del club son bastante dispersos: algunos miembros leen mucho menos que el promedio y otros mucho más. Ejercicio 4: tiempos de traslado al trabajoUna consultora de recursos humanos estudia el tiempo de traslado, en minutos, de los empleados de una gran oficina. Se encuesta a una muestra de \(100\) personas.
a) Tabla de cálculo:
Media: \[ \bar{x}=\frac{3525}{100}=35{,}25 \] Varianza muestral: \[ s^2=\frac{23\,118{,}75}{100-1}\approx 233{,}52 \] Desviación estándar muestral: \[ s=\sqrt{233{,}52}\approx 15{,}28 \] b) Interpretación: \[ \frac{15{,}28}{35{,}25}\approx 0{,}43=43\% \] Como la desviación estándar equivale aproximadamente al \(43\%\) de la media, la variabilidad es alta. Esto indica que los tiempos de traslado no son muy consistentes: algunos empleados tienen traslados cortos y otros bastante más largos. Ejercicio 5: gasto mensual en ocioSe realiza una encuesta a una muestra de \(60\) jóvenes para conocer su gasto mensual en ocio, en pesos chilenos.
a) Tabla de cálculo:
Media: \[ \bar{x}=\frac{2\,340\,000}{60}=39\,000 \] Varianza muestral: \[ s^2=\frac{28\,340\,000\,000}{60-1}\approx 480\,338\,983{,}05 \] Desviación estándar muestral: \[ s=\sqrt{480\,338\,983{,}05}\approx 21\,916{,}64 \] b) Interpretación: \[ \frac{21\,916{,}64}{39\,000}\approx 0{,}56=56\% \] La desviación estándar equivale a más de la mitad de la media, por lo que la variabilidad es alta. Esto indica que los hábitos de consumo son heterogéneos: hay una diferencia importante entre quienes gastan poco y quienes gastan mucho. Ejercicio 6: duración de baterías de celularesUn sitio web de tecnología prueba la duración de la batería, en horas, de una muestra de \(40\) modelos de celulares nuevos bajo uso continuo.
a) Tabla de cálculo:
Media: \[ \bar{x}=\frac{352}{40}=8{,}8 \] Varianza muestral: \[ s^2=\frac{182{,}34}{40-1}\approx 4{,}68 \] Desviación estándar muestral: \[ s=\sqrt{4{,}68}\approx 2{,}16 \] b) Interpretación: \[ \frac{2{,}16}{8{,}8}\approx 0{,}25=25\% \] La desviación estándar representa aproximadamente el \(25\%\) de la media, por lo que la variabilidad es moderada. Esto indica que el rendimiento de las baterías es relativamente consistente, aunque sí existen diferencias entre modelos. Nivel 2B:Cálculos que incluyen evaluación de los valores obtenidos en poblacionesEjercicio 7: calificaciones finales de un 4° MedioLa siguiente tabla muestra las calificaciones finales de matemática de toda la generación de 4° Medio de un liceo, compuesta por \(45\) estudiantes. Al ser el universo completo de alumnos, los datos corresponden a una población.
a) Tabla de cálculo:
Media poblacional: \[ \mu=\frac{212{,}5}{45}\approx 4{,}72 \] Varianza poblacional: \[ \sigma^2=\frac{65{,}78}{45}\approx 1{,}46 \] Desviación estándar poblacional: \[ \sigma=\sqrt{1{,}46}\approx 1{,}21 \] b) Interpretación: \[ \frac{1{,}21}{4{,}72}\approx 0{,}256=25{,}6\% \] Como la desviación estándar equivale aproximadamente al \(25{,}6\%\) de la media, la variabilidad es moderada. El rendimiento no fue completamente uniforme, pero tampoco extremadamente disperso. Ejercicio 8: producción diaria de tornillosUna máquina produce tornillos y se analiza la longitud de toda la producción de un día, que consta de \(200\) unidades. Se considera esta producción diaria como una población.
a) Tabla de cálculo:
Media poblacional: \[ \mu=\frac{3991}{200}=19{,}955 \] Varianza poblacional: \[ \sigma^2=\frac{1{,}695}{200}=0{,}008475 \] Desviación estándar poblacional: \[ \sigma=\sqrt{0{,}008475}\approx 0{,}092 \] b) Interpretación: \[ \frac{0{,}092}{19{,}955}\approx 0{,}0046=0{,}46\% \] La desviación estándar es extremadamente pequeña en comparación con la media. Esto indica una variabilidad muy baja. Para un proceso industrial, este resultado muestra un alto nivel de precisión y consistencia en la producción. 11. La Desviación Media (optativo complementario)Idea inicialAdemás del rango y la desviación estándar, existe otra forma de medir la dispersión llamada desviación media \(DM\), también conocida como desviación absoluta promedio. Esta medida responde de forma directa a la pregunta: en promedio, ¿a qué distancia está cada dato de la media? Fórmula de la desviación mediaLa desviación media es el promedio de los valores absolutos de las desviaciones de los datos con respecto a la media. \[ DM=\frac{\sum_{i=1}^{n}|x_i-\bar{x}|}{n} \]
Cálculo Paso a PasoEjemplo: goles por partidoUn futbolista ha anotado los siguientes goles en los últimos 5 partidos: \[ \{0,1,1,2,6\} \] Calculemos la desviación media para entender la consistencia de su rendimiento. 1. Calcular la media \(\bar{x}\): \[ \bar{x}=\frac{0+1+1+2+6}{5}=\frac{10}{5}=2 \] La media es de \(2\) goles por partido. 2. Calcular las desviaciones absolutas:
3. Calcular la desviación media: \[ DM=\frac{\text{suma de desviaciones absolutas}}{n}=\frac{8}{5}=1{,}6 \] Conclusión: la desviación media es de \(1{,}6\) goles. Esto significa que, en promedio, los goles que anota el futbolista en un partido se alejan \(1{,}6\) goles de su media de \(2\). Desviación Media vs. Desviación Estándar¿Por qué la desviación estándar es más común?Si la desviación media es fácil de interpretar, puede surgir la pregunta: ¿por qué se utiliza más la desviación estándar en estadística avanzada? La razón principal es que la desviación estándar, al elevar las diferencias al cuadrado, tiene propiedades matemáticas más útiles para técnicas estadísticas más complejas, como la inferencia o las regresiones. Sin embargo, la desviación media es una excelente herramienta para describir la dispersión de forma clara, porque se interpreta directamente como una distancia promedio respecto de la media. Ejercicios PropuestosEjercicio 1: tiempos de carreraLos tiempos, en minutos, de un corredor en 6 días de entrenamiento fueron: \[ \{25,28,30,32,32,35\} \] Calcula la desviación media de sus tiempos. 1. Calculamos la media: \[ \bar{x}=\frac{25+28+30+32+32+35}{6}=\frac{182}{6}=\frac{91}{3}\approx 30{,}33 \] 2. Calculamos las desviaciones absolutas:
3. Calculamos la desviación media: \[ DM=\frac{16}{6}=\frac{8}{3}\approx 2{,}67 \] Respuesta: la desviación media de los tiempos es aproximadamente \(2{,}67\) minutos. Problema 2: consistencia de puntajesDos estudiantes, Ana y Beto, tienen el mismo promedio \(8{,}0\) en sus últimas 5 evaluaciones. Sus puntajes fueron:
Calcula la desviación media para cada estudiante y explica qué indican los resultados sobre su rendimiento. Ana: La media de Ana es: \[ \bar{x}=\frac{8+8+8+8+8}{5}=8 \] Sus desviaciones absolutas son: \[ |8-8|=0,\quad |8-8|=0,\quad |8-8|=0,\quad |8-8|=0,\quad |8-8|=0 \] Entonces: \[ DM_A=\frac{0+0+0+0+0}{5}=0 \] Beto: La media de Beto es: \[ \bar{x}=\frac{6+7+8+9+10}{5}=\frac{40}{5}=8 \] Sus desviaciones absolutas son: \[ |6-8|=2,\quad |7-8|=1,\quad |8-8|=0,\quad |9-8|=1,\quad |10-8|=2 \] Entonces: \[ DM_B=\frac{2+1+0+1+2}{5}=\frac{6}{5}=1{,}2 \] Conclusión: Ana tiene desviación media \(0\), por lo tanto sus puntajes no se alejan de su promedio. Beto tiene desviación media \(1{,}2\), lo que indica que sus puntajes se alejan, en promedio, \(1{,}2\) puntos de su media. Aunque ambos tienen el mismo promedio, Ana fue más consistente. 12. Ejercicios de Selección Múltiple (Parte 1)Ejercicios de Selección Múltiple (Parte 1)Subunidad 1: Análisis de Datos Estadísticos con Medidas de Dispersión Instrucciones: Elige la alternativa correcta. Haz clic en "Mostrar solución" para ver la respuesta y el desarrollo. Ejercicio 1¿Cuál de las siguientes variables es cualitativa nominal?
Respuesta correcta: c) Marca de automóvil. Desarrollo: Una variable cualitativa nominal clasifica en categorías que no tienen un orden natural. La marca de automóvil, por ejemplo Ford, Toyota o Chevrolet, es una categoría sin jerarquía. En cambio, el número de hijos y los años de escolaridad son variables cuantitativas discretas; la temperatura corporal es cuantitativa continua; y el nivel de satisfacción es cualitativa ordinal porque sus categorías tienen orden. Ejercicio 2¿Cuál de las siguientes variables es cuantitativa continua?
Respuesta correcta: c) Peso de una persona. Desarrollo: Una variable cuantitativa continua puede tomar valores decimales dentro de un intervalo. El peso de una persona puede expresarse, por ejemplo, como \(70,5\) kg o \(70,52\) kg. La cantidad de asignaturas aprobadas es discreta, mientras que color de ojos y tipo de sangre son variables cualitativas. Ejercicio 3¿Cuál de las siguientes no es una medida de tendencia central?
Respuesta correcta: d) Rango. Desarrollo: La media, la mediana y la moda son medidas de tendencia central porque describen valores representativos del conjunto de datos. El promedio corresponde a la media aritmética. El rango, en cambio, mide dispersión, pues se calcula como la diferencia entre el valor máximo y el valor mínimo. Ejercicio 4Datos: \(2, 4, 6, 8, 10\). Calcula la media.
Respuesta correcta: a) 6. Desarrollo: Para calcular la media, sumamos todos los datos y dividimos por la cantidad de datos: \[ \bar{x}=\frac{2+4+6+8+10}{5}=\frac{30}{5}=6 \] Ejercicio 5Datos: \(1, 3, 5, 5, 7\). Calcula la mediana.
Respuesta correcta: c) 5. Desarrollo: Los datos ya están ordenados: \[ 1,\ 3,\ 5,\ 5,\ 7 \] Como hay cinco datos, la mediana es el dato central, es decir, el tercer valor. Por lo tanto, la mediana es \(5\). Ejercicio 6Datos: \(2, 2, 4, 5, 5, 5, 6\). Calcula la moda.
Respuesta correcta: d) 5. Desarrollo: La moda es el dato que más se repite. En el conjunto, el \(2\) aparece dos veces, el \(4\) aparece una vez, el \(5\) aparece tres veces y el \(6\) aparece una vez. Por lo tanto, la moda es \(5\). Ejercicio 7Datos: \(3, 7, 1, 9, 5\). Calcula el rango.
Respuesta correcta: d) 8. Desarrollo: El rango se calcula restando el valor mínimo al valor máximo. En este conjunto, el valor máximo es \(9\) y el mínimo es \(1\). Entonces: \[ R=9-1=8 \] Ejercicio 8Datos: \(2, 4, 6, 8\). Calcula la varianza muestral.
Respuesta correcta: c) 6,67. Desarrollo: Primero calculamos la media: \[ \bar{x}=\frac{2+4+6+8}{4}=\frac{20}{4}=5 \] Luego calculamos las desviaciones respecto de la media y sus cuadrados: \[ 2-5=-3,\quad 4-5=-1,\quad 6-5=1,\quad 8-5=3 \] \[ (-3)^2=9,\quad (-1)^2=1,\quad 1^2=1,\quad 3^2=9 \] La suma de cuadrados es \(9+1+1+9=20\). Como es varianza muestral, dividimos por \(n-1\): \[ s^2=\frac{20}{4-1}=\frac{20}{3}\approx 6,67 \] Ejercicio 9Datos: \(2, 4, 6, 8\). Calcula la desviación estándar muestral.
Respuesta correcta: c) 2,58. Desarrollo: Del ejercicio anterior, la varianza muestral es: \[ s^2=\frac{20}{3}\approx 6,67 \] La desviación estándar muestral es la raíz cuadrada de la varianza: \[ s=\sqrt{6,67}\approx 2,58 \] Ejercicio 10Si un conjunto de datos tiene desviación estándar \(0\), se puede concluir que:
Respuesta correcta: c) Todos los datos son iguales entre sí. Desarrollo: La desviación estándar mide qué tan alejados están los datos respecto de la media. Si vale \(0\), no hay dispersión. Eso solo ocurre cuando todos los datos tienen el mismo valor, por lo que todos coinciden con la media. Ejercicio 11¿Cuál describe mejor una distribución con alta desviación estándar?
Respuesta correcta: b) Datos muy dispersos. Desarrollo: Una desviación estándar alta indica que, en general, los datos están alejados de la media. Por eso, la distribución presenta mayor dispersión. No significa necesariamente que la media, la mediana o la moda sean altas. Ejercicio 12En la siguiente tabla de frecuencias, calcula la media.
Respuesta correcta: b) 2,4. Desarrollo: Para calcular la media con frecuencias, multiplicamos cada valor por su frecuencia y dividimos por el total de datos: \[ \bar{x}=\frac{(1\cdot 2)+(2\cdot 3)+(3\cdot 4)+(4\cdot 1)}{2+3+4+1} \] \[ \bar{x}=\frac{2+6+12+4}{10}=\frac{24}{10}=2,4 \] Ejercicio 13Un valor atípico es, generalmente:
Respuesta correcta: c) Un dato muy alejado de la mayoría de los demás datos. Desarrollo: Un valor atípico es un dato que se distancia claramente del comportamiento general del conjunto. Puede deberse a un error de medición, pero no siempre; también puede ser un dato real que simplemente es poco común respecto de los demás. Ejercicio 14Si la media de un conjunto de datos es \(10\) y la mediana es \(12\), ¿qué se puede intuir sobre la distribución?
Respuesta correcta: c) Está sesgada a la izquierda. Desarrollo: Cuando la media es menor que la mediana, suele indicar que algunos valores bajos están arrastrando la media hacia la izquierda. Por eso se puede intuir un sesgo a la izquierda. Esta interpretación no es una certeza absoluta, pero es la conclusión más razonable con la información dada. Ejercicio 15¿Cuál de las siguientes afirmaciones sobre la desviación estándar es siempre verdadera?
Respuesta correcta: d) Es un valor no negativo. Desarrollo: La desviación estándar se obtiene como la raíz cuadrada de la varianza. Como la varianza se calcula a partir de cuadrados, nunca puede ser negativa. Por lo tanto, la desviación estándar siempre es mayor o igual que \(0\). 13. Ejercicios de Selección Múltiple (Parte 2)Ejercicios de Selección Múltiple (Parte 2)Subunidad 1: Análisis de datos estadísticos con medidas de dispersiónResuelve cada ejercicio seleccionando una alternativa. Luego revisa la solución desarrollada con el botón correspondiente. Ejercicio 16Datos agrupados: intervalo \(0-9\) con marca de clase \(4{,}5\) y frecuencia \(5\); intervalo \(10-19\) con marca de clase \(14{,}5\) y frecuencia \(10\); intervalo \(20-29\) con marca de clase \(24{,}5\) y frecuencia \(5\). Calcula la media aproximada.
Respuesta correcta: a) \(14{,}5\). Desarrollo: Para datos agrupados, usamos la media ponderada: \[ \bar{x}=\frac{\sum x_i f_i}{\sum f_i} \] Reemplazamos las marcas de clase y sus frecuencias: \[ \bar{x}=\frac{(4{,}5\cdot 5)+(14{,}5\cdot 10)+(24{,}5\cdot 5)}{5+10+5} \] \[ \bar{x}=\frac{22{,}5+145+122{,}5}{20} =\frac{290}{20}=14{,}5 \] Por lo tanto, la media aproximada es \(14{,}5\). Ejercicio 17Con los datos del ejercicio 16, calcula la varianza muestral aproximada.
Respuesta correcta: e) \(52{,}63\). Desarrollo: Del ejercicio anterior, la media aproximada es: \[ \bar{x}=14{,}5 \] Usamos la fórmula de varianza muestral para datos agrupados: \[ s^2=\frac{\sum f_i(x_i-\bar{x})^2}{n-1} \] Calculamos las desviaciones respecto de la media:
Ahora ponderamos por las frecuencias: \[ \sum f_i(x_i-\bar{x})^2=(5\cdot 100)+(10\cdot 0)+(5\cdot 100)=1000 \] Como \(n=20\), se divide por \(n-1=19\): \[ s^2=\frac{1000}{19}\approx 52{,}63 \] Por lo tanto, la varianza muestral aproximada es \(52{,}63\). Ejercicio 18Con los datos del ejercicio 16, calcula la desviación estándar muestral aproximada.
Respuesta correcta: a) \(7{,}25\). Desarrollo: La desviación estándar muestral es la raíz cuadrada de la varianza muestral. Del ejercicio anterior: \[ s^2\approx 52{,}63 \] Entonces: \[ s=\sqrt{52{,}63}\approx 7{,}25 \] Por lo tanto, la desviación estándar muestral aproximada es \(7{,}25\). Ejercicio 19Dos grupos tienen la misma media, pero el grupo A tiene una desviación estándar mayor que el grupo B. ¿Qué implica esto?
Respuesta correcta: b) Los datos del grupo A están más dispersos. Justificación: La desviación estándar mide qué tan alejados están los datos respecto de la media. Si ambos grupos tienen la misma media, pero el grupo A tiene mayor desviación estándar, entonces sus datos están más separados del promedio que los del grupo B. Ejercicio 20Grupo X: media \(80\), desviación estándar \(5\). Grupo Y: media \(80\), desviación estándar \(12\). ¿Cuál tiene mayor variabilidad relativa?
Respuesta correcta: b) Grupo Y. Desarrollo: Como ambos grupos tienen la misma media, podemos comparar directamente sus desviaciones estándar. También podemos calcular el coeficiente de variación: \[ CV_X=\frac{5}{80}\cdot 100\%=6{,}25\% \] \[ CV_Y=\frac{12}{80}\cdot 100\%=15\% \] Como \(15\%>6{,}25\%\), el grupo Y tiene mayor variabilidad relativa. Ejercicio 21Calcula el coeficiente de variación \(CV\) para un conjunto de datos con media \(25\) y desviación estándar \(5\).
Respuesta correcta: b) \(20\%\). Desarrollo: El coeficiente de variación se calcula como: \[ CV=\frac{\text{desviación estándar}}{\text{media}}\cdot 100\% \] Reemplazamos los valores: \[ CV=\frac{5}{25}\cdot 100\%=0{,}2\cdot 100\%=20\% \] Por lo tanto, el coeficiente de variación es \(20\%\). |
|---|