Cómo Calcular la Desviación Estándar (Paso a Paso)
La desviación estándar mide cuánto se alejan tus datos de su propio promedio: encuentras la media, calculas cuánto se desvía cada valor de esa media y elevas ese resultado al cuadrado, promedias esos cuadrados y por último extraes la raíz cuadrada. Existen dos versiones de la fórmula según el origen de tus datos: la poblacional divide entre n, la muestral divide entre n menos 1. La diferencia entre ambas parece un detalle técnico, pero cambia el resultado y, en algunos casos, la conclusión que sacas de él.
por qué la media sola no basta
Dos conjuntos de notas pueden tener exactamente el mismo promedio y describir situaciones completamente distintas en el salón de clase. Mira estos dos grupos:
- Clase A: 68, 70, 72, 70, 70
- Clase B: 50, 90, 60, 80, 70
Ambos promedian 70. Si solo miraras la media, dirías que el desempeño de las dos clases fue idéntico. La desviación estándar cuenta otra historia.
| Grupo | Media | Desviación poblacional | Desviación muestral |
|---|---|---|---|
| Clase A | 70 | 1,26 | 1,41 |
| Clase B | 70 | 14,14 | 15,81 |
En la Clase A casi todos sacaron algo cercano a 70, con variaciones mínimas de dos puntos hacia arriba o hacia abajo. En la Clase B hubo un 50 y un 90 conviviendo con un 70 justo en el medio: el promedio es el mismo, pero la dispersión real de los resultados no tiene nada que ver. Un profesor que solo reporta el promedio de 70 en ambos casos está ocultando que un grupo fue mucho más parejo que el otro. Eso, precisamente, es lo que mide la desviación estándar: qué tan lejos suelen estar los datos individuales de su propio centro.
la fórmula: poblacional vs muestral
La fórmula de la desviación estándar tiene tres pasos fijos sin importar cuál versión uses. Primero calculas la media de todos los valores. Después, para cada valor, restas la media y elevas esa diferencia al cuadrado (elevarla al cuadrado evita que los valores negativos se cancelen con los positivos). Luego sumas todos esos cuadrados y divides: aquí es donde aparece la diferencia.
Si tus datos representan a todo el grupo que te interesa (por ejemplo, las notas de los cinco únicos estudiantes de un taller pequeño), divides esa suma entre n, el número total de valores. Eso te da la varianza poblacional, y su raíz cuadrada es la desviación estándar poblacional.
Si en cambio tus datos son solo una muestra sacada de un grupo más grande (encuestaste a 200 personas de una ciudad de 2 millones, o mediste 10 cajas de una producción de miles), divides entre n menos 1 en vez de entre n. Esa resta de uno se conoce como corrección de Bessel, y compensa el hecho de que una muestra tiende a subestimar la variabilidad real de la población de la que proviene. El resultado siempre es un número un poco más alto que el poblacional, y por eso las calculadoras estadísticas casi siempre ofrecen ambas fórmulas por separado.
En la práctica, cuando dudes entre las dos, la pregunta que resuelve el dilema es simple: ¿tus números son el universo completo que te importa, o son una porción de algo más grande? Encuestas, controles de calidad y experimentos científicos casi siempre trabajan con muestras, así que ahí la fórmula muestral es la que corresponde.
ejemplo práctico: control de calidad en una fábrica
Una fábrica de cereales fija el peso objetivo de cada caja en 500 gramos. Al final de un turno, un inspector pesa diez cajas al azar de la línea de producción y anota estos valores en gramos:
498, 502, 501, 497, 503, 500, 499, 502, 496, 501
El primer paso es la media. Sumando los diez pesos se obtiene 4999, y 4999 dividido entre 10 da 499,9 gramos. La fábrica está prácticamente en el objetivo, con apenas una décima de gramo de diferencia respecto a los 500g esperados. El rango, es decir la distancia entre la caja más pesada y la más liviana, va de 496 a 503, siete gramos en total, pero el rango solo mira los dos extremos y no dice nada sobre las ocho cajas restantes.
Para cada caja se resta la media (499,9) y se eleva esa diferencia al cuadrado:
| Caja (g) | Desviación (caja − 499,9) | Desviación al cuadrado |
|---|---|---|
| 498 | -1,9 | 3,61 |
| 502 | 2,1 | 4,41 |
| 501 | 1,1 | 1,21 |
| 497 | -2,9 | 8,41 |
| 503 | 3,1 | 9,61 |
| 500 | 0,1 | 0,01 |
| 499 | -0,9 | 0,81 |
| 502 | 2,1 | 4,41 |
| 496 | -3,9 | 15,21 |
| 501 | 1,1 | 1,21 |
Sumando la última columna se llega a 48,9, el total de las desviaciones al cuadrado. Como estas diez cajas son una muestra sacada de una producción mucho mayor (miles de cajas salen de esa línea cada turno), lo correcto es dividir entre n menos 1, es decir entre 9, no entre 10.
Con la fórmula muestral: 48,9 / 9 = 5,43 de varianza, y la raíz cuadrada de 5,43 da una desviación estándar muestral de aproximadamente 2,33 gramos. Si por comparación se calculara la versión poblacional (como si estas diez cajas fueran todo lo que le interesa al inspector, sin proyectarlo a la producción completa), la varianza sería 48,9 / 10 = 4,89 y la desviación estándar poblacional, 2,21 gramos.
La diferencia entre 2,21 y 2,33 gramos no cambia gran cosa en este caso, pero en muestras más pequeñas (cinco o seis mediciones en vez de diez) la brecha entre ambas fórmulas se nota mucho más, y elegir la incorrecta puede llevar a subestimar cuánto varía realmente el proceso de producción.
calcula con tus propios números
Pega tu propia lista de valores (separados por coma o por salto de línea) y obtén al instante la media, la varianza y la desviación estándar, tanto poblacional como muestral.
Separa los valores con comas, espacios o saltos de línea.
Introduce al menos un número para ver los resultados.
- Cantidad (n)
- —
- Suma
- —
- Media (promedio)
- —
- Mínimo
- —
- Máximo
- —
- Rango
- —
errores comunes al calcular la desviación estándar
Confundir la fórmula muestral con la poblacional es, con diferencia, el error más habitual. Dividir entre n cuando los datos son una muestra hace que el resultado salga artificialmente bajo, lo cual importa especialmente en informes técnicos o científicos donde ese número alimenta cálculos posteriores como intervalos de confianza.
Otro tropiezo frecuente es promediar las desviaciones sin elevarlas al cuadrado primero. Si sumas las diferencias respecto a la media tal cual, sin el cuadrado, el resultado siempre da cero (o algo muy cercano a cero por redondeo), porque los valores por encima de la media y los que están por debajo se cancelan entre sí. El paso de elevar al cuadrado no es opcional ni cosmético: es lo que evita esa cancelación y permite que la dispersión real quede reflejada en el número final.
Reportar la varianza como si fuera la desviación estándar es un tercer error que aparece incluso en trabajos publicados. La varianza está en unidades al cuadrado (gramos al cuadrado, en el ejemplo de las cajas de cereal), mientras que la desviación estándar regresa a las unidades originales gracias a la raíz cuadrada. Olvidar ese último paso deja un número que, aunque relacionado, no se puede comparar directamente con los datos de partida.
Por último, aplicar n en vez de n menos 1 a datos que claramente son una muestra (una encuesta, un lote de control de calidad, un experimento con un grupo reducido de participantes) subestima la variabilidad real del fenómeno que se está midiendo. Cuantas menos observaciones tengas, más se nota esa subestimación, así que en muestras pequeñas conviene revisar dos veces cuál fórmula se está usando.
preguntas frecuentes
¿Cuál es la diferencia entre desviación estándar muestral y poblacional? La poblacional divide la suma de las desviaciones al cuadrado entre n, el total de datos, y se usa cuando esos datos son el grupo completo que te interesa analizar. La muestral divide entre n menos 1 y se usa cuando los datos son una porción extraída de un grupo mayor. La versión muestral siempre da un número igual o mayor, porque esa resta de uno compensa la tendencia de las muestras pequeñas a subestimar la variación real.
¿Qué significa una desviación estándar “baja” o “alta” en la práctica? Una desviación baja indica que los valores están agrupados cerca de la media, como en la Clase A del ejemplo anterior, donde casi todas las notas rondaban el 70. Una desviación alta indica que los valores están más dispersos, como en la Clase B, donde hubo notas de 50 y de 90 con el mismo promedio de 70. No hay un umbral universal de “alto” o “bajo”: depende de la escala y el contexto de lo que se esté midiendo.
¿La desviación estándar puede ser negativa? No. Como se calcula a partir de una raíz cuadrada de valores al cuadrado (que siempre son positivos o cero), el resultado nunca puede ser un número negativo. El valor mínimo posible es cero, y eso ocurre únicamente cuando todos los datos del conjunto son exactamente iguales entre sí.
¿Cómo se relaciona la desviación estándar con la varianza? La varianza es el promedio de las desviaciones al cuadrado, y la desviación estándar es simplemente la raíz cuadrada de esa varianza. Se calculan casi de la misma manera, pero la varianza queda en unidades al cuadrado (metros cuadrados, gramos al cuadrado) mientras que la desviación estándar vuelve a las unidades originales del dato, lo que la hace mucho más fácil de interpretar y comparar.
¿Hace falta calcular la desviación estándar a mano, o basta con una calculadora? Entender el procedimiento manual (media, desviación, cuadrado, promedio, raíz) ayuda a interpretar de dónde sale cada número y a detectar errores de cálculo o de fórmula. Para conjuntos de datos grandes, sin embargo, una calculadora o una hoja de cálculo evita el trabajo repetitivo y reduce el margen de error humano en la suma de los cuadrados.