Intervalos de Confianza

Recta numérica de 0 a 8 que muestra un intervalo de confianza de 2 a 6 centrado en 4
Un intervalo de 4 más o menos 2

Un intervalo de confianza es un rango de valores en el que estamos bastante seguros de que se encuentra nuestro verdadero valor.

Grupo de hombres corriendo una carrera de maratón

Ejemplo: altura promedio

Medimos las alturas de 40 hombres elegidos al azar y obtenemos una altura media de 175cm,

También sabemos que la desviación estándar de las alturas de los hombres es de 20cm.

El intervalo de confianza del 95% (mostramos cómo calcularlo más adelante) es:

Recta numérica de 160 a 190 que muestra un intervalo de confianza de 168.8 a 181.2 centrado en 175

El signo "±" significa "más o menos", de modo que 175cm ± 6.2cm significa

  • 175cm − 6.2cm = 168.8cm a 
  • 175cm + 6.2cm = 181.2cm

Y nuestro resultado dice que la verdadera media de TODOS los hombres (si pudiéramos medir todas sus alturas) es probable que esté entre 168.8cm y 181.2cm

¡Pero podría no ser así!

El "95%" dice que el 95% de los experimentos como el que acabamos de hacer incluirán la verdadera media, pero el 5% no lo hará.

Imagina que repetimos este proceso de muestreo una y otra vez, entonces alrededor de 19 de cada 20 contendrían la verdadera media, y alrededor de 1 de cada 20 no la contendría. ¡Esta podría ser la que no la contenga!

Cálculo del intervalo de confianza

Paso 1: recopilar la información de la muestra

Nota: Idealmente usaríamos la desviación estándar de la población σ, pero normalmente no la conocemos.

Por lo tanto, para muestras más grandes (alrededor de n ≥ 30), usar la desviación estándar de la muestra s funciona lo suficientemente bien.

Usando nuestro ejemplo:

Paso 2: elegir el nivel de confianza

Las opciones más comunes son 95% o 99%. Un intervalo de confianza del 95% significa que este método capturaría la media verdadera alrededor del 95% de las veces si repitiéramos el muestreo muchas veces.

Encuentra el valor Z correspondiente aquí:

Intervalo de
Confianza
Z
80% 1.282
85% 1.440
90% 1.645
95% 1.960
99% 2.576
99.5% 2.807
99.9% 3.291

Para un intervalo de confianza del 95%, el valor Z es 1.960

Paso 3: usa ese valor Z en esta fórmula para el intervalo de confianza:

X ± Zs√n

Donde:

Y tenemos:

175 ± 1.960 × 20√40

Es decir:

175cm ± 6.20cm

En otras palabras: de 168.8cm a 181.2cm

El valor después del ± se llama margen de error

El margen de error en nuestro ejemplo es 20√40 = 6.20cm

Calculadora

Captura de pantalla de la interfaz de la calculadora de intervalos de confianza en línea

Tenemos una Calculadora de Intervalos de Confianza para facilitarte la vida.

Simulador

También tenemos un Simulador de Distribución Normal muy interesante donde podemos comenzar con una media "verdadera" teórica y una desviación estándar, y luego tomar muestras aleatorias.

Nos ayuda a comprender cómo las muestras aleatorias a veces pueden ser muy buenas o malas para representar los valores verdaderos subyacentes.

Otro ejemplo

Primer plano de manzanas rojas maduras colgando de la rama de un árbol

Ejemplo: huerto de manzanas

¿Son las manzanas lo suficientemente grandes?

Hay cientos de manzanas en los árboles, por lo que eliges aleatoriamente solo 46 manzanas y obtienes:

  • una media de 86 g
  • una desviación estándar de 6.2 g

Así que calculemos:

X ± Zs√n

Sabemos que:

  • X es la media = 86
  • Z es el valor Z = 1.960 (de la tabla anterior para el 95%)
  • s es la desviación estándar = 6.2
  • n es el número de observaciones = 46

86 ± 1.960 × 6.2√46 = 86 ± 1.79

Por lo tanto, es probable que la verdadera media (de todos los cientos de manzanas) esté entre 84.21 y 87.79

Media verdadera

Ahora imagina que podemos recolectar TODAS las manzanas de inmediato, y hacer que TODAS sean medidas por la máquina empaquetadora (¡este es un lujo que normalmente no se tiene en estadística!).

Y la verdadera media resulta ser 84.9

Coloquemos todas las manzanas en el suelo desde la más pequeña hasta la más grande:

Gráfico que muestra los pesos individuales de las manzanas con un intervalo de confianza de 86 más o menos 1.79 que incluye la media verdadera de 84.9
Cada manzana es un punto verde,
nuestras observaciones están marcadas en  azul

Nuestro resultado no fue exacto... después de todo es aleatorio... pero la verdadera media está dentro de nuestro intervalo de confianza de 86 ± 1.79 (en otras palabras, de 84.21 a 87.79)

Ahora bien, la verdadera media podría no estar dentro del intervalo de confianza, ¡pero en el 95% de los casos sí lo estará!

El 95% de todos los "Intervalos de confianza del 95%" incluirán la verdadera media.

Quizás tuvimos esta muestra, con una media de 83.5:

Gráfico que muestra los pesos de las manzanas con un intervalo de confianza de 83.5 más o menos 1.25 que no incluye la media verdadera de 84.9
Cada manzana es un punto verde,
nuestras observaciones están marcadas en morado

La cual no incluye la verdadera media. Eso puede ocurrir aproximadamente el 5% de las veces para un intervalo de confianza del 95%.

Entonces, ¿cómo sabemos si nuestra muestra es una del 95% "afortunado" o del 5% desafortunado? A menos que podamos medir a toda la población como arriba, simplemente no lo sabemos.

Este es el riesgo en el muestreo: podríamos tener una "mala" muestra.

Ejemplo en la investigación

Aquí se muestra el intervalo de confianza utilizado en una investigación real sobre ejercicio adicional para personas mayores:

Tabla de resultados de razón de riesgo para hombres y mujeres con sus correspondientes intervalos de confianza del 95 por ciento

¿Qué nos dice? Mirando la fila "Male" (Hombres) vemos:

  • 1,226 hombres (47.6% de todos los participantes)
  • tuvieron un "HR" (ver abajo) con una media de 0.92,
  • y un intervalo de confianza del 95% (IC del 95%) de 0.88 a 0.97 (que también es 0.92 ± 0.05)

"HR" son las siglas en inglés de Hazard Ratio (cociente de riesgo o razón de riesgo): una medida común en la investigación médica. Un HR menor que 1 significa menor riesgo (un mejor resultado), mientras que mayor que 1 significa mayor riesgo (un peor resultado).

Por lo tanto, para el HR de los hombres: tenemos un 95% de confianza de que el verdadero HR poblacional se encuentra entre 0.88 y 0.97. Todo el intervalo está por debajo de 1, por lo que la reducción del riesgo es estadísticamente significativa (p < 0.05). En lenguaje sencillo: el ejercicio adicional parece aportar un beneficio real para los hombres.

Pero este no es el caso para las mujeres en el mismo estudio. Su IC del 95% fue de 0.90–1.03 (que incluye el 1), por lo que no se encontró ningún beneficio estadísticamente significativo.

Distribución Normal Estándar

Todo se basa en la idea de la Distribución Normal Estándar, donde el valor Z es la "puntuación Z"

Por ejemplo, el valor Z para el 95% es 1.960, y aquí vemos que el rango de -1.96 a +1.96 incluye el 95% de todos los valores:

Curva de distribución normal estándar que muestra el 95 por ciento del área bajo la curva entre -1.96 y 1.96
De -1.96 a +1.96 desviaciones estándar es el 95%

Aplicar eso a nuestra muestra se ve así:

Curva de campana centrada en 86 con un intervalo de confianza del 95 por ciento sombreado de 84.21 a 87.79
También de -1.96 a +1.96 desviaciones estándar, por lo que incluye el 95%

Conclusión

El intervalo de confianza se basa en la media y la desviación estándar. Su fórmula es:

X ± Zs√n

Donde:

11285, 11286, 11287, 11288, 11289, 11290, 11291, 11292