Aprende bioestadística con datos de farmacia

Tres temas en orden, con laboratorios que puedes tocar, problemas que cambian cada vez y un examen que se adapta a tu nivel.

Examen adaptativo

Una prueba de nivel de 8 preguntas decide si empiezas en fácil, medio, difícil o experto. Después, el examen sube o baja de nivel según tus respuestas.

Tema 1, estadística descriptiva

Variables, tablas de frecuencias y gráficos

Antes de calcular nada hay que saber qué tipo de dato tienes. El tipo de variable decide qué tabla, qué gráfico y qué medidas tienen sentido.

Variables estadísticas

Una variable estadística es una característica de la población que estudiamos. Hay dos grandes familias, y cada una se divide en dos.

Cualitativa

Nominal

Categorías sin orden. Grupo sanguíneo, tipo de medicamento (analgésico, antibiótico…), estado de vacunación.
Cualitativa

Ordinal

Categorías con orden. Gravedad (leve, moderado, severo), nivel de satisfacción (bajo, medio, alto).
Cuantitativa

Discreta

Solo toma ciertos valores, normalmente enteros. Número de hijos, dosis de vacuna recibidas, días con síntomas.
Cuantitativa

Continua

Cualquier valor en un rango. Temperatura corporal, estatura, glucosa en sangre (mg/dl).
Ojo con los códigos. Puedes codificar una variable cualitativa con números (vacunado = 1, no vacunado = 0), pero son arbitrarios: no tiene sentido sumarlos ni hacer su media. Y la frontera discreta/continua depende del diseño: si registras el peso solo en kilos enteros, en la práctica lo tratas como discreta.

El recorrido de una variable cuantitativa es la diferencia entre su valor máximo y su valor mínimo.

Frecuencias

Con una muestra de tamaño n y valores x1, …, xk, contamos cuántas veces aparece cada valor.

FrecuenciaQué esFórmula
Absoluta, niVeces que aparece xi—
Relativa, fiProporción de la muestrafi = nin
Absoluta acumulada, NiDatos menores o iguales que xiNi = n1 + … + ni
Relativa acumulada, FiProporción de datos ≤ xiFi = Nin = f1 + … + fi
Comprobaciones rápidas. La columna ni suma n, la columna fi suma 1, el último Ni es n y el último Fi es 1. Las acumuladas solo tienen sentido si los valores se pueden ordenar.

Construye tu tabla de frecuencias

Datos: días con síntomas de 50 pacientes (Tema 1). Puedes cambiarlos.
Separa los datos con espacios o punto y coma.

Datos agrupados en clases e histogramas

Con variables continuas, o con muchos valores distintos, agrupamos el recorrido en intervalos [a, b). Cada intervalo se representa por su marca de clase:

marca de clase = a + b2

En un histograma las bases de las barras son los intervalos y lo que es proporcional a la frecuencia es el área. Si los intervalos tienen distinta longitud, la altura debe ser una densidad:

altura = frecuencia del intervalolongitud del intervalo

¿Cuántos intervalos?

Glucosa en sangre de los 20 pacientes del ejemplo (mg/dl), de 70 a 145.

Resumir en clases pierde información: con muchos intervalos y pocos datos aparecen huecos y picos que no dicen nada de la población.

Qué gráfico usar

GráficoQué codifica la frecuenciaCuándo
Diagrama de barrasLa altura de cada barraCualitativas y cuantitativas discretas. Permite comparar varias muestras.
Diagrama de sectoresEl ángulo del sector (indica el %)Solo cualitativas con pocas categorías. Rara vez es la mejor opción.
HistogramaEl área de la barraCuantitativas agrupadas en clases. Nunca para cualitativas.

Tema 2, estadística descriptiva

Medidas para describir una muestra

Cuatro preguntas sobre cualquier variable cuantitativa: ¿cuál es el valor típico?, ¿dónde queda un dato concreto?, ¿cómo de dispersos están?, ¿qué forma tiene la distribución?

Medidas de centralización

Media aritmética. Con datos sueltos o con tabla de frecuencias (en datos agrupados, xi es la marca de clase):

x̄ = 1n∑ni=1xi     x̄ = 1n∑ki=1nixi = ∑ki=1fixi

Mediana (Me). Ordena los datos. Con n impar es el valor central; con n par, la media de los dos centrales. En una tabla de frecuencias, es el primer valor con Fi ≥ 0,5.

Moda (Md). El valor (o clase) más frecuente. Sirve también para cualitativas. Puede haber varias: muestras bimodales, trimodales…

Media frente a mediana con un valor atípico

Datos: 4, 5, 6, 7, 4, 1 y un séptimo valor que tú eliges.
Cuidado con la representatividad. Dos muestras pueden tener la misma media y la misma mediana y ser muy distintas: una concentrada en el centro y otra con los datos en los extremos (bimodal). Por eso necesitamos medidas de dispersión.

Medidas de posición

Generalizan la mediana. Los cuartiles Q1, Q2 = Me, Q3 dejan por debajo el 25 %, 50 % y 75 % de los datos. Los deciles Dk dejan el k·10 %, y los percentiles Pk el k %. Así, D2 = P20 y Q2 = D5 = P50.

Receta con tabla de frecuencias. Para la medida que deja por debajo la proporción p, busca el primer valor cuyo Fi sea ≥ p. En los días con síntomas: Q1 = 4 (F = 0,36), Me = 5 (F = 0,52), Q3 = 8 (F = 0,82), D2 = 3, P68 = 7.

Medidas de dispersión

Indican cuánto se puede fiar uno de la media: dispersión baja significa datos homogéneos y media representativa.

Recorrido intercuartílico: IQR = Q3 − Q1. Un dato es atípico si está por debajo de Q1 − 1,5·IQR o por encima de Q3 + 1,5·IQR.

Varianza (poblacional) y desviación típica:

S² = 1n∑ni=1(xi − x̄)² = 1n∑ni=1xi² − x̄²     S = √S²

Cuasivarianza (varianza muestral) y cuasidesviación típica (desviación estándar): solo cambia el denominador.

s² = 1n − 1∑ni=1(xi − x̄)² = nn − 1S²     s = √s²
Statgraphics llama «varianza» a la cuasivarianza y «desviación típica» a la cuasidesviación. En clase, «varianza» a secas es la poblacional. La varianza tiene las unidades de la variable al cuadrado y solo sirve para comparar dispersión si las medias son parecidas.

Coeficiente de variación: adimensional, compara dispersiones de muestras con medias o unidades distintas. Si CV ≤ 0,30 la media es representativa (datos homogéneos). Falla si x̄ está cerca de 0.

CV = sx̄

Variable tipificada: cuántas desviaciones estándar está un dato por encima (z > 0) o por debajo (z < 0) de su media. Tiene media 0 y desviación 1.

z = x − x̄s

¿Quién es relativamente más pesado?

El ejemplo del elefante y la hormiga culona. Cambia los valores.
ValorMediaDesv. estándarz
Elefante (t)
Hormiga (mg)

Medidas de forma

Coeficiente de asimetría de Fisher y coeficiente de curtosis, con los momentos respecto a la media:

g1 = m3S³,   m3 = 1n∑ ni(xi − x̄)³     g2 = m4S⁴ − 3,   m4 = 1n∑ ni(xi − x̄)⁴

Distribución simétrica implica media = mediana, pero no al revés. Con g2 > 0 la distribución es leptocúrtica (apuntada), con g2 < 0 platicúrtica (aplanada) y con g2 = 0 mesocúrtica, como la normal. Si los coeficientes de asimetría y curtosis tipificados están entre −2 y 2, los datos son aproximadamente normales.

Calculadora descriptiva y diagrama de caja

Todas las medidas de una muestra

Por defecto, el ejemplo del diagrama de caja del Tema 2.
Decimales con coma o punto; separa los datos con espacios o punto y coma.

Los cuartiles de datos sueltos se calculan por interpolación (igual que Excel y que el ejemplo de clase: Q1 = 12,5, Q3 = 16). En tablas de frecuencias usa la regla del primer Fi ≥ p.

Tema 3, métodos de regresión

Correlación y regresión

Ahora medimos dos variables en cada individuo. ¿Están relacionadas? ¿Podemos encontrar una función y = f(x) que las describa y sirva para predecir?

Distribuciones bidimensionales

Tenemos pares (x1, y1), …, (xn, yn) medidos sobre el mismo individuo. X es la variable explicativa (independiente) e Y la variable respuesta (dependiente). Se representan con un diagrama de dispersión.

Si hay valores repetidos se usa una tabla de doble entrada: nij son los individuos con xi e yj a la vez; las frecuencias marginales ni+ (suma de la fila) y n+j (suma de la columna) ignoran la otra variable.

Edad (X) y número de medicamentos recetados en un mes (Y)

Covarianza y coeficiente de correlación de Pearson

La covarianza muestral mide si las dos variables varían juntas:

Cov(x, y) = 1n − 1∑ni=1(xi − x̄)(yi − ȳ)

Cov > 0: cuando una aumenta, la otra también. Cov < 0: cuando una aumenta, la otra disminuye. Si son independientes, Cov = 0, pero Cov = 0 no garantiza independencia. La covarianza tiene unidades, así que su tamaño no dice nada por sí solo.

El coeficiente de correlación lineal de Pearson la hace adimensional usando las cuasidesviaciones típicas:

r = Cov(x, y)s(x) · s(y),    −1 ≤ r ≤ 1

El signo de r es el de la pendiente. |r| = 1 es correlación perfecta; r ≈ 0 indica que no hay relación lineal (puede haberla de otro tipo). Orientación de J. Susan Milton, nunca como verdad absoluta: |r| ≤ 0,5 débil, 0,5 < |r| ≤ 0,9 moderada, |r| > 0,9 fuerte.

Ejemplo resuelto. Dosis de un antihipertensivo (X, mg) y reducción de la presión arterial (Y, mm Hg):

Recta de regresión por mínimos cuadrados

Buscamos la recta ŷ = b0 + b1x que minimiza la suma de los cuadrados de los residuos yi − ŷi, es decir, el error cuadrático medio:

ECM = 1n − 1∑(yi − b0 − b1xi)²  ⟹  b1 = Cov(x, y)sx²,   b0 = ȳ − b1x̄

También se escribe ŷ − ȳ = b1(x − x̄): la recta siempre pasa por el punto (x̄, ȳ). En el ejemplo de la dosis, b1 = 775 / 6250 = 0,124 y b0 = 17,8 − 0,124 · 150 = −0,8, así que para 75 mg esperamos una reducción de −0,8 + 0,124 · 75 = 8,5 mm Hg.

Laboratorio de regresión

Pulsa en el papel para añadir puntos, arrástralos para moverlos y haz doble clic para quitarlos.

Representatividad de la recta

Para un mismo x podemos observar distintos y: además del modelo actúa el azar o ruido (individuos distintos, variables no consideradas, precisión de las medidas). La identidad ANOVA separa la variabilidad total en la parte del azar y la parte del modelo:

∑(yi − ȳ)² = ∑(yi − ŷi)² + ∑(ŷi − ȳ)²  ⟹  1 = ∑(yi − ŷi)²∑(yi − ȳ)² + r²

El coeficiente de determinación r² es la proporción de la variabilidad total que explica el modelo. Un buen ajuste lineal tiene r² cercano a 1. En el laboratorio de arriba, la barra ANOVA muestra este reparto en directo.

Tres advertencias del tema. La recta solo es una buena aproximación localmente: no la uses para extrapolar fuera de (xmin, xmax), ni para predecir x a partir de y. Representa siempre los datos: el cuarteto de Anscombe (cárgalo en el laboratorio) tiene cuatro nubes muy distintas con la misma media, varianzas, r = 0,816 y recta y = 3 + 0,5x. Y correlación no implica causalidad: los divorcios en Reino Unido y las películas de Disney estrenadas entre 2000 y 2012 tienen r = 0,925.

Métodos de regresión no lineal

Cuando la nube no sugiere una recta, un cambio de variables permite linealizar el problema: ajustamos la recta z = c0 + c1w y deshacemos el cambio. Si una variable no aparece en la tabla, no se transforma.

ModeloFunciónCambio de variableCoeficientesEjemplo
Exponencialy = b0eb₁xz = ln yb0 = ec₀, b1 = c1Crecimiento celular, enfriamiento
Potencialy = b0xb₁w = ln x, z = ln yb0 = ec₀, b1 = c1Alometrías
Logarítmicoy = b0 + b1ln xw = ln xb0 = c0, b1 = c1pH
Hiperbólicoy = b0x / (1 + b1x)w = 1/x, z = 1/yb0 = 1/c1, b1 = c0/c1Michaelis-Menten
¿Qué modelo elegir? En ausencia de otra información, el de mayor r² (calculado en las variables transformadas).

Prueba los cinco modelos

Elige un conjunto de datos simulado y compara los r².

Problemas

Cada problema se genera con datos nuevos. Intenta resolverlo con papel y calculadora, compruébalo y mira la solución paso a paso.