Aprende bioestadística con datos de farmacia
Tres temas en orden, con laboratorios que puedes tocar, problemas que cambian cada vez y un examen que se adapta a tu nivel.
Examen adaptativo
Una prueba de nivel de 8 preguntas decide si empiezas en fácil, medio, difícil o experto. Después, el examen sube o baja de nivel según tus respuestas.
Tema 1, estadística descriptiva
Variables, tablas de frecuencias y gráficos
Antes de calcular nada hay que saber qué tipo de dato tienes. El tipo de variable decide qué tabla, qué gráfico y qué medidas tienen sentido.
Variables estadísticas
Una variable estadística es una característica de la población que estudiamos. Hay dos grandes familias, y cada una se divide en dos.
Nominal
Categorías sin orden. Grupo sanguíneo, tipo de medicamento (analgésico, antibiótico…), estado de vacunación.Ordinal
Categorías con orden. Gravedad (leve, moderado, severo), nivel de satisfacción (bajo, medio, alto).Discreta
Solo toma ciertos valores, normalmente enteros. Número de hijos, dosis de vacuna recibidas, días con síntomas.Continua
Cualquier valor en un rango. Temperatura corporal, estatura, glucosa en sangre (mg/dl).El recorrido de una variable cuantitativa es la diferencia entre su valor máximo y su valor mínimo.
Frecuencias
Con una muestra de tamaño n y valores x1, …, xk, contamos cuántas veces aparece cada valor.
| Frecuencia | Qué es | Fórmula |
|---|---|---|
| Absoluta, ni | Veces que aparece xi | — |
| Relativa, fi | Proporción de la muestra | fi = nin |
| Absoluta acumulada, Ni | Datos menores o iguales que xi | Ni = n1 + … + ni |
| Relativa acumulada, Fi | Proporción de datos ≤ xi | Fi = Nin = f1 + … + fi |
Construye tu tabla de frecuencias
Datos: días con síntomas de 50 pacientes (Tema 1). Puedes cambiarlos.Datos agrupados en clases e histogramas
Con variables continuas, o con muchos valores distintos, agrupamos el recorrido en intervalos [a, b). Cada intervalo se representa por su marca de clase:
En un histograma las bases de las barras son los intervalos y lo que es proporcional a la frecuencia es el área. Si los intervalos tienen distinta longitud, la altura debe ser una densidad:
¿Cuántos intervalos?
Glucosa en sangre de los 20 pacientes del ejemplo (mg/dl), de 70 a 145.Resumir en clases pierde información: con muchos intervalos y pocos datos aparecen huecos y picos que no dicen nada de la población.
Qué gráfico usar
| Gráfico | Qué codifica la frecuencia | Cuándo |
|---|---|---|
| Diagrama de barras | La altura de cada barra | Cualitativas y cuantitativas discretas. Permite comparar varias muestras. |
| Diagrama de sectores | El ángulo del sector (indica el %) | Solo cualitativas con pocas categorías. Rara vez es la mejor opción. |
| Histograma | El área de la barra | Cuantitativas agrupadas en clases. Nunca para cualitativas. |
Tema 2, estadística descriptiva
Medidas para describir una muestra
Cuatro preguntas sobre cualquier variable cuantitativa: ¿cuál es el valor típico?, ¿dónde queda un dato concreto?, ¿cómo de dispersos están?, ¿qué forma tiene la distribución?
Medidas de centralización
Media aritmética. Con datos sueltos o con tabla de frecuencias (en datos agrupados, xi es la marca de clase):
Mediana (Me). Ordena los datos. Con n impar es el valor central; con n par, la media de los dos centrales. En una tabla de frecuencias, es el primer valor con Fi ≥ 0,5.
Moda (Md). El valor (o clase) más frecuente. Sirve también para cualitativas. Puede haber varias: muestras bimodales, trimodales…
Media frente a mediana con un valor atípico
Datos: 4, 5, 6, 7, 4, 1 y un séptimo valor que tú eliges.Medidas de posición
Generalizan la mediana. Los cuartiles Q1, Q2 = Me, Q3 dejan por debajo el 25 %, 50 % y 75 % de los datos. Los deciles Dk dejan el k·10 %, y los percentiles Pk el k %. Así, D2 = P20 y Q2 = D5 = P50.
Medidas de dispersión
Indican cuánto se puede fiar uno de la media: dispersión baja significa datos homogéneos y media representativa.
Recorrido intercuartílico: IQR = Q3 − Q1. Un dato es atípico si está por debajo de Q1 − 1,5·IQR o por encima de Q3 + 1,5·IQR.
Varianza (poblacional) y desviación típica:
Cuasivarianza (varianza muestral) y cuasidesviación típica (desviación estándar): solo cambia el denominador.
Coeficiente de variación: adimensional, compara dispersiones de muestras con medias o unidades distintas. Si CV ≤ 0,30 la media es representativa (datos homogéneos). Falla si x̄ está cerca de 0.
Variable tipificada: cuántas desviaciones estándar está un dato por encima (z > 0) o por debajo (z < 0) de su media. Tiene media 0 y desviación 1.
¿Quién es relativamente más pesado?
El ejemplo del elefante y la hormiga culona. Cambia los valores.| Valor | Media | Desv. estándar | z | |
|---|---|---|---|---|
| Elefante (t) | ||||
| Hormiga (mg) |
Medidas de forma
Coeficiente de asimetría de Fisher y coeficiente de curtosis, con los momentos respecto a la media:
Distribución simétrica implica media = mediana, pero no al revés. Con g2 > 0 la distribución es leptocúrtica (apuntada), con g2 < 0 platicúrtica (aplanada) y con g2 = 0 mesocúrtica, como la normal. Si los coeficientes de asimetría y curtosis tipificados están entre −2 y 2, los datos son aproximadamente normales.
Calculadora descriptiva y diagrama de caja
Todas las medidas de una muestra
Por defecto, el ejemplo del diagrama de caja del Tema 2.Los cuartiles de datos sueltos se calculan por interpolación (igual que Excel y que el ejemplo de clase: Q1 = 12,5, Q3 = 16). En tablas de frecuencias usa la regla del primer Fi ≥ p.
Tema 3, métodos de regresión
Correlación y regresión
Ahora medimos dos variables en cada individuo. ¿Están relacionadas? ¿Podemos encontrar una función y = f(x) que las describa y sirva para predecir?
Distribuciones bidimensionales
Tenemos pares (x1, y1), …, (xn, yn) medidos sobre el mismo individuo. X es la variable explicativa (independiente) e Y la variable respuesta (dependiente). Se representan con un diagrama de dispersión.
Si hay valores repetidos se usa una tabla de doble entrada: nij son los individuos con xi e yj a la vez; las frecuencias marginales ni+ (suma de la fila) y n+j (suma de la columna) ignoran la otra variable.
Edad (X) y número de medicamentos recetados en un mes (Y)
Covarianza y coeficiente de correlación de Pearson
La covarianza muestral mide si las dos variables varían juntas:
Cov > 0: cuando una aumenta, la otra también. Cov < 0: cuando una aumenta, la otra disminuye. Si son independientes, Cov = 0, pero Cov = 0 no garantiza independencia. La covarianza tiene unidades, así que su tamaño no dice nada por sí solo.
El coeficiente de correlación lineal de Pearson la hace adimensional usando las cuasidesviaciones típicas:
El signo de r es el de la pendiente. |r| = 1 es correlación perfecta; r ≈ 0 indica que no hay relación lineal (puede haberla de otro tipo). Orientación de J. Susan Milton, nunca como verdad absoluta: |r| ≤ 0,5 débil, 0,5 < |r| ≤ 0,9 moderada, |r| > 0,9 fuerte.
Ejemplo resuelto. Dosis de un antihipertensivo (X, mg) y reducción de la presión arterial (Y, mm Hg):
Recta de regresión por mínimos cuadrados
Buscamos la recta ŷ = b0 + b1x que minimiza la suma de los cuadrados de los residuos yi − ŷi, es decir, el error cuadrático medio:
También se escribe ŷ − ȳ = b1(x − x̄): la recta siempre pasa por el punto (x̄, ȳ). En el ejemplo de la dosis, b1 = 775 / 6250 = 0,124 y b0 = 17,8 − 0,124 · 150 = −0,8, así que para 75 mg esperamos una reducción de −0,8 + 0,124 · 75 = 8,5 mm Hg.
Laboratorio de regresión
Pulsa en el papel para añadir puntos, arrástralos para moverlos y haz doble clic para quitarlos.Representatividad de la recta
Para un mismo x podemos observar distintos y: además del modelo actúa el azar o ruido (individuos distintos, variables no consideradas, precisión de las medidas). La identidad ANOVA separa la variabilidad total en la parte del azar y la parte del modelo:
El coeficiente de determinación r² es la proporción de la variabilidad total que explica el modelo. Un buen ajuste lineal tiene r² cercano a 1. En el laboratorio de arriba, la barra ANOVA muestra este reparto en directo.
Métodos de regresión no lineal
Cuando la nube no sugiere una recta, un cambio de variables permite linealizar el problema: ajustamos la recta z = c0 + c1w y deshacemos el cambio. Si una variable no aparece en la tabla, no se transforma.
| Modelo | Función | Cambio de variable | Coeficientes | Ejemplo |
|---|---|---|---|---|
| Exponencial | y = b0eb₁x | z = ln y | b0 = ec₀, b1 = c1 | Crecimiento celular, enfriamiento |
| Potencial | y = b0xb₁ | w = ln x, z = ln y | b0 = ec₀, b1 = c1 | Alometrías |
| Logarítmico | y = b0 + b1ln x | w = ln x | b0 = c0, b1 = c1 | pH |
| Hiperbólico | y = b0x / (1 + b1x) | w = 1/x, z = 1/y | b0 = 1/c1, b1 = c0/c1 | Michaelis-Menten |
Prueba los cinco modelos
Elige un conjunto de datos simulado y compara los r².Problemas
Cada problema se genera con datos nuevos. Intenta resolverlo con papel y calculadora, compruébalo y mira la solución paso a paso.