REGRESIÓN: Es la predicción de una medida basándonoslos en el conocimiento de otra. Tenemos una de referencia y en función de ella, predecimos como se va a comportar los resultados de un estudios.
ESTUDIO CONJUNTO DE DOS VARIABLES :
Veamos un ejemplo:
Realizamos una tabla de datos, con la variables "X" (altura en cm) y otra variable "Y" (peso en kg), que recogen las mediadas antropométricas de un individuo. Una vez que tenemos la tabla completada, establecemos los datos en un diagrama de dispersión (scatterplot), en donde, cada individuo es un punto cuyas coordenadas
El objetivo será intentar conocer a partir del mismo si hay relación entre las variables y de qué tipo, y si es posible predecir el valor de una de ellas en función de la otra. Además, al fin y al cabo, es un tipo de contraste de hipótesis, y por ello, habrá que plantear la hipótesis nula viendo si esta se rechaza o no.
Observamos una relación entre las variables, en el cual, parece que el peso aumenta con la altura, aparentemente aumenta 10 kilos por cada 10 cm de altura, ósea, el peso aumenta una unidad por cada unidad de altura.
RELACION:
En estos diagramas de dispersión podemos encontrar varios tipo de relación:
Incorrelación: Para los valores de X por encima de la media, tenemos valores de Y por encima, y por debajo en proporciones similares.
Fuente de relación : Para valores de X mayores que la media, encontramos valores de Y mayores. Para valores de X menores que la media, encontramos valores Y menores también.
Cierta relación inversa o decreciente: Para los valores de X mayores que la media corresponden valores Y menores.
De igual manera, encontramos una relación entre dos variables cuantitativas:
Variables independientes: No existe una forma definida, por tanto, no existe relación.
Variable dependiente: Aceptamos la hipótesis alternativa, rechazando la nula. Tenemos dos tipos de dependencia:
Dependencia funcional: Puntos exactamente sobre una linea curva o recta. No suele darse en estadística
Dependencia estocástica: No están todos los puntos exactamente sobre el modelo, si no que existe una tendencia
REGRESIÓN LINEAL SIMPLE: CORRELACIÓN Y DETERMINACIÓN:
Se trata de estudiar la asociación lineal entre dos variables cuantitativas:
Regresión lineal simple: Una sola variable independiente
Regresión lineal múltiple: Mas de una variable dependiente.
Aquí, es importante destacar que si B > 0 la relación es directa ( X aumenta e Y aumenta) y si B < 0 la relación es inversa ( X disminuye e Y aumenta).
Para calcular a y b encontramos:
A su vez encontramos dos modelos lineales:
Modelos lineales deterministas: La variable independiente determina el valor de la variable dependiente, habiendo solo un valor de la dependiente para cada valor de la independiente.
Modelo probabilístico: Para cada valor de la variable independiente existe una distribución de probabilidad de valores de la dependiente, con probabilidad entre 1 y 0.
COEFICIENTES DE CORRELACIÓN
Para las variables cuantitativas normales utilizaremos el coeficiente de correlación e de Pearson mientras que para las variables cuantitativas no normales y variables ordinales utilizaremos el coeficiente de relación por Rango o de rho Sprarman.
Coeficiente de correlación de Pearson:
Es un coeficiente que mide lel grado de la relación de dependencia que existe entre las variables (x,y), cuyos valores van desde -1 hasta 1. La magnitud del coeficiente de correlación (r) indica cuan cerca están los puntos de la recta:
Si r es menor que 0 = lineal inversa. Si r es mayor de 0 = relación directa. Si r = 0, tenemos variables independientes o que no son lineales.
Coeficiente de relación por Rango o de rho de Sprearman.
Por lo tanto: El coeficiente de correlación (Pearson y Spearman): Son números dimensionales (entre 1 y -1) que mide la fuerza y el sentido de la relación lineal entre dos viables:
RESUMIENDO UN POCO... Primero establecemos en un tabla los datos, observamos las dos hipótesis de partida. Traslados los datos a los ejes de los datos, y observamos una relación inversa en función del valor que hemos obtenido al aplicar la fórmula
EJEMPLO:
¿ CÓMO EVALUAMOS LA BOLDAD DE AJUSTE DE ESTE MODELO?
Se evalúa a través del coeficiente de determinación (R2), siendo un valor acotado entre el 0 y el 1. Cuanto mas se acerque a 1, mayor poder explicativo, mayor bondad de ajuste, es decir, mas Cantidad de puntos de la nube están cerca realmente de ese modelo.
--> R2 x 100 = Porcentaje de variaciones explicadas por el modelo
Por ultimo, se realiza el calculo del test de hipotesis para modelos de regresión lineal simple (t de Kendall):
t > valor de la tabla, rechazamos la hipótesis nula
La prueba χ² se considera una prueba no paramédica que mide la discrepancia entre una distribución observada y otra teórica. Es la mas utilizada para el análisis de variables cualitativas.
La prueba de chi cuadrado se utiliza para comprobar si la diferencia en los datos que observamos:
Es debido al azar: Recordaremos que la H0 establece que no hay diferencia, es decir, que hay igualdad. Aceptamos la H0
Es debido a algo mas, por ejemplo, una asociación entre las variables que estudiamos. Rechazamos la H0 y aceptamos la H1.
Condiciones para aplicar la Chi cuadrado:
Las observaciones deben ser independientes
Utilizada en variables cualitativas
Mas de 50 casos
La frecuencia teórica o esperadas en cada casilla de clasificación no deben ser inferiores a 5.
Si no se cumplen los requisitos, se usan pruebas paramétricas, como utilizar el estadístico de Fisher o la corrección de continuidad de Yates.
Para la prueba de Chi cuadrado:
Frecuencia observada: La que recogen los datos
Frecuencia esperada: La que observaríamos si no hubiera relación.
Grado de libertad (gl): Numero de valores o datos que puedan varias libremente dado un determinado resultado.Si solo hay un criterio de, la formula sería k-1 (nº de categorías menos una), pero si hay dos criterios e clasificación la formula seria (filas -1) x (columnas - 1)
PROCEDIMIENTO EN CHI CUADRADO:
A) Establecer la hipótesis nula (H0)
Ejemplo: No existe asociación entre el consumo de tabaco y el sexo (independencia), mientras que la hipótesis alternativa establece que existen asociaciones entre el consuo de tabaco y el sexo.
B) Realizar una tabla con los datos o frecuencia observadas (f0)
Para evaluar la independencia entre las variables, se calculan los valores que indicarían la independencia absoluta, lo que se denomina "frecuencias esperadas".
Se suelen hacer una tabla de contingencia con los datos, siendo tablas de doble entrada que se emplean para registrar y analizar la asociación entre dos o ma s variables de naturaleza cualitativa.
Ejemplo:
C) Calcular los grados de libertad (gl)
Ejemplo: (Nº de filas - 1) x ( nº de columnas - 1) = (2 - 1) x (2 -1) = 1
D) Calcular las frecuencias esperadas o teóricas (fe o ft)
Para obtener los valores esperados, éstos se calculan a través del producto de los valores totales marginales divididos por el número total de casos (n)
E) Utilizamos el estadístico:
Calculamos el valor estadístico de chi cuadrado (χ²) a partir de os datos observados
F) Comparamos el valor estadístico con el valor chi-cuadrado teórico y aceptamos o rechazamos la hipótesis nula:
Para obtener el valor de chi-cuadrado teórico lo debemos buscar en la tabla que
encontramos en este enlace: tabla_chi_cuadrado.pdf, en el cual debemos tener en cuenta en sus ejes tanto el grado de libertad como el nivel de significación.
Si χ² observada > χ² teórica --> Rechazamos H0
Si χ² observada < χ² teórica --> Aceptamos H0
Ejemplo: En nuestro ejemplo, la χ² observada es 0,056 mientras que la χ² teórica es 3,8415). Al ser el chi cuadrado observado menor que el teórico, podemos decir que no hay diferencia en los datos mas allá que la que habría si la diferencia fuera producida al azar, por ello, aceptamos H0.
Otro ejemplo:
Se esta estudiando la relación de las complicaciones en la herida quirúrgica de los servicios hospitalarios (A,B). Para ello hemos recogido las observaciones de dos servicios durante un periodo de tiempo.
Queremos trabajar a un nivel de significación de 0,07(95%)
ODDS RATIO:
Permite cuantificar la importancia/fuerza de la asociación entre dos variables
Puede acompañar al resultado de la prueba chi - cuadrado (variables dicotómicas)
Odds ratio sería el cociente entre la odas del grupo de individuos de la categorías 1 de la variable supuestamente dependiente (variable 2) (a/c), frente a la odas del otro grupo formado por los individuos de la categoría 2 de esa misma variable (b/d).
OR = 1, indica que no hay asociaciones (independencia)
OR>1, la presencia del factor de exposición (V1.1) se asocia a mayor ocurrencia del evento (2.1)
OR<1, la presencia del factor exposición (V1.1) se asocia a menor ocurrencia del evento (V2.1)
La significación estadística es la probabilidad de que la relación observada sea producto de la casualidad.
Una de las dos maneras de inferencia estadística es el contraste de hipótesis
Permite contrastar hipótesis y relacionarlo con el método científico
Se parte de la hipotesis nula, frente a la hipótesis alternativa
Permite calcular el nivel de significación
Nos permite tomar decisiones, cuantificando el error.
CONTRASTE DE HIPÓTESIS:
Esta prueba consiste en contrastar la hipótesis del estudio con los datos obtenidos en la muestra con el fin de verificar si existen diferencias en los hallazgos obtenidos en ambos grupos debidas a la acción de la variable independiente, o si simplemente estas diferencias han sido fruto del azar.
Hipótesis nula (H0) = Indica que no existe diferencias significativas entre los resultados obtenidos en la practica y los resultados teóricos, es decir, que no hay realización real entre las variables y que cualquier relación observada es fruto del azar.
Hipótesis de investigación o alternativa (H1) = la que afirma que la media de la población es un valor diferente al hipotético
Según el nivel de significación que hayamos preestablecido (habitualmente 95%) las soluciones pueden ser:
p > 0,05: No podemos rechazar laa hipótesis nula
p < 0,05: Rechazamos la hipótesis nula, aceptando la alternativa
Para realizar un contraste de hipótesis encontramos 3 fases:
1. FASE UNO:
Formular la hipótesis nula a partir de la hipótesis de investigación o alternativa. Esto suele expresarse:
H0: μA = μB
H1: μA ≠ μB
Si la hipotesis nula es verdadera, solo hay un probabilidad: μA=μB, pero si la hipótesis nula es falsa, sabemos queμA ≠ μB pero no sabemos si esμA < μB o μA > μB. Para averiguar esto es necesario hacer un contraste bilateral.
2.FASE DOS:
Tras formular la H0, mediante el estadístico de contraste más apropiado, la probabilidad de que los resultados observador puedan deberse al azar.
Un estadístico de contraste de hipótesis o de significación estadística es una medida estandarizada de la discrepancia que hay entre la hipótesis nula y el resultado de la diferencia de medias obtenidas en la muestra. Para elegir el estadístico de contraste mas adecuado, hay que tener en cuenta:
La escala de medida y el tipo de variable
La independencia o dependencia de las medidas
El aspecto de la distribución de la variable dependiente.
3. FASE TRES:
Basándose en esta probabilidad, se decidirá rechazar o no la hipótesis nula. Cuanto menor sea el valor de p, menor será la probabilidad de que los resultados obtenidos se deban al azar y mayor evidencia habrá en contra de la hipótesis nula.
Para decidir si rechazar o no la H0 debe fijarse previamente un valor de p, por debajo del cual se considera que se dispone de la suficiente evidencia contra H0 para rechazarla. Este valor se denomina valor de significación estadística α, fijada normalmente en el 5% (0,05)
4. FASE CUATRO:
Realizar calculo y exponer cupones
ERRORES DE HIPÓTESIS:
Encontramos el error α, que es la probabilidad de equivocarnos al realizar la hipótesis nula. Encontramos dos tipos de error:
Error de tipo 1: Consiste en decir que existen diferencias estadísticamente significativas cuando realmente no es cierto
Error tipo 2: Se indica que no existen diferencias cuando realmente no es cierto.
El error tipo 2 es mas probable que se cometa que el ed tipo 1.
Aquí os dejo un video relacionado con la fase 2, para saber que prueba estadística escoger:
De la población con un muestreo probabilisitco, obtengo una muestra,
de la cual hago un análisis descriptivo (estimación puntual) y después
podemos realizar na estimación (inferencia)
INFERENCIA ESTADÍSTICA:Es el conjunto de procedimientos estadísticos que permiten pasar de lo particular, la muestra, a lo general, la población.
Población: Conjunto de personas, sujetos o unidades que presenten una característica común
Muestra: Subconjunto extraído y seleccionado de una población a la que representan
Muestra independiente: Esta formado por datos independientes, o sea, aquellos obtenidos tras una única observación
Muestra apareada o dependiente: Está constituida por datos apareados. Comparan el mismo grupo de sujetos en dos tiempos diferentes, o bien son grupos muy relacionados entre si
Dos maneras de hacer estadística inferencial...
1. CONTRASTE DE HIPÓTESIS:
Se formula la hipótesis nula (H0), que postula que no hay diferencia entre los dos grupos que se comparan, y se contrasta con los datos obtenidos para determinar si esta es verdad o falsa.
Se puede realizar para métodos paramédicos y no paramétricos:
2. ESTIMACIÓN DE PARÁMETROS POBLACIONALES:
Estimación del valor en la población (parámetro) a partir de un valor de la muestra (estimador) . Existen dos tipos:
La estimación puntual: Utiliza el valor del estadístico calculado en la muestra como valor del parámetro que se desea estimar. Habitualmente, se utiliza el valor de la media muestra 'x' como estimador de la media poblacional μ.
La estimación por intervalos: Informa de la probabilidad de que el parámetro poblacional se encuentre entre unos valores determinados.
Ejemplo:
ERRORES ESTANDAR:
El error stander de la media (EEM) mide la dispersión hipotética que tendrían las medias de infinitas muestras tomadas de una población determinada. Es decir, mide el grado de variabilidad en los valores del estimador en las distintas muestras de un determinado tamaño que pudiésemos tomar de una población.
Existen dos errores:
1. Error estándar para una media
El EEM depende de la desviación típica, de la población y del tamaño muestral. De tal manera que la formula es:
2. Error estandar para una proporción:
El EE de un porcentaje, es la desviación estándar de una distribución formada "n" porcentajes resultantes de la observación de "n" muestras de esa población.
TEOREMA CENTRAL DEL LÍMITE:
Es una teoría estadística que establece que, dada una muestra suficientemente grande de la población, la distribución de las medias muestras seguiría una distribución normal.
El TCL considera una muestra como grande cuando el tamaño esta es superior a 30.
La media poblacional y la media muestral serán iguales
La varianza de la distribución de de las medias muestras será σ²/n
INTERVALO DE CONFIANZA:
Son un medio de conocer el parámetro en una población midiendo el error que tiene que ver con el azar (error aleatorio). Se trata de un par de numero tales, con un nivel de confianza determinados, podamos asegurar que el valor del parámetro es mayor o menor que de ambos números.
Se calcula considerando que el estimador muestral sigue una distribución normal, como establece la teoría central del límite:
Al conjunto de procedimientos que permiten elegir muestras de tal forma que estas reflejen las características de la población le llamamos técnicas de muestreo.
Muestreo probabilístico o aleatorio: Si la muestra se elige con un procedimiento al azar, se puede evaluar ese error, denominado error aleatorio.
Muestreo no probabilístico: No se usa el azar y no es posible evaluar el error.
La muestra es un subconjunto de elementos de una población,
teniendo que ser representativa de la población diana y debe ser un
tamaño adecuado para generalizar y lo suficiente pequeña para poder
trabajar con ella y comparable.
MUESTREO NO PROBABILÍSTICO:
Las unidades que componen la población tiene diferente probabilidad de ser elegidas ya que no solo interviene el azar sino también otras condiciones.
1. Muestreo consecutivo:
Se recluta a todos los individuos de una población que son accesibles y que cumplen los criterios de inclusión durante un periodo de reclutamiento fijado. Es el mas utilizado
2. Muestreo de conveniencia o accidental:
Se recluta a los individuos que son más accesibles para el equipo de investigación o que se presentan voluntariamente. Se una con frecuencia al ser el menos costoso y más fácil.
3. Muestreo intencional a criterio:
El propio investigador es quien selecciona a los individuos al considerarlos los mas apropiados. Se una cuando se quiere contar con una muestra de expertos o en estudios cualitativos.
4. Muestreo bola de nieve, de avalancha o muestreo en cadena:
El propio investigador elige a un participante que cumpla los criterios de inclusión y al mismo tiempo se le pide que identifique a otros individuos con sus mismas características para invitarles a participar y así sucesivamente hasta que tenga la muestra.
5. Muestreo teórico:
La selección de la muestra se hace de forma gradual debido a que el propósito del estudio es la generación de una teoría o porque la integración de la muestra se va diciendo sobre la marcha.
MUESTREO PROBABILÍSTICO:
Todas las unidades que componen la población tienen una probabilidad de ser elegidas y se puede calcular de antemano
Muestreo aleatorio:Existen varios tipos:
Simple: Seleccionar al azar (por tabla de número o pc) la n (muestra. Se usa poblaciones pequeñas y es el mas representativo.
Sistemático: Seleccionar individuos según una regla o proceso periódico.
Para ello, se calcula constante K, y elegimos un numero al azar entre 1 y K, que sería la primera unidad R. Después sumamos R + K hasta conseguir el tamaño de la muestra, siendo el segundo R+ K, el tercero R + 2K... La forma de K, es K= N/n
Muestreo estratificado:
Se utiliza cuando la característica objeto de estudio no se distribuye de forma homogénea en la población y puede afectar a los resultados del estudio, pero existen grupos o estratos donde si se presenta de manera homogénea. Estos grupos tienen alguna características en común pero son mutuamente excluyente.
Muestreos conglomerados:
Se obtienen de grupos o conglomerados ya establecidos cuando no hay listado de la población.
Primero hay que definir los conglomerados, se trata de definir una característica que permite dividir la población en grupos sin solapamiento. Seleccionamos después al azar algún conglomerado ya sea por muestro aleatorio simple o sistemático y por ultimo, investigamos todos los sujetos del conglomerado o bien optar una nueva muestra dentro de ese conglomerado.
TAMAÑO DE LA MUESTRA:
El tamaño de la muestra influye de una manera capital en la representatividad de nuestros resultados y va a depender de:
El error aleatorio
De la mínima diferencia entre los grupos de comparación que se considera importante en los valores de la variable a estudiar
De la variabilidad de la variable a estudiar.
De la amplitud del intervalo de confianza, que cuanto mas estrecho, mas preciso serán los datos
El tamaño de la población de estudio
TAMAÑO DE UNA POBLACIÓN:
Z: Es un valor que depende 1- alfa
S2: Es la varianza poblacional
e: es el error máximo aceptado por los investigadores.
TAMAÑO DE UNA PROPORCIÓN:
p: es la proporción de una categoría variable
1-p es la proporción de la otra categoría
z es el valor que depende del nivel de confianza 1- alfa
Es la parte de las matemáticas que estudia los fenómenos aleatorios estadísticos, es decir, lo contrario a los fenomenos determinista.
La teoría de la probabilidad se ocupa de asignar un cierto número a cada posible resultado que pueda ocurrir en un experimento aleatorio
Se expresa mediante un numero entre 0 y 1
La estimación sobre la probabilidad de ocurrencia del evento, nos ayuda a tomar decisiones
Cuanto mas probable es que ocurra un evento, su medida de ocurrencia estará mas próximo a 1 o a 100, y cuanto menos probable, mas se aproxima al 0
PROBABILIDAD SUBJETIVA O PERSONLÍSTICA:
"Estadística bayesiana" : Se refiere a la probabilidad de ocurrencia de un suceso, basado en la experiencia previa , la opinión o la intuición, en caso después de estudiar la información disponible, se asigna un valor de probabilidad basado en el grado de creencia de que el suceso pueda ocurrir.
Ejemplo: Los aficionados del futbol, pueden estimar que en un partido la proporción de que un equipo gané sobre otra se de un X%.
PROBABILIDAD OBJETIVA:
1. Probabilidad clásica o "a priori"
Si un evento puede ocurrir de N formas, las cuales se excluyen mutuamente y son igualmente probables , y si "m" de esos eventos poseen característica "E".
Es decir, el numero de casos favorables entre el numero de casos posibles.
2. Probabilidad relativa o "a posteriori"
Si un suceso es repetido un gran número de veces, y si algún evento resultando, con características "E" ocurre "m" veces, la frecuencia relativa de la ocurrencia de "E", m/n, es aproximadamente igual a la probabilidad de ocurrencia de E
si
Es decir, el nº de vecess que se ha obtenido el resultado que se estudia entre el nº de repeticiones del experimento
EVENTOS O SUCESOS:
Se llama suceso o evento al subconjunto de resultados posibles en un experimento aleatorio. El conjunto de todos los resultados posibles de denomina espacio / muestra.
Encontramos:
Suceso independiente: Pueden pasar uno independiente del otro
Suceso dependiente: Un evento, condiciona la otro
Suceso compatible: Tienen algún suceso elemental en común
Suceso Incompatible: Ningun suceso elemental en común,
REGLAS BÁSICAS: TEORIA DE LA PROBABILIDAD
La probabilidad de un evento o suceso siempre oscila entre 0 y 1, siendo 1 la probabilidad de que ocurra seguro y 0 la probabilidad de que no ocurra.
La union de A y B es:
La probabilidad de un suceso contrario:
Probabilidad condicionada:
TEOREMA DE BAYES:
DISTRIBUCIÓN DE PROBABILIDAD EN VARIABLES EN VARIABLES DISCRETAS:
Distribución binominal:
Se utilizan para resolver problemas que platean: "Si al hacer un experimento hay una probabilidad "p" de que ocurra un suceso. ¿Cuáles es la probabilidad de que en N experimentos ocurra X veces?"
P: Probabilidad de ocurrencia
Q: Probabilidad de no ocurrencia
X: Número sucesos favorables
N: Número total de ensayos.
Distribución de Poisson:
Esta distribución se utiliza para obtener la probabilidad de sucesos raros (eventos que ocurren con poca frecuencia)
P(X=x): Es la probabilidad de ocurrencia cuando la variable discreta X toma un
valor finito x
λ: Promedio de ocurrencia en un intervalo
e: Tiene un valor aproximado de 2,7193
x: Es el número de ocurrencias.
DISTRIBUCIONES NORMALES:
La función de densidad de una distribución normal tiene forma de campana de Gauss y es simétrica en cuanto a la media.
La media coincide con la moda que es el punto mas alto y con la mediana. En todas las distribuciones si yo le sumo o le resto el valor de la desviación típica a la media de cualquier serie estadística que sigue una población normal, el valor de esa serie se va a encontrar en un 68,26%, si le sumo o resto 2 veces la desviación típica la encontraríamos en un 95,45%...
La tipificación es muy importante para los problemas:
La importancia de las representaciones gráficas reside en que es una manera de representar los datos de manera rápida para comunicar la información numérica y completan el análisis estadístico, aumentando la información y ofreciendo una orientación visual.
Normas básicas:
Tienen que ser visualmente claras
Tiene que tener su leyenda
Representa graficamente las conclusiones del estudio
Evitar gráficos confusos y sobrecargados.
VARIABLES CUALITATIVAS:
1. Gráficos de sectores:
Utiles para variables cualitativas nominales, ya sean dicotómicas o policotómicas ( no es recomendable para mas de 4 o 5 categorías). Solo con una variable
2. Diagrama de barra:
Para variables policotómicas y se usa también en variables cualitativas ordinales.
3. Pictográmas
Es un tipo de gráfico en el que en lugar de barras se utilizan figuras proporcionales a la frecuencia.
VARIABLES CUANTITATIVAS:
1. Histográma:
Es igual que el diagrama de barras en cuanto al tipo de frecuencias que se pueden utilizar pero este es para variables continuas.
2. Polígonos de frecuencia:
El polígono de frecuencia resumen, en una sola linea, el resultado del histograma correspondiente pues une los punto de las bases superiores de los rectángulos.
3. Grafico de tronco y hojas:
Es un híbrido entre la tabla de frecuencia y el histograma, nos va a mostrar la distribución y los valores de la variable. Cada dato de la serie se divide en dos partes: el tronco (decenas) y hojas (unidades)
GRÁFICOS PARA DATOS BIDIMENSIONALES:
1. Gráficos de tendencias temporales:
2. Diagrama de Dispersión: Nube de puntos o "scatter plot"
Correlación positiva: Tendencia ascendente tipo bisectriz
Correlación negativa: Aquella que desciende conforme va disminuyendo los valores
Ninguna asociación: Cuando hay asimetría
GRÁFICAS PARA DATOS MULTIDIMENSIONALES:
1. Diagrama de estrellas:
Para representarlo en el diagrama de estrella se establece una leyenda, cada línea de un color para cada año. Las siete variables esta cada una en un extremo de la estrella.