Buscar este blog

martes, 14 de febrero de 2017

Comprobación de la adecuación del modelo de regresión lineal

Las premisas de un modelo de regresión lineal son aspectos que este debe cumplir, principalmente están asociados a los errores que se encuentran en el modelo, son 5 aspectos principales:

-La relación entre la variable dependiente e independiente es lineal: son muchos los métodos tanto matemáticos como estadísticos para demostrar que la relación entre variables sigue una tendencia lineal, estos métodos se dejan a elección del investigador, usualmente se utiliza el coeficiente de determinación o el de correlación al probar esta premisa.

-Los errores se distribuyen normalmente: esto se puede probar construyendo los residuales estandarizados, estos siguen la siguiente ecuación característica:


Estos residuales estandarizados se grafican en un diagrama residuales estandarizados vs valores teóricos, y se espera que el comportamiento siga una linea recta, cualquier desviación de esta línea atentaría a esta segunda premisa como se muestra a continuación.



-Los errores tienen media cero: La media del calculo de los errores debe ser igual a cero para cumplir con esta premisa.

-Los errores tienen varianza constante o son homocedasticos: se espera que los errores tengan una variación constante, sin patrones o tendencias, esta premisa se puede comprobar mediante un diagrama de dispersión de residuales vs valores ajustados de y.
Este gráfico mostrara tendencias para decidir si los errores son homocedasticos o por el contrario son heterocedasticos.




-Los errores no están correlacionados: esta premisa se comprueba mediante un gráfico de residuales vs tiempo, por lo tanto, se debe tener la historia de los errores y el orden en que las observaciones fueron tomadas. El comportamiento esperado para verificar que los errores no estén correlacionados es el siguiente:



The premises of a linear regression model are aspects that must be met, mainly associated with the errors found in the model, are 5 main aspects:

1. The relationship between the dependent and independent variable is linear: there are many mathematical and statistical methods to demonstrate that the relationship between variables follows a linear trend, these methods are left to the researcher's choice, usually the coefficient of determination or of correlation when proving this premise.

2. The errors are normally distributed: this can be proven by constructing the standardized residuals, these follow the following characteristic equation:

These standardized residuals are plotted in a diagram of standardized residuals vs. theoretical values, and it is expected that the behavior follows a straight line, any deviation from this line would attend to this second premise as shown below.

3. The errors have zero mean: The average calculation of errors must be equal to zero to comply with this premise.

4. The errors have constant variance or are homocedastic: errors are expected to have a constant variation, without patterns or trends, this premise can be verified by a scatter plot of residuals vs adjusted values ​​of y.

This graph will show tendencies to decide if the errors are homocedastic or on the contrary they are heterocedastic.


5. The errors are not correlated: this premise is checked by a graph of residuals vs. time, therefore, the history of the errors and the order in which the observations were taken should be taken. The expected behavior to verify that the errors are not correlated is as follows:

jueves, 9 de febrero de 2017

Modelos de regresión lineal múltiple

Los modelos de regresión lineal múltiple (de ahora en adelante MRLM) son mucho más potentes a la hora de relacionar multiplicidad de variables, en la mayoría de problemas de ciencias e ingeniería estos modelos se tornan necesarios, sin embargo su tratamiento se torna tedioso con el calculo manual, es por esta razón que es necesario en muchos casos cuando se trabajan con multitud de variables y datos, utilizar software especifico para esta tarea.


Los vectores y la matriz que componen nuestro modelo de regresión lineal múltiple es el siguiente:

Una vez definido el modelo, las variables y los datos, es necesario hallar los estimadores de los coeficientes del modelo, esto se realiza mediante la multiplicación de matrices, como esta expuesto a continuación:


Una vez hallados los coeficientes y obtener el MRLM, se debe conocer la significancia del modelo de regresión y así saber si se ajusta a posibles y futuras predicciones.
Así como en la RLS existen formas de hacerlo:

1. La tabla ANOVA, que se construye de forma similar pero se debe hallar la significancia para todos los coeficientes y para cada uno de ellos mediante las pruebas de hipótesis.
La tabla ANOVA queda constituida de la siguiente manera:


Donde k es el número de variables, n es el numero de datos y en algunos casos se habla de p como el número de coeficientes del modelo y esta definido como k+1.

2. Coeficiente de determinación ajustado


El coeficiente es una proporción que varia entre 0 y 1, donde a medida que el coeficiente se acerca a 1 el modelo es más adecuado.

En el siguiente enlace se puede apreciar como se construye y analiza un MRLM utilizando la herramienta STATGRAPHICS https://youtu.be/Un4faTbUWTw


miércoles, 8 de febrero de 2017

Análisis de varianza (ANOVA) para la variable respuesta

El análisis de varianza (o de ahora en adelante ANOVA) para la variable respuesta descompone la variabilidad en: explicada y no explicada o residual.

El ANOVA permite comparar si el modelo es significativo o no, bajo la hipótesis de que existe una relación lineal entre la variable respuesta y la variable regresora. Por lo tanto una prueba de hipótesis valida para este caso sería la siguiente:

Hipótesis nula: La variable regresora no influye y no hay relación lineal entre ambas variables.
Hipótesis alterna: Existe una dependencia entre las variables, por lo tanto el modelo es significativo.



Por ortogonalidad vectorial, la última parte de la ecuación se convierte en 0.
A partir de esto se construye la tabla ANOVA para probar la hipótesis antes mencionada.

Su construcción es la siguiente:



La prueba F calculada a partir de la tabla deberá ser entonces comparada con la tabla F, y el criterio sera: Se rechaza la hipótesis nula si F calculada es mayor que el valor de la tabla F.

La tabla F se puede consultar en el siguiente enlace:
http://users.sussex.ac.uk/~grahamh/RM1web/F-ratio%20table%202005.pdf

Sigue el enlace para ver de manera aplicada este tema en: https://youtu.be/4dYZXE_8Rto

Coeficiente de correlación lineal

El coeficiente de correlación lineal dentro de la regresión lineal simple esta definido de la siguiente manera:


El coeficiente de correlación muestra la manera en la cual la variable Y y X tienen una relación reciproca, este coeficiente puede tomar valores entre -1 y 1, el significado de esta reciprocidad es la siguiente:

R = 1, fuerte reciprocidad o correlación, mientras que Y crece X crece.
R = -1, fuerte reciprocidad o correlación, sin embargo mientras que una variable crece, la otra decrece.
R tiende a 0, correlación negativa, no existe relación entre variables.

Algunos patrones de correlación son los siguientes:


The linear correlation coefficient within the simple linear regression is defined as follows:



The correlation coefficient shows the way in which the variable Y and X have a reciprocal relationship, this coefficient can take values ​​between -1 and 1, the meaning of this reciprocity is as follows:

R = 1, strong reciprocity or correlation, while Y grows X grows.
R = -1, strong reciprocity or correlation, however, while one variable grows, the other decreases.
R tends to 0, negative correlation, there is no relationship between variables.

Some correlation patterns are as follows:

lunes, 6 de febrero de 2017

Método de los mínimos cuadrados

El método de los mínimos cuadrados es una de las metodologías mas utilizadas para hallar los coeficientes de un MRLS, aquí se presenta la demostración de dicho procedimiento:



El modelo ajustado cuando se aplica el método de los mínimos cuadrados es el que se presenta a continuación:


Es importante anotar que a este modelo ajustado se le deben asociar pruebas de análisis residuales y de coeficiente de correlación lineal, esto con el fin de evaluar la idoneidad de dicho modelo ajustado.


Modelo de regresión lineal simple

Modelo de regresión lineal simple (MRLS)


El modelo de RLS tiene las siguientes características explicadas a continuación:

•𝛽0: intercepto
•𝛽1: coeficiente de 𝑥
•𝜎2: varianza de los errores

Notese que el modelo RLS al ser un modelo estadístico tiene asociado los errores dentro de su modelo, y es similar al modelo ya conocido Y = mX +b, siendo "m" la pendiente y "b" el intercepto con el eje Y.

Por lo tanto, es necesario estimar los parámetros del modelo, para hallar dentro de los casos presentados más adelante un modelo univariable que se ajuste a los datos.

Para esto se utilizan tipicamente dos métodos:
-Estimación por mínimos cuadrados
-Estimación por máxima verosimilitud




Introducción al análisis de regresión lineal

¿Que es el análisis de regresión lineal?

Es una técnica estadística que consiste en modelar la relación entre variables.

Por lo tanto esta técnica utiliza la relación entre dos tipos de variables:
-Respuesta o Dependiente
-Explicativas, Regresoras, Covariables o Independientes

La variable respuesta es comúnmente asociada con la Y, mientras que la variable independiente es la X (o en modelos de regresión múltiple son varias X)

¿Donde se aplica el análisis de regresión?

•Física
•Ingeniería
•Química
•Economía
•Administración
•Ciencias biológicas
•Ciencias de la salud
•Ciencias sociales
•Mercadeo

Así como en muchas otras múltiples áreas de investigación y ciencias.

¿Cuales son los modelos de tipos de regresión existentes?

Principalmente se pueden dividir en dos:
-Modelos lineales: que pueden ser a su vez: simples o múltiples
-Modelos no lineales

¿Que tipos de estudios se pueden llevar a cabo utilizando la regresión lineal?

Se pueden llevar a cabo estudios:
-Retrospectivos
-Observacionales
-Experimentales

¿Cuales son los usos encontrados para el análisis de regresión lineal?

Los usos pueden ser variados, aunque principalmente depende del foco de investigación, algunos usos encontrados pueden ser:
-Descripción de datos
-Estimación de parámetros
-Predicción
-Control
______________________________________________________________________________

INTRODUCTION TO LINEAR REGRESSION

What is linear regression analysis?

It is a statistical technique that consists of modeling the relationship between variables.
Therefore this technique uses the relationship between two types of variables:

-Reply or Dependent
-Explainers, Regressors, Covariates or Independent

The response variable is commonly associated with Y, while the independent variable is X (or in multiple regression models there are several X)

Where is the regression analysis applied?

•Physical
•Engineering
•Chemistry
•Economy
•Administration
•Biological Sciences
•Health Sciences
•Social Sciences
•Marketing

As in many other multiple areas of research and science.

What are the models of existing regression types?

Mainly they can be divided in two:
-Linear models: which can be in turn: single or multiple
-Nonlinear models

What types of studies can be carried out using linear regression?
Studies can be carried out:

-Retrospective
-Observational
-Experimental

What are the uses found for linear regression analysis?

The uses can be varied, although mainly it depends on the research focus, some uses found can be:

-Data description
-Parameter estimation
-Prediction
-Control