Çoklu Doğrusal Regresyon Analizi

Çoklu doğrusal regresyon, bir bağımlı değişken ile iki ya da daha fazla bağımsız değişken arasındaki doğrusal ilişkiyi modellemek için kullanılan istatistiksel bir yöntemdir.

  • İstatistik
Çoklu Doğrusal Regresyon Analizi

Çoklu doğrusal regresyon, bir bağımlı değişkenin (y) birden fazla bağımsız değişkene (x1, x2, x3, ...) olan doğrusal ilişkisini inceleyen istatistiksel bir tekniktir. Basit doğrusal regresyonda sadece bir bağımsız değişken varken, çoklu doğrusal regresyonda birden fazla değişken vardır.

Temel Denklem:

Y = β₀ + β₁X₁ + β₂X₂ + ... + βₙXₙ + ε

  • Y: Bağımlı değişken (tahmin edilen değer)
  • X₁, X₂, ..., Xₙ: Bağımsız değişkenler
  • β₀: Sabit terim (intercept)
  • β₁, β₂, ..., βₙ: Katsayılar (her bir X'in Y üzerindeki etkisi)
  • ε: Hata terimi (modelin açıklayamadığı kısım)
y=β0+β1X1+β2X2++βkXk+εy = \beta_0 + \beta_1X_1 + \beta_2X_2 + \cdots + \beta_kX_k + \varepsilon

(1.1)

1. En Küçük Kareler Kestirimi

𝛽0 , 𝛽1 , 𝛽2,…, 𝛽𝑘 parametreleri bilinmeyenlerdir ve örneklem verileri üzerinden kestirimler gerekir. (𝑦1, 𝑥11, 𝑥12, … , 𝑥1𝑘 ), … , (𝑦𝑛, 𝑥𝑛1, 𝑥𝑛2, … , 𝑥𝑛𝑘) olmak üzere n sayıda ve k bağımsız değişkenden oluşan veri kümesi olduğu varsayılır.

1.1. Regresyon Katsayılarının En Küçük Kareler Kestirimi

𝑦𝑖 , 𝛽1 , 𝛽2,…, 𝛽𝑘 gözlemleri ile regresyon doğrusu arasındaki farkın en küçük olacak şekilde kestirilir. Denklem (1.1)’deki regresyon katsayılarının kestirimi için kullanılır. n>k gözlemin olduğunu varsayılarak aşağıdaki denklem yazılır.

yi=β0+β1xi1+β2xi2++βkxik+εi,i=1,2,,nyi=β0+j=1kβjxij+εi,i=1,2,,n\begin{gathered} y_i = \beta_0 + \beta_1x_{i1} + \beta_2x_{i2} + \cdots + \beta_kx_{ik} + \varepsilon_i, \quad i = 1,2,\ldots,n \\[8pt] y_i = \beta_0 + \sum_{j=1}^{k}\beta_jx_{ij} + \varepsilon_i, \quad i = 1,2,\ldots,n \end{gathered}

(1.2)

En küçük kareler fonksiyonu aşağıdaki gibidir:

S(β0,β1,,βk)=i=1nεi2=i=1n(yiβ0j=1kβjxij)2S(\beta_0,\beta_1,\ldots,\beta_k) = \Sn\varepsilon_i^2 = \Sn\left(y_i - \beta_0 - \sum_{j=1}^{k}\beta_jx_{ij}\right)^2

(1.3)

Denklem (1.2) 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘 göre ayrı ayrı türevi alınıp sıfıra eşitlenirse,

nβ^0+β^1i=1nxi1+β^2i=1nxi2++β^ki=1nxik=i=1nyiβ^0i=1nxi1+β^1i=1nxi12+β^2i=1nxi1xi2++β^ki=1nxi1xik=i=1nxi1yi    β^0i=1nxik+β^1i=1nxikxi1+β^2i=1nxikxi2++β^ki=1nxik2=i=1nxikyi\begin{aligned} n\hat\beta_0 + \hat\beta_1\Sn x_{i1} + \hat\beta_2\Sn x_{i2} + \cdots + \hat\beta_k\Sn x_{ik} &= \Sn y_i \\ \hat\beta_0\Sn x_{i1} + \hat\beta_1\Sn x_{i1}^2 + \hat\beta_2\Sn x_{i1}x_{i2} + \cdots + \hat\beta_k\Sn x_{i1}x_{ik} &= \Sn x_{i1}y_i \\ &\;\;\vdots \\ \hat\beta_0\Sn x_{ik} + \hat\beta_1\Sn x_{ik}x_{i1} + \hat\beta_2\Sn x_{ik}x_{i2} + \cdots + \hat\beta_k\Sn x_{ik}^2 &= \Sn x_{ik}y_i \end{aligned}

(1.4)

Denklemini verir. Bu denklemler en küçük kareler normal denklemleri olarak adlandırılır. Normal denklemlerinin çözümü 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘 en küçük kareler kestiricilerini verecektir.

Çoklu regresyon modelleriyle ilgilenirken onları matris içinde ifade etmek daha uygundur. Verilerin ve sonuçların daha kısa ve öz bir biçimde ortaya çıkmasınısağlar Denklem(1.2)’da verilen modelin matris gösterimi,

𝑦 = 𝑋𝛽 + 𝜀 biçimindedir. Burada ki, matrisler aşağıdaki gibidir;

y=[y1y2yn],X=[1x11x12x1k1x21x22x2k1xn1xn2xnk]β=[β0β1βk],ε=[ε1ε2εn]\begin{gathered} y = \begin{bmatrix} y_1 \\ y_2 \\ \vdots \\ y_n \end{bmatrix}, \qquad X = \begin{bmatrix} 1 & x_{11} & x_{12} & \cdots & x_{1k} \\ 1 & x_{21} & x_{22} & \cdots & x_{2k} \\ \vdots & \vdots & \vdots & \ddots & \vdots \\ 1 & x_{n1} & x_{n2} & \cdots & x_{nk} \end{bmatrix} \\[12pt] \beta = \begin{bmatrix} \beta_0 \\ \beta_1 \\ \vdots \\ \beta_k \end{bmatrix}, \qquad \varepsilon = \begin{bmatrix} \varepsilon_1 \\ \varepsilon_2 \\ \vdots \\ \varepsilon_n \end{bmatrix} \end{gathered}

(1.5)

y:Gözlemler vektörü

X:Bağımsız değişkenler matrisi

𝛽:Regeresyon Katsayıları vektörü

𝜀:Rasgele hatalar vektörü

Aşağıda verilen 𝑆(𝛽) fonsiyonunu minimize ederek 𝛽̂ en küçük kareler kestiricileri vektörünü elde ederiz:

S(β)=i=1nεi2=εε=(yXβ)(yXβ)S(\beta) = \Sn\varepsilon_i^2 = \varepsilon'\varepsilon = (y - X\beta)'(y - X\beta)

(1.6)

𝑆(𝛽) aşağıdaki gibi elde edilir:

S(β)=yyβXyyXβ+βXXβ=yy2βXy+βXXβ\begin{aligned} S(\beta) &= y'y - \beta'X'y - y'X\beta + \beta'X'X\beta \\ &= y'y - 2\beta'X'y + \beta'X'X\beta \end{aligned}

(1.7)

Denklem (1.7) 𝛽’ya göre türevi alınıp basitleştirilirse:

Sββ^=2Xy+2XXβ^=0\left.\frac{\partial S}{\partial \beta}\right|_{\hat\beta} = -2X'y + 2X'X\hat\beta = 0

(1.8)

Denklem(1.8)’ün matris gösterimi aşağıdaki gibidir

XXβ^=XyX'X\hat\beta = X'y

(1.9)

Denklem(1.9)’ün matris gösterimi aşağıdaki gibidir.

[ni=1nxi1i=1nxi2i=1nxiki=1nxi1i=1nxi12i=1nxi1xi2i=1nxi1xiki=1nxiki=1nxikxi1i=1nxikxi2i=1nxik2][β^0β^1β^k]=[i=1nyii=1nxi1yii=1nxikyi]\begin{bmatrix} n & \Sn x_{i1} & \Sn x_{i2} & \cdots & \Sn x_{ik} \\ \Sn x_{i1} & \Sn x_{i1}^2 & \Sn x_{i1}x_{i2} & \cdots & \Sn x_{i1}x_{ik} \\ \vdots & \vdots & \vdots & & \vdots \\ \Sn x_{ik} & \Sn x_{ik}x_{i1} & \Sn x_{ik}x_{i2} & \cdots & \Sn x_{ik}^2 \end{bmatrix} \begin{bmatrix} \hat\beta_0 \\ \hat\beta_1 \\ \vdots \\ \hat\beta_k \end{bmatrix} = \begin{bmatrix} \Sn y_i \\ \Sn x_{i1}y_i \\ \vdots \\ \Sn x_{ik}y_i \end{bmatrix}

(1.10)

Denklemi(1.10) çözmek için her iki tarafı (X’X)^-1 ile çarpılır. 𝛽’nın en küçük kareler kestiricisi bulunur.

β^=(XX)1Xy\hat\beta = (X'X)^{-1}X'y

(1.11)

1.2. 𝝈² ’nin kestirimi

İdeal olarak bu kestirimin kurulan modelin yeterliliğine bağlı olmaması tercih edilir. Bu ise yanlızca x’in en az bir değeri için y üzerinde farklı gözlemler olduğunda ya da 𝜎²’ye ilişkin önceliğinden elde edilmiş bilgi bulunduğunda mümkün olmalıdır. Bu yaklaşım kullanılamadığında 𝜎², artık veya hata kareler toplamından elde edilir.

SSRes=i=1n(yiy^i)2=i=1nei2=ee\SSres = \Sn(y_i - \hat{y}_i)^2 = \Sn e_i^2 = e'e

(1.12)

𝑒 = 𝑦 − 𝑋𝛽̂ yerine konulmasıyla aşağıdaki ifade elde edilir

SSRes=(yXβ^)(yXβ^)=yy2β^Xy+β^XXβ^\begin{aligned} \SSres &= (y - X\hat\beta)'(y - X\hat\beta) \\ &= y'y - 2\hat\beta'X'y + \hat\beta'X'X\hat\beta \end{aligned}

(1.13)

Denklem (1.12)’ten son denklem aşağıdaki gibi olur.

SSRes=yyβ^Xy\SSres = y'y - \hat\beta'X'y

(1.14)

Artık kareler toplamını n-p serbestlik derece sine sahiptir. SSRes’in beklenen değeri E(SSRes)=(n-p)𝜎² olduğu göstermektedir; dolayısı ile 𝜎²’nin yansız bir kestiricisi aşağıdaki gibidir:

σ^2=SSResnp=MSRes\hat\sigma^2 = \frac{\SSres}{n-p} = \MSres

(1.15)

1.3. Dummy Değişken

2 ve daha fazla kategorisi olan bir değişkeni 1 ve 0 şeklinde kodladığımızda aslında tek kategoriye indirmiş oluyoruz. Örneğin erkek=0 kadın=1 olarak kodlandığında değişkeni kadın olmak ya da olmamak şeklinde yorumlayarak regresyon analizi yapılır. Burada yaptığımız bir grubu referans grubu alıp sadece diğer grubun verileri ile analiz yapıp daha sonra elde edilen regresyon katsayısını da analize katılan grup üzerinden yorumlamaktır.

  1. Cinsiyet: Erkek, Kadın
  2. Medeni Durum: Evli, Bekar
  3. Eğitim Durumu: Lise, Lisans, Yüksek Lisans

Orijinal Veriler (Kategorik)

KişiCinsiyetMedeni DurumEğitim Durumu
1ErkekEvliLisans
2KadınBekarLise
3ErkekBekarYüksek Lisans

Dummy Değişkenli Tablo

KişiCinsiyet_ErkekCinsiyet_KadınMedeni_EvliMedeni_BekarEğitim_LiseEğitim_LisansEğitim_YüksekLisans
11010010
20101100
31001001

Not: Gerçek regresyon modellerinde "dummy trap" yani çoklu doğrusal bağlantıyı önlemek için genelde her kategoriden bir tanesi silinir. Örneğin:

  • Cinsiyet_Kadın, Medeni_Bekar, Eğitim_Lise gibi değişkenler çıkarılır, ve onlar baz (referans) kategori olarak kabul edilir.

Multiple linear regression is a statistical technique that examines the linear relationship between a dependent variable (y) and more than one independent variable (x1, x2, x3, ...) . In simple linear regression there is only one independent variable, while multiple linear regression has more than one.

Basic Equation:

Y = β₀ + β₁X₁ + β₂X₂ + ... + βₙXₙ + ε

  • Y: Dependent variable (predicted value)
  • X₁, X₂, ..., Xₙ: Independent variables
  • β₀: Constant term (intercept)
  • β₁, β₂, ..., βₙ: Coefficients (the effect of each X on Y)
  • ε: Error term (the part the model cannot explain)
y=β0+β1X1+β2X2++βkXk+εy = \beta_0 + \beta_1X_1 + \beta_2X_2 + \cdots + \beta_kX_k + \varepsilon

(1.1)

1. Least Squares Estimation

The parameters 𝛽0 , 𝛽1 , 𝛽2,…, 𝛽𝑘 are unknown and must be estimated from sample data. The data set is assumed to consist of n observations on k independent variables: (𝑦1, 𝑥11, 𝑥12, … , 𝑥1𝑘 ), … , (𝑦𝑛, 𝑥𝑛1, 𝑥𝑛2, … , 𝑥𝑛𝑘).

1.1. Least Squares Estimation of the Regression Coefficients

The coefficients are estimated so that the difference between the observations 𝑦𝑖 and the regression line is as small as possible; this is used to estimate the regression coefficients in Equation (1.1). Assuming n>k observations, the following equation is written.

yi=β0+β1xi1+β2xi2++βkxik+εi,i=1,2,,nyi=β0+j=1kβjxij+εi,i=1,2,,n\begin{gathered} y_i = \beta_0 + \beta_1x_{i1} + \beta_2x_{i2} + \cdots + \beta_kx_{ik} + \varepsilon_i, \quad i = 1,2,\ldots,n \\[8pt] y_i = \beta_0 + \sum_{j=1}^{k}\beta_jx_{ij} + \varepsilon_i, \quad i = 1,2,\ldots,n \end{gathered}

(1.2)

The least squares function is as follows:

S(β0,β1,,βk)=i=1nεi2=i=1n(yiβ0j=1kβjxij)2S(\beta_0,\beta_1,\ldots,\beta_k) = \Sn\varepsilon_i^2 = \Sn\left(y_i - \beta_0 - \sum_{j=1}^{k}\beta_jx_{ij}\right)^2

(1.3)

Taking the derivative of Equation (1.2) with respect to 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘 separately and setting it equal to zero

nβ^0+β^1i=1nxi1+β^2i=1nxi2++β^ki=1nxik=i=1nyiβ^0i=1nxi1+β^1i=1nxi12+β^2i=1nxi1xi2++β^ki=1nxi1xik=i=1nxi1yi    β^0i=1nxik+β^1i=1nxikxi1+β^2i=1nxikxi2++β^ki=1nxik2=i=1nxikyi\begin{aligned} n\hat\beta_0 + \hat\beta_1\Sn x_{i1} + \hat\beta_2\Sn x_{i2} + \cdots + \hat\beta_k\Sn x_{ik} &= \Sn y_i \\ \hat\beta_0\Sn x_{i1} + \hat\beta_1\Sn x_{i1}^2 + \hat\beta_2\Sn x_{i1}x_{i2} + \cdots + \hat\beta_k\Sn x_{i1}x_{ik} &= \Sn x_{i1}y_i \\ &\;\;\vdots \\ \hat\beta_0\Sn x_{ik} + \hat\beta_1\Sn x_{ik}x_{i1} + \hat\beta_2\Sn x_{ik}x_{i2} + \cdots + \hat\beta_k\Sn x_{ik}^2 &= \Sn x_{ik}y_i \end{aligned}

(1.4)

gives these equations. They are called the least squares normal equations. Solving the normal equations gives the least squares estimators of 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘.

When working with multiple regression models, it is more convenient to express them in matrix form, which presents the data and results more concisely. The matrix form of the model given in Equation (1.2)

is 𝑦 = 𝑋𝛽 + 𝜀, where the matrices are as follows:

y=[y1y2yn],X=[1x11x12x1k1x21x22x2k1xn1xn2xnk]β=[β0β1βk],ε=[ε1ε2εn]\begin{gathered} y = \begin{bmatrix} y_1 \\ y_2 \\ \vdots \\ y_n \end{bmatrix}, \qquad X = \begin{bmatrix} 1 & x_{11} & x_{12} & \cdots & x_{1k} \\ 1 & x_{21} & x_{22} & \cdots & x_{2k} \\ \vdots & \vdots & \vdots & \ddots & \vdots \\ 1 & x_{n1} & x_{n2} & \cdots & x_{nk} \end{bmatrix} \\[12pt] \beta = \begin{bmatrix} \beta_0 \\ \beta_1 \\ \vdots \\ \beta_k \end{bmatrix}, \qquad \varepsilon = \begin{bmatrix} \varepsilon_1 \\ \varepsilon_2 \\ \vdots \\ \varepsilon_n \end{bmatrix} \end{gathered}

(1.5)

y: Vector of observations

X: Matrix of independent variables

𝛽: Vector of regression coefficients

𝜀: Vector of random errors

We obtain the vector 𝛽̂ of least squares estimators by minimizing the function 𝑆(𝛽) given below:

S(β)=i=1nεi2=εε=(yXβ)(yXβ)S(\beta) = \Sn\varepsilon_i^2 = \varepsilon'\varepsilon = (y - X\beta)'(y - X\beta)

(1.6)

𝑆(𝛽) is obtained as follows:

S(β)=yyβXyyXβ+βXXβ=yy2βXy+βXXβ\begin{aligned} S(\beta) &= y'y - \beta'X'y - y'X\beta + \beta'X'X\beta \\ &= y'y - 2\beta'X'y + \beta'X'X\beta \end{aligned}

(1.7)

Taking the derivative of Equation (1.7) with respect to 𝛽 and simplifying:

Sββ^=2Xy+2XXβ^=0\left.\frac{\partial S}{\partial \beta}\right|_{\hat\beta} = -2X'y + 2X'X\hat\beta = 0

(1.8)

The matrix form of Equation (1.8) is as follows

XXβ^=XyX'X\hat\beta = X'y

(1.9)

The matrix form of Equation (1.9) is as follows.

[ni=1nxi1i=1nxi2i=1nxiki=1nxi1i=1nxi12i=1nxi1xi2i=1nxi1xiki=1nxiki=1nxikxi1i=1nxikxi2i=1nxik2][β^0β^1β^k]=[i=1nyii=1nxi1yii=1nxikyi]\begin{bmatrix} n & \Sn x_{i1} & \Sn x_{i2} & \cdots & \Sn x_{ik} \\ \Sn x_{i1} & \Sn x_{i1}^2 & \Sn x_{i1}x_{i2} & \cdots & \Sn x_{i1}x_{ik} \\ \vdots & \vdots & \vdots & & \vdots \\ \Sn x_{ik} & \Sn x_{ik}x_{i1} & \Sn x_{ik}x_{i2} & \cdots & \Sn x_{ik}^2 \end{bmatrix} \begin{bmatrix} \hat\beta_0 \\ \hat\beta_1 \\ \vdots \\ \hat\beta_k \end{bmatrix} = \begin{bmatrix} \Sn y_i \\ \Sn x_{i1}y_i \\ \vdots \\ \Sn x_{ik}y_i \end{bmatrix}

(1.10)

To solve Equation (1.10), both sides are multiplied by (X’X)^-1, which gives the least squares estimator of 𝛽.

β^=(XX)1Xy\hat\beta = (X'X)^{-1}X'y

(1.11)

1.2. Estimation of 𝝈²

Ideally, this estimate should not depend on the adequacy of the fitted model. This is only possible when there are repeated observations of y for at least one value of x, or when prior information about 𝜎² is available. When this approach cannot be used, 𝜎² is estimated from the residual (error) sum of squares.

SSRes=i=1n(yiy^i)2=i=1nei2=ee\SSres = \Sn(y_i - \hat{y}_i)^2 = \Sn e_i^2 = e'e

(1.12)

Substituting 𝑒 = 𝑦 − 𝑋𝛽̂ gives the following expression

SSRes=(yXβ^)(yXβ^)=yy2β^Xy+β^XXβ^\begin{aligned} \SSres &= (y - X\hat\beta)'(y - X\hat\beta) \\ &= y'y - 2\hat\beta'X'y + \hat\beta'X'X\hat\beta \end{aligned}

(1.13)

The last equation from Equation (1.12) becomes the following.

SSRes=yyβ^Xy\SSres = y'y - \hat\beta'X'y

(1.14)

The residual sum of squares has n-p degrees of freedom. It can be shown that the expected value of SSRes is E(SSRes)=(n-p)𝜎²; therefore, an unbiased estimator of 𝜎² is:

σ^2=SSResnp=MSRes\hat\sigma^2 = \frac{\SSres}{n-p} = \MSres

(1.15)

1.3. Dummy Variables

When we code a variable with 2 or more categories as 1 and 0, we are effectively reducing it to a single category. For example, when male=0 and female=1, the regression analysis interprets the variable as being female or not. What we do here is take one group as the reference group, analyze with the data of the other group, and then interpret the resulting regression coefficient with respect to the group included in the analysis.

  1. Gender: Male, Female
  2. Marital Status: Married, Single
  3. Education: High School, Bachelor's, Master's

Original Data (Categorical)

PersonGenderMarital StatusEducation
1MaleMarriedBachelor's
2FemaleSingleHigh School
3MaleSingleMaster's

Dummy Variable Table

PersonGender_MaleGender_FemaleMarital_MarriedMarital_SingleEducation_HighSchoolEducation_BachelorEducation_Master
11010010
20101100
31001001

Note: In real regression models, to avoid the "dummy variable trap" (i.e. multicollinearity), usually one category of each variable is dropped. For example:

  • Variables such as Gender_Female, Marital_Single and Education_HighSchool are removed and treated as the base (reference) categories.