Çoklu Doğrusal Regresyon Analizi
Çoklu doğrusal regresyon, bir bağımlı değişken ile iki ya da daha fazla bağımsız değişken arasındaki doğrusal ilişkiyi modellemek için kullanılan istatistiksel bir yöntemdir.
- İstatistik

Çoklu doğrusal regresyon, bir bağımlı değişkenin (y) birden fazla bağımsız değişkene (x1, x2, x3, ...) olan doğrusal ilişkisini inceleyen istatistiksel bir tekniktir. Basit doğrusal regresyonda sadece bir bağımsız değişken varken, çoklu doğrusal regresyonda birden fazla değişken vardır.
Temel Denklem:
Y = β₀ + β₁X₁ + β₂X₂ + ... + βₙXₙ + ε
- Y: Bağımlı değişken (tahmin edilen değer)
- X₁, X₂, ..., Xₙ: Bağımsız değişkenler
- β₀: Sabit terim (intercept)
- β₁, β₂, ..., βₙ: Katsayılar (her bir X'in Y üzerindeki etkisi)
- ε: Hata terimi (modelin açıklayamadığı kısım)
(1.1)
1. En Küçük Kareler Kestirimi
𝛽0 , 𝛽1 , 𝛽2,…, 𝛽𝑘 parametreleri bilinmeyenlerdir ve örneklem verileri üzerinden kestirimler gerekir. (𝑦1, 𝑥11, 𝑥12, … , 𝑥1𝑘 ), … , (𝑦𝑛, 𝑥𝑛1, 𝑥𝑛2, … , 𝑥𝑛𝑘) olmak üzere n sayıda ve k bağımsız değişkenden oluşan veri kümesi olduğu varsayılır.
1.1. Regresyon Katsayılarının En Küçük Kareler Kestirimi
𝑦𝑖 , 𝛽1 , 𝛽2,…, 𝛽𝑘 gözlemleri ile regresyon doğrusu arasındaki farkın en küçük olacak şekilde kestirilir. Denklem (1.1)’deki regresyon katsayılarının kestirimi için kullanılır. n>k gözlemin olduğunu varsayılarak aşağıdaki denklem yazılır.
(1.2)
En küçük kareler fonksiyonu aşağıdaki gibidir:
(1.3)
Denklem (1.2) 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘 göre ayrı ayrı türevi alınıp sıfıra eşitlenirse,
(1.4)
Denklemini verir. Bu denklemler en küçük kareler normal denklemleri olarak adlandırılır. Normal denklemlerinin çözümü 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘 en küçük kareler kestiricilerini verecektir.
Çoklu regresyon modelleriyle ilgilenirken onları matris içinde ifade etmek daha uygundur. Verilerin ve sonuçların daha kısa ve öz bir biçimde ortaya çıkmasınısağlar Denklem(1.2)’da verilen modelin matris gösterimi,
𝑦 = 𝑋𝛽 + 𝜀 biçimindedir. Burada ki, matrisler aşağıdaki gibidir;
(1.5)
y:Gözlemler vektörü
X:Bağımsız değişkenler matrisi
𝛽:Regeresyon Katsayıları vektörü
𝜀:Rasgele hatalar vektörü
Aşağıda verilen 𝑆(𝛽) fonsiyonunu minimize ederek 𝛽̂ en küçük kareler kestiricileri vektörünü elde ederiz:
(1.6)
𝑆(𝛽) aşağıdaki gibi elde edilir:
(1.7)
Denklem (1.7) 𝛽’ya göre türevi alınıp basitleştirilirse:
(1.8)
Denklem(1.8)’ün matris gösterimi aşağıdaki gibidir
(1.9)
Denklem(1.9)’ün matris gösterimi aşağıdaki gibidir.
(1.10)
Denklemi(1.10) çözmek için her iki tarafı (X’X)^-1 ile çarpılır. 𝛽’nın en küçük kareler kestiricisi bulunur.
(1.11)
1.2. 𝝈² ’nin kestirimi
İdeal olarak bu kestirimin kurulan modelin yeterliliğine bağlı olmaması tercih edilir. Bu ise yanlızca x’in en az bir değeri için y üzerinde farklı gözlemler olduğunda ya da 𝜎²’ye ilişkin önceliğinden elde edilmiş bilgi bulunduğunda mümkün olmalıdır. Bu yaklaşım kullanılamadığında 𝜎², artık veya hata kareler toplamından elde edilir.
(1.12)
𝑒 = 𝑦 − 𝑋𝛽̂ yerine konulmasıyla aşağıdaki ifade elde edilir
(1.13)
Denklem (1.12)’ten son denklem aşağıdaki gibi olur.
(1.14)
Artık kareler toplamını n-p serbestlik derece sine sahiptir. SSRes’in beklenen değeri E(SSRes)=(n-p)𝜎² olduğu göstermektedir; dolayısı ile 𝜎²’nin yansız bir kestiricisi aşağıdaki gibidir:
(1.15)
1.3. Dummy Değişken
2 ve daha fazla kategorisi olan bir değişkeni 1 ve 0 şeklinde kodladığımızda aslında tek kategoriye indirmiş oluyoruz. Örneğin erkek=0 kadın=1 olarak kodlandığında değişkeni kadın olmak ya da olmamak şeklinde yorumlayarak regresyon analizi yapılır. Burada yaptığımız bir grubu referans grubu alıp sadece diğer grubun verileri ile analiz yapıp daha sonra elde edilen regresyon katsayısını da analize katılan grup üzerinden yorumlamaktır.
- Cinsiyet: Erkek, Kadın
- Medeni Durum: Evli, Bekar
- Eğitim Durumu: Lise, Lisans, Yüksek Lisans
Orijinal Veriler (Kategorik)
| Kişi | Cinsiyet | Medeni Durum | Eğitim Durumu |
|---|---|---|---|
| 1 | Erkek | Evli | Lisans |
| 2 | Kadın | Bekar | Lise |
| 3 | Erkek | Bekar | Yüksek Lisans |
Dummy Değişkenli Tablo
| Kişi | Cinsiyet_Erkek | Cinsiyet_Kadın | Medeni_Evli | Medeni_Bekar | Eğitim_Lise | Eğitim_Lisans | Eğitim_YüksekLisans |
|---|---|---|---|---|---|---|---|
| 1 | 1 | 0 | 1 | 0 | 0 | 1 | 0 |
| 2 | 0 | 1 | 0 | 1 | 1 | 0 | 0 |
| 3 | 1 | 0 | 0 | 1 | 0 | 0 | 1 |
Not: Gerçek regresyon modellerinde "dummy trap" yani çoklu doğrusal bağlantıyı önlemek için genelde her kategoriden bir tanesi silinir. Örneğin:
- Cinsiyet_Kadın, Medeni_Bekar, Eğitim_Lise gibi değişkenler çıkarılır, ve onlar baz (referans) kategori olarak kabul edilir.
Multiple linear regression is a statistical technique that examines the linear relationship between a dependent variable (y) and more than one independent variable (x1, x2, x3, ...) . In simple linear regression there is only one independent variable, while multiple linear regression has more than one.
Basic Equation:
Y = β₀ + β₁X₁ + β₂X₂ + ... + βₙXₙ + ε
- Y: Dependent variable (predicted value)
- X₁, X₂, ..., Xₙ: Independent variables
- β₀: Constant term (intercept)
- β₁, β₂, ..., βₙ: Coefficients (the effect of each X on Y)
- ε: Error term (the part the model cannot explain)
(1.1)
1. Least Squares Estimation
The parameters 𝛽0 , 𝛽1 , 𝛽2,…, 𝛽𝑘 are unknown and must be estimated from sample data. The data set is assumed to consist of n observations on k independent variables: (𝑦1, 𝑥11, 𝑥12, … , 𝑥1𝑘 ), … , (𝑦𝑛, 𝑥𝑛1, 𝑥𝑛2, … , 𝑥𝑛𝑘).
1.1. Least Squares Estimation of the Regression Coefficients
The coefficients are estimated so that the difference between the observations 𝑦𝑖 and the regression line is as small as possible; this is used to estimate the regression coefficients in Equation (1.1). Assuming n>k observations, the following equation is written.
(1.2)
The least squares function is as follows:
(1.3)
Taking the derivative of Equation (1.2) with respect to 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘 separately and setting it equal to zero
(1.4)
gives these equations. They are called the least squares normal equations. Solving the normal equations gives the least squares estimators of 𝛽0 , 𝛽1 , 𝛽2 ,…, 𝛽𝑘.
When working with multiple regression models, it is more convenient to express them in matrix form, which presents the data and results more concisely. The matrix form of the model given in Equation (1.2)
is 𝑦 = 𝑋𝛽 + 𝜀, where the matrices are as follows:
(1.5)
y: Vector of observations
X: Matrix of independent variables
𝛽: Vector of regression coefficients
𝜀: Vector of random errors
We obtain the vector 𝛽̂ of least squares estimators by minimizing the function 𝑆(𝛽) given below:
(1.6)
𝑆(𝛽) is obtained as follows:
(1.7)
Taking the derivative of Equation (1.7) with respect to 𝛽 and simplifying:
(1.8)
The matrix form of Equation (1.8) is as follows
(1.9)
The matrix form of Equation (1.9) is as follows.
(1.10)
To solve Equation (1.10), both sides are multiplied by (X’X)^-1, which gives the least squares estimator of 𝛽.
(1.11)
1.2. Estimation of 𝝈²
Ideally, this estimate should not depend on the adequacy of the fitted model. This is only possible when there are repeated observations of y for at least one value of x, or when prior information about 𝜎² is available. When this approach cannot be used, 𝜎² is estimated from the residual (error) sum of squares.
(1.12)
Substituting 𝑒 = 𝑦 − 𝑋𝛽̂ gives the following expression
(1.13)
The last equation from Equation (1.12) becomes the following.
(1.14)
The residual sum of squares has n-p degrees of freedom. It can be shown that the expected value of SSRes is E(SSRes)=(n-p)𝜎²; therefore, an unbiased estimator of 𝜎² is:
(1.15)
1.3. Dummy Variables
When we code a variable with 2 or more categories as 1 and 0, we are effectively reducing it to a single category. For example, when male=0 and female=1, the regression analysis interprets the variable as being female or not. What we do here is take one group as the reference group, analyze with the data of the other group, and then interpret the resulting regression coefficient with respect to the group included in the analysis.
- Gender: Male, Female
- Marital Status: Married, Single
- Education: High School, Bachelor's, Master's
Original Data (Categorical)
| Person | Gender | Marital Status | Education |
|---|---|---|---|
| 1 | Male | Married | Bachelor's |
| 2 | Female | Single | High School |
| 3 | Male | Single | Master's |
Dummy Variable Table
| Person | Gender_Male | Gender_Female | Marital_Married | Marital_Single | Education_HighSchool | Education_Bachelor | Education_Master |
|---|---|---|---|---|---|---|---|
| 1 | 1 | 0 | 1 | 0 | 0 | 1 | 0 |
| 2 | 0 | 1 | 0 | 1 | 1 | 0 | 0 |
| 3 | 1 | 0 | 0 | 1 | 0 | 0 | 1 |
Note: In real regression models, to avoid the "dummy variable trap" (i.e. multicollinearity), usually one category of each variable is dropped. For example:
- Variables such as Gender_Female, Marital_Single and Education_HighSchool are removed and treated as the base (reference) categories.