ラベル 説明変数 の投稿を表示しています。 すべての投稿を表示
ラベル 説明変数 の投稿を表示しています。 すべての投稿を表示

2012/10/04

文系のための「重回帰分析のモデル」(1)

変数の関係を観察するための基本的方法に「相関」と「回帰」の考え方がある。
相関は、変数間の結びつきの「連動性」を表す方法であり、
回帰は、変数間の結びつきの「関係性」を表す方法であった。

ここで「うん...?」となった人は、もう一度、相関の話回帰の話を復習。

相関の考え方の場合では、複数の変数の場合相関係数行列を用いたが、
回帰の考え方の場合には、どのように表すのか?というのが、今回のテーマである。

ところで、一般的な解説では「説明する」という言葉に重きを置いて、
回帰分析を解説することが多いが、回帰分析は変数間の関係を観察する手法である。
「説明変数」と「目的変数」という言葉に惑わされてはいけない。

まずは、2変数の場合における回帰、すなわち、単回帰の話を思い出してみる。
たしか、以下のような式によって、表されたのであった。



この式では、一方の変数のみで、もう一方の変数を変数を表そうとしていることが解る。
一般的な言い方をすると、一方の変数でもう一方の変数の「説明」を試みている。
ここで、説明される側の変数を目的変数説明する側の変数を説明変数と呼んだ。

この式において左辺の目的変数には「^(ハット)」が付いている。
したがって、説明変数によって導かれているのは推定値だと解る。
ここで、実際の値を表現するのであれば、以下のようになる。



左辺の目的変数の「^(ハット)」が取れて、右辺の最後に「」が付くだけ。
最後に付け足した「」は、説明しきれない「残差(誤差)を表すのであった。
説明変数によって、説明しきれなかった部分を最後に足してやれば元の値が解るハズ。

おそらく、ここまでの話は、理解できている...と信じたい。

さて、変数がさらに多くなるとどうなるのか?
p個の変数からなる多次元データがあったとして、
一つの変数を目的変数としたとき、次のように表すことができる。



p-1となっているのは、元の変数の内の1つが目的変数とな っているため。
p個の変数のうち、説明変数を抜いた「p-1」個の変数が説明変数となる。
この式では、目的変数推定値であるが、実際の値は次のように表すことができる。



これが、「重回帰分析」と呼ばれるもののモデルである。
添字が並んでいるので、混乱するかもしれないが、
要するに、変数が増えただけ。モデルとしては、基本的に単回帰と同じ。

これを実際に計算するとなると、少々面倒な手続きが必要となる。

まずは、目的変数を推定する式をと眺めてみる。気づくことはないか?
このままだと、少々、解りにくいかもしれない。
この式はベクトルの式で表されているので行列の式で表してみる。



行列の「掛け算」を理解していれば、難しくは無いハズ。
ここで知りたいのは、「β」のベクトルの部分。回帰係数のベクトルである。
これで、意味が解った人はスゴイ。解らない人のために式を変形してみる

たしか、行列には割り算が存在しない代わりに、
スカラー逆数に相当する、逆行列というのがあった。
まずは、これを使って両辺を基準化してみる。すると以下のようになる。



逆行列の性質から、元の行列に逆行列を掛けると、単位行列が出てくるので、
要するに、上の式は、実際には以下のようになっている。



単位行列に別の行列を掛けると、掛けた行列が出てくる。
つまり、何も起きないのであった。したがって、次のようになる。



最後に、左辺と右辺を入れ替えると次のようになる。



さて、ここまで変形してみて意味が解ればと合格。
要するに、連立方程式の形にもってきただけのこと。
逆行列を使えば連立方程式が解ける

もう少し、一般的な式に書きなおしてみると、以下のようになる。



本当にこの式で大丈夫だろうか?
逆行列は正方行列にしか使えないので、擬逆行列にしないといけない。
つまり、以下のようになる。擬逆行列の話を思い出してみる。



あるいは、特異値分解による逆行列の近似によって、以下のようにも表すことができる。
もちろん、計算結果は上の式と同じ。詳しくは、擬逆行列の話でも述べている。



以上のようにして、複数の変数における回帰係数を求めることができる。
すでに、ここまでの話を、一つずつ積み重ねてきた人は、
Rで重回帰分析における回帰係数を計算することができるハズ。

次の話では、実際のデータを用いてもう少し、
重回帰分析意味モデルの見方について整理したい。

2012/09/19

文系のための「二変数の関係」(3)

これまでの話から、二つの変数間の関係を見るための方法には、
相関係数以外にも単回帰という方法があることが理解できたハズ。

単回帰は、相関係数に良く似ているが、
一方の変数によってもう一方を説明するという考え方に基づいている。
相関係数は、二つの変数を平等に見ていたので、この点が大きく異なる。

また、重要なこととして、相関係数は二つの変数が平等なので軸は関係無いが、
単回帰の場合は、どちらを説明変数に置くかによって値が異なる。
まぁ、この辺りは、感覚的に理解できていることだろうと信じたい。

さて、今回は、もう少し単回帰について踏み込んでみる。
実は、前回の話では、二つの変数間の関係の強さについては、
十分に検討ができていなかったのである。

相関係数と同様に、二つの変数間の関係の強さを観察するには、
推定された値と実際の値との誤差の部分の解釈が必要となる。
本日は、このことについて整理する。

ということで、前回のデータの読み込みから。

# Windows と Linux の人は次のコマンド
X <- read.table("clipboard", sep=",", header=TRUE)

# Mac の人は次のコマンド
X <- read.table(pipe("pbpaste") , sep=",", header=TRUE)

以下が、そのデータ。データの説明に関しては、平均の話を参照。

Oroshi_Kg, Taka, Naka, Yasu
Tai, 1336, 3150, 1217, 53
Chinu, 226, 630, 513, 105
Sawara, 212, 1575, 1259, 840
Yazu, 4834, 840, 315, 179
Suzuki, 618, 1575, 1146, 525
Akou, 21, 4725, 3129, 1575
Kochi, 28, 2100, 874, 210
Okoze, 28, 5250, 2635, 210
Ainame, 29, 3150, 621, 315
Hage, 1205, 1890, 383, 210
Konoshiro, 21, 2100, 1100, 105
Sayori, 12, 5250, 3916, 1260
Anago, 1637, 2625, 1721, 630
Mebaru, 330, 4200, 1680, 315
Tachiuo, 1211, 2310, 930, 105
Hamo, 1622, 3938, 592, 53
Karei, 41, 6300, 3178, 525
Hirame, 540, 2100, 1496, 210
Aji, 5149, 3150, 789, 210
Saba, 5413, 3675, 625, 53
Ika, 2414, 2888, 1083, 105
Tako, 1844, 1890, 1180, 525
Ebi, 560, 7350, 1420, 525
KurumaEbi, 222, 8925, 6508, 2625
Koiwashi, 1316, 1155, 617, 328
ObaIwashi, 2716, 499, 267, 175
Mentai, 678, 1155, 859, 394
Hamachi, 4772, 998, 632, 105
Isaki, 268, 2625, 1465, 840

ふむ。前回と同様に、中値安値の関係を使うことにするか。
単回帰分析も行うことにしよう。lm()関数があるが今は使わない。

x1 <- X$Naka
x2 <- X$Yasu

# まず、推定値を求める
B <- cov(x1,x2)/var(x1)

# まず、推定値を求める
B0 <- mean(x2) - B*mean(x1)

# x2の推定値を求める
x2.hat <- B0 + B*x1

数式あった方が解り易い。x1によってx2の値を説明するので、
たしか、以下のような式になるハズであった。



ここで、二つ推定値のいうのがそれぞれ、

,  

であった。詳しい説明は既にしてあるから、ここまでは大丈夫であろう。
自信が無い人は、もう一度復習をすること。

さて、現在、この回帰式によって説明されるのは、
あくまで、理屈として推定される値であって、実際の値とは異なる
理屈上の話だから、直線で推定の直線が描けたのであった。

では、実際の値というのは、推定された値を使ってどのように表現できるか?



この式は、推定値では無くて、実際の値を表しているから、
左辺の「^(ハット)」が取れていることにも注目。

さて、この式の中で重要なことは最後に「」の値が付いていること。
これを「残差(residuals)」と呼び、この記号は一般的に残差を表す。

つまり、推定された値に誤差を加えたものが実際の値、と考えるのである。
この辺りの考え方は、数学嫌いの人には、少々、理解し難いかもしれない。

では、残差は、どうすれば求めることができるか?
これも中学校までの数学の知識があれば簡単なことであろう。



つまり、実際の値から推定値を引くだけ。混乱することは無い。
では、早速、この誤差の部分を計算してみる。

residuals <- x2 - x2.hat

ふむ。これで誤差が計算できた。ちょっと解りにくいので可視化する。
# 上手く重なるようにx軸とy軸の描画範囲を固定する
x.lim <- c(0,max(x1))
y.lim <- c(0,max(x2))

# 散布図を作成する
plot(x1, x2, xlim=x.lim, ylim=y.lim, pch=16)

# 図を重ねるためのオマジナイ
par(new=TRUE)

# xの値の範囲を最低値と最大値で決める。
x1.range <- seq(min(x1),max(x1))

# x値の範囲に対応する推定値を計算する。
x1.estim <- B0 + B*x1.range

# 回帰直線を引く
plot(x1.range, x1.estim, xlim=x.lim, ylim=y.lim, xaxt="n", yaxt="n", xlab="", ylab="", type="l", col="red")

# 残差を表す線を描画する
for(i in seq(1,length(x1))){
  x <- rep(x1[i],2)                 # x1の値を2つ作る
  y <- c(x2[i], x2[i]-residuals[i]) # x2の値とx2の値から残差を引いた値を作る

  # 残差を表す垂線を引く
  par(new=TRUE)
  plot(x, y, xlim=x.lim, ylim=y.lim, xaxt="n", yaxt="n", xlab="", ylab="", type="l", col="blue")
}

# 最後にグリッドを描いて全体を整える
grid()

この図において、実際の値から回帰直線に引かれた垂線が残差「residuals」である。
この残差というのが、二つの変数間の関係を観察する上で重要な値で、
残差を合わせた値が小さいほど当てはまりが良いことを表す



二乗しているのは、値の正負が打ち消し合わないようにするため。
これを残差平方和(Sum Squared Error)と呼ぶ。とりあえず、Se と置いておく。
試しに、今回のデータを使って、この値を確認してみる。

(se <- sum(residuals^2))

これを実行すると、以下のようになる。

> (se <- sum(residuals^2))
[1] 2076206

さて、この値が小さいということが重要なのだけれど、これは大きいのか?
この値の大小の程度を見分けるためには、やはり、基準化しないといけない。
原点に帰って、もう一度、この残差というものが何なのかを考えてみる。

データを観察する上で、最も重要なのは、くどいけれど、バラツキ
そして、個々の値のバラツキ偏差と言い、
偏差を二乗して足し合わせたものが偏差平方和

とりあえず、目的変数総平方和(Sum Squared Total Deviation)と呼び、
この値をSt とでも置いておくことにする。式は以下の通り。



これを対象数から1を引いた「n-1」で割ると?そうそう、分散になる。
要するに、分散の式の分子の部分に当たるのであった。

さて、このStSeの関係に注目してやると、
Stは観測値のバラツキの平方和で、Seは残差のバラツキの平方和だから、
予測値のバラツキとSe を足したものが、St になるはず。

では、予測値のバラツキはどうなるか?というと、以下のようになる。



つまり、St = Se + Sr という関係が成立するはず。
これは、直感的に理解できる。ここからが数学マジック!
両辺をStで割るとどういうことになるのか?



となる。ここで、残差平方和の影響の大きさを見たいので、
この式から、予測値のバラツキの部分を抜いてしまう。
すると、以下のようになる。左辺に何もないと困るので「」を置いておく。



つまり、残差平方和の大きさというのは、このように表すことができる。
この値が「1」に近づくということは、残差の影響が小さいことを意味する
なかなか、エレガントな数式。私は美しいと思うのだが、どうだろう?

さて、この「」という指標は頻繁に登場する。だからちゃんと名前がある。
一般的に、この指標のことを「決定係数」と呼び、慣例的に「」で表す。

では、この決定係数を実際に計算してみる。

# 一応、三つの値を出しておく。
st <- sum((x2-rep(mean(x2), length(x2)))^2)
sr <- sum((x2.hat-rep(mean(x2), length(x2)))^2)
se <- sum((x2-x2.hat)^2)

# 決定係数の計算
(R2 <- 1-(se/st))

では、確認。以下が実行結果。

> # 決定係数の計算
> (R2 <- 1-(se/st))
[1] 0.7576962

さて、この結果は果たして高いと言えるのかどうか?実は、判断は難しいのであるが、
一方の変数がもう一方を説明する上で、75.8%の説明力を持っていることを示していて、
これは、決して低い値ではない。大体、60〜70%以上であれば、悪くはない。

決定係数に関しては、注意するべきことがある。
相関係数と同様に、この値を盲目的に信用してはならないし、
慎重にデータの解釈をしなければならない。決定係数は、基準の一つでしかない

例えば、決定係数は、対象数が多くなると必然的に値が高くなるので、
自由度調整済み決定係数と呼ばれる指標を用いたり、
確立統計の手法を用いる場合もある。

さてさて、最後に、Rのlm()関数を使った場合についてもやっておく。
とりあえず、X.reg という変数に、回帰分析の結果を入れて、その要約を確認する。

X.reg <- lm(x2 ~ x1)
summary(X.reg)

以下がこの処理の実行結果。

> X.reg <- lm(x2 ~ x1)
> summary(X.reg)

Call:
lm(formula = x2 ~ x1)

Residuals:
    Min      1Q  Median      3Q     Max 
-678.72 -163.58   -7.29  158.81  506.60 

Coefficients:
             Estimate Std. Error t value Pr(>|t|)    
(Intercept) -69.68447   77.21191  -0.903    0.375    
x1            0.36372    0.03958   9.189 8.45e-10 ***
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 

Residual standard error: 277.3 on 27 degrees of freedom
Multiple R-squared: 0.7577, Adjusted R-squared: 0.7487 
F-statistic: 84.43 on 1 and 27 DF,  p-value: 8.447e-10 

実は、色々と見ないといけないのであるが、
そもそも、今回の話の目的は、二つの変数間の関係を見ることであって、
精密な推定を行うことではない。ということで、決定係数以外は無視。

さて、上記の出力において、Coefficients の部分は係数の部分。
決定係数の部分は、下から二行目の部分。Multiple R-squared の右側。
ちゃんと、手計算で算出した決定係数と一致していることが解る。

回帰分析の解説の多くは、「目的変数説明変数によって推定する手法」、
と紹介しているのではないかと思うが、変数間の関係を見ることが重要なのである。
これは、相関係数の考え方に非常に良く似ているのである。たしかに、式も似ていた。

相関係数との違いは、一方の変数によってもう一方の変数を説明するという考え方
したがって、その説明力を「残差」に注目して検討するのである
残差が小さいほど、二つの変数の間の関係は強いということになる。

他の教科書に書かれているように、推定に注目するのであれば、
より複雑なことが必要になるし、3つ以上の変数間の関係になると結構大変。
残差そのものに関する検討や、複数の変数の当てはまりの高さの検討も必要。

この章で書いてしまいたい話ではあるが、
この辺りの話は、中級編重回帰分析の話で整理することにする。

2012/09/18

文系のための「二変数の関係」(2)

データを観察する上で最も重要なことは、何度でも言うけれども、
データの中心」と「データのバラツキ」を把握すること。
あらゆる統計的な手法はこの二つの点が全ての原点になっている。

そう言えば、数量化理論を創り上げた林知己夫氏が、
以下のように語っていることを思い出した。

科学は所詮平均値の議論である。・・・(中略)・・・
平均や構造をみることで大きな知見を得ることができ、
さらに個々を介して新たに発展の道をたどることになる。

この言は、日本行動計量学会35年記念誌『行動計量学』2008年9月号の、
「論文 ーその世俗的な話しー」と題したエッセイに書かれてある。
思わず、苦笑いしたくなる名言が詰まっていて、是非、研究者には読んでもらいたい。

初っ端から話が逸れてしまったが、重要なことは、あくまでデータの中心であって、
その中心からのバラツキを測った指標として、分散標準偏差があった。

さらに、このバラツキ二つの変数間で観察するための指標として、
共分散というものがあり、それを基準化したものとして相関係数があった。
ふむふむ。では、相関係数とはどのようなものだったか?

確か、二つの変数の関係の強さ-1〜1の範囲で表し、

一方が増加するともう一方が減少する場合を負の相関と呼び、
一方が増加するともう一方も増加する場合を正の相関と呼んだ。

そうそう。そういった関連性の強さを表すものであった。

実を言うと、このように二つの変数の関連の強さを観察する方法というのは、
相関係数だけではない。別の考え方に基づく方法がある。
今回の話は、その方法についての話。

とりあえず、相関の話で使ったデータの読み込みから。

# Windows と Linux の人は次のコマンド
X <- read.table("clipboard", sep=",", header=TRUE)

# Mac の人は次のコマンド
X <- read.table(pipe("pbpaste") , sep=",", header=TRUE)

以下が、そのデータ。前回のものを再掲しただけ。
データの説明に関しては、平均の話を参照。

Oroshi_Kg, Taka, Naka, Yasu
Tai, 1336, 3150, 1217, 53
Chinu, 226, 630, 513, 105
Sawara, 212, 1575, 1259, 840
Yazu, 4834, 840, 315, 179
Suzuki, 618, 1575, 1146, 525
Akou, 21, 4725, 3129, 1575
Kochi, 28, 2100, 874, 210
Okoze, 28, 5250, 2635, 210
Ainame, 29, 3150, 621, 315
Hage, 1205, 1890, 383, 210
Konoshiro, 21, 2100, 1100, 105
Sayori, 12, 5250, 3916, 1260
Anago, 1637, 2625, 1721, 630
Mebaru, 330, 4200, 1680, 315
Tachiuo, 1211, 2310, 930, 105
Hamo, 1622, 3938, 592, 53
Karei, 41, 6300, 3178, 525
Hirame, 540, 2100, 1496, 210
Aji, 5149, 3150, 789, 210
Saba, 5413, 3675, 625, 53
Ika, 2414, 2888, 1083, 105
Tako, 1844, 1890, 1180, 525
Ebi, 560, 7350, 1420, 525
KurumaEbi, 222, 8925, 6508, 2625
Koiwashi, 1316, 1155, 617, 328
ObaIwashi, 2716, 499, 267, 175
Mentai, 678, 1155, 859, 394
Hamachi, 4772, 998, 632, 105
Isaki, 268, 2625, 1465, 840

最初にするべきことは、やはり相関係数を出すこと。
話を解りやすく進めるため、今回は「中値」と「安値」で見ていくことにする。
この二つの変数をそれぞれ、x1x2という変数に入れ直して、相関係数を見る。

x1 <- X$Naka
x2 <- X$Yasu
cor(x1, x2)

実行結果は以下のようになる。

> x1 <- X$Naka
> x2 <- X$Yasu
> cor(x1, x2)
[1] 0.8704575

相関係数の符号はプラスで、値は、0.81に近い値になっている。
ところで、相関係数の算出式はどようなものであったか?
今一度、思い出してみる。たしか、以下のような式だった。



要するに、分母が二つの変数の標準偏差に相当し分子が共分散となっている。
二つの変数の値が全く同じ場合は、共分散の部分が分散となり、
結果として、相関係数が「1になるのであった。忘れた人は、もう一度復習を。

さて、この式は、二つ変数の実際のバラツキの連動性を、
理屈上のバラツキの連動性で基準化しているということになる。
見方を変えると、この式は二つの変数を対等に見ているとも言える。

はて?「対等」ということはどのようなことか?
また、逆に「対等でない」ということはどのようなことか?

要するに、一方の変数のバラツキから、
もう一方の変数のバラツキを「説明する」という考え方もできる。



β の上に「^(ハット)」が付いているが、これは推定値という意味
数学の世界では慣例的に、ある数式によって導かれた値をこのように表す。

なお、相関係数の式では、二つの標準偏差を使うことで、
分散の値に揃えようとしていたのだけれど、ここでは一方のみで良いので、
分母の部分は分散に相当するようになっている。分子はそのまま。

さて、この式は、一体何を表しているか?

要するに、二つの共分散を一方の変数のみで基準化すると、
もう一方の「理屈上の分散を推定できる、と考えているのである。

さらに突き詰めて考えてみると、一方の値が分かれば、
理屈上のもう一方の値の「増減率」を推定することができる。

さて、言葉で考えても解りにくいので、
とりあえず、散布図を描きながら考えてみることにする。
# まず、推定値を求める
B <- cov(x1,x2)/var(x1)

# xの値の範囲を最低値と最大値で決める。
x1.range <- seq(min(x1),max(x1))

# x値の範囲に対応する推定値を計算する。
x1.estim <- B*x1.range

# まずは、普通に散布図を描く
plot(x1, x2, ylim=c(0,max(x2)), xaxt="n", yaxt="n", xlab="", ylab="")

# 図を重ね合わすためのオマジナイ。
par(new=TRUE)

# 推定され得る値を直線で表す
plot(x1.range, x1.estim, col="red", type="l", ylim=c(0,max(x2)), xlab="", ylab="")

# x軸とy軸の軸ラベルを付ける
title(xlab="x1", ylab="x2")

# 変数x2の平均(横線)と変数x1の平均(縦線)を描く
abline(h=mean(x2), v=mean(x1), lty=2, col="blue")

このように、相関係数とは異なった方法で二つの変数の関係を表すことができる。
今回の例の場合は、「それとなく」線と散布図がフィットしているように見えるが、
この赤い線によって推定されているのは、二つの変数の増減率の関係を表す「傾きだけ。

値そのものを推定したいのであれば、二つの値の中心に原点を合わす必要がある。
要するに、上の図で言うと、二つの青い破線の交点に赤い線を通すようにすれば良い。
どのようにすれば良いかは、頭で考えても解るハズ。中学校までの知識で十分。

うん?という人のために補足説明。

推定の赤い線が、x1平均値の時に、x2平均値を取るようすれば良いので、
以下のような補正項を考えれば良いことになる。



x1の推定された値が、実際の平均よりもy軸方向にズレているのが問題なので、
そのズレの部分を計算しているだけ。大して難しい話では無い。
さて、この部分を先ほどの増減率の式と一緒にしてみる。



つまり、最終的にこのようになる。推定されるべきx2の値は、
補正項の部分とx1の推定された増減率の値を足したものからなる。

これを「単回帰」と呼ぶ。

実は、このブログでは、相関係数から単回帰についての説明を導いたが、
歴史的には、相関係数よりも単回帰の方が先に発見された。
ちなみに、発見した人物はナイチンゲールの親戚でもあるフランシス・ゴールトン

少し話が逸れたが、この回帰直線相関係数を同時に表示すると、
さらに、二つの変数間の関係がよく解るのである。
そのため、散布図を描いた際に、回帰直線を一緒に描くことがよくある。

そう言えば、先程の図は、まだ補正項の部分が修正されていなかった。
折角なので、補正した図を作成してみる。
# まず、推定値を求める
B <- cov(x1,x2)/var(x1)

# まず、推定値を求める
B0 <- mean(x2) - B*mean(x1)

# xの値の範囲を最低値と最大値で決める。
x1.range <- seq(min(x1),max(x1))

# x値の範囲に対応する推定値を計算する。
x1.estim <- B0 + B*x1.range

# まずは、普通に散布図を描く
plot(x1, x2, ylim=c(0,max(x2)), xaxt="n", yaxt="n", xlab="", ylab="")

# 図を重ね合わすためのオマジナイ。
par(new=TRUE)

# 推定され得る値を直線で表す
plot(x1.range, x1.estim, col="red", type="l", ylim=c(0,max(x2)), xlab="", ylab="")

# x軸とy軸の軸ラベルを付ける
title(xlab="x1", ylab="x2")

# 変数x2の平均(横線)と変数x1の平均(縦線)を描く
abline(h=mean(x2), v=mean(x1), lty=2, col="blue")

今回は、仕組みを理解するために手計算で回帰直線を引いたが、
もちろん、Rには簡単に回帰分析を行うための関数がある。以下は、実行結果。

> lm(x2 ~ x1)
Call:
lm(formula = x2 ~ x1)
Coefficients:
(Intercept)           x1
   -69.6845       0.3637

Rでは、lm()関数というものを用いる。括弧の中身が解りにくいかもしれない。
これは、モデル式と呼ばれるもので、「」の左側に求めたい変数を置き、
右側に求めたい値を「説明するための変数」を置く。

統計学では、説明するための変数のことを「説明変数」と呼び、
その説明変数によって説明される変数のことを「目的変数」と呼ぶ。

ちなみに、

数学では、説明するための変数のことを「独立変数」と呼び、
その説明変数によって説明される変数のことを「従属変数」と呼ぶ。

文系出身者の多くには、二つの分野が同じように見えるかもしれないが、
前者は工学系の分野で、後者は理学系の分野
論理の立て方が異なるので、与えられる用語は(記号も)微妙に異なる。

実際には同じなのだけれど、用語の使い方に惑わされないように。

さてさて。出力結果で見ないといけないのは、Coefficientsと書かれている部分。
(Intercept) というのは、日本語では「切片」と訳される。要するに、 の部分。
そして、x1と書かれている部分が「傾き」の係数部分になる。

lm()関数は、単回帰だけでなく、重回帰分析でも使用する関数なので、
今の間に覚えておいた方が良いかもしれない。


ふむ。確かに、推定するための線があった方が散布図は見易そうである。
ところで、この推定された値は、実際にはどの程度上手く当てはまっているのだろうか?
これを検討するには、推定された値と、実際の値とのズレを分析する必要があるのだが…。

今回も、話が少し長くなったので、この「ズレ」の検討については次回にしよう。