線形回帰は、スカラー応答(従属変数)と1つ以上の説明変数(回帰変数または独立変数)との間の関係を推定する統計モデルである。説明変数がちょうど1つであるモデルは単純線形回帰と呼ばれ、2つ以上の説明変数を持つモデルは多重線形回帰と呼ばれる。この用語は、単一の従属変数ではなく複数の相関する従属変数を予測する多変量線形回帰とは区別される。
線形回帰における関係は、データから推定される未知パラメータを持つ線形予測関数を用いてモデル化される。最も一般的には、説明変数の値が与えられたときの応答の条件付き平均が、それらの値のアフィン関数であると仮定される。あまり一般的ではないが、条件付き中央値やその他の分位数が用いられることもある。すべての形式の回帰分析と同様に、線形回帰は予測子が与えられたときの応答の条件付き確率分布に焦点を当てており、すべての変数の同時確率分布(これは多変量解析の領域である)には焦点を当てない。
線形回帰はまた、機械学習アルゴリズムの一種、具体的には教師ありアルゴリズムであり、ラベル付きデータセットから学習し、データポイントを最適化された線形関数にマッピングして、新しいデータセットの予測に使用できるようにする。これは、厳密に研究され、実用的な応用で広く使用された最初のタイプの回帰分析であり、未知パラメータに線形に依存するモデルは非線形モデルよりも適合が容易であり、結果として得られる推定量の統計的性質も決定しやすいためである。
歴史的発展
線形回帰の中心となる最小二乗法は、1805年にアドリアン=マリ・ルジャンドルによって最初に発表され、1809年にカール・フリードリヒ・ガウスによって独立に発表された。ガウスは1795年からこの方法を使用していたと主張し、彼の研究は正規分布とガウス=マルコフ定理の理論的基礎を確立した。初期の応用には、天文学的计算、測地学、惑星軌道の予測が含まれていた。19世紀後半までに、線形回帰は社会科学や生物科学における標準的なツールとなり、特に遺伝の文脈で「回帰」という用語を導入したフランシス・ゴルトンと、相関と回帰分析を形式化したカール・ピアソンの業績を通じて普及した。
20世紀には、計算方法の発展と統計学の学問としての台頭により、線形回帰の適用範囲が拡大した。1920年代にロナルド・フィッシャーによって行列表記と一般線形モデルが導入され、回帰と分散分析が統合された。その後、1950年代から1960年代にかけて電子計算機が利用可能になり、大規模な回帰モデルの適合が可能となり、経済学、工学、自然科学での広範な使用につながった。
数学的定式化
n個の統計単位のデータセットが与えられたとき、線形回帰モデルは、従属変数yと回帰変数のベクトルxとの間の関係が線形であると仮定する。この関係は、線形関係にノイズを加える観測されないランダム変数である撹乱項または誤差変数εを通じてモデル化される。モデルは次の形式を取る:
y_i = β_0 + β_1 x_i1 + ... + β_p x_ip + ε_i = x_i^T β + ε_i、i = 1, ..., n、
ここで、βは未知パラメータのベクトルであり、x_i^T βはベクトルx_iとβの内積である。多くの場合、これらのn個の方程式は行列表記でy = Xβ + εとしてまとめられ、ここでXはn × (p+1)の計画行列である。
パラメータβは通常、コスト関数を最小化することによって推定される。最も一般的なアプローチは、残差平方和を最小化する普通最小二乗法(OLS)である。OLS推定量は、行列X^T Xが可逆である場合、閉形式解β_hat = (X^T X)^{-1} X^T yを持つ。ガウス=マルコフの仮定の下では、OLSは最良線形不偏推定量(BLUE)である。
推定方法と変種
線形回帰モデルはしばしば最小二乗法を用いて適合されるが、最小絶対偏差回帰のような他のノルムでの不適合の最小化や、最小二乗コスト関数のペナルティ付きバージョンの最小化によっても適合され得る。リッジ回帰は係数にL2ノルムペナルティを追加し、係数をゼロに向けて縮小し、多重共線性に対処する。ラッソ(最小絶対収縮および選択演算子)はL1ノルムペナルティを追加し、一部の係数を正確にゼロに設定して変数選択を行う。エラスティックネットは両方のペナルティを組み合わせる。
多くの大きな外れ値を持つデータセットでコストとして平均二乗誤差(MSE)を使用すると、MSEは大きな誤差に高い重要度を割り当てるため、真のデータよりも外れ値に適合するモデルが生じる可能性がある。したがって、データセットに多くの大きな外れ値がある場合は、Huber損失や分位回帰のような外れ値にロバストなコスト関数を使用すべきである。逆に、最小二乗法は、予測子を変換することによって、多項式回帰のような線形モデルではないモデルを適合させるために使用できる。したがって、「最小二乗法」と「線形モデル」という用語は密接に関連しているが、同義ではない。
予測と推論における応用
線形回帰には多くの実用的な用途があり、大きく2つのカテゴリに分けられる。第一に、予測または予報が目的である場合、線形回帰は観測データセットに予測モデルを適合させ、誤差または分散を最小化できる。このようなモデルを開発した後、説明変数の追加値が応答値を伴わずに収集された場合、適合モデルを使用して応答を予測できる。これは、経済学、金融、環境科学などの分野で一般的である。
第二に、応答変数の変動を説明することが目的である場合、線形回帰分析は応答と説明変数の間の関係の強さを定量化できる。一部の説明変数が応答と線形関係をまったく持たないかどうかを判断したり、冗長な情報を含む説明変数のサブセットを特定したりできる。これは、社会科学、疫学、マーケティング分析で広く使用されている。
線形回帰はまた、機械学習における基礎的な構成要素としても機能する。これは単純で解釈可能なモデルであり、より複雑なアルゴリズムのベースラインとしてよく使用される。ニューラルネットワークや深層学習などの多くの現代的な手法は、線形モデルの一般化と見なすことができる。教師あり学習では、線形回帰は出力が連続値である回帰タスクに使用され、決定木やサポートベクターマシンなどのより柔軟なモデルとしばしば比較される。
限界と拡張
線形回帰は、応答と予測子の間の線形関係を仮定しており、これは実世界のデータでは成立しない可能性がある。外れ値に敏感であり、予測子の数が観測数に比べて多い場合には過適合を起こす可能性がある。予測子間の多重共線性は係数推定の分散を膨張させる可能性がある。これらの問題に対処するために、多項式回帰、一般化線形モデル(GLM)、正則化法などの拡張が開発されてきた。
その単純さにもかかわらず、線形回帰は最も広く使用される統計ツールの1つであり続けている。その解釈可能性と計算効率は、統計学と機械学習の両方のカリキュラムで定番となっている。2020年代現在、データサイエンスにおける基本的な手法であり続け、探索的分析の最初のステップや、より複雑なモデルのベンチマークとしてしばしば機能している。