統計学の教科書を開くと、必ずと言っていいほど登場する言葉があります。
それが最尤推定です。
読み方は「さいゆうすいてい」で、英語ではMaximum Likelihood Estimationと呼ばれ、略してMLEと表記されることも多いです。
データから母集団のパラメータを推定するための代表的な手法であり、機械学習や統計モデリングの現場でも欠かせない考え方となっています。
とはいえ、尤度関数やパラメータ推定といった専門用語が並ぶと、途端に難しく感じてしまう方も多いのではないでしょうか。
実際、最尤推定という言葉だけを見ると数式の塊のようなイメージを持ってしまいがちです。
しかし、その根底にある発想はとてもシンプルです。
手元にあるデータが得られる確率が最も高くなるように、パラメータの値を選ぶ。
これだけと言っても過言ではありません。
この記事では、最尤推定の意味や定義、読み方といった基本事項から、尤度関数の考え方、統計学における位置づけ、具体的な計算のイメージまでを、できるだけかみ砕いてご紹介していきます。
数式が苦手な方でも読み進められるよう、具体例を交えながら解説していきますので、ぜひ最後までお付き合いください。
最尤推定とは?結論から言うと最も尤もらしいパラメータを選ぶ推定方法です
それではまず最尤推定について解説していきます。
結論を先に申し上げると、最尤推定とは観測されたデータをもとに、そのデータが得られる確率が最大になるようなパラメータを選び出す統計的な推定方法です。
言い換えれば、手元のデータに対して最も辻褄が合う、つまり最も尤もらしいパラメータを探し当てる作業と言えるでしょう。
統計学における推定には、大きく分けて点推定と区間推定という考え方が存在します。
最尤推定はこのうち点推定に分類される代表的な手法です。
母集団の分布を仮定したうえで、その分布を特徴づけるパラメータ、たとえば平均や分散などを、観測データから逆算していくイメージです。
最尤推定の本質は非常にシンプルです。
数ある候補のパラメータの中から、今手元にあるデータが生まれる確率を最大にするものを選ぶ。
これが最尤推定のすべてと言っても過言ではありません。
たとえばコインを10回投げて、表が7回、裏が3回出たとします。
このとき、コインの表が出る確率をどう推定すればよいでしょうか。
コインの表が出る確率をpとします。
表が7回、裏が3回出る確率は、二項分布に従うと考えると次のように表せます。
P(データ|p)= C(10,7) × p^7 × (1-p)^3
この確率を最大にするpの値が、最尤推定量となります。
実際に計算すると、p=0.7のときにこの確率が最大になります。
つまり、感覚的に「7割くらい表が出やすいコインなのだろう」と考える発想を、数学的に厳密化したものが最尤推定なのです。
この考え方は、コイン投げのような単純な例だけでなく、正規分布やポアソン分布といった複雑な確率分布のパラメータ推定にも応用されています。
マーケティングの効果測定や医療統計、機械学習のロジスティック回帰など、幅広い分野で最尤推定は活用されているのです。
尤度関数とは?最尤推定を理解するうえでの核心部分です
続いては尤度関数について確認していきます。
最尤推定を理解するうえで避けて通れないのが、尤度関数という概念です。
尤度関数とは、あるパラメータの値を仮定したときに、観測されたデータが得られる確率、あるいは確率密度を表す関数のことを指します。
ここで注意したいのが、確率と尤度は似ているようで意味が異なるという点です。
| 用語 | 何を固定するか | 何を変数として見るか |
|---|---|---|
| 確率 | パラメータ | データ |
| 尤度 | データ | パラメータ |
確率は、パラメータを固定したうえでデータが変動するという見方をします。
一方の尤度は、すでに観測されたデータを固定し、パラメータの方を動かして考えるという逆転の発想です。
この視点の切り替えこそが、最尤推定の核心部分と言えるでしょう。
尤度関数は一般的にL(θ)という形で表記されることが多く、θはパラメータを意味します。
独立に得られたn個のデータx1からxnがあるとき、尤度関数は次のように定義されます。
L(θ)= f(x1|θ) × f(x2|θ) × … × f(xn|θ)
ここでfは確率密度関数、または確率質量関数を表します。
実際の計算では、この尤度関数をそのまま扱うと掛け算が延々と続き、非常に扱いにくくなります。
そこで登場するのが対数尤度という考え方です。
対数をとることで、掛け算を足し算に変換できるため、微分計算が格段に楽になります。
対数は単調増加関数であるため、対数尤度を最大化するパラメータと、元の尤度関数を最大化するパラメータは一致します。
この性質があるからこそ、実務では対数尤度を用いた計算が標準的に行われているのです。
尤度関数を最大化するという発想さえ押さえておけば、最尤推定の理解は大きく前進するでしょう。
最尤推定の求め方とは?具体的な計算手順を確認しましょう
続いては最尤推定の求め方を確認していきます。
最尤推定量を求める手順は、大まかに次のような流れで進んでいきます。
| 手順 | 内容 |
|---|---|
| 手順1 | データが従うと考えられる確率分布を仮定する |
| 手順2 | 尤度関数を設定する |
| 手順3 | 対数をとり対数尤度関数に変換する |
| 手順4 | パラメータで微分し、方程式を解く |
| 手順5 | 得られた解が最大値であることを確認する |
この流れに沿って、正規分布の平均を推定する例を見ていきましょう。
データx1からxnが平均μ、分散σ二乗の正規分布に従うと仮定します。
対数尤度関数は次のようになります。
log L(μ)= -n/2 log(2πσ二乗) – Σ(xi-μ)二乗 / (2σ二乗)
これをμで微分し、0と置いて解くと、μの最尤推定量は次の通りになります。
μハット = (x1+x2+…+xn) / n
驚くべきことに、正規分布の平均に関する最尤推定量は、単純な標本平均と完全に一致します。
普段何気なく使っている平均という値が、実は最尤推定という理論的な裏付けを持っていたわけです。
これは決して偶然ではありません。
数式の展開を丁寧に追っていくと、必然的にこの結果へとたどり着くのです。
一方で分散の最尤推定量を求める場合には、少し注意が必要な点も出てきます。
分散のパラメータについても同様に微分して求めることは可能ですが、得られる推定量には若干の偏りが生じることが知られています。
この偏りを補正したものが、いわゆる不偏分散と呼ばれる指標です。
最尤推定量が常に偏りのない推定量になるとは限らない、という点は覚えておきたいポイントでしょう。
最尤推定と統計学の関係とは?他の推定手法との違いも整理します
続いては最尤推定と統計学全体との関係について確認していきます。
統計学における推定手法は、最尤推定だけではありません。
代表的なものとして、モーメント法やベイズ推定といった手法も存在します。
| 推定手法 | 基本的な考え方 |
|---|---|
| 最尤推定 | データが得られる確率を最大化するパラメータを選ぶ |
| モーメント法 | 標本の平均や分散などを理論値と一致させる |
| ベイズ推定 | 事前分布とデータをもとに事後分布を計算する |
モーメント法は、標本から計算できる平均や分散といった統計量を、理論上のモーメントと一致させることでパラメータを求める手法です。
計算は比較的シンプルですが、最尤推定と比べると推定の効率が劣る場合が多いとされています。
一方のベイズ推定は、パラメータそのものを確率変数とみなし、事前の知識を確率分布として組み込む点が最尤推定との大きな違いです。
最尤推定はパラメータを固定された未知の値として扱うのに対し、ベイズ推定はパラメータ自体に確率分布を仮定するという発想の違いがあります。
どちらが優れているというより、目的や状況に応じて使い分けるべきものと考えるのが自然でしょう。
では、なぜ最尤推定がこれほどまでに広く使われているのでしょうか。
その理由の一つに、最尤推定量が持つ優れた統計的性質が挙げられます。
サンプルサイズが十分に大きくなると、最尤推定量は真のパラメータに収束していくという一致性を持ちます。
また、漸近的に正規分布に従うという性質や、漸近的に効率的であるという性質も知られています。
これらの理論的な裏付けがあるからこそ、多くの統計モデルにおいて最尤推定が標準的な手法として採用されているのです。
回帰分析やロジスティック回帰、時系列モデルなど、統計学の幅広い分野で最尤推定の考え方が基盤となっています。
最尤推定が使われる具体例とは?身近な場面をイメージしてみましょう
続いては最尤推定が実際に使われる具体例を確認していきます。
理論だけを聞いてもピンとこないという方のために、身近な場面に置き換えて考えてみましょう。
アンケート調査における比率の推定
ある商品に対する満足度調査を行い、100人中80人が満足と回答したとします。
このとき、母集団全体における満足度の割合を推定する場面で最尤推定が活躍します。
直感的には80パーセントという数字がそのまま推定値になりそうですが、これはまさに二項分布における最尤推定の考え方そのものです。
機械学習のロジスティック回帰
顧客が商品を購入するかどうかを予測するロジスティック回帰モデルでは、パラメータの推定に最尤推定が用いられています。
購入するか、しないかという二値の結果に対して、最も説明力の高いパラメータの組み合わせを最尤推定によって探し出しているのです。
機械学習における損失関数の設計思想も、突き詰めれば尤度の最大化と密接に関わっています。
品質管理における不良率の推定
工場の生産ラインで、ある期間に検査した製品のうち何個が不良品であったかを記録し、その不良率を推定する場面でも最尤推定は活用されます。
ポアソン分布や二項分布を仮定し、観測されたデータから母集団全体の不良率を最尤推定によって導き出すのです。
最尤推定は決して抽象的な理論だけの話ではありません。
アンケート集計、機械学習モデル、品質管理といった実務の現場で、日々活用されている実践的な手法なのです。
こうした具体例からも分かる通り、最尤推定は統計学の教科書の中だけに閉じた概念ではありません。
データをもとに意思決定を行うあらゆる場面で、最尤推定の考え方が土台となっているのです。
最尤推定を学ぶメリットとは?押さえておきたい注意点も解説します
続いては最尤推定を学ぶメリットと、押さえておきたい注意点について確認していきます。
最尤推定を理解することには、どのようなメリットがあるのでしょうか。
まず一つ目は、統計モデルの背後にある仮定を理解できるようになる点です。
平均値や回帰係数といった何気なく使っている統計量が、実は最尤推定という枠組みのもとで導かれていると知ることで、分析結果への理解が格段に深まります。
二つ目は、機械学習アルゴリズムの理解が進むという点です。
ニューラルネットワークの学習における損失関数の多くも、尤度の最大化という発想から設計されています。
最尤推定の考え方を知っておくことで、なぜその損失関数が選ばれているのかという背景まで理解できるようになるでしょう。
一方で、最尤推定にはいくつか注意すべき点も存在します。
| 注意点 | 内容 |
|---|---|
| 分布の仮定への依存 | 誤った確率分布を仮定すると推定結果も歪んでしまう |
| サンプルサイズの影響 | データ数が少ないと推定の精度が下がりやすい |
| 解析的に解けない場合がある | 複雑なモデルでは数値計算による近似が必要になる |
特に注意したいのが、確率分布の仮定に依存するという点でしょう。
データの実態にそぐわない分布を仮定してしまうと、どれだけ数式を正確に計算しても、得られる推定値は的外れなものになりかねません。
また、サンプルサイズが小さい場合には、最尤推定量が持つ望ましい性質、つまり一致性や漸近正規性といった性質が十分に発揮されないこともあります。
さらに、実際の分析で扱うモデルは、正規分布や二項分布のように解析的に解ける単純なものばかりではありません。
複雑なモデルになると、微分方程式を手計算で解くことが難しくなり、ニュートン法などの数値最適化アルゴリズムを用いて近似的に解を求める必要が出てきます。
統計ソフトウェアやプログラミング言語のライブラリを使えば、こうした複雑な計算も自動で処理してくれますが、その裏側で何が行われているかを理解しておくことは非常に重要です。
仕組みを理解したうえでツールを使うのと、ブラックボックスのまま使うのとでは、分析の質に大きな差が生まれるでしょう。
まとめ
今回は最尤推定について、意味や読み方、尤度関数との関係、具体的な計算手順や活用例まで幅広く解説してきました。
最尤推定とは、観測されたデータが得られる確率を最大にするようなパラメータを選び出す推定方法です。
その核心にあるのは、尤度関数という考え方であり、確率とは逆にデータを固定してパラメータを動かすという視点の転換がポイントでした。
正規分布の平均を推定すると単純な標本平均と一致するなど、普段何気なく使っている統計量の裏には、最尤推定という理論的な支えがあることも見えてきたのではないでしょうか。
アンケート調査、機械学習のロジスティック回帰、品質管理における不良率の推定など、最尤推定は実務のさまざまな場面で活用されている、非常に実践的な考え方です。
一方で、分布の仮定やサンプルサイズによって推定精度が左右されるという注意点もあわせて押さえておく必要があるでしょう。
最尤推定という言葉を聞いて難しく感じていた方も、この記事を通じてその発想がシンプルであることを感じていただけたなら幸いです。
ぜひ今後の統計学習や実務の場面で、最尤推定の考え方を役立ててみてください。