分布フィッティング
概要
分布フィッティングは、ヒストグラムに理論分布を重ねる手法です。 ヒストグラムと同じサンプルから最尤推定したパラメトリックな確率密度を、棒の上に重ね描きします。
ヒストグラム単体との違いは、分布の形の判断が言葉から数値に変わる点です。 ヒストグラムから読み取れるのは「だいたい釣鐘型」「右に歪んでいる」といった定性的な印象までですが、分布フィッティングはこれを「どの分布族がどのパラメータでもっともよく記述するか」という定量的な言明に変えます。 分布族とパラメータが数値で残ることで、レポーティングや、対数正規に従う量(厳密に正の工学的応答量に多い)の発見、信頼性評価の下地として使えるようになります。
対応する分布族は、正規、対数正規、ワイブルの 3 つです。 後者 2 つは、厳密に正のサンプルにのみ適用できます。 後述するように、対数正規は に正規分布の推定を適用し、ワイブルの MLE 方程式にも が現れます。 どちらもゼロ以下の値が混ざると対数が定義できなくなるため、正のサンプルという制限が付きます。
数式
サンプル に対する最尤推定量:
正規分布 は、閉形式で求まります:
対数正規分布は、 に正規分布の MLE を適用します(パラメータ )。
ワイブル分布(形状 、尺度 、密度 )には閉形式がなく、形状は MLE 方程式
を二分法で解きます(左辺は について単調)。 その後 を求めます。 この方程式はスケール不変なので、Tunny Dashboard は先に で正規化し、大きな での のオーバーフローを防いでいます。
モデル比較には赤池情報量規準(AIC)を使います。 3 分布族ともパラメータ数は 2 なので
となり、罰則項 はどの分布族でも共通の値になります。 そのためここでは、AIC による順位付けは尤度による順位付けと等価です。 それでも AIC を提示しているのは、パラメータ数の異なる分布族を比較する場合との連続性を保つためです。
確率密度は全体の面積が になるよう正規化されているので、カウント表示のヒストグラムにそのまま重ねると縦軸の桁が合いません。 そこで密度を重ねるときは、PDF に (サンプル数 × ビン幅)を掛けることで、曲線と棒が同じ縦軸を共有するようにしています。
特性・限界
- MLE は適合度検定ではありません。3 分布族の中で最良の AIC は「この 3 つの中でもっともましなもの」でしかなく、二峰性や重い裾を持つサンプルにも必ず勝者が付きます。たとえば山が 2 つあるサンプルでも、3 つのうちどれかが最良として選ばれるため、AIC の値だけからは当てはまりの悪さがわかりません。パラメータを引用する前に、重ね描き曲線と棒を目視で照合してください。
- サンプルにゼロ以下の値が含まれると、対数正規とワイブルは自動的に適用不能となり、正規のみが残ります。この場合の「最良」は正規しか候補がなかった結果なので、3 分布族を比べたうえでの結論ではない点に注意してください。
- ワイブルの形状パラメータには解釈があります。$k < 1$ は減少ハザード(初期故障型)、$k = 1$ は指数分布に帰着、$k > 1$ は増加ハザードを表します。形状パラメータ 1 つで故障の起こり方の傾向を表現できるため、ワイブル分布は信頼性工学で広く使われています。
- MLE の分散推定量は、不偏標本分散に対して 倍だけ小さいバイアスを持ちますが、フィッティングが意味を持つサンプルサイズでは無視できます。たとえば なら、差はわずか です。
アプリ内での利用箇所
- Histogram ウィジェット → Fit セレクタ:選択した分布族(Auto なら最良 AIC の分布族)をヒストグラムに重ね描きし、適用可能な各分布族のフィット済みパラメータと AIC を表示します。
参考文献
- Akaike, H. (1974). A new look at the statistical model identification. IEEE Transactions on Automatic Control, 19(6), 716–723. https://doi.org/10.1109/TAC.1974.1100705