ヒストグラム
概要
ヒストグラムは、値の個数を数えて分布を描く図です。 1 つの変数の値域を連続したビン(区間)に分割し、各ビンに含まれる観測数を数えることで、単変量の分布を要約します。
平均のような単一の要約統計量との違いは、分布の「形」がそのまま残る点です。 平均は分布を 1 つの数値に潰してしまうので、歪み(skewness)や多峰性(複数の山があること)、外れ値の有無までは読み取れません。 ヒストグラムはこれらをもっとも直接的に把握できるため、ある変数の性質をまず確かめたいときの出発点になります。
ビン数の決め方
ビンの数(あるいは幅)は分布の見え方に強く影響するため、妥当なデフォルト値を自動的に選ぶための経験則がいくつか存在します。 本アプリが用意しているのは Sturges、Scott、Freedman–Diaconis の 3 つで、以下ではこの順に紹介します。
Sturges の公式は、標本サイズのみからビン数 を決めます:
これはデータがおおむね正規分布に従うという前提で導かれています。 が の対数でしか増えないため、$n$ が大きくなるとビンが少なすぎて(幅が広すぎて)分布の細部を潰してしまう傾向があります。 たとえば では ですが、$n$ を 100 倍の 10000 にしても にしかなりません。
Scott の公式は、正規性を仮定した積分平均二乗誤差の最小化から、ビン幅 をデータのばらつきそのものより導きます:
ここで は標本標準偏差であり、$n-1$ で補正した不偏推定量を用います。 を使うため外れ値の影響を受けやすく、外れ値があると が膨らんでビン幅が過大になります。 ビン幅が過大になることで、本体側の分布がわずかな本数の棒に潰れてしまう場合もあります。
Freedman–Diaconis の公式は、$\sigma$ の代わりに四分位範囲(IQR、箱ひげ図参照)を用います:
IQR は極端な値の影響を受けにくい頑健なばらつきの指標です。 から までの中央 の幅しか見ないので、両端の値がどれだけ極端でも IQR そのものは変わりません。 そのためデータに外れ値がある場合や正規分布から大きく外れている場合でも安定して機能し、Scott の公式より汎用的な既定値として安全に使えます。
計算されたビン幅 が非正または非有限になる場合は、Tunny Dashboard は不正なビン数を生成する代わりに Sturges の公式へフォールバックします。 これは、同一値が多く Freedman–Diaconis の IQR が に潰れる場合や、データがほぼ定数で Scott の になる場合に起こります。 Sturges の公式は標本サイズ だけからビン数を決めるため、データの中身がどれだけ退化していても有効な値を返せます。
特性・限界
- ヒストグラムの見た目(山の数、歪みの向き)は、選んだビン数やビン幅によって大きく変わり得ます。たとえばビン数を倍に増やすことで、1 つに見えていた山が 2 つに割れる場合もあります。ヒストグラムはデータそのものではなく、データに対する 1 つの「見方」に過ぎないことを、常に意識する必要があります。
- ヒストグラムは、真の分布を離散的なビンで区切って推定した不連続な近似です。カーネル密度推定(KDE)との違いは、この不連続さを滑らかな連続曲線に置き換える点にあります。ですが KDE は、ビン境界に依存する問題をバンド幅の選択に依存する問題へ置き換えているに過ぎないため、どちらが「より正しい」とは一概には言えません。それでも棒グラフに滑らかな KDE を重ねることで、分布の形が読み取りやすくなることが多いです。
- どの公式を使っても、得られるビン数は常に にクランプされます。病的な入力や非常に大きなサンプルでも、無制限あるいは実用に耐えないほど細かいビンにならないようにするためです。
- ビンは、最後のビンを除いて半開区間
となり、最後のビンのみ両端を含む閉区間
となります。これは
numpy.histogramと同じ規約であり、データの最大値が捨てられずに必ず最後のビンへカウントされることを保証します。
アプリ内での利用箇所
- Histogram ウィジェット:選択したパラメータや目的関数の値の分布を表示し、歪みや多峰性の把握、最適化の探索がどの領域に集中しているかの確認に用います。Fit セレクタでは、最尤推定によるパラメトリック密度を重ね描きできます(分布フィッティングを参照)。
参考文献
- Sturges, H. A. (1926). The Choice of a Class Interval. Journal of the American Statistical Association, 21(153), 65–66. https://doi.org/10.1080/01621459.1926.10502161
- Scott, D. W. (1979). On optimal and data-based histograms. Biometrika, 66(3), 605–610. https://doi.org/10.1093/biomet/66.3.605
- Freedman, D., & Diaconis, P. (1981). On the histogram as a density estimator: L2 theory. Zeitschrift für Wahrscheinlichkeitstheorie und verwandte Gebiete, 57(4), 453–476. https://doi.org/10.1007/BF01025868