これまでの記事では、平均値や中央値、分散、標準偏差、偏差値、箱ひげ図など、データの特徴を要約するためのさまざまな統計量について学んできました。
これらの指標をより深く理解するうえで欠かせないのが、正規分布(Normal Distribution)という考え方です。
正規分布は、統計学で最も重要な確率分布の一つです。身長、血圧、測定誤差、製品寸法など、複数の要因が重なって生じる現象では、正規分布に近い形が観察されることがあります。
また、信頼区間、仮説検定、回帰分析など、多くの統計手法の理論には正規分布が深く関係しています。偏差値も、正規分布と標準偏差の考え方を理解すると、その意味をより正確に読み取れるようになります。
ただし、現実のデータがすべて正規分布になるわけではありません。正規分布は、あらゆるデータに当てはまる万能な形ではなく、データや推定量の性質を理解するための重要な基準と考える必要があります。
今回は、正規分布とは何か、どのような特徴を持つのか、そしてなぜ統計学でこれほど重要なのかについて学んでいきましょう。
正規分布とは
正規分布とは、平均値を中心として左右対称に広がる連続型の確率分布です。

グラフにすると中央が最も高く、左右に向かうにつれてなだらかに低くなる形をしています。その形から、一般にベル型分布や釣り鐘型分布とも呼ばれます。
正規分布では、平均値に近い値ほど現れやすく、平均値から離れるほど現れる可能性が低くなります。
ただし、正規分布の左右の裾は、理論上どこまでも続きます。極端に大きな値や小さな値が出現する確率は非常に低いものの、完全に0になるわけではありません。
正規分布は確率分布であるため、曲線の高さそのものが確率を表しているわけではありません。ある範囲に含まれる確率は、その範囲に対応する曲線下の面積によって表されます。曲線全体の面積は1、すなわち100%になります。
正規分布の数式
正規分布の確率密度関数は、次の式で表されます。
f(x)=\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)ここで、\mu は母平均、\sigma^2 は母分散、\sigma は母標準偏差を表します。
この式を暗記する必要はありません。重要なのは、正規分布の形が平均値と標準偏差の二つによって決まるという点です。
平均値は分布の中心を決め、標準偏差は分布の広がりを決めます。
正規分布の特徴
正規分布には、いくつかの重要な特徴があります。
まず、正規分布は平均値を中心として左右対称です。したがって、平均値より大きい値が現れる確率と、平均値より小さい値が現れる確率は、それぞれ50%です。
また、理論上の正規分布では、
\text{平均値}=\text{中央値}=\text{最頻値}となります。
平均値、中央値、最頻値がすべて分布の中央に位置するため、データの中心が非常に明確です。
さらに、正規分布は平均値と標準偏差だけで形が決まります。
平均値が変化すると、分布の形を保ったまま全体が左右に移動します。一方、標準偏差が大きくなると曲線は低く広がり、標準偏差が小さくなると高く細い形になります。
なお、曲線全体の面積は常に1であるため、分布が横に広がれば、その分だけ山の高さは低くなります。
68・95・99.7ルール
正規分布には、標準偏差とデータの含まれる範囲に関する有名な性質があります。
これを68・95・99.7ルール、または経験則と呼びます。
正規分布では、平均値を\mu、標準偏差を\sigmaとすると、
\mu-\sigma \leq X \leq \mu+\sigmaの範囲に約68.3%、
\mu-2\sigma \leq X \leq \mu+2\sigmaの範囲に約95.4%、
\mu-3\sigma \leq X \leq \mu+3\sigmaの範囲に約99.7%の値が含まれます。
一般的な説明では、それぞれ約68%、約95%、約99.7%と表します。
例えば、ある集団の身長が平均170cm、標準偏差5cmの正規分布に従っているとします。
平均値±1標準偏差は、
170 \pm 5なので、165cmから175cmの範囲に約68%の人が含まれます。
平均値±2標準偏差は、
170 \pm 10なので、160cmから180cmの範囲に約95%の人が含まれます。
同様に、平均値±3標準偏差である155cmから185cmの範囲には、約99.7%の人が含まれることになります。
この性質を使うと、平均値と標準偏差から、データがどの範囲にどの程度含まれるかを大まかに把握できます。
標準正規分布とは
正規分布には、平均値や標準偏差が異なるさまざまな形があります。
それらを共通の尺度で扱うために用いられるのが、標準正規分布です。
標準正規分布は、平均値が0、標準偏差が1となる正規分布です。
ある値xを標準正規分布に変換するには、次の式を用います。
z=\frac{x-\mu}{\sigma}この値をZスコア(標準得点)と呼びます。
Zスコアは、ある値が平均値から標準偏差何個分離れているかを表します。
例えば、平均点70点、標準偏差10点のテストで80点を取った場合、
z=\frac{80-70}{10}=1となります。
これは、「80点は平均点より1標準偏差高い位置にある」ことを意味します。
これは、80点が平均値より1標準偏差高い位置にあることを意味します。
偏差値は、このZスコアを平均50、標準偏差10となるように変換した指標です。
なぜ正規分布が重要なのか
正規分布が重要である理由の一つは、多数の小さな要因が加算的に影響する現象で、正規分布に近い形が現れやすいことです。
例えば、身長は遺伝、栄養、生活環境など、さまざまな要因の影響を受けます。測定誤差も、機器の状態、測定者の操作、環境条件など、多くの小さな誤差が重なって生じます。
このように、一つの要因だけで決まるのではなく、多数の独立した小さな要因が積み重なる場合、結果の分布が正規分布に近づくことがあります。
もう一つの重要な理由は、中心極限定理です。
中心極限定理とは、一定の条件のもとで、元のデータの分布が正規分布でなくても、標本数が大きくなるにつれて標本平均の分布が正規分布に近づくという定理です。
ここで重要なのは、元の観測値そのものが正規分布になるのではなく、標本平均の分布が正規分布に近づくという点です。
この性質があるため、標本平均を用いた信頼区間や仮説検定など、多くの統計的推測が可能になります。
多くの統計手法は何が正規分布なのか
「統計手法は正規分布を前提としている」と説明されることがありますが、何が正規分布に従う必要があるのかは、手法によって異なります。
例えば、1標本t検定では、標本数が小さい場合、対象となる変数の母集団分布が正規分布に近いことが重要になります。
一方、線形回帰分析では、説明変数や目的変数そのものが必ず正規分布である必要はありません。一般的な推測では、モデルから得られる誤差や残差の分布が重要になります。
また、標本数が大きい場合には、中心極限定理によって推定量の分布が正規分布に近づき、観測値の分布が多少歪んでいても分析が比較的安定することがあります。
したがって、「データが正規分布でなければ分析できない」と機械的に判断するのではなく、利用する手法がどのような仮定を必要としているのかを確認することが大切です。
正規分布ではないデータも多い
現実のデータがすべて正規分布に従うわけではありません。
例えば、所得、資産、住宅価格、SNSのフォロワー数、動画の再生回数、論文の被引用数などは、一部の対象だけが非常に大きな値を持つため、右に長い尾を持つ分布になることがあります。
また、病気の発症件数や事故件数のような回数データでは、ポアソン分布など別の確率分布が適している場合があります。
生存時間や故障までの時間などでは、指数分布やワイブル分布が用いられることがあります。
さらに、0か1、成功か失敗、採択か不採択といった二値データは、正規分布ではなくベルヌーイ分布や二項分布によって表されます。
このように、データの種類や発生過程によって適切な確率分布は異なります。正規分布は重要ですが、すべてのデータを正規分布として扱えばよいわけではありません。
データが正規分布かどうかを確認する方法
データの分布を確認する際には、まずグラフを見ることが重要です。
ヒストグラムを作成すると、分布が左右対称か、山が一つか、どちらかに長い尾があるかを確認できます。
また、正規Q-Qプロットを用いると、データが正規分布からどの程度ずれているかを視覚的に確認できます。点がおおむね直線上に並んでいれば、正規分布に近いと判断できます。
シャピロ・ウィルク検定などの正規性検定を用いる方法もありますが、検定結果だけで判断することには注意が必要です。
標本数が非常に多い場合には、実質的には問題にならない小さなずれでも有意になることがあります。反対に、標本数が少ない場合には、正規分布から大きく外れていても検出できないことがあります。
そのため、正規性を確認するときは、ヒストグラム、Q-Qプロット、外れ値、標本数、分析目的などを総合的に検討することが重要です。
正規分布はどのような場面で使われるのか
正規分布は、さまざまな分野で利用されています。
教育分野では、テスト得点の分布や偏差値の計算を理解する際に役立ちます。ただし、実際のテスト得点は上限と下限があるため、必ずしも正規分布になるとは限りません。
医療分野では、身長、血圧、検査値などの分布を記述したり、基準範囲を設定したりする際に正規分布が参考にされることがあります。ただし、すべての検査値が正規分布するわけではなく、対数変換後に正規分布へ近づくデータもあります。
製造業では、製品寸法や重量のばらつきを管理し、工程が安定しているかを確認するために正規分布が利用されます。
金融分野では、収益率や価格変動をモデル化する際に正規分布が使われることがあります。ただし、実際の金融データは正規分布よりも極端な変動が生じやすいため、正規分布だけではリスクを過小評価する場合があります。
AIや機械学習では、モデルの誤差分布、初期値の設定、ベイズ統計の事前分布などに正規分布が用いられることがあります。
このように、正規分布は現代のデータ分析を支える基本的な確率分布ですが、利用する際にはデータやモデルとの適合性を確認する必要があります。
例題1(基礎)
問題
あるテストの点数は平均70点、標準偏差10点で、おおむね正規分布に従っています。
約68%の生徒は、何点から何点の範囲に含まれるでしょうか。
解答
60点から80点
解説
正規分布では、平均値±1標準偏差の範囲に約68%のデータが含まれます。
したがって、
70 \pm 10を計算すると、
60 \leq X \leq 80となります。
そのため、約68%の生徒が60点から80点の範囲に含まれると考えられます。
例題2(応用)
問題
ある製品の長さは平均100mm、標準偏差2mmで、おおむね正規分布に従っています。
約95%の製品は、何mmから何mmの範囲に含まれるでしょうか。
解答
96mmから104mm
解説
正規分布では、平均値±2標準偏差の範囲に約95%のデータが含まれます。
したがって、
100 \pm (2 \times 2)となり、
100 \pm 4と計算できます。
そのため、
96 \leq X \leq 104となり、約95%の製品が96mmから104mmの範囲に含まれると考えられます。
まとめ
正規分布とは、平均値を中心として左右対称に広がるベル型の確率分布です。理論上の正規分布では、平均値、中央値、最頻値が一致し、分布の形は平均値と標準偏差によって決まります。
また、正規分布では、平均値±1標準偏差の範囲に約68%、平均値±2標準偏差の範囲に約95%、平均値±3標準偏差の範囲に約99.7%の値が含まれます。
正規分布が統計学で重要なのは、現実の一部のデータが正規分布に近い形を示すだけでなく、中心極限定理によって標本平均の分布が正規分布に近づくためです。この性質が、信頼区間や仮説検定など、多くの統計的推測の基礎となっています。
一方で、すべてのデータが正規分布に従うわけではありません。所得や被引用数のような歪んだデータ、回数データ、二値データなどには、別の分布や分析方法が適している場合があります。
したがって、統計分析では正規分布を当然の前提とするのではなく、データの分布、標本数、分析手法が必要とする仮定を確認することが重要です。
次の記事
「中心極限定理とは?なぜ標本平均は正規分布に近づくのかをわかりやすく解説」
正規分布を理解したら、次は統計的推測の土台となる中心極限定理を学びます。
中心極限定理を理解すると、元のデータが正規分布でなくても、なぜ標本平均を用いて母平均の推定や仮説検定を行えるのかが見えてきます。次回からは、記述統計から一歩進み、標本をもとに母集団を推測する統計的推測へ進んでいきましょう。

コメント