常態分布(normal distribution,中國大陸作正態分布,台灣作常態分布),物理學中通稱高斯分佈(Gaussian distribution)[1],是一個非常常見的連續機率分佈。正態分佈在統計學上十分重要,經常用在自然和社會科學來代表一個不明的隨機變量。[2][3]
此條目翻譯品質不佳。 (2022年4月24日) |
「normal distribution」的各地常用譯名 | |
---|---|
中國大陸 | 正態分布 |
臺灣 | 常態分布 |
港澳 | 常態分佈、正態分佈 |
日本 | 正規分布 |
韓國 | 正規分布 |
正態分佈的數學期望值值或期望值,可解釋為位置參數,決定了分佈的位置;其方差的平方根或標準差可解釋尺度參數,決定了分佈的幅度。[5]
中心極限定理指出,在特定條件下,一個具有有限均值和方差的隨機變量的多個樣本(觀察值)的平均值本身就是一個隨機變量,其分佈隨着樣本數量的增加而收斂於正態分佈。因此,許多與獨立過程總和有關的物理量,例如測量誤差,通常可被近似為正態分佈。
正態分佈的機率密度函數曲線呈鐘形,因此人們又經常稱之為鐘形曲線(類似於寺廟裏的大鐘,因此得名)。我們通常所說的標準正態分佈是位置參數,尺度參數的正態分佈[5](見右圖中紅色曲線)。
概要
正態分佈是自然科學與行為科學中的定量現象的一個方便模型。各種各樣的心理學測試分數和物理現象比如光子計數都被發現近似地服從正態分佈。儘管這些現象的根本原因經常是未知的,理論上可以證明如果把許多小作用加起來看做一個變量,那麼這個變量服從正態分佈(在R.N.Bracewell的Fourier transform and its application中可以找到一種簡單的證明)。正態分佈出現在許多區域統計:例如,採樣分佈均值是近似地正態的,即使被採樣的樣本的原始群體分佈並不服從正態分佈。另外,正態分佈資訊熵在所有的已知均值及方差的分佈中最大,這使得它作為一種均值以及方差已知的分佈的自然選擇。正態分佈是在統計以及許多統計測試中最廣泛應用的一類分佈。在機率論,正態分佈是幾種連續以及離散分佈的極限分佈。
正態分佈最早是狄默夫在1718年著作的書籍的(Doctrine of Change),及1734年發表的一篇關於二項分佈文章中提出的,當二項隨機變量的位置參數n很大及形狀參數p為1/2時,則所推導出二項分佈的近似分佈函數就是正態分佈。拉普拉斯在1812年發表的《分析機率論》(Theorie Analytique des Probabilites)中對棣莫佛的結論作了擴展到二項分佈的位置參數為n及形狀參數為1>p>0時。現在這一結論通常被稱為棣莫佛-拉普拉斯定理。
拉普拉斯在誤差分析試驗中使用了正態分佈。勒讓德於1805年引入最小平方法這一重要方法;而高斯則宣稱他早在1794年就使用了該方法,並通過假設誤差服從正態分佈給出了嚴格的證明。
將正態分佈稱作「鐘形曲線」的習慣可以追溯到Jouffret他在1872年首次提出這個術語(Bell curve)用來指代二元正態分佈。正態分佈這個名字還被查爾斯·皮爾士、法蘭西斯·高爾頓、威爾赫姆·萊克希斯在1875分別獨立地使用。這個術語是不幸的,因為它反映和鼓勵了一種謬誤,即很多機率分佈都是正態的。(請參考下面的「實例」)
這個分佈被稱為「正態」或者「高斯」正好是史蒂格勒名字由來法則的一個例子,這個法則說「沒有科學發現是以它最初的發現者命名的」。
正態分佈的定義
有幾種不同的方法用來說明一個隨機變量。最直觀的方法是機率密度函數,這種方法能夠表示隨機變量每個取值有多大的可能性。累積分佈函數是一種機率上更加清楚的方法,請看下邊的例子。還有一些其他的等價方法,例如cumulant、特徵函數、矩生成函數以及cumulant-生成函數。這些方法中有一些對於理論工作非常有用,但是不夠直觀。請參考關於機率分佈的討論。
正態分佈的機率密度函數均值為 方差為 (或標準差)是高斯函數的一個實例:
- 。
(請看指數函數以及.)
如果一個隨機變量服從這個分佈,我們寫作 ~ . 如果並且,這個分佈被稱為標準正態分佈,這個分佈能夠簡化為
- 。
右邊是給出了不同參數的正態分佈的函數圖。
正態分佈中一些值得注意的量:
累積分佈函數是指隨機變量小於或等於的機率,用機率密度函數表示為
正態分佈的累積分佈函數能夠由一個叫做誤差函數的特殊函數表示:
標準正態分佈的累積分佈函數習慣上記為,它僅僅是指,時的值,
將一般正態分佈用誤差函數表示的公式簡化,可得:
它的反函數被稱為反誤差函數,為:
該分位數函數有時也被稱為probit函數。probit函數已被證明沒有初等原函數。
矩生成函數,或稱矩母函數被定義為的期望值。
正態分佈的矩產生函數如下:
可以通過在指數函數內配平方得到。
特徵函數被定義為的期望值,其中是虛數單位. 對於一個正態分佈來講,特徵函數是:
把矩生成函數中的換成就能得到特徵函數。
性質
正態分佈的一些性質:
此章節尚無任何內容,需要擴充。 |
一些正態分佈的一階矩如下:
階數 | 原動差 | 主動差 | 累積量 |
---|---|---|---|
0 | 1 | 0 | |
1 | 0 | ||
2 | |||
3 | 0 | 0 | |
4 | 0 |
標準正態的所有二階以上的累積量為零。
此章節尚無任何內容,需要擴充。 |
正態分佈有一個非常重要的性質:在特定條件下,大量統計獨立的隨機變量的平均值的分佈趨於正態分佈,這就是中心極限定理。中心極限定理的重要意義在於,根據這一定理的結論,其他機率分佈可以用正態分佈作為近似。
- 參數為和的二項分佈,在相當大而且接近0.5時近似於正態分佈(有的參考書建議僅在與至少為5時才能使用這一近似)。
近似正態分佈平均數為且方差為.
- 一泊松分佈帶有參數當取樣樣本數很大時將近似正態分佈.
近似正態分佈平均數為且方差為.
這些近似值是否完全充分正確取決於使用者的使用需求
正態分佈是無限可分的機率分佈。
正態分佈是嚴格穩定的機率分佈。
在實際應用上,常考慮一組數據具有近似於正態分佈的機率分佈。若其假設正確,則約68.3%數值分佈在距離平均值有1個標準差之內的範圍,約95.4%數值分佈在距離平均值有2個標準差之內的範圍,以及約99.7%數值分佈在距離平均值有3個標準差之內的範圍。稱為「68-95-99.7法則」或「經驗法則」。
數字比率 標準差值 |
機率 | 包含之外比例 | |
---|---|---|---|
百分比 | 百分比 | 比例 | |
639σ 0.318 | 25% | 75% | 3 / 4 |
490σ 0.674 | % 50 | % 50 | 1 / 2 |
458σ 0.994 | 68% | 32% | 1 / 3.125 |
1σ | 9492% 68.268 | 0508% 31.731 | 1 / 4872 3.151 |
552σ 1.281 | 80% | 20% | 1 / 5 |
854σ 1.644 | 90% | 10% | 1 / 10 |
964σ 1.959 | 95% | 5% | 1 / 20 |
2σ | 9736% 95.449 | 0264% 4.550 | 1 / 895 21.977 |
829σ 2.575 | 99% | 1% | 1 / 100 |
3σ | 0204% 99.730 | 9796% 0.269 | 1 / 370.398 |
527σ 3.290 | 99.9% | 0.1% | 1 / 1000 |
592σ 3.890 | 99.99% | 0.01% | 1 / 000 10 |
4σ | 666% 99.993 | 334% 0.006 | 1 / 787 15 |
173σ 4.417 | 99.999% | 0.001% | 1 / 000 100 |
σ 4.5 | 99.9993204653751% | 0.0006795346249% | 1 / 159.5358 147 3.4 / 000000 (每一邊) 1 |
638σ 4.891 | % 99.9999 | % 0.0001 | 1 / 000000 1 |
5σ | 9426697% 99.999 | 0573303% 0.000 | 1 / 744278 1 |
724σ 5.326 | 99% 99.999 | 01% 0.000 | 1 / 000000 10 |
729σ 5.730 | 999% 99.999 | 001% 0.000 | 1 / 000000 100 |
σ 6 | 9998027% 99.999 | 0001973% 0.000 | 1 / 797346 506 |
410σ 6.109 | 9999% 99.999 | 0001% 0.000 | 1 / 000000000 1 |
951σ 6.466 | 99999% 99.999 | 00001% 0.000 | 1 / 000000000 10 |
502σ 6.806 | 999999% 99.999 | 000001% 0.000 | 1 / 000000000 100 |
7σ | 99.9999999997440% | 000000256% 0.000 | 1 / 682215445 390 |
相關分佈
估計
多元正態分佈的協方差矩陣的估計的推導是比較難於理解的。它需要瞭解譜原理(spectral theorem)以及為什麼把一個標量看做一個1×1矩陣的跡(trace)而不僅僅是一個標量更合理的原因。請參考協方差矩陣的估計(estimation of covariance matrices)。
此章節尚無任何內容,需要擴充。 |
常見實例
此章節尚無任何內容,需要擴充。 |
某飲料公司裝瓶流程嚴謹,每罐飲料裝填量符合平均600毫升,標準差3毫升的正態分配法則。隨機選取一罐,求(1)容量超過605毫升的機率;(2)容量小於590毫升的機率。
容量超過605毫升的機率 = p ( X > 605)= p ( ((X-μ) /σ) > ( (605 – 600) / 3) )= p ( Z > 5/3) = p( Z > 1.67) = 1 - 0.9525 = 0.0475
容量小於590毫升的機率 = p (X < 590) = p ( ((X-μ) /σ) < ( (590 – 600) / 3) )= p ( Z < -10/3) = p( Z < -3.33) = 0.0004
6-標準差(6-sigma或6-σ)的品質管制標準
6-標準差(6-sigma或6-σ),是製造業流行的品質管制標準。在這個標準之下,一個標準正態分配的變數值出現在正負三個標準差之外,只有2* 0.0013= 0.0026 (p (Z < -3) = 0.0013以及p(Z > 3) = 0.0013)。也就是說,這種品質管制標準的產品不良率只有萬分之二十六。假設例中的飲料公司裝瓶流程採用這個標準,而每罐飲料裝填量符合平均600毫升,標準差3毫升的正態分配。那麼預期裝填容量的範圍應該多少?
6-標準差的範圍 = p ( -3 < Z < 3)= p ( - 3 < (X-μ) /σ < 3) = p ( -3 < (X- 600) / 3 < 3)= p ( -9 < X – 600 < 9) = p (591 < X < 609) 因此,預期裝填容量應該介於591至609毫升之間。
此章節尚無任何內容,需要擴充。 |
此章節尚無任何內容,需要擴充。 |
此章節尚無任何內容,需要擴充。 |
假設某校入學新生的智力測驗平均分數與標準差分別為100與12。那麼隨機抽取50個學生,他們智力測驗平均分數大於105的機率?小於90的機率?
本例沒有正態分配的假設,還好中心極限定理提供一個可行解,那就是當隨機樣本長度超過30,樣本平均數近似於一個正態變數,
因此標準正態變數。
平均分數大於105的機率
平均分數小於90的機率
計算統計應用
在計算機模擬中,經常需要生成正態分佈的數值。最基本的一個方法是使用標準的正態累積分佈函數的反函數。除此之外還有其他更加高效的方法,Box-Muller轉換就是其中之一。另一個更加快捷的方法是ziggurat算法。下面將介紹這兩種方法。一個簡單可行的並且容易編程的方法是:求12個在(0,1)上均勻分佈的和,然後減6(12的一半)。這種方法可以用在很多應用中。這12個數的和是Irwin-Hall分佈;選擇一個方差12。這個隨即推導的結果限制在(-6,6)之間,並且密度為12,是用11次多項式估計正態分佈。
Box-Muller方法是以兩組獨立的隨機數U和V,這兩組數在(0,1]上均勻分佈,用U和V生成兩組獨立的標準正態分佈隨機變量X和Y:
- 。
這個方程的提出是因為二自由度的卡方分佈(見性質4)很容易由指數隨機變量(方程中的lnU)生成。因而通過隨機變量V可以選擇一個均勻環繞圓圈的角度,用指數分佈選擇半徑然後轉換成(正態分佈的)x,y坐標。
參考文獻
外部連結
參見
Wikiwand in your browser!
Seamless Wikipedia browsing. On steroids.
Every time you click a link to Wikipedia, Wiktionary or Wikiquote in your browser's search results, it will show the modern Wikiwand interface.
Wikiwand extension is a five stars, simple, with minimum permission required to keep your browsing private, safe and transparent.