機率與統計第 4 章
Discrete Random Variables
本章目錄
這一章把一個隨機試驗變成一個你可以拿來計算的數:離散、它的,以及不用列出每一個結果就能描述它的兩個摘要數字:和。章末講離散隨機變數在實務上最常見的一種形狀:,以及求它自己的平均數和標準差的。
什麼是隨機變數
隨機變數(random variable)在結果未知之前,把一個數賦予隨機試驗的結果;當它的可能取值可以逐一數出、逐一列出,值與值之間有真正的空隙時,它就是離散(discrete)的。
問兩件事:它是否把一個數賦予一個尚未知道的結果?是的話,它就是隨機變數。然後套用第 1 章判斷時用的同一個「計數還是測量」測試:一個值可以嚴格落在兩個相鄰的可能取值之間嗎?不可以的話,它就是離散的。
一位餐車老闆記錄隨機選出的一個午餐時間內食物過敏特殊訂單的數目(假設的例子)。這個數目只能是 0、1、2、3,依此類推,1 和 2 之間沒有任何有效的值,所以它是離散隨機變數。
「寫下『X = 3』和說『有 30% 的機會』是同一類的陳述。」 不是: 指的是變數可能取的一個值,而 指的是這個值有多大可能出現;隨機變數和它的機率是不同的東西。「離散隨機變數的取值一定是從 0 開始的連續整數。」 離散只要求取值可以列出、值與值之間有真正的空隙;負數、跳過某些值,或者間距不均,仍然是離散的。
建立一個有效的機率分布
離散隨機變數的機率質量函數(probability mass function),簡稱 PMF (機率質量函數),把它能取的每一個值與該值的機率配對。
一張表只有在兩條規則都成立時才是有效的 PMF (機率質量函數):每一個機率都介於 0 與 1 之間(含),而且所有機率加起來恰好等於 1。只符合其中一條並不足夠。
餐車老闆為每個午餐時間 0、1、2 或 3 筆特殊訂單擬了一張表:機率是 0.35、0.30、0.25、0.10。每一個都介於 0 與 1 之間,而且加起來等於 1,所以這張表是有效的 PMF (機率質量函數)。
「只要每一個數都是合法的機率,這張表就算有效。」 單靠這一點並不足夠:一張 0.35、0.30、0.25、0.20 的表有四個看似合法的數,加起來卻是 1.10,在理應涵蓋所有可能性的結果之上,聲稱的機會超過了必然。「機率分布一定要把機率平均分給每一個值,否則就不算真正隨機。」 沒有任何規定要求機率相等;只要上面兩條規則都成立,一個大幅偏向某一個值的分布,和一個平均的分布完全一樣有效。
期望值:長期平均
期望值(expected value)記為 ,是離散隨機變數在多次重複之下的長期平均結果。
把每個可能的值乘以它自己的機率,再把乘積相加:。這描述的是多次重複之下結果集中在哪裡,不是任何單一次試驗會發生什麼。
就餐車的表而言,從 0.35、0.30、0.25、0.10 算出的 是一個不屬於 0、1、2、3 任何一個的長期平均,下面逐步展示。
- 列出每個值和它的機率。 從表中:,。
- 把每個值乘以它的機率。 ;;;。
- 把乘積相加。 筆特殊訂單。
常見錯誤:把四個 值直接取平均而完全不依機率加權;把乘積的總和除以結果的數目(4),這樣就把第 2 步已經做過的加權重複算了一次。
「期望值就是你在任何一次試驗中最預期會看到的值,也就是最可能出現的結果。」 那個量是眾數,而且經常和 不一致:這裡 0 是單一最可能出現的數目,機率是 0.35,但 。「既然是平均數,期望值一定是變數能取的其中一個值。」 不必:整數的平均數很少本身也是整數,就像一個班級的平均兄弟姊妹數目可以是 1.8,卻沒有任何學生真的有 1.8 個兄弟姊妹。
標準差:結果通常偏離多遠
標準差(standard deviation)記為 ,衡量隨機變數的結果通常偏離它的 多遠。
把每個值與 的距離平方,讓高於和低於的距離不會互相抵消,再依各自的機率加權、相加,然後開平方根:。
就餐車的表而言,;把每個值與 1.10 的距離的平方依其機率加權再相加,得 0.99,所以 筆特殊訂單。
「標準差是 0 代表計算出錯了,因為隨機變數理應會變動。」 這不是錯誤: 正確地描述了一個永遠取同一個值、完全沒有變動的隨機變數。「標準差和期望值基本上衡量的是同一件事。」 它們回答不同的問題: 問結果集中在哪裡; 問結果通常離那裡多遠,兩個隨機變數可以其中一個相同而另一個差別很大。
二項分布,以及它什麼時候適用
二項隨機變數(binomial random variable)計算 次獨立試驗中成功的次數,每次試驗都有相同的兩個可能結果,成功的機率 也相同;記為 。
三個條件一起檢查:固定的試驗次數 ;每次試驗恰好兩個結果,成功(機率 )和失敗(機率 );以及各次試驗互相獨立, 從一次試驗到下一次都不變。
一位籃球員的罰球有 70% 會投進,每一次罰球都視為與其他各次獨立(假設的例子),她罰球 8 次。「投進的球數」是二項的,,。她恰好投進 6 球的機率是多少?
- 確認條件,找出 、、。 固定次數、兩個結果、獨立而機率不變,全部成立;這裡 ,,,目標 。
- 計算排列方式的數目。 :在 8 次罰球中,投進 6 球、沒進 2 球可以出現的順序有這麼多種。
- 計算其中一種排列的機率。 。
- 相乘。 :恰好投進 6 球的機會大約是 30%。
常見錯誤:漏掉 ,得出的是投進和沒進某一種特定順序的機率,而不是全部順序;把指數對調成 ,算出來的是沒投進 球而不是成功 次的機率。
「任何『若干次嘗試中的成功次數』都算是二項的。」 各次嘗試會互相影響的話就不算:以取後不放回的方式抽 8 張牌來數紅色的牌,每一次抽牌都改變機率,破壞了獨立性;那裡適用的是另一種分布。「『至少』可以用計算恰好那個數目的機率來回答。」 「至少投進 6 球」問的是一個範圍: 和 合在一起,而不是單獨的 一個值。
二項隨機變數的平均數與標準差
二項隨機變數的和可以簡化為 和 ,不需要完整的機率分布表。
平均數: 乘以 ;標準差: 乘以 再乘以 ,然後開平方根。兩者對任何有效的 都成立,不只是 。
對那位罰球球員來說,,,:預期投進 球; 球。
「簡便公式 只在 時才適用。」 它對每一個有效的 都成立; 只是最容易用手驗算的情況,因為在那裡成功和失敗的可能性相等。「 一定是整數,對應一個實際可能的次數。」 這裡 ,在一場比賽的 8 次罰球中她永遠不可能恰好投進這個數;那個「平均數不需要是可以達到的值」的事實,同樣適用於這條簡便公式。
一次看到整個分布綜合運用
最後一個假設的例子:一個客服中心,每一通來電都以 0.6 的機率獨立地一次解決,一位主管記錄每 5 通來電中一次解決的數目。
這個數目是一個:附在一個尚未觀察到的結果上的數,取 0 到 5 這些可以列出的值。寫出它的,就是把這六個值各自配上一個機率,而只有當每一項都介於 0 與 1 之間、六項加起來恰好等於 1 時才有效。每一次試驗都獨立,有相同的兩個結果和相同的固定機率,所以這個數目也是二項的,,它的和都化為只含 和 的簡短算式。
描述的是很多組五通來電的長期平均,不是對這一組的保證; 描述的是典型的一組偏離這個平均多遠。兩個數都不承諾接下來會發生什麼;合起來,它們描述了多次重複之下傾向發生什麼的形狀,一次以表的形式呈現,一次以公式的形式呈現。
資料來源
- 1 OpenStax Introductory Statistics §4.1: Probability Distribution Function (PDF) for a Discrete Random Variable — 來源
- 2 OpenStax Introductory Statistics §4.2: Mean or Expected Value and Standard Deviation — 來源
- 3 OpenStax Introductory Statistics §4.3: Binomial Distribution — 來源
- 4 NIST/SEMATECH e-Handbook of Statistical Methods §1.3.6.6.18: Binomial Distribution (states the closed-form PMF and the mean np, SD √(np(1−p))) — 來源