機率與統計第 5 章

Continuous Random Variables

5 個概念

本章目錄

這一章把第 1 章的之分,從已經收集的資料延伸到取值還未知的隨機變數:當可能的結果填滿一個區間,而不是一份可以逐一數算的清單時,機率必須以曲線下的面積來測量,不能從一張結果表讀出來。由這一個想法出發,本章建立兩個標準的連續模型:均勻分布在區間上的平坦密度,以及指數分布對隨機等待的建模,包括讓它與眾不同的無記憶性

結果填滿一個區間,而不是一份清單

定義

當一個隨機變數的可能結果填滿數線上的一個區間,而不是形成一份一個個分開、可以逐一列出的清單,這個隨機變數就是連續(continuous)的:這正是第 1 章用在資料上的離散/連續測試,在這裡用於一個還沒被觀察的結果

怎樣判斷

問原則上能不能出現一個嚴格介於兩個值之間的值。計數得到的事件數、成功次數或商品件數不能;測量出來的時間、長度或分量可以,無論你看得多仔細。

例子

假設一名顧客在自動販賣機前的決定時間可以落在一段秒數的任何位置;同一名顧客買的商品件數不能落在 2 和 3 之間。前者是連續的;後者是離散的。

陷阱

「碼錶只顯示到小數點後兩位,所以時間本身一定是離散的。」 顯示器把一個連續的量四捨五入,並沒有改變被測量的是什麼:真正經過的時間原則上仍然可以落在中間任何位置。「連續變數還是可以逐一列出來的,只是值很多而已。」 任何兩個連續的值之間總夾著另一個值,沒完沒了:沒有「下一個值」可以列,這正是為什麼前幾章那種靠清單的機率需要換成面積。

機率是密度曲線下的面積

定義

機率密度函數(probability density function)f(x)f(x) 這樣描述一個連續隨機變數:機率是它的曲線之下、某個區間上的面積,而不是曲線在單獨一點的高度

怎樣判斷

對任何區間,機率就是面積:平坦的一段是底乘以高,更一般地是曲線下的區域,而所有可能的值上的總面積恰好是 1。對任何一個確切的值,區間的寬度為零,所以面積、也就是機率,是零:P(X=x)=0P(X=x)=0

例子

假設一個轉盤落在 0 到 10 的區間上任何位置,密度平坦,為 0.1。它落在 2 到 6 之間的機率是這個長方形的面積,4×0.1=0.44 \times 0.1 = 0.4;它恰好落在 x=6x=6 的機率是 0×0.1=00 \times 0.1 = 0

一條假設的連續密度曲線:兩點之間的陰影區域是一個機率,而單獨一點因為寬度為零,圍不出面積,因此機率也是零。
一條假設的連續密度曲線:兩點之間的陰影區域是一個機率,而單獨一點因為寬度為零,圍不出面積,因此機率也是零。由 figures/fig-density-area.py 繪製
陷阱

「恰好在 xx 的機率就是曲線的高度 f(x)f(x)。」 f(x)f(x) 是密度,不是機率:它要乘上一個寬度才會變成機率,而單獨一點的寬度是零。「既然對每一個 xx 都有 P(X=x)=0P(X=x)=0,那就沒有任何值真的可能出現。」 總有某個值會出現;只是沒有任何單獨的值自己帶有正機率,只有區間才有。

均勻分布:區間上一片平坦的密度

定義

當連續隨機變數 XX 的密度對 aabb 之間的每一個 xx 都是常數 f(x)=1ba\displaystyle f(x) = \frac{1}{b-a},它就服從均勻分布(uniformly distributed),記為 XU(a,b)X \sim U(a,b)

怎樣判斷

確認密度在一個固定的區間 [a,b][a,b] 上是平坦的。是的話,任何子區間 (c,d)(c,d) 的機率就是面積:寬度乘以那個常數高度,(dc)1ba\displaystyle (d-c)\cdot\frac{1}{b-a},無論這個子區間位於 [a,b][a,b] 的哪個位置。它的中心和離散程度單由兩個端點決定:μ=a+b2\displaystyle \mu = \frac{a+b}{2}σ=(ba)212\sigma = \sqrt{\frac{(b-a)^2}{12}}

例子

假設一輛校園接駁車在整點後 0 到 24 分鐘的任何一分鐘到站的可能性都相等:XU(0,24)X \sim U(0,24),所以在這個區間上 f(x)=124f(x) = \frac{1}{24}

例題詳解
  1. 確認密度。 XU(0,24)X \sim U(0,24),所以對 [0,24][0,24] 內的每一個 xxf(x)=124f(x) = \frac{1}{24}
  2. 求區間的寬度。P(5<X<11)P(5<X<11),寬度是 115=611-5=6
  3. 寬度乘以高度。 P(5<X<11)=6×124=0.25P(5<X<11) = 6 \times \frac{1}{24} = 0.25

常見錯誤:只用區間的寬度而沒有乘以 1ba\frac{1}{b-a};兩個端點相減的順序對調。

陷阱

「一個區間的機率就是它的寬度。」 單看寬度漏了高度:一個 6 分鐘的時段是 6×124\displaystyle 6 \times \frac{1}{24},不是 6。「『均勻』是說每一個確切的值都是等可能的,就像一顆骰子的六個面一樣。」 密度是常數,但每一個單獨的值的機率仍然是零,正如上一節所確立的:「均勻」形容的是平坦的曲線,不是等可能的點。

指數分布:為隨機等待建模

定義

指數分布(exponential distribution)XExp(m)X \sim \text{Exp}(m) 為直到某個隨機事件發生為止的等待時間建模,密度為 f(x)=memxf(x) = me^{-mx}x0x \ge 0;其中率參數(rate parameter)mm 是平均等待時間的倒數,m=1μ\displaystyle m=\frac{1}{\mu},而這個參數在本書以外幾乎都寫作 λ\lambda。它的標準差等於它的平均數

怎樣判斷

問這個量是不是等到某件事發生為止的等待,而且短等待比長等待常見。的密度是平坦的;指數密度在 x=0x=0 最高,隨著 xx 增大而縮小,累積機率為 P(X<x)=1emxP(X<x) = 1-e^{-mx}

例子

客服工單陸續進來,等下一張進來的平均等待時間是 5 分鐘(假設的例子):XExp(0.2)X \sim \text{Exp}(0.2),因為 m=15=0.2m=\frac{1}{5}=0.2

例題詳解
  1. 求率參數。 平均等待時間 μ=5\mu=5 分鐘,所以 m=1μ=15=0.2m=\frac{1}{\mu}=\frac{1}{5}=0.2
  2. 套用累積分布函數(cumulative distribution function,)。 P(X<x)=1emxP(X<x) = 1-e^{-mx}
  3. 代入計算。 P(X<3)=1e0.2×3=1e0.610.5488=0.4512P(X<3) = 1-e^{-0.2\times3} = 1-e^{-0.6} \approx 1-0.5488 = 0.4512

常見錯誤:把平均數 μ\mu 而不是它的倒數代入 mm;漏掉指數上的負號。

延伸說明

用軟體核對,而不會靜靜地得到一個錯的答案。 各種工具對你該交給它哪個數並不一致。R 直接要率,所以 pexp(3, rate = 0.2) 重現上面的 0.4512。Python 的 SciPy 要的是尺度(scale),也就是率的倒數:正確的呼叫是 expon.cdf(3, scale = 1/0.2),即 scale = 5。寫成 expon.cdf(3, 0.2) 看起來對,其實不對:第二個位置引數是平移,不是率,所以這個呼叫會成功,並回傳一個不同的數,不會回報任何錯誤。這就是值得點名的失敗模式:工具大聲地跟你不一致,只花你一分鐘;工具靜靜地跟你不一致,會讓學習者對本來一直正確的算術失去信心。當這裡的結果和螢幕上的結果不同,先查清楚函數要的是哪個引數,再懷疑方法。

兩種連續密度的形狀對照:均勻分布的平坦長方形(左,陰影標出正文算過的同一個 5 到 11 分鐘時段),對比指數分布前高後低、逐漸衰減的曲線(右,陰影標出正文算過的同一個 3 分鐘以內的等待)。
兩種連續密度的形狀對照:均勻分布的平坦長方形(左,陰影標出正文算過的同一個 5 到 11 分鐘時段),對比指數分布前高後低、逐漸衰減的曲線(右,陰影標出正文算過的同一個 3 分鐘以內的等待)。由 figures/fig-uniform-vs-exponential.py 繪製
陷阱

「率參數就是平均等待時間,所以 m=0.2m=0.2 表示典型的等待是 0.2 分鐘。」 率計數的是每單位時間內的事件數,而平均等待時間是它的倒數:μ=1m=5\displaystyle \mu = \frac{1}{m} = 5 分鐘。因此 mm 越大,事件來得越頻繁,等待越短,而不是越長。「一個固定的率,表示等待是等距出現的。」 率描述的是許多次等待的平均,不是任何一次等待的模式:個別的等待時間隨機變化,通常很短,偶爾很長。

延伸說明

指數分布有一個關係密切的離散親戚。如果相鄰兩個事件之間的等待服從平均數為 μ\mu 的指數分布,那麼一個固定時間單位內這類事件的數目,就服從一個為計數區間內事件數而設的分布,平均率為 λ=1μ\displaystyle \lambda=\frac{1}{\mu}:同一個背後的隨機過程,一次描述成事件之間的連續等待,一次描述成事件的離散計數。這個離散計數是另一個獨立的概念,在建立離散隨機變數的地方講。

無記憶性:為什麼等待會忘記過去

定義

無記憶性(memoryless property)是指,存活到時間 rr 對剩餘的等待沒有任何改變:對每一個 r,t0r,t \ge 0P(X>r+tX>r)=P(X>t)P(X>r+t \mid X>r) = P(X>t)

怎樣判斷

把「已知已經存活到 rr,再存活 tt 個單位」的條件機率,跟「重新抽一次,從零開始存活 tt 個單位」的機率比較。對指數分布來說,兩者在代數上永遠相等;對大多數其他分布則不然。

例子

假設一個零件的壽命平均數是 8 年,所以它的率參數是 m=18=0.125\displaystyle m=\frac{1}{8}=0.125。它已經運轉了 3 年,再用 5 年的機率等於一個全新零件用 5 年的機率:P(X>5)=e0.125×5=e0.6250.5353P(X>5)=e^{-0.125 \times 5}=e^{-0.625}\approx 0.5353

一條指數密度曲線(實線),以及同一條曲線平移到從已經過 3 年的時刻開始(虛線):平移後的尾部恰好與一條從零開始的新曲線重疊,這是無記憶性的視覺標誌。
一條指數密度曲線(實線),以及同一條曲線平移到從已經過 3 年的時刻開始(虛線):平移後的尾部恰好與一條從零開始的新曲線重疊,這是無記憶性的視覺標誌。由 figures/fig-memoryless.py 繪製
陷阱

「無記憶性是說零件不會老化。」 只在狹義上成立:這個模型沒有內建磨損;它不是說物理上什麼都沒有變,只是說過去的存活對剩餘的等待不帶任何機率上的資訊。「已經存活了異常長的時間,它一定『該』快要故障了。」 這是賭徒謬誤式的解讀;這個性質說的恰好相反:已經過的時間永遠不會提高或降低剩餘等待的機率。

把連續機率用起來綜合運用

再來一個假設的例子:急診室的等待時間。在測量之前,這個等待是一個隨機變數:它可以落在一段分鐘數的任何位置,不是一份固定的清單,所以它的機率是,不是一張列出各種機會的表,而它恰好等於任何一個確切分鐘數的機率都是零,無論那一段感覺上多麼可能。

如果範圍內每一種等待長度都同樣說得通,就合用:密度是常數,寬度相等的時段無論落在哪裡都帶有相等的機率。真實的等待通常不是這樣:短等待一般比長等待常見,於是改為用上,它的密度在零最高,隨著等待增長而下降,由一個參數決定,而這個參數是平均等待時間的倒數。

指數模型還帶著一個更進一步、更尖銳的主張,就是它的:一名已經等了 20 分鐘的病人,再等 10 分鐘的可能性跟一名剛走進來的病人相比,既不更高也不更低;「已經等了很久」本身並不是等待快要結束的證據。

資料來源

  1. 1 OpenStax Introductory Statistics §5.1: Continuous Probability Functions來源
  2. 2 OpenStax Introductory Statistics §5.2: The Uniform Distribution來源
  3. 3 OpenStax Introductory Statistics §5.3: The Exponential Distribution來源
  4. 4 NIST/SEMATECH e-Handbook §1.3.6.6.2: Uniform Distribution (mean (A+B)/2, standard deviation sqrt((B-A)^2/12))來源
  5. 5 SciPy scipy.stats.expon documentation — the exponential is parameterized by the rate lambda, supplied as scale = 1/lambda來源