인지야공

인지야공/강의 요약/10번째 글

빅데이터를 위한 확률과 통계 — 현장에서 쓰던 것들의 이름 찾기

고등학교 때 확률과 통계는 억지로 머리에 넣어야 하는데 표현까지 애매모호한 그 무엇이었다. 현상을 겪어 본 적도, 왜 해야 하는지도 모르는 상태였으니 당연했다.

현장에서 오래 일한 뒤에 같은 과목을 다시 들으니 순서가 반대가 되어 있었다. 분산과 표준편차, 정규분포, 관리한계 — 이미 해 오던 것들에 이름과 근거를 붙이는 작업이었다. 그래서 이 강의는 “새로 배운 것”보다 “왜 그렇게 해도 되는지”를 회수한 기록에 가깝다.

K-MOOC 매치업 과정으로, 7주 구성이다.

주차주제
1확률 — 표본공간과 사건, 확률의 성질, 조건부 확률
2확률분포 — 이산·연속 확률분포, 기댓값과 분산
3정규분포 — 표준정규분포, 표준화, 정규분포로의 근사화
4기술통계학 — 도수분포표, 통계 그래프
5표본분포 — 모집단의 분포, 표본평균의 분포, 카이제곱·t 분포
6표본비율의 분포와 추정 — 점 추정, 구간 추정, 표본의 크기
7추정 및 가설검정 — 검정 절차, 양측 검정과 p 값

확률 — 조건을 걸면 분모가 바뀐다

시행·표본공간·사건의 정의부터 시작한다. 여기까지는 집합 이야기다. 합사건·곱사건·차사건· 여사건, 그리고 교환·결합·분배·드 모르간 법칙.

P(A)=n(A)n(S),P(Ac)=1−P(A),P(A∪B)=P(A)+P(B)−P(A∩B)P(A) = \frac{n(A)}{n(S)}, \qquad P(A^c) = 1 - P(A), \qquad P(A \cup B) = P(A) + P(B) - P(A \cap B)

조건부 확률이 이 주차의 핵심이다.

P(B∣A)=n(A∩B)n(A)=P(A∩B)P(A)P(B \mid A) = \frac{n(A \cap B)}{n(A)} = \frac{P(A \cap B)}{P(A)}

정의만 보면 밋밋한데, 강의의 도입 예제가 좋았다. 요일별·원인별 교통사고 사망자 표를 놓고 음주운전 사망자 중 토요일이었을 확률을 묻는다. 표 전체가 분모가 아니라 음주운전 열의 합계가 분모가 된다. 조건을 건다는 것은 표본공간을 갈아 끼우는 일이라는 게 표 하나로 보인다.

여기서 곱셈정리가 따라 나온다.

P(A∩B)=P(A) P(B∣A)P(A \cap B) = P(A)\,P(B \mid A)

복원추출이면 두 번째 뽑기의 확률이 그대로고, 비복원추출이면 분모가 하나 줄어든다. 공장 A·B·C 의 생산 비율과 불량률을 주고 불량품이었을 때 C 공장에서 나왔을 확률을 구하는 예제로 마무리하는데, 이게 사실상 베이즈 정리다.

배반과 독립은 반대말이 아니다

가장 오래 남은 대목이다.

정의뜻
배반사건A∩B=∅A \cap B = \varnothing동시에 일어날 수 없다
독립사건P(A∩B)=P(A)P(B)P(A \cap B) = P(A)P(B)서로 영향을 주지 않는다

주사위에서 AA 를 짝수, BB 를 홀수라 하면 둘은 배반이다. 그런데 P(B)=1/2P(B) = 1/2 인 반면 P(B∣A)=0P(B \mid A) = 0 이다. AA 가 일어났다는 사실이 BB 의 확률을 0으로 바꿔 버렸으니 영향을 준 것이고, 따라서 종속이다.

배반사건은 독립이 아니라 종속이다.

확률분포 — 분포는 데이터의 생김새에 대한 가정이다

확률변수는 표본공간의 각 원소를 실수에 대응시킨 것이다. 값이 띄엄띄엄하면 이산, 구간 안의 모든 값을 취하면 연속이다. 연속에서는 P(X=x)=0P(X = x) = 0 이라서 넓이로만 확률을 말한다는 점이 이산과의 결정적 차이다.

f(x)≥0,∫αβf(x) dx=1,P(a≤X≤b)=∫abf(x) dxf(x) \ge 0, \qquad \int_{\alpha}^{\beta} f(x)\,dx = 1, \qquad P(a \le X \le b) = \int_a^b f(x)\,dx

분포확률질량함수쓰는 자리
이산균등f(x)=1/nf(x) = 1/n모든 값이 같은 확률
베르누이f(x)=px(1−p)1−xf(x) = p^x(1-p)^{1-x}1회 시행, 결과 두 가지
이항 B(n,p)B(n,p)f(x)=nCx px(1−p)n−xf(x) = {}_nC_x\,p^x(1-p)^{n-x}베르누이 시행 nn 회 반복
포아송f(x)=e−mmxx!f(x) = \dfrac{e^{-m}m^x}{x!}단위 시간·공간당 발생 횟수

포아송은 전제조건 세 가지를 명시해 준 게 좋았다 — 독립성(사건끼리 독립), 일정성 (발생 확률이 일정), 비집락성(아주 짧은 구간에서 두 번 이상 일어날 확률이 0에 가까움). 설비 고장 건수나 결점 수에 포아송을 갖다 붙이기 전에 확인해야 하는 조건이 이것이다. “주당 평균 3건의 산업재해”에서 하루 기준으로 바꾸면 m=3/7m = 3/7 로 바뀐다는 예제가 단위 환산의 함정을 잘 짚는다.

기댓값과 분산

E(X)=∑xipi,V(X)=∑(xi−m)2pi=E(X2)−{E(X)}2E(X) = \sum x_i p_i, \qquad V(X) = \sum (x_i - m)^2 p_i = E(X^2) - \{E(X)\}^2

연속에서는 합이 적분으로 바뀔 뿐 형태가 같다. 실무에서 자주 쓰는 것은 선형 성질 쪽이다.

E(aX+b)=aE(X)+b,V(aX+b)=a2V(X),σ(aX+b)=∣a∣ σ(X)E(aX+b) = aE(X) + b, \qquad V(aX+b) = a^2 V(X), \qquad \sigma(aX+b) = |a|\,\sigma(X)

분산에는 상수항이 영향을 주지 않고, 배율은 제곱으로 들어간다. 단위를 바꿀 때마다 확인하게 되는 규칙이다.

분포기댓값분산
이항 B(n,p)B(n,p)npnpnp(1−p)np(1-p)
포아송mmmm

포아송은 평균과 분산이 같다. 실제 계수 데이터에서 분산이 평균보다 훨씬 크면 포아송 가정이 깨졌다는 신호다.

정규분포 — 표준화는 자를 바꾸는 일

f(x)=12π σ e−(x−m)22σ2,X∼N(m,σ2)f(x) = \frac{1}{\sqrt{2\pi}\,\sigma}\,e^{-\frac{(x-m)^2}{2\sigma^2}}, \qquad X \sim N(m, \sigma^2)

곡선은 x=mx = m 에 대칭이고, 아래 넓이는 1이며, 표준편차가 커지면 납작해지고 평균이 바뀌면 좌우로 움직인다. 외워 둘 값은 세 개다.

P(m−σ≤X≤m+σ)=0.6826,P(m±2σ)=0.9544,P(m±3σ)=0.9974P(m-\sigma \le X \le m+\sigma) = 0.6826, \quad P(m \pm 2\sigma) = 0.9544, \quad P(m \pm 3\sigma) = 0.9974

3σ3\sigma 가 99.74% 라는 것 — 관리도의 관리한계선이 왜 ±3σ\pm 3\sigma 인지가 여기 있다.

표준화는 Z=(X−m)/σZ = (X - m)/\sigma 로 N(0,12)N(0, 1^2) 으로 옮기는 것이다. 강의의 예제가 직관적이었다. 국어(평균 65, 표준편차 6)에서 75점, 수학(55, 10)에서 75점, 영어(60, 8)에서 74점을 받았을 때 어느 과목을 잘한 것인가?

과목원점수ZZ
국어75(75−65)/6=3.33(75-65)/6 = 3.33
수학75(75−55)/10=2.00(75-55)/10 = 2.00
영어74(74−60)/8=1.75(74-60)/8 = 1.75

같은 75점이라도 국어가 가장 잘한 것이다. 서로 다른 자로 잰 값을 비교하려면 자를 통일해야 한다 — 이것이 표준화의 전부다.

근사화

원래 분포조건근사
이항 B(n,p)B(n,p)nn 이 크면N(np, npq)N(np,\ npq)
포아송m>5m > 5N(m, m)N(m,\ m)

항체 생성률 80% 인 약을 100명에게 투여했을 때 70~90명일 확률 같은 문제는, 이항으로 스물한 개 항을 더하는 대신 N(80,42)N(80, 4^2) 으로 바꿔 P(−2.5≤Z≤2.5)=0.9876P(-2.5 \le Z \le 2.5) = 0.9876 으로 끝난다.

기술통계학 — 요약은 손실이다

기술통계학은 수집한 데이터를 요약·묘사·설명하는 기법이고, 추측통계학은 그것을 바탕으로 추론·예측하는 기법이다. 이 구분이 4주차의 뼈대다.

도수분포표 작성 절차는 순서를 그대로 외워 둘 만하다.

  1. 최댓값·최솟값으로 범위 R=xmax−xminR = x_{max} - x_{min} 을 구한다
  2. 계급의 수 kk 를 정한다
  3. 계급구간 c=R/kc = R/k 를 결정한다
  4. 계급의 경계를 정한다
  5. 계급값(양 끝값의 평균)을 구한다
  6. 계급도수 fif_i 를 센다

여기에 상대도수(fi/Nf_i/N), 누적도수(Fi=∑k≤ifkF_i = \sum_{k \le i} f_k), 누적 상대도수를 붙이면 표가 완성된다.

그래프특징
막대그래프계급구간이 없다. 범주형 — 좋아하는 색, 학점
히스토그램계급구간이 있다. 연속형 — 키, 온도, 나이
줄기 잎 그림분포를 보면서 원래 관측값을 잃지 않는다
원그래프중심각 = 360°×360° \times 상대도수
시계열 그림가로축이 시간
상자그림여러 집단의 분포를 나란히 비교할 때

막대그래프와 히스토그램을 구분해서 가르치는 게 새삼스러워 보여도, 실무 보고서에서 가장 자주 틀리는 지점이다. 막대 사이를 붙였는가 띄웠는가에 “계급구간이 있는가”라는 정보가 실려 있다.

다섯 숫자 요약과 상자그림

최솟값, Q1Q_1, 중앙값, Q3Q_3, 최댓값. 그리고 IQR=Q3−Q1IQR = Q_3 - Q_1 로 이상치 경계를 잡는다.

하한=Q1−1.5×IQR,상한=Q3+1.5×IQR\text{하한} = Q_1 - 1.5 \times IQR, \qquad \text{상한} = Q_3 + 1.5 \times IQR

표본분포 — 표본평균도 확률변수다

이 주차가 강의 전체의 허리다. 표본을 뽑을 때마다 평균이 다르게 나온다. 그러니 표본평균 자체가 분포를 갖는 확률변수다.

E(Xˉ)=μ,V(Xˉ)=σ2nE(\bar{X}) = \mu, \qquad V(\bar{X}) = \frac{\sigma^2}{n}

평균은 모평균과 같고, 분산은 nn 으로 나뉜다. 표본을 4배로 늘리면 표준오차는 절반이 된다. “표본을 더 뽑으면 정확해진다”는 말의 정확한 형태가 이 식이다. 표본평균의 표준편차를 평균의 표준오류(standard error)라 부른다.

경우를 네 가지로 나눠 정리해 준 표가 이 과목에서 가장 실용적이었다.

모집단모분산쓰는 통계량
정규분포알고 있다Z=Xˉ−μσ/n∼N(0,1)Z = \dfrac{\bar{X} - \mu}{\sigma/\sqrt{n}} \sim N(0,1)
정규분포 아님알고 있다n≥25n \ge 25 이면 위와 같이 근사 (중심극한정리)
정규분포모른다T=Xˉ−μs/n∼t(n−1)T = \dfrac{\bar{X} - \mu}{s/\sqrt{n}} \sim t(n-1)
정규분포 아님모른다n≥25n \ge 25 이면 근사

현실에서는 모분산을 아는 경우가 거의 없다. 그래서 실무는 대부분 3행과 4행이다.

카이제곱 분포와 t 분포

표준정규를 제곱해서 더하면 카이제곱이 된다.

∑i=1nZi2∼χ2(n),(n−1)S2σ2∼χ2(n−1)\sum_{i=1}^{n} Z_i^2 \sim \chi^2(n), \qquad \frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)

모평균 μ\mu 대신 표본평균 Xˉ\bar{X} 를 쓰는 순간 자유도가 하나 줄어 n−1n-1 이 된다. 표본분산의 분모가 왜 n−1n-1 인가에 대한 답이 여기서 나온다.

t 분포는 표준정규를 카이제곱으로 나눈 것이다.

T=ZV/n∼t(n)T = \frac{Z}{\sqrt{V/n}} \sim t(n)

모양은 정규분포와 비슷한데 꼬리가 두껍다. 자유도가 커지면 정규분포에 수렴하고, 표본이 30 이상이면 사실상 정규분포로 봐도 된다. 모분산을 몰라도 표본분산으로 대신할 수 있다는 것이 t 분포의 존재 이유다.

추정 — 점 하나가 아니라 구간으로

점 추정량 θ^\hat{\theta} 가 E(θ^)=θE(\hat{\theta}) = \theta 를 만족하면 불편 추정량, 아니면 편의 추정량이고 그 차이 E(θ^)−θE(\hat{\theta}) - \theta 가 편의(bias)다.

통계량불편 추정량인가
표본평균 Xˉ\bar{X}모평균의 불편 추정량 — 맞다
표본분산 s2s^2모분산의 불편 추정량 — 맞다
표본표준편차 ss모표준편차의 불편 추정량이 아니다

마지막 줄이 함정이다. 제곱근이 비선형이라 E(s)≠σE(s) \ne \sigma 가 된다. 분산은 편향이 없는데 표준편차는 있다.

신뢰구간 — 모분산을 아는 경우.

Xˉ−zα/2σn≤μ≤Xˉ+zα/2σn\bar{X} - z_{\alpha/2}\frac{\sigma}{\sqrt{n}} \le \mu \le \bar{X} + z_{\alpha/2}\frac{\sigma}{\sqrt{n}}

모분산을 모르고 표본이 작으면 zz 대신 tα/2(n−1)t_{\alpha/2}(n-1) 을 쓴다. 신뢰도 95% 면 z=1.96z = 1.96, 99% 면 2.582.58 이다.

구간의 폭이 신뢰도·분산·표본 크기 세 가지에만 달려 있다는 점이 중요하다. 그래서 거꾸로 “신뢰구간 길이를 얼마 이하로 만들려면 표본이 몇 개 필요한가”를 풀 수 있다.

L=2zα/2σn≤L0  ⟹  n≥(2zα/2σL0)2L = 2 z_{\alpha/2}\frac{\sigma}{\sqrt{n}} \le L_0 \;\Longrightarrow\; n \ge \left(\frac{2z_{\alpha/2}\sigma}{L_0}\right)^2

정밀도를 2배로 올리려면 표본은 4배가 필요하다. 시험 계획을 세울 때 이 관계를 모르면 근거 없이 표본 수를 정하게 된다.

모분산의 신뢰구간은 카이제곱으로 잡는다.

(n−1)S2χα/22≤σ2≤(n−1)S2χ1−α/22\frac{(n-1)S^2}{\chi^2_{\alpha/2}} \le \sigma^2 \le \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}}

가설검정 — 무엇을 기본값으로 둘 것인가

내용
귀무가설 H0H_0일반적으로 믿어 온 사실
대립가설 H1H_1실험자가 주장하고 싶은 것

택시 기사들이 “우리 급여가 고시된 220만 원과 다르다”고 주장한다면 H1:μ≠220H_1: \mu \ne 220, H0:μ=220H_0: \mu = 220 이다. 주장하는 쪽이 대립가설이고, 검정은 그 주장을 증명하는 게 아니라 귀무가설을 기각할 만큼 증거가 센가를 본다.

검정 결과 \ 실제H0H_0 참H0H_0 거짓
H0H_0 채택옳은 결정제2종 오류
H0H_0 기각제1종 오류옳은 결정

유의수준 α\alpha 는 제1종 오류를 범할 확률이다. α=0.05\alpha = 0.05 는 참인 귀무가설을 잘못 기각하는 일을 100번 중 5번까지 허용한다는 뜻이다.

검정 절차는 여섯 단계다.

  1. 대립가설을 세우고, 그 반대로 귀무가설을 세운다
  2. 유의수준 α\alpha 를 정한다
  3. 적당한 검정통계량을 고른다
  4. 기각역을 구한다
  5. 표본에서 검정통계량의 관찰값을 계산한다
  6. 관찰값이 기각역에 들어가면 H0H_0 를 기각한다
유형대립가설기각역
양측H1:μ≠μ0H_1: \mu \ne \mu_0∣z0∣>zα/2\lvert z_0 \rvert > z_{\alpha/2} (5% 면 1.96)
상단측H1:μ>μ0H_1: \mu > \mu_0z0>zαz_0 > z_\alpha (5% 면 1.64)
하단측H1:μ<μ0H_1: \mu < \mu_0z0<−zαz_0 < -z_\alpha

p 값

p-value=P(Z>z0) (상단측),p≤α⇒H0 기각p\text{-value} = P(Z > z_0)\ (\text{상단측}), \qquad p \le \alpha \Rightarrow H_0\ \text{기각}

기각역을 그려 보는 대신 확률 하나로 판정하는 방법이다. 강의의 예제 하나가 p 값의 의미를 정확히 보여 준다 — p=0.0475p = 0.0475 일 때 유의수준 5% 에서는 기각되고 1% 에서는 채택된다. 같은 데이터가 기준에 따라 다른 결론을 낸다. p 값은 “참이냐”가 아니라 “어느 기준까지 버틸 수 있느냐”를 말한다.

마지막 예제는 경유차 질소산화물 배출 허용기준(0.080 g/km)을 두고 표본 25대의 평균 0.095, 표본표준편차 0.03 으로 초과 여부를 검정한다. 모분산을 모르니 t 통계량을 쓴다.

T0=0.095−0.0800.03/25=2.5,p=0.0098<0.01T_0 = \frac{0.095 - 0.080}{0.03/\sqrt{25}} = 2.5, \qquad p = 0.0098 < 0.01

유의수준 1% 에서도 기각 — 기준치를 초과한다는 결론이다. 현장에서 규격 초과를 주장하려면 이 정도 형식은 갖춰야 한다는 것을, 마지막 예제가 대신 말해 준다.

남는 것

이 과목에서 실제로 얻은 것은 공식이 아니라 질문의 순서였다.

  1. 이 데이터는 어떤 분포를 가정할 수 있는가 (그 가정의 전제조건은 만족하는가)
  2. 내가 보고 있는 것은 모집단인가 표본인가
  3. 모분산을 아는가 모르는가 — zz 인가 tt 인가
  4. 점으로 말할 것인가 구간으로 말할 것인가
  5. 무엇을 귀무가설로 둘 것인가

기초 원리를 모른 채 도구를 따라 쓰기만 하면 틀린 결론에 자신 있게 도달하게 된다. 그것을 피하려고 이 과목을 먼저 들었다.

같은 시기에 들은 선형대수 정리와 데이터 시각화 정리도 함께 두었다. 분포와 검정을 도구로 다루는 쪽은 빅데이터분석기사 정리에 있다.

표시는 이 브라우저에만 남는다. 서버로 가는 것은 없다.