인지야공/강의 요약/10번째 글
빅데이터를 위한 확률과 통계 — 현장에서 쓰던 것들의 이름 찾기
고등학교 때 확률과 통계는 억지로 머리에 넣어야 하는데 표현까지 애매모호한 그 무엇이었다. 현상을 겪어 본 적도, 왜 해야 하는지도 모르는 상태였으니 당연했다.
현장에서 오래 일한 뒤에 같은 과목을 다시 들으니 순서가 반대가 되어 있었다. 분산과 표준편차, 정규분포, 관리한계 — 이미 해 오던 것들에 이름과 근거를 붙이는 작업이었다. 그래서 이 강의는 “새로 배운 것”보다 “왜 그렇게 해도 되는지”를 회수한 기록에 가깝다.
K-MOOC 매치업 과정으로, 7주 구성이다.
| 주차 | 주제 |
|---|---|
| 1 | 확률 — 표본공간과 사건, 확률의 성질, 조건부 확률 |
| 2 | 확률분포 — 이산·연속 확률분포, 기댓값과 분산 |
| 3 | 정규분포 — 표준정규분포, 표준화, 정규분포로의 근사화 |
| 4 | 기술통계학 — 도수분포표, 통계 그래프 |
| 5 | 표본분포 — 모집단의 분포, 표본평균의 분포, 카이제곱·t 분포 |
| 6 | 표본비율의 분포와 추정 — 점 추정, 구간 추정, 표본의 크기 |
| 7 | 추정 및 가설검정 — 검정 절차, 양측 검정과 p 값 |
확률 — 조건을 걸면 분모가 바뀐다
시행·표본공간·사건의 정의부터 시작한다. 여기까지는 집합 이야기다. 합사건·곱사건·차사건· 여사건, 그리고 교환·결합·분배·드 모르간 법칙.
조건부 확률이 이 주차의 핵심이다.
정의만 보면 밋밋한데, 강의의 도입 예제가 좋았다. 요일별·원인별 교통사고 사망자 표를 놓고 음주운전 사망자 중 토요일이었을 확률을 묻는다. 표 전체가 분모가 아니라 음주운전 열의 합계가 분모가 된다. 조건을 건다는 것은 표본공간을 갈아 끼우는 일이라는 게 표 하나로 보인다.
여기서 곱셈정리가 따라 나온다.
복원추출이면 두 번째 뽑기의 확률이 그대로고, 비복원추출이면 분모가 하나 줄어든다. 공장 A·B·C 의 생산 비율과 불량률을 주고 불량품이었을 때 C 공장에서 나왔을 확률을 구하는 예제로 마무리하는데, 이게 사실상 베이즈 정리다.
배반과 독립은 반대말이 아니다
가장 오래 남은 대목이다.
| 정의 | 뜻 | |
|---|---|---|
| 배반사건 | 동시에 일어날 수 없다 | |
| 독립사건 | 서로 영향을 주지 않는다 |
주사위에서 를 짝수, 를 홀수라 하면 둘은 배반이다. 그런데 인 반면 이다. 가 일어났다는 사실이 의 확률을 0으로 바꿔 버렸으니 영향을 준 것이고, 따라서 종속이다.
배반사건은 독립이 아니라 종속이다.
확률분포 — 분포는 데이터의 생김새에 대한 가정이다
확률변수는 표본공간의 각 원소를 실수에 대응시킨 것이다. 값이 띄엄띄엄하면 이산, 구간 안의 모든 값을 취하면 연속이다. 연속에서는 이라서 넓이로만 확률을 말한다는 점이 이산과의 결정적 차이다.
| 분포 | 확률질량함수 | 쓰는 자리 |
|---|---|---|
| 이산균등 | 모든 값이 같은 확률 | |
| 베르누이 | 1회 시행, 결과 두 가지 | |
| 이항 | 베르누이 시행 회 반복 | |
| 포아송 | 단위 시간·공간당 발생 횟수 |
포아송은 전제조건 세 가지를 명시해 준 게 좋았다 — 독립성(사건끼리 독립), 일정성 (발생 확률이 일정), 비집락성(아주 짧은 구간에서 두 번 이상 일어날 확률이 0에 가까움). 설비 고장 건수나 결점 수에 포아송을 갖다 붙이기 전에 확인해야 하는 조건이 이것이다. “주당 평균 3건의 산업재해”에서 하루 기준으로 바꾸면 로 바뀐다는 예제가 단위 환산의 함정을 잘 짚는다.
기댓값과 분산
연속에서는 합이 적분으로 바뀔 뿐 형태가 같다. 실무에서 자주 쓰는 것은 선형 성질 쪽이다.
분산에는 상수항이 영향을 주지 않고, 배율은 제곱으로 들어간다. 단위를 바꿀 때마다 확인하게 되는 규칙이다.
| 분포 | 기댓값 | 분산 |
|---|---|---|
| 이항 | ||
| 포아송 |
포아송은 평균과 분산이 같다. 실제 계수 데이터에서 분산이 평균보다 훨씬 크면 포아송 가정이 깨졌다는 신호다.
정규분포 — 표준화는 자를 바꾸는 일
곡선은 에 대칭이고, 아래 넓이는 1이며, 표준편차가 커지면 납작해지고 평균이 바뀌면 좌우로 움직인다. 외워 둘 값은 세 개다.
가 99.74% 라는 것 — 관리도의 관리한계선이 왜 인지가 여기 있다.
표준화는 로 으로 옮기는 것이다. 강의의 예제가 직관적이었다. 국어(평균 65, 표준편차 6)에서 75점, 수학(55, 10)에서 75점, 영어(60, 8)에서 74점을 받았을 때 어느 과목을 잘한 것인가?
| 과목 | 원점수 | |
|---|---|---|
| 국어 | 75 | |
| 수학 | 75 | |
| 영어 | 74 |
같은 75점이라도 국어가 가장 잘한 것이다. 서로 다른 자로 잰 값을 비교하려면 자를 통일해야 한다 — 이것이 표준화의 전부다.
근사화
| 원래 분포 | 조건 | 근사 |
|---|---|---|
| 이항 | 이 크면 | |
| 포아송 |
항체 생성률 80% 인 약을 100명에게 투여했을 때 70~90명일 확률 같은 문제는, 이항으로 스물한 개 항을 더하는 대신 으로 바꿔 으로 끝난다.
기술통계학 — 요약은 손실이다
기술통계학은 수집한 데이터를 요약·묘사·설명하는 기법이고, 추측통계학은 그것을 바탕으로 추론·예측하는 기법이다. 이 구분이 4주차의 뼈대다.
도수분포표 작성 절차는 순서를 그대로 외워 둘 만하다.
- 최댓값·최솟값으로 범위 을 구한다
- 계급의 수 를 정한다
- 계급구간 를 결정한다
- 계급의 경계를 정한다
- 계급값(양 끝값의 평균)을 구한다
- 계급도수 를 센다
여기에 상대도수(), 누적도수(), 누적 상대도수를 붙이면 표가 완성된다.
| 그래프 | 특징 |
|---|---|
| 막대그래프 | 계급구간이 없다. 범주형 — 좋아하는 색, 학점 |
| 히스토그램 | 계급구간이 있다. 연속형 — 키, 온도, 나이 |
| 줄기 잎 그림 | 분포를 보면서 원래 관측값을 잃지 않는다 |
| 원그래프 | 중심각 = 상대도수 |
| 시계열 그림 | 가로축이 시간 |
| 상자그림 | 여러 집단의 분포를 나란히 비교할 때 |
막대그래프와 히스토그램을 구분해서 가르치는 게 새삼스러워 보여도, 실무 보고서에서 가장 자주 틀리는 지점이다. 막대 사이를 붙였는가 띄웠는가에 “계급구간이 있는가”라는 정보가 실려 있다.
다섯 숫자 요약과 상자그림
최솟값, , 중앙값, , 최댓값. 그리고 로 이상치 경계를 잡는다.
표본분포 — 표본평균도 확률변수다
이 주차가 강의 전체의 허리다. 표본을 뽑을 때마다 평균이 다르게 나온다. 그러니 표본평균 자체가 분포를 갖는 확률변수다.
평균은 모평균과 같고, 분산은 으로 나뉜다. 표본을 4배로 늘리면 표준오차는 절반이 된다. “표본을 더 뽑으면 정확해진다”는 말의 정확한 형태가 이 식이다. 표본평균의 표준편차를 평균의 표준오류(standard error)라 부른다.
경우를 네 가지로 나눠 정리해 준 표가 이 과목에서 가장 실용적이었다.
| 모집단 | 모분산 | 쓰는 통계량 |
|---|---|---|
| 정규분포 | 알고 있다 | |
| 정규분포 아님 | 알고 있다 | 이면 위와 같이 근사 (중심극한정리) |
| 정규분포 | 모른다 | |
| 정규분포 아님 | 모른다 | 이면 근사 |
현실에서는 모분산을 아는 경우가 거의 없다. 그래서 실무는 대부분 3행과 4행이다.
카이제곱 분포와 t 분포
표준정규를 제곱해서 더하면 카이제곱이 된다.
모평균 대신 표본평균 를 쓰는 순간 자유도가 하나 줄어 이 된다. 표본분산의 분모가 왜 인가에 대한 답이 여기서 나온다.
t 분포는 표준정규를 카이제곱으로 나눈 것이다.
모양은 정규분포와 비슷한데 꼬리가 두껍다. 자유도가 커지면 정규분포에 수렴하고, 표본이 30 이상이면 사실상 정규분포로 봐도 된다. 모분산을 몰라도 표본분산으로 대신할 수 있다는 것이 t 분포의 존재 이유다.
추정 — 점 하나가 아니라 구간으로
점 추정량 가 를 만족하면 불편 추정량, 아니면 편의 추정량이고 그 차이 가 편의(bias)다.
| 통계량 | 불편 추정량인가 |
|---|---|
| 표본평균 | 모평균의 불편 추정량 — 맞다 |
| 표본분산 | 모분산의 불편 추정량 — 맞다 |
| 표본표준편차 | 모표준편차의 불편 추정량이 아니다 |
마지막 줄이 함정이다. 제곱근이 비선형이라 가 된다. 분산은 편향이 없는데 표준편차는 있다.
신뢰구간 — 모분산을 아는 경우.
모분산을 모르고 표본이 작으면 대신 을 쓴다. 신뢰도 95% 면 , 99% 면 이다.
구간의 폭이 신뢰도·분산·표본 크기 세 가지에만 달려 있다는 점이 중요하다. 그래서 거꾸로 “신뢰구간 길이를 얼마 이하로 만들려면 표본이 몇 개 필요한가”를 풀 수 있다.
정밀도를 2배로 올리려면 표본은 4배가 필요하다. 시험 계획을 세울 때 이 관계를 모르면 근거 없이 표본 수를 정하게 된다.
모분산의 신뢰구간은 카이제곱으로 잡는다.
가설검정 — 무엇을 기본값으로 둘 것인가
| 내용 | |
|---|---|
| 귀무가설 | 일반적으로 믿어 온 사실 |
| 대립가설 | 실험자가 주장하고 싶은 것 |
택시 기사들이 “우리 급여가 고시된 220만 원과 다르다”고 주장한다면 , 이다. 주장하는 쪽이 대립가설이고, 검정은 그 주장을 증명하는 게 아니라 귀무가설을 기각할 만큼 증거가 센가를 본다.
| 검정 결과 \ 실제 | 참 | 거짓 |
|---|---|---|
| 채택 | 옳은 결정 | 제2종 오류 |
| 기각 | 제1종 오류 | 옳은 결정 |
유의수준 는 제1종 오류를 범할 확률이다. 는 참인 귀무가설을 잘못 기각하는 일을 100번 중 5번까지 허용한다는 뜻이다.
검정 절차는 여섯 단계다.
- 대립가설을 세우고, 그 반대로 귀무가설을 세운다
- 유의수준 를 정한다
- 적당한 검정통계량을 고른다
- 기각역을 구한다
- 표본에서 검정통계량의 관찰값을 계산한다
- 관찰값이 기각역에 들어가면 를 기각한다
| 유형 | 대립가설 | 기각역 |
|---|---|---|
| 양측 | (5% 면 1.96) | |
| 상단측 | (5% 면 1.64) | |
| 하단측 |
p 값
기각역을 그려 보는 대신 확률 하나로 판정하는 방법이다. 강의의 예제 하나가 p 값의 의미를 정확히 보여 준다 — 일 때 유의수준 5% 에서는 기각되고 1% 에서는 채택된다. 같은 데이터가 기준에 따라 다른 결론을 낸다. p 값은 “참이냐”가 아니라 “어느 기준까지 버틸 수 있느냐”를 말한다.
마지막 예제는 경유차 질소산화물 배출 허용기준(0.080 g/km)을 두고 표본 25대의 평균 0.095, 표본표준편차 0.03 으로 초과 여부를 검정한다. 모분산을 모르니 t 통계량을 쓴다.
유의수준 1% 에서도 기각 — 기준치를 초과한다는 결론이다. 현장에서 규격 초과를 주장하려면 이 정도 형식은 갖춰야 한다는 것을, 마지막 예제가 대신 말해 준다.
남는 것
이 과목에서 실제로 얻은 것은 공식이 아니라 질문의 순서였다.
- 이 데이터는 어떤 분포를 가정할 수 있는가 (그 가정의 전제조건은 만족하는가)
- 내가 보고 있는 것은 모집단인가 표본인가
- 모분산을 아는가 모르는가 — 인가 인가
- 점으로 말할 것인가 구간으로 말할 것인가
- 무엇을 귀무가설로 둘 것인가
기초 원리를 모른 채 도구를 따라 쓰기만 하면 틀린 결론에 자신 있게 도달하게 된다. 그것을 피하려고 이 과목을 먼저 들었다.
같은 시기에 들은 선형대수 정리와 데이터 시각화 정리도 함께 두었다. 분포와 검정을 도구로 다루는 쪽은 빅데이터분석기사 정리에 있다.