기록·
논문 공부 — 통계 배운 것 정리
논문을 읽다가 결과표를 보다 보면, 통계 용어에서 멈칫하게 된다
똑붕약사
약사 · 약제학(나노 DDS) 박사과정 연구원
4분 읽기 · 조회 0

논문을 읽다가 결과표를 보다 보면, 통계 용어에서 멈칫하게 된다. t-test? ANOVA? OR? HR? 숫자는 보이는데, 무슨 말인지 감이 안 온다. 사실 배우긴 했지만, 너무 쉽게 휘발되어버린다 그래서 오늘은 논문 해석에 꼭 필요한 기초 통계 지식을 한 번에 정리해보려고 한다. 이 글 하나면 Methods & Results 파트가 훨씬(한결) 편해질 것이다. 먼저 범주형 ( O, X로 표현 가능) 연속형 (수치로 표현) 으로
독립변수(X축), 종속변수(Y축)으로 구분하여 정리해보겠다.
1. 결과가 '수치(평균)'일 때 (연속형)
예: 혈압, 약물 농도, 종양 크기, IC50 2그룹 비교: t-test (정규성 안 맞으면 Mann-Whitney) 3그룹 이상 비교: ANOVA (정규성 안 맞으면 Kruskal-Wallis) 숫자와 숫자의 관계: 선형 회귀분석 (Linear Regression)
2. 결과가 '있다/없다(비율)'일 때 (범주형)
예: 완치/미완치, 생존/사망, 부작용 유/무 그룹 간 비율 비교: 카이제곱 검정 (χ2 test) (샘플 적으면 Fisher's Exact) 영향을 주는 요인 찾기: 로지스틱 회귀분석 (Logistic Regression) → OR(승산비) 확인
3. 결과에 '시간' 개념이 들어갈 때 (생존 분석)
예: 사망까지 걸린 시간, 재발까지의 기간 그래프 그리기: Kaplan-Meier (생존 곡선) 위험 요인 분석: Cox 회귀분석 (Cox Regression) → HR(위험비) 확인 내가 보고 있는 지표 사용하는 분석법 핵심 결과값 평균 차이 t-test / ANOVA p-value (0.05 미만인가?) 발생 확률(Risk) 로지스틱 회귀 OR (1보다 큰가/작은가?) 사건 발생 속도 Cox 회귀
HR (위험도가 몇 배인가?) 위 내용을 먼저 읽히고, 아래 한번 더 얘기를 해보겠다.
1. 평균을 비교할 때 쓰는 통계
Independent t-test (독립표본 t검정) 두 집단의 평균을 비교할 때 사용한다. 예를 들어, 약물 투여군 vs 대조군의 평균 종양 크기 비교. 남녀 평균 혈압 비교. 조건은 정규분포, 연속형 데이터이다.
- p < 0.05
- 두 집단 평균 차이가 통계적으로 유의하다.
Paired t-test (대응표본 t검정) 같은 사람의 전후 비교 예로, 치료 전 혈압 vs 치료 후 혈압 독립이 아니라 “짝지어진 데이터”일 때 사용한다. ANOVA (분산분석) 세 집단 이상 평균 비교 저용량 / 중용량 / 고용량 비교할 때 t-test를 여러 번 쓰면 안 된다. 그럴 때 ANOVA를 쓴다. p < 0.05라면, “적어도 한 집단은 다르다”는 뜻이다. 어디가 다른지는 사후검정(Tukey 등)이 필요하다.
2. 정규분포가 아닐 때 쓰는 방법 (비모수 검정)
데이터가 삐뚤거나 표본이 작으면 t-test 쓰기 어렵다. 그럴 때 등장한다. Mann–Whitney U test 독립표본 t-test의 비모수 버전(표본이 충분하면 모수 버전임) 두 집단 비교 정규분포 가정이 어려울 때 사용한다. 값 대신 “순위(rank)”를 비교한다. Wilcoxon signed-rank test Paired t-test의 비모수 버전 전후 비교인데 정규분포가 아닐 때 사용한다.
Kruskal–Wallis test ANOVA의 비모수 버전 3개 이상 집단 비교, 정규성 만족 안 할 때 사용한다.
3. 비율을 비교할 때 쓰는 통계
평균이 아니라 “있다/없다” 같은 범주형 데이터일 때다. 카이제곱검정 (Chi-square test) 두 범주형 변수의 관련성 확인 예: 흡연 여부 vs 암 발생 여부 p < 0.05
- 두 변수는 독립이 아니다
- 관련 있다
Fisher’s Exact Test 표본이 작을 때 사용하는 카이제곱 대체법 기대빈도 5 미만이면, Fisher를 쓴다.
4. 위험을 분석할 때 쓰는 통계
Odds Ratio (OR), 오즈의 비율 주로 case-control 연구 또는 로지스틱 회귀분석 결과로 나온다. OR = 1 → 차이 없음 OR > 1 → 위험 증가 OR < 1 → 보호 효과 희귀질환일수록 OR ≈ RR 이 된다. Relative Risk (RR), 확률의 비율 cohort 연구에서 사용한다. 실제 발생률을 비교한다. RR = 2
- 위험이 2배
Hazard Ratio (HR) 시간까지 고려한 위험비 생존분석에서 사용한다. Kaplan–Meier curve, Cox regression과 함께 등장한다. HR = 0.7
- 사건 발생 속도 30% 감소
5. 로지스틱 회귀분석 (Logistic regression)
결과가 “있다/없다”일 때, 여러 변수를 동시에 보정해서 분석 결과는 OR로 나온다. 단순 비교가 아니라 나이, 성별, 흡연 등 여러 요인을 동시에 고려한다. 논문에서 “adjusted OR”가 나오면 이 분석을 했다는 뜻이다. 길게 쓰지는 않으려고 적당히 정리하려다 보니, 읽고 이해할 수 있는 글인가 하는 의문이 들기는 한다 ㅋㅋ 그래도 통계법은 논문 데이터를 보면서 공부하는게 제일 좋다고 하니
논문을 좀 더 보며 공부할 때 다시 또 복습 해보아야겠다.
- #연구
- #기록
- #통계