한국데이터산업진흥원(K-DATA)에서 주관하는 빅데이터분석기사(빅분기)는 데이터 분석 기획부터 모델링, 시각화까지 데이터 전 과정을 다루는 국가기술자격증입니다.
총 4개 과목(빅데이터 분석 기획, 빅데이터 탐색, 빅데이터 모델링, 빅데이터 결과 해석)으로 구성되며, 과목당 40점 이상(과락 방지) 및 전 과목 평균 60점 이상이면 합격합니다. 통계학이나 코딩 지식이 부족한 비전공자도 2주 만에 합격 커트라인을 넘길 수 있는 핵심 공부법과 필수 암기 공식을 정리했습니다.
1. 2주 벼락치기 과목별 시간 배분 전략
비전공자가 가장 많이 과락을 맞는 구간은 수식과 모델이 쏟아지는 2과목(탐색)과 3과목(모델링)입니다.
| 과목 | 목표 점수 | 핵심 공략 포인트 |
|---|---|---|
| 1과목: 빅데이터 분석 기획 | 80점 이상 (고득점) | 데이터 거버넌스, 분석 마스터플랜, 개인정보 비식별화 기술 등 암기 위주 득점밭 |
| 2과목: 빅데이터 탐색 | 60점 방어 | 기초 통계(확률분포, 가설검정 p-value), 결측치/이상치 처리, 상관계수 |
| 3과목: 빅데이터 모델링 | 60점 방어 | 머신러닝 알고리즘(회귀, 의사결정나무, SVM, 앙상블), 과적합 규제(L1/L2) |
| 4과목: 빅데이터 결과 해석 | 75점 이상 | 혼동행렬 평가지표 계산, ROC 곡선, 시각화 차트 종류 및 해석 |
2. 시험에 100% 나오는 빈출 계산 공식 핵심 요약
필기 시험에서 매회 4~6문제 출제되는 혼동행렬(Confusion Matrix) 평가지표는 공식을 외우지 않으면 손도 댈 수 없습니다.
- 정밀도 (Precision): 모델이 참(Positive)이라고 예측한 것 중 실제 참인 비율
$$\text{Precision} = \frac{TP}{TP + FP}$$ - 재현율 (Recall / 민감도): 실제 참(Positive)인 것 중 모델이 참이라고 맞힌 비율
$$\text{Recall} = \frac{TP}{TP + FN}$$ - F1-Score: 정밀도와 재현율의 조화평균
$$\text{F1} = 2 \times \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}}$$ - 오분류율 (Error Rate): 전체 데이터 중 잘못 예측한 비율
$$\text{Error Rate} = \frac{FP + FN}{TP + TN + FP + FN}$$
💡 암기 암기팁: “정밀도는 모델이 ‘정’한 것 기준(TP+FP 분모), 재현율은 ‘실’제 데이터 기준(TP+FN 분모)“로 외우면 헷갈리지 않습니다.
3. 2주 일자별 실전 커리큘럼
- 1주 차 (1~7일): 핵심 개념 1회독 + 요약 노트 정독
- Day 1~2: 1과목 기획 & 4과목 결과 해석 (개념 암기 위주로 빠르게 완독)
- Day 3~4: 2과목 기초 통계 및 전처리 기법 (가설검정 귀무가설 기각 조건 정리)
- Day 5~7: 3과목 머신러닝/딥러닝 모델 비교 (배깅 vs 부스팅 차이, 앙상블 원리)
- 2주 차 (8~14일): 기출문제 5회분 무한 회독 + 오답 노트
- Day 8~11: 최근 5회분 기출문제를 실제 시험처럼 풀고 해설 완독
- Day 12~13: 틀린 문제만 모아서 개념 역추적 및 계산 문제 손으로 풀기
- Day 14: 공식 암기장 복습 및 취약 과목 최종 점검
두꺼운 기본서를 1페이지부터 정독하려 하지 말고, 기출문제 선지 분석과 빈출 계산 공식 손풀기에 집중하면 2주 만에 안정적인 70점대 합격이 가능합니다.