ADsP · 데이터 분석 (과목3)
한국어 · 45장
데이터분석 준전문가 과목3 통계·데이터마이닝·R 핵심 45개
-
R
통계 분석과 시각화에 특화된 오픈소스 프로그래밍 언어.
🔑 통계·시각화 언어=R
-
데이터 마트
분석에 맞게 요약변수·파생변수를 가공한 분석용 데이터 집합.
🔑 요약·파생변수 가공=마트
-
요약변수 vs 파생변수
요약변수는 합·평균 등 재집계 값, 파생변수는 조건·의미를 부여해 새로 만든 변수.
🔑 요약=집계, 파생=의미부여
-
결측값(NA) 처리
삭제·평균/중앙값 대치·회귀 대치·다중 대치 등으로 처리.
🔑 삭제·대치로 처리
-
이상값(Outlier)
정상 범위를 벗어난 값. ESD·IQR(사분위)·상자그림 등으로 탐지.
🔑 IQR·상자그림으로 탐지
-
기술통계
평균·중앙값·최빈값 등으로 데이터를 요약·기술하는 통계.
🔑 평균·중앙값·최빈값
-
분산·표준편차
데이터가 평균에서 흩어진 정도. 표준편차는 분산의 제곱근.
🔑 흩어진 정도=분산/표준편차
-
왜도·첨도
왜도(Skewness)는 분포의 비대칭도, 첨도(Kurtosis)는 뾰족한 정도.
🔑 왜도=비대칭, 첨도=뾰족함
-
모집단 vs 표본
모집단은 관심 대상 전체, 표본은 모집단에서 뽑은 일부.
🔑 전체=모집단, 일부=표본
-
표본추출 방법
단순 무작위·계통·층화·군집 추출 등.
🔑 단순·계통·층화·군집
-
확률변수(이산/연속)
이산은 셀 수 있는 값(이항·포아송), 연속은 구간 값(정규·지수).
🔑 이산=셀수있음, 연속=구간
-
정규분포
평균을 중심으로 좌우대칭인 종 모양 분포. 평균·분산으로 결정.
🔑 종 모양 좌우대칭=정규
-
이항분포·포아송분포
이항은 성공/실패 n회 시행, 포아송은 단위 시간·공간당 사건 발생 수.
🔑 이항=성공/실패, 포아송=발생수
-
중심극한정리(CLT)
표본 크기가 커지면 표본평균의 분포가 정규분포에 근사한다.
🔑 n 커지면 표본평균 정규 근사
-
점추정 vs 구간추정
점추정은 하나의 값으로, 구간추정은 신뢰구간으로 모수를 추정.
🔑 점=한값, 구간=신뢰구간
-
신뢰구간
모수가 포함될 것으로 기대되는 구간. 신뢰수준(95% 등)과 함께 제시.
🔑 모수 포함 기대 구간
-
가설검정
귀무가설(H0)과 대립가설(H1)을 세우고 표본으로 채택·기각을 판단.
🔑 H0 vs H1 판단
-
1종 오류 vs 2종 오류
1종은 참인 H0를 기각(α), 2종은 거짓인 H0를 채택(β).
🔑 1종=α(참을 기각), 2종=β
-
유의수준·p-value
유의수준(α)은 1종 오류 허용 한계, p-value가 α보다 작으면 H0 기각.
🔑 p<α → H0 기각
-
t-검정·분산분석(ANOVA)
t-검정은 두 집단 평균 비교, ANOVA는 셋 이상 집단 평균 비교.
🔑 2집단=t, 3집단↑=ANOVA
-
카이제곱 검정
범주형 변수의 적합도·독립성·동질성을 검정.
🔑 범주형 독립성=카이제곱
-
상관분석
두 변수의 선형 관계 강도(-1~1). 피어슨(연속)·스피어만(순위).
🔑 관계 강도 -1~1
-
회귀분석
독립변수로 종속변수를 예측하는 모형. 단순·다중 회귀.
🔑 X로 Y 예측=회귀
-
회귀모형 가정
선형성·독립성·등분산성·정규성·비상관성을 만족해야 함.
🔑 선형·독립·등분산·정규
-
결정계수 R²
회귀모형이 종속변수 변동을 설명하는 비율(0~1). 클수록 설명력↑.
🔑 R² 클수록 설명력↑
-
다중공선성
독립변수 간 강한 상관으로 회귀가 불안정해지는 문제. VIF로 진단.
🔑 VIF>10 의심=다중공선성
-
변수 선택법
전진 선택·후진 제거·단계적 선택으로 유의미한 변수 선정.
🔑 전진·후진·단계적
-
더미변수
범주형 변수를 0/1로 변환한 변수. 범주 수-1개 생성.
🔑 범주형→0/1 변환
-
시계열 분석
시간 순서 데이터 분석. 정상성 가정, AR·MA·ARIMA 모형.
🔑 AR·MA·ARIMA, 정상성
-
데이터 마이닝
대용량 데이터에서 패턴·규칙을 발견하는 기법.
🔑 데이터에서 패턴 발견
-
지도학습 vs 비지도학습
지도학습은 정답(레이블)이 있는 학습(분류·회귀), 비지도학습은 정답이 없는 학습(군집·연관).
🔑 지도=정답O, 비지도=정답X
-
분류 vs 예측
분류는 범주(이산) 예측, 예측(회귀)은 연속값 추정.
🔑 분류=범주, 예측=수치
-
의사결정나무
if-then 규칙으로 분기하는 트리 모형. 지니지수·엔트로피·정보이득으로 분할.
🔑 지니·엔트로피로 분기
-
과대적합·가지치기
과대적합(Overfitting)은 학습데이터에 과하게 맞춰 일반화 실패. 가지치기(Pruning)로 완화.
🔑 과적합↔가지치기로 완화
-
앙상블
여러 모형을 결합해 성능을 높이는 기법. 배깅·부스팅·랜덤포레스트.
🔑 배깅·부스팅·랜덤포레스트
-
배깅 vs 부스팅
배깅은 병렬로 부트스트랩 학습 후 결합, 부스팅은 순차적으로 오분류를 보정.
🔑 배깅=병렬, 부스팅=순차보정
-
인공신경망
입력·은닉·출력층과 활성화 함수로 비선형 패턴을 학습하는 모형.
🔑 층+활성화함수=신경망
-
로지스틱 회귀
종속변수가 범주(0/1)일 때 확률을 추정하는 분류 모형.
🔑 0/1 확률 추정=로지스틱
-
SVM
서포트 벡터 머신. 마진을 최대화하는 결정 경계로 분류.
🔑 마진 최대화=SVM
-
군집분석
유사한 개체끼리 묶는 비지도학습. 계층적·비계층적(K-means).
🔑 유사한 것끼리 묶기
-
K-means
K개 군집 중심으로 개체를 할당·갱신 반복하는 비계층적 군집.
🔑 K개 중심 반복=K-means
-
연관분석
장바구니 분석. 지지도·신뢰도·향상도로 항목 간 연관 규칙 도출.
🔑 지지도·신뢰도·향상도
-
혼동행렬
분류 결과 표. 정확도·정밀도·재현율·F1-score로 성능 평가.
🔑 정확·정밀·재현·F1
-
정밀도 vs 재현율
정밀도는 양성 예측 중 실제 양성 비율, 재현율은 실제 양성 중 맞춘 비율.
🔑 정밀=예측기준, 재현=실제기준
-
ROC 커브·AUC
임계값 변화에 따른 민감도-특이도 곡선. AUC(면적)가 1에 가까울수록 우수.
🔑 AUC 1에 가까울수록 우수
비슷한 덱