내 데이터엔 뭘 써야 하지? — 데이터 분석 기법 16선 현장 도감 - 지식유니버스

2026년 7월 27일 월요일

내 데이터엔 뭘 써야 하지? — 데이터 분석 기법 16선 현장 도감

 

내 데이터엔 뭘 써야 하지? — 데이터 분석 기법 16선 현장 도감

데이터 분석 기법 16선 · 현장 도감

회귀분석? XGBoost? 내 업무 데이터엔 뭘 써야 하지

A field guide to 16 analysis methods

기법 이름은 다 들어봤는데, 정작 내 앞의 엑셀 파일을 열면 막막합니다. 이 도감은 기법을 설명하지 않고, 목적에서 출발합니다. 하고 싶은 일을 고르면 쓸 기법만 남습니다. 각 카드의 버튼은 위키 문서와 실무 문서로 바로 연결됩니다.

무엇을 하고 싶으세요? Filter · 16 methods

지금 보이는 기법 16

일단 데이터를 열었다

분석의 방향을 정하는 첫 두 걸음

EDA

탐색적 데이터 분석Exploratory Data Analysis

분포·이상치·결측치를 시각화와 요약통계로 먼저 훑어, 이후 분석 방향을 정하는 출발점입니다.

이럴 때설문 결과를 피벗·차트로 그려 튀는 값을 찾아낼 때
난이도 · 모든 분석의 0단계

COR

상관분석Correlation Analysis

두 변수가 얼마나 함께 움직이는지 수치 하나로 요약합니다. 단, 관련성은 인과가 아닙니다.

이럴 때광고비와 매출액이 실제로 같이 움직이는지 확인할 때
난이도 · 인과 판단은 회귀로

숫자를 예측한다

원인을 추정하거나, 다음 달을 내다볼 때

REG

회귀분석Regression Analysis

영향인자(독립변수)가 결과치(종속변수)에 미치는 영향을 추정하고 값을 예측합니다.

이럴 때소득 수준에 따른 소비지출 규모를 예측할 때
난이도 · 해석이 쉬운 기본기

TSA

시계열분석Time Series Analysis

시간 순서로 쌓인 데이터에서 추세·계절성·주기를 분리해 미래 값을 내다봅니다.

이럴 때월별 전력사용량으로 다음 달 수요를 예측할 때
난이도 · 순서가 곧 정보

분류하고, 정확도를 끌어올린다

트리 하나에서 수백 개의 트리까지

DTR

의사결정나무Decision Tree

조건 질문을 나뭇가지처럼 이어 붙여 분류·예측합니다. 판단 근거를 눈으로 따라갈 수 있습니다.

이럴 때고객 이탈 여부 예측, 서비스 신청자의 수급 가능 여부 분류
난이도 · 설명력이 최대 강점

RF

랜덤포레스트Random Forest

서로 다르게 학습한 결정나무 수백 개의 투표를 모아, 한 그루의 편향을 지웁니다.

이럴 때신용등급 분류, 이상 행위 탐지, 고위험 대상자 예측
난이도 · 앙상블의 표준

XGB

XGBoostGradient Boosting

앞선 모델이 틀린 부분만 다음 모델이 이어 보완하는 방식으로 성능을 밀어 올립니다.

이럴 때민원 재발 가능성 예측, 사고위험 지역 도출
난이도 · 정형 데이터 최강자

정답(label)이 없다

라벨링 없이 데이터 스스로 구조를 드러내게

CLU

군집분석Cluster Analysis

비슷한 특성끼리 자동으로 묶어 그룹을 만듭니다. 몇 개로 나눌지는 사람이 판단합니다.

이럴 때고객 유형 세분화, 지역 특성 분류
난이도 · 비지도학습의 대표

UNS

비지도학습Unsupervised Learning

정답 없이 데이터 내부의 구조와 패턴을 스스로 학습하는 기계학습의 큰 갈래입니다.

이럴 때행동 패턴 기반 고객 분류, 이상값 탐지
난이도 · 라벨 비용이 0

학습 방식의 두 갈래

개별 기법이 아니라, 그 기법들이 서 있는 땅

SUP

지도학습Supervised Learning

입력과 정답이 함께 있는 데이터로 학습해, 새로운 입력의 결과를 맞힙니다.

이럴 때이메일 스팸 분류, 이미지 인식
난이도 · 회귀·트리·부스팅의 상위 개념

DL

딥러닝Deep Learning

다층 인공신경망으로 영상·음성·문서 같은 복잡한 비정형 데이터를 학습합니다.

이럴 때CCTV 영상 기반 불법주정차 탐지, 민원 음성 자동분류
난이도 · 데이터·연산량 요구 큼

표에 안 들어가는 데이터

글자, 위치, 관계, 그리고 경로

TXT

텍스트분석Text Mining

비정형 문자 데이터를 정량화해 의미 있는 정보나 감성을 뽑아냅니다.

이럴 때민원 텍스트에서 주요 불만 키워드를 도출할 때
난이도 · 한국어는 형태소 분석부터

GEO

공간분석Spatial Analysis

위치정보가 붙은 데이터로 지리적 분포와 공간적 관계를 분석합니다.

이럴 때범죄 발생 지역 시각화 및 집중도 분석
난이도 · 좌표계 통일이 관문

NET

네트워크분석Network Analysis

사람·기관 같은 개체 간 연결 구조를 모델링해 중심성, 영향력, 경로를 봅니다.

이럴 때부처 간 협업 빈도 분석, 조직 내 정보 흐름 분석
난이도 · 관계 자체가 데이터

OPT

최적경로분석Route Optimization

시간·거리·비용 조건을 함께 놓고 가장 효율적인 이동 경로를 계산합니다.

이럴 때현장 방문 순서 최적화, 긴급차량 출동 동선 설계
난이도 · 제약조건 설계가 핵심

ETC

기타 — 직접 적어야 하는 칸e.g. RAG · LLM 기반 지식검색

과제 서식의 ‘기타’는 구체적 기법명을 반드시 적어야 합니다. 최근 이 칸을 가장 많이 채우는 답이 검색증강생성(RAG)입니다.

이럴 때고장사례 보고서처럼 흩어진 문서를 질문 한 줄로 찾아 쓸 때
난이도 · 문서 품질이 성능

다음 단계

기법을 먼저 고르면 실패합니다

현장에서 가장 흔한 실수는 ‘XGBoost를 써보자’로 시작하는 것입니다. 순서를 뒤집으면 결과가 달라집니다. 답이 있어야 할 질문 → 지금 가진 데이터 → 그 조합에 맞는 기법. 위 카드의 버튼은 이 순서의 마지막 칸을 채우기 위한 참고 자료입니다.

  1. STEP 1어떤 의사결정을 바꾸고 싶은지 한 문장으로 씁니다.
  2. STEP 2그 문장에 필요한 데이터가 어디에, 어떤 형태로 있는지 확인합니다.
  3. STEP 3정답(label)이 있는지 없는지로 기법 절반을 걸러냅니다.
  4. STEP 4가장 단순한 기법으로 먼저 기준선을 만듭니다.

출처: 첨부 참고자료 ‘데이터 분석 기법’ 표(총 16개 항목, 설명 및 활용 예시 포함)를 바탕으로 재구성했습니다.

각 카드의 버튼은 위키백과(한국어 문서가 있는 경우 우선, 없으면 영어 문서)와 해당 기법의 대표 실무 문서로 연결되는 외부 링크입니다. 새 탭에서 열립니다.

댓글 없음:

댓글 쓰기