대치프라임 대치프라임 Your Future 홈으로 →

Your Future

데이터사이언스학과

인공지능학과와 겹치는 부분이 많지만, 대용량 데이터(Big Data)를 수집, 정제, 분석해 의미 있는 인사이트를 도출하는 데 더 방점이 찍혀 있어요. 통계학과 컴퓨터공학의 융합 성격이 강합니다. 과목 8개 · 개념 29개.

진로 데이터 분석가비즈니스 인텔리전스(BI) 전문가데이터 엔지니어데이터 과학자

데이터 수집 및 전처리

Data Collection & Preprocessing

데이터수집 및 전처리 2학년 2학기

Data Collection & Preprocessing

웹크롤링과 API 수집

Web Crawling & API Collection

HTTP GET 요청을 자동으로 반복 전송해 웹페이지의 HTML을 긁어와 필요한 데이터를 파싱하는 크롤링과, 서비스가 공식으로 제공하는 API 엔드포인트에 요청해 이미 정형화된 JSON 등으로 데이터를 받는 방법. 크롤링 시에는 robots.txt로 명시된 수집 허용 범위와 서버 부하를 고려한 요청 간격(rate limiting)을 지켜야 함.

결측치와 이상치 처리

Handling Missing Values & Outliers

비어있는 값(결측치)은 평균·중앙값으로 채우거나 해당 행을 제거해 처리하고, 비정상적으로 튀는 값(이상치)은 1사분위수 와 3사분위수 사이 범위(IQR) 밖으로 이상 벗어난 값을 기준으로 판별하는 게 흔한 방법.

데이터 정제

Data Cleaning (ETL)

여러 소스에서 원본 데이터를 추출(Extract)하고, 형식을 통일하고 중복·오류를 제거해 분석 가능한 형태로 변환(Transform)한 뒤, 데이터웨어하우스 등 저장소에 적재(Load)하는 3단계 파이프라인.

데이터 정규화와 스케일링

Data Normalization & Scaling

변수마다 단위와 범위가 크게 다르면(예: 나이 0~100 vs 연봉 0~수억) 거리 기반 알고리즘이나 경사하강법이 특정 변수에 과도하게 좌우되는데, 최솟값·최댓값을 0~1 사이로 맞추는 min-max 스케일링이나 평균 0·표준편차 1로 맞추는 표준화(z-score)로 변수들의 스케일을 통일해 모델이 공정하게 학습하도록 만드는 전처리 기법.

ex) 키(cm)와 몸무게(kg)처럼 단위가 다른 변수를 함께 군집분석에 넣기 전 반드시 스케일을 맞추는 것.

데이터베이스 및 데이터웨어하우스 3학년 1학기

Databases & Data Warehousing

데이터웨어하우스 설계

Data Warehouse Design (Star Schema)

매출액·수량 같은 측정값을 담은 중앙의 팩트 테이블과, "언제·어디서·무엇을"에 해당하는 시간·지역·상품 같은 차원(dimension) 테이블들이 팩트 테이블을 별 모양으로 둘러싸는 스키마. 분석 쿼리가 팩트와 차원 테이블만 조인하면 되게 단순화해 집계 성능을 높임.

OLAP과 OLTP

OLAP vs OLTP

"이번 분기 지역별·상품별 매출 합계"처럼 대량의 데이터를 여러 차원으로 집계·분석하는 OLAP(온라인분석처리)과, "이 주문 한 건을 지금 처리"처럼 짧고 빈번한 읽기·쓰기 트랜잭션을 정확하게 처리하는 OLTP(온라인거래처리). 둘은 요구되는 DB 구조와 최적화 방향이 정반대라 보통 시스템을 분리함.

슬로우리 체인징 디멘션

Slowly Changing Dimensions (SCD)

고객의 주소나 상품 카테고리처럼 차원 테이블의 값은 시간이 지나며 가끔 바뀌는데, 값이 바뀔 때 기존 행을 덮어써버리면(Type 1) 과거 시점 기준 분석이 불가능해지므로, 변경 이력을 새 행으로 추가해 유효기간을 함께 기록하는(Type 2) 방식으로 "그 당시 기준"의 정확한 분석을 가능하게 하는 데이터웨어하우스 설계 기법.

ex) 고객이 작년에 서울에서 부산으로 이사했어도, 작년 매출 분석에서는 여전히 서울 고객으로 정확히 집계되는 것.

데이터 분석 및 마이닝

Data Analysis & Mining

데이터마이닝 3학년 1학기

Data Mining

연관규칙분석

Association Rule Mining

"A를 산 사람 중 몇 %가 B도 샀는가"를 나타내는 신뢰도(confidence)와, "A, B가 함께 나타난 비율"인 지지도(support)로 항목 간 동시발생 패턴을 정량화하는 기법. 장바구니 분석에서 "기저귀를 산 사람이 맥주도 산다"류의 규칙을 찾아냄.

군집분석

Cluster Analysis

유사도(주로 유클리드 거리)를 기준으로 가까운 데이터끼리 묶는 기법. 미리 군집 수를 정하고 중심점을 반복 갱신하는 k-평균 방식과, 가장 가까운 두 군집을 계속 합쳐가며 트리(덴드로그램)를 만드는 계층적 군집화 방식이 대표적.

분류 및 예측 모델

Classification & Prediction Models

입력 특징으로부터 범주(예: 이탈/유지)를 예측하는 분류와 연속값(예: 매출액)을 예측하는 회귀를 통칭. 로지스틱회귀, 결정트리, 랜덤포레스트 등 다양한 모델 중 데이터 특성과 해석 필요성에 맞는 모델을 고르는 게 실무의 핵심.

이상탐지

Anomaly Detection

대부분의 데이터가 따르는 정상 패턴을 통계적 분포나 모델로 학습한 뒤, 그 패턴에서 크게 벗어나는 극소수의 데이터를 찾아내는 기법. 정상 사례는 아주 많고 이상 사례는 극히 드물어 일반 분류 모델처럼 두 클래스를 균형 있게 학습시키기 어렵다는 점이 핵심 난제로, 정상 데이터만으로 "정상다움"을 학습시키는 방식이 흔히 쓰임.

ex) 신용카드 회사가 평소와 다른 소비 패턴을 실시간으로 감지해 이상거래를 차단하는 시스템.

통계적 데이터 분석 3학년 2학기

Statistical Data Analysis

기술통계와 탐색적 데이터 분석

Descriptive Statistics & EDA

평균·중앙값·분산·표준편차로 데이터의 중심과 퍼짐 정도를 요약하는 기술통계와, 히스토그램·산점도 등으로 변수 간 관계와 이상치, 분포의 치우침(왜도)을 시각적으로 탐색하는 과정.

A/B 테스트

A/B Testing

사용자를 무작위로 두 그룹(A/B)에 나눠 서로 다른 버전을 보여준 뒤, 두 그룹의 전환율 차이가 우연히 발생했을 확률(p-value)이 통계적으로 유의미하게 낮은지 검정해 어느 버전이 실제로 더 나은지 판단하는 실험. 표본 크기가 작으면 우연한 차이를 실제 효과로 오판할 위험이 커짐.

인과추론

Causal Inference

"운동을 많이 하는 사람이 건강하다"처럼 두 변수가 함께 움직인다는 상관관계만으로는 운동이 건강의 원인인지, 건강한 사람이 운동을 더 하는 건지, 제3의 요인(예: 소득)이 둘 다에 영향을 주는지 구분할 수 없는데, A/B테스트 같은 무작위 실험이 불가능한 상황에서도 이중차분법·도구변수법 같은 준실험적 기법으로 진짜 인과효과를 추정하려는 통계 분야.

ex) 가격 할인을 실험할 수 없는 과거 데이터만으로 "할인이 실제로 매출 증가의 원인이었는지"를 추정하는 것.

상관계수와 공분산

Correlation Coefficient & Covariance

두 변수가 같은 방향으로 함께 움직이는지를 나타내는 공분산은 변수의 단위에 따라 값의 크기가 달라져 강도를 비교하기 어려운데, 이를 각 변수의 표준편차로 나눠 -1에서 1 사이로 표준화한 것이 상관계수. 1에 가까울수록 강한 양의 상관, -1에 가까울수록 강한 음의 상관이지만, 상관계수가 높다고 반드시 인과관계가 있는 건 아니라는 점을 항상 함께 고려해야 함.

ex) 광고비와 매출의 상관계수를 계산해 둘 사이 관계의 강도를 하나의 숫자로 요약하는 것.

예측모델링 4학년 1학기

Predictive Modeling

시계열 예측

Time Series Forecasting

과거 매출·트래픽처럼 시간 순서가 있는 데이터의 추세(장기적 증감)와 계절성(주기적 패턴)을 분리해 모델링하고, 이를 바탕으로 미래 값을 예측하는 분석. 계절성을 무시하면 명절 특수 같은 반복 패턴을 놓치게 됨.

수요예측을 위한 회귀모델

Regression Models for Demand Forecasting

가격, 프로모션 여부, 계절, 경쟁사 동향 등 여러 변수를 설명변수로 넣어 수요(종속변수)를 예측하는 다중회귀 모델. 각 변수의 회귀계수 크기로 어떤 요인이 수요에 얼마나 영향을 주는지도 함께 해석할 수 있음.

ARIMA 모델

ARIMA Model

과거 값 자신으로 현재 값을 설명하는 자기회귀(AR), 예측 오차의 과거 값으로 현재를 보정하는 이동평균(MA), 추세를 제거하기 위해 값을 차분(현재-이전)하는 과정(I, 차분)을 결합한 시계열 예측 모델. 딥러닝 이전부터 널리 쓰여온 통계적 시계열 예측의 표준 모델로, 계절성까지 추가로 반영한 SARIMA로 확장되기도 함.

ex) 다음 달 매출을 과거 매출의 패턴과 오차 보정만으로 예측하는 전통적 통계 예측 모델.

빅데이터 처리

Big Data Processing

빅데이터인프라 4학년 1학기

Big Data Infrastructure

하둡 생태계

Hadoop Ecosystem (HDFS/MapReduce)

파일을 128MB 등 일정 크기 블록으로 쪼개 여러 서버에 분산 저장하되 각 블록을 3중 복제해 일부 서버가 죽어도 데이터가 살아남게 하는 HDFS와, 데이터를 각 서버에서 병렬로 처리(Map)한 뒤 키별로 모아(Shuffle) 집계(Reduce)하는 MapReduce로 구성된 분산처리 프레임워크.

스파크 분산처리

Apache Spark

중간 계산 결과를 매번 디스크에 썼다 읽는 MapReduce와 달리, 데이터를 메모리에 RDD(분산 데이터셋)로 올려두고 여러 연산을 이어 붙인 실행 계획(DAG)을 한 번에 최적화해 처리하는 인메모리 분산처리 엔진. 반복 연산이 많은 머신러닝 파이프라인에서 하둡보다 훨씬 빠름.

NoSQL 데이터베이스

NoSQL Databases

고정된 테이블 스키마 대신, 키-값 쌍(Redis), JSON 같은 문서(MongoDB), 컬럼 단위 저장(Cassandra), 노드-엣지 관계(Neo4j) 등 데이터 형태에 맞는 유연한 모델로 대용량 데이터를 저장하는 데이터베이스군. 대신 여러 테이블에 걸친 복잡한 조인이나 강한 일관성 보장은 관계형 DB보다 약한 경우가 많음.

실시간 스트림 처리

Real-Time Stream Processing (Kafka/Flink)

하둡·스파크가 이미 쌓인 대용량 데이터를 일괄로 처리하는 배치(batch) 방식이라면, 카프카 같은 메시지 큐가 끊임없이 들어오는 이벤트를 순서대로 버퍼링하고 플링크 같은 스트림 처리 엔진이 그 이벤트를 도착하는 즉시 하나씩(또는 짧은 시간창 단위로) 처리해 결과를 실시간으로 갱신하는 방식. 데이터가 다 모일 때까지 기다릴 수 없는 상황에 필수적임.

ex) 카드사가 결제가 발생하는 바로 그 순간 이상거래인지 실시간으로 탐지해 승인을 거부하는 시스템.

데이터 레이크와 데이터 메시

Data Lake & Data Mesh

정형화된 스키마 없이 원본 그대로의 데이터(로그, 이미지, JSON 등)를 일단 저렴하게 모두 저장해두고 필요할 때 스키마를 적용해 분석하는 데이터 레이크와, 하나의 중앙 데이터 팀이 모든 데이터를 관리하는 대신 각 사업 도메인 팀이 자기 데이터를 상품처럼 책임지고 관리·공개하게 하는 조직적 접근인 데이터 메시. 조직이 커질수록 중앙집중형 데이터 관리가 병목이 되는 문제를 데이터 메시로 해결하려는 흐름.

ex) 대기업이 여러 사업부의 데이터를 한 팀이 다 관리하다 병목이 생겨, 각 사업부가 자기 데이터를 직접 책임지는 구조로 전환하는 것.

데이터 시각화 및 비즈니스 인텔리전스

Data Visualization & Business Intelligence

데이터시각화 3학년 2학기

Data Visualization

시각화 문법

Grammar of Graphics

데이터(data), 좌표축 매핑(aesthetic mapping), 점·선·막대 같은 기하 표현(geometry)을 독립적인 층(layer)으로 쌓아 조합함으로써 어떤 형태의 그래프든 일관된 규칙으로 만들 수 있게 하는 이론적 틀. ggplot2 같은 시각화 도구가 이 문법을 그대로 구현함.

대시보드 설계

Dashboard Design

가장 중요한 지표(KPI)를 화면 상단·좌측 같은 시선이 먼저 가는 위치에 배치하고, 세부 지표는 필터·드릴다운으로 접근하게 만드는 정보 위계를 고려한 설계. 한 화면에 너무 많은 차트를 욱여넣으면 오히려 의사결정을 늦춘다는 점이 핵심 원칙.

지리공간 시각화

Geospatial Visualization

위도·경도를 가진 데이터를 지도 위에 점·영역·색 농도로 표현해, 숫자 표로는 드러나지 않는 지역적 패턴(어느 지역에 매출이 몰리는지, 어느 동네에 배달이 몰리는지)을 한눈에 파악할 수 있게 하는 시각화 기법. 단순 위치 표시를 넘어 지역별 값을 색 농도로 나타내는 코로플레스 지도가 대표적.

ex) 배달 앱이 지역별 주문 밀도를 지도 색상으로 표시해 신규 물류센터 입지를 결정하는 데 활용하는 것.

비즈니스 인텔리전스 4학년 1학기

Business Intelligence

KPI 설계와 지표 관리

KPI Design & Metrics Management

조직의 목표를 측정 가능한 숫자(예: 월간 활성 사용자 수, 전환율)로 구체화하고, 그 값이 목표 대비 어떻게 움직이는지 정기적으로 추적하는 활동. 좋은 KPI는 실제로 통제 가능한 행동과 인과적으로 연결되어야 함.

데이터 기반 의사결정

Data-Driven Decision Making

경험이나 직관 대신 데이터 분석 결과와 실험(A/B 테스트 등)의 통계적 근거를 바탕으로 의사결정을 내리는 조직 운영 방식. 다만 상관관계를 인과관계로 오판하지 않도록 실험 설계와 통계적 유의성 검증이 뒷받침돼야 함.

코호트 분석

Cohort Analysis

전체 사용자를 뭉뚱그려 평균 지표만 보면 "이번 달 가입자"와 "1년 전 가입자"가 섞여 진짜 추세를 놓치는데, 같은 시기에 가입(또는 특정 행동을 함)한 사용자 집단(코호트)별로 나눠 시간 경과에 따른 행동(재구매율, 잔존율)을 추적하면 특정 시기의 마케팅이나 제품 변경이 실제로 사용자 유지에 효과가 있었는지 훨씬 명확하게 판별할 수 있음.

ex) 1월 가입자와 6월 가입자의 3개월 후 재방문율을 따로 비교해 신규 온보딩 개선의 실제 효과를 검증하는 것.