대치프라임 대치프라임 Your Future 홈으로 →

Your Future

데이터사이언스 / 비즈니스 애널리틱스학과

산업공학과 안에서 데이터로 기업의 의사결정을 돕는 학과예요. 확률통계부터 데이터마이닝, ERP까지 다룹니다. 과목 2개 · 개념 11개.

데이터사이언스 / 비즈니스 애널리틱스

Data Science & Business Analytics

진로 IT 기업(네이버·카카오)금융권 데이터 분석가대기업 DX(디지털 전환) 추진 부서
확률통계 및 시뮬레이션 3학년 1학기

Probability, Statistics & Simulation

가설검정

Hypothesis Testing

표본에서 관찰된 차이가 실제 모집단의 차이인지, 아니면 우연에 의한 것인지를 판단하기 위해, "차이가 없다"는 귀무가설이 참이라고 가정했을 때 지금 관찰된 데이터(또는 더 극단적인 데이터)가 나올 확률(p-value)을 계산해 그 확률이 충분히 작으면 귀무가설을 기각하는 절차.

ex) 새 공정이 기존 공정보다 불량률이 정말 낮은지, 아니면 우연히 낮게 나온 것인지 통계적으로 검증하는 것.

회귀분석

Regression Analysis

독립변수들과 종속변수 사이의 관계를, 실제 관측값과 예측값의 오차 제곱합이 최소가 되도록 계수 를 추정해 하나의 선형식으로 모델링하는 통계 기법. 계수의 크기와 부호로 각 변수가 결과에 미치는 영향의 방향과 정도까지 해석할 수 있음.

ex) 광고비 지출과 매출 사이의 관계를 회귀식으로 모델링해 다음 분기 매출을 예측하는 것.

대기행렬이론

Queueing Theory

고객이 도착하는 속도 와 서비스가 처리되는 속도 의 비율인 이용률 이 1에 가까워질수록 대기줄이 기하급수적으로 길어진다는 확률적 원리를 이용해, 대기시간·줄 길이의 평균과 분포를 수식으로 예측하는 이론.

ex) 콜센터 상담원을 몇 명 배치해야 고객 대기시간이 목표 수준 이하로 유지되는지 계산하는 것.

몬테카를로 시뮬레이션

Monte Carlo Simulation

변수들의 확률분포에서 난수를 반복적으로 뽑아 시스템을 수천~수만 번 가상으로 실행해보고, 그 결과들의 분포로 실제 시스템의 성능이나 위험을 근사적으로 추정하는 방법. 변수가 여럿 얽힌 복잡한 시스템은 수식으로 정확히 풀기 어려워, 반복 시행으로 답에 근사하는 이 방식이 실무에서 널리 쓰임.

ex) 신제품 출시의 예상 수익을 여러 불확실 변수(수요, 원가 등)를 반영해 수천 번 시뮬레이션으로 추정하는 것.

다변량 분석과 주성분분석

Multivariate Analysis & Principal Component Analysis (PCA)

변수가 수십~수백 개인 데이터는 한눈에 파악하기 어려운데, 주성분분석은 서로 상관관계가 높은 원래 변수들을 조합해 데이터의 분산을 가장 많이 설명하는 새로운 소수의 축(주성분)으로 차원을 압축하는 기법. 정보 손실을 최소화하면서도 데이터를 2~3차원으로 시각화하거나, 변수 간 다중공선성 문제를 해결하는 데 널리 쓰임.

ex) 수백 개 설문 문항을 몇 개의 핵심 성향 축으로 압축해 고객 세그먼트를 시각화하는 것.

시계열 분석과 정상성

Time Series Analysis & Stationarity

시간 순서가 있는 데이터를 분석할 때, 평균·분산이 시간에 따라 변하지 않는 정상 시계열이어야 안정적으로 통계 모델을 적용할 수 있는데, 실제 매출·주가 데이터는 대개 추세나 계절성 때문에 정상성이 깨져 있음. 차분(현재값-이전값)으로 추세를 제거해 정상 시계열로 변환하는 전처리가 ARIMA 같은 시계열 모델을 적용하기 전 필수적인 단계.

ex) 꾸준히 증가하는 매출 데이터를 그대로 분석하면 왜곡되므로, 차분해 정상 시계열로 바꾼 뒤 분석하는 것.

A/B테스트의 통계적 검정력

Statistical Power in A/B Testing

실제로 두 그룹 사이에 차이가 있을 때 그 차이를 통계적으로 유의미하다고 정확히 검출해낼 확률이 검정력. 표본 크기가 작거나 실제 효과 크기가 미미하면 검정력이 낮아져, 진짜 효과가 있어도 "차이 없음"으로 잘못 결론 내리는 2종 오류를 범할 위험이 커짐. 실험을 설계하기 전 원하는 검정력을 확보하는 데 필요한 최소 표본 크기를 미리 계산하는 게 신뢰할 만한 A/B테스트의 전제조건.

ex) A/B테스트에서 표본이 너무 적어 실제로는 효과가 있는 새 디자인을 "차이 없다"고 잘못 결론 내리는 것을 방지하는 사전 설계.

데이터분석 및 비즈니스 애널리틱스 4학년 1학기

Data Analytics & Business Analytics

데이터마이닝

Data Mining

수작업으로는 도저히 찾을 수 없는 대량 데이터 속 패턴을, 유사한 데이터끼리 자동으로 묶는 군집분석이나 "A를 사면 B도 산다" 같은 동시발생 규칙을 찾는 연관규칙분석 같은 알고리즘으로 자동 탐색하는 기법.

ex) 온라인 쇼핑몰이 구매 패턴을 분석해 "이 상품을 산 고객이 함께 산 상품"을 추천하는 것.

ERP 시스템

Enterprise Resource Planning

과거 부서마다 따로 관리하던 생산·재무·인사·구매 데이터를 하나의 데이터베이스로 통합해, 한 부서의 데이터 변경이 실시간으로 관련 부서 전체에 반영되도록 만든 통합 정보시스템. 부서 간 정보 불일치와 중복 입력을 없애는 게 핵심 가치.

ex) 영업팀이 주문을 입력하면 생산팀 재고와 재무팀 매출이 동시에 자동 갱신되는 것.

산업통계학

Industrial Statistics

실험계획법으로 어떤 변수(온도, 압력 등)가 공정 결과에 실제로 유의미한 영향을 주는지 최소한의 실험 횟수로 밝혀내고, 그 결과를 통계적으로 검증해 공정 개선 의사결정에 활용하는 응용통계 분야.

ex) 반도체 공정에서 수율에 영향을 주는 변수를 최소 실험으로 찾아내는 실험계획법.

비정형데이터분석

Unstructured Data Analysis

표(정형 데이터)로 정리되지 않은 텍스트·이미지·음성 데이터에서, 자연어처리나 이미지 인식 모델을 이용해 감성·주제·객체 같은 유의미한 정보를 추출해 정형 데이터처럼 분석 가능하게 만드는 기법.

ex) SNS 게시글을 분석해 신제품에 대한 소비자 반응(긍정/부정)을 자동으로 집계하는 것.