image.png

직무 카테고리

DATA/AI 직무 카테고리별로 정리한 가이드북입니다.

직무 카테고리 애널리틱스 엔지니어 데이터 분석가 데이터 엔지니어 AI 엔지니어 전방 배치 엔지니어 (FDE)
직무 설명 데이터 분석 영역과 데이터 엔지니어링 영역의 교차점에서 필요한 데이터 모델링과 시멘틱 레이어를 구축합니다. 다양한 데이터를 기반으로 비즈니스 결정에 필요한 인사이트를 도출하고 의사결정을 지원합니다. 데이터를 수집하고 해당 데이터를 저장·처리하는 데이터 파이프라인을 설계 및 구축하고 운영합니다. LLM 모델을 활용한 어플리케이션/프로덕트에 배포하여 비즈니스 가치를 창출합니다. 고객사의 실무 현장에 파견되어 현장 밀착형 문제를 정의하고, 프로덕트 환경에 솔루션을 구현하고 운영합니다.
핵심 업무 데이터 품질을 신뢰할 수 있는 셀프 서비스 (Self-Service) 기반의 데이터를 활용할 수 있는 환경을 구축합니다. W5H1, MECE 모델로 데이터 기반 의사결정을 지원합니다. 안정적이고 확장 가능한
데이터 파이프라인 시스템 및 인프라 구축 LLM 모델을 적용하여 사용자 경험을 혁신
하고 비즈니스 프로세스를 효율화 고객 요구사항을 바탕으로 모호한 비즈니스 문제를 해결하는 솔루션을 전달합니다.
주요 업무 키워드 • dbt 모델 개발
• 매트릭스/시맨틱 레이어 구축
• 데이터 품질 테스트 자동화 • 비즈니스 지표 및 임팩트 측정
• EDA, 대시보드 구축
• A/B 테스트 분석 • ETL/ELT 파이프라인 구축
• 데이터 웨어하우스 설계
• 배치/스트리밍 데이터 처리 • LLM 모델 학습 및 튜닝
• MLOps/ LLMOps 구축
• LLM/GenAI 기반 어플리케이션 개발 • 문제 기반 솔루션/시스템 아키텍처 도출• 비즈니스 문제 기반 PoC 및 MVP 제공• LLM 기반 엔터프라이즈 어플리케이션 개발/운영
주요 협업 대상 데이터 분석가, 데이터 엔지니어, PM PM, 마케팅, 운영 부서 및 경영진 백엔드 개발자, 데브옵스 개발자, 데이터 분석가 데이터 엔지니어, 백엔드 개발자, PM 운영 부서 및 경영진, 인프라 엔지니어, 클라우드 아키텍트, PM
평균 연봉 (US) $90K - $140K $75K - $120K $100K - $160K $120K - $200K $230K - $240K
커리어 로드맵 Junior → Senior DAE
→ Staff DAE
→ Head of Analytics Engineering Junior Analyst → Senior Analyst → Analytics Manager → Head of Analytics / CDO Junior → Senior DE
→ Staff/Principal DE
→ Data Architect / VP Eng Junior → Senior AI Eng
→ Staff/Principal ML Eng
→ AI Director / CTO Junior FDE → Senior FDE → Staff / Principal FDE → Chief Solution Architect / Distinguished Engineer
진입 난이도 ★★★☆☆ ★★☆☆☆ ★★★★☆ ★★★★★ ★★★★★
핵심 기술 스택 SQL, Python, dbt, Data Modeling, Git SQL, Python(Pandas, Numpy), Tableau/Power BI, Statistics, Excel SQL, Python, Spark, Airflow, Cloud (AWS/GCP/Azure) Python (PyTorch/TensorFlow), MLOps, LLM, RAG, Docker/K8s Frontend/ Backend / Database / DevOps / CloudOps / Agentic Stack
관련 전공 데이터 사이언스, 소프트웨어공학 통계학, 경영학, 경제학, 사회과학, 심리학, 금융학 컴퓨터공학, 소프트웨어공학, 인프라/백엔드 컴퓨터공학, 수학, 통계학, AI 전공 컴퓨터공학, 소프트웨어공학, 데이터 과학, AI 전공

애널리틱스 엔지니어

데이터 분석 영역과 데이터 엔지니어링 영역의 교차점에서 필요한 데이터 모델링과 시멘틱 레이어를 구축합니다.

<aside>

목차

</aside>

직무 설명

직무 역할 데이터 엔지니어링과 데이터 분석의 중간에서, 데이터의 품질을 신뢰할 수 있도록 데이터 모델과 매트릭스 레이어를 구축하는 전문가입니다.
핵심 미션 데이터 활용의 신빙성을 극대화하고, 조직 전체가 일관된 수치와 지표로 의사결정할 수 있는 분석 환경을 구축합니다.
직무 스킬 데이터 모델링 × 시스템 디자인 × 분석적 해석력 = 에너레틱스 엔지니어

주요 업무

업무 내용 설명 빈도
데이터 모델 개발 및 개선 각 데이터 레이어별 모델링 및 구조 개선 매일
코드 버저닝 및 리팩토링 팀원의 dbt 모델 리뷰 및 피드백 매일
데이터 품질 테스트 및 검증 dbt test, Python Great Expectations 등으로 데이터 품질 검증 매일
시맨틱/매트릭스 레이어 관리 Metrics/Semantic Layer 설계 및 모델링 주 2-3회
데이터 모델 문서화 Data Glossary, Entity Relationship Diagram, Data Lineage 등을 문서화 주 1-2회
신규 분석 모델 요청 대응 새로운 데이터 모델 요청 접수 및 우선순위 조정 주 2-3회
기존 데이터 모델 개선 및 리펙토링 데이터 모델의 쿼리 성능 개선, 정확도 증가, 구조 최적화 월 1-2회
신규 데이터 소스 연결 / 통합 새로운 데이터를 연결하여 분석 레이어에 통합 월 1-2회

필수 기술 스택

카테고리 Tool / Skill 숙련도 기준 추천 학습 리소스
데이터 추출 SQL Window Function, CTE, Join, 쿼리 성능 최적화 SQL 강좌, SQLZoo
데이터 변환 dbt 데이터 모델링, 스크립트 매크로, 패키지 개발 및 관리 dbt Learn (공식), dbt Community Slack
프로그래밍 Python 데이터 처리 스크립트, dbt/airflow 통합 및 연결 Real Python, Automate the Boring Stuff
데이터 모델링 Kimball / Inmon Modeling Star Schema, Snowflake Schema를 활용한 웨어하우스 설계 The Data Warehouse Toolkit (도서)
코드 버전 관리 Git / GitHub / GitLab / Bitbucket Pull Request 프로세스화, Branch 관리, CI/CD 연동 가능 GitHub Learning Lab, Atlassian Git Tutorial
클라우드 웨어하우스 BigQuery / Snowflake / Databricks 테이블 파티셔닝, 클러스터링, 비용 최적화 각 플랫폼 공식 문서 및 인증 자격증 (Cetrificate)
매트릭스 / 시맨틱 레이어 Looker / Tableau / dbt Metrics 매트릭스 레이어 /시맨틱 레이어 설계 및 관리 Looker 공식 학습, dbt Metrics 문서
오케스트레이션 Airflow / Dagster / Prefect 데이터 처리 작업 스케줄링 및 의존성 관리 Astronomer Academy, Dagster University
데이터 품질 dbt tests / Python Great Expectations 데이터 품질 테스트 자동화 및 모니터링 Great Expectations 공식 문서

역량 체크리스트

역량 항목 초급 (0-1년) 중급 (1-3년) 고급 (3년+)
SQL 데이터 모델링 중급/고급 쿼리및 단순 모델 작성 가능 Kimball 방법론 기반 Dimension/Fact 테이블 설계 조직 전체 데이터 모델 아키텍처 설계 및 거버넌스 수립
dbt 활용 기본 모델, source, ref 사용 가능 매크로, 패키지, incremental 모델 활용 커스텀 materialization, dbt 패키지 개발, CI/CD 구축
데이터 품질 파이프라인 (ETL,ELT) 연결, 재시도, 품질 체크 커스텀 테스트, 데이터 계약(Contract) 설계 조직 전체 데이터 품질 시스템 구축 및 SLA 관리
소프트웨어 공학 원칙 Git 기본 사용, 코드 포맷팅 PR 리뷰 문화, DRY 원칙, 모듈화 설계 코딩 스탠다드 수립, 아키텍처 의사결정 기록(ADR)
비즈니스 이해 데이터 모델 요청을 그대로 수행 비즈니스 메트릭스 정의에 참여, 용어 표준화 조직 전체 메트릭스 거버넌스 주도, 데이터 전략 기여
커뮤니케이션 팀 내 기술 공유 가능 분석가-엔지니어 간 브릿지 역할 수행 기술 방향성 제시, 팀 간 협업 프로세스 설계

커리어 로드맵

단계 기간 핵심 목표 필요 역량 포트폴리오 예시
입문 0 - 6개월 SQL 고급 마스터dbt 기초 학습 및 프로젝트 적용 SQL 고급, Git 기초dbt 기초, 데이터 모델링 개념 개인 프로젝트에 dbt 적용
공공데이터 Staging→Mart 모델 구축
주니어 6개월 - 2년 독립적 dbt 프로젝트 수행데이터 모델링 방법론 습득 Kimball 방법론, dbt 중급, Jinja 매크로, 데이터 품질 테스트 dbt 프로젝트 오픈소스
공개데이터 모델 문서화 포트폴리오
시니어 2 - 5년 전사 데이터 모델 아키텍처 설계메트릭스 레이어 구축 주도 시맨틱 레이어, 성능 최적화데이터 거버넌스, 멘토링 시맨틱 레이어 구축 사례
데이터 품질 프레임워크 설계
스태프/리드 5년+ 전사 분석 인프라 전략 수립팀 구축 및 운영 기술 리더십, 조직 설계데이터 전략, 벤더 평가 AE 팀 빌딩 사례
데이터 플랫폼 마이그레이션 리드

추천 학습 경로

주제 추천 리소스 예상 기간
SQL 고급 Leetcode/HackerRank SQL Medium-Hard 3주
데이터 모델링 The Data Warehouse Toolkit/ Principle 4주
dbt 기초 ~ 중급 dbt Learn / Metrics / Test 4주
Git & SWE 원칙 GitHub를 바탕으로 브런치 및 CI/CD 파이프라인 구축하기 2주
시맨틱 레이어 & 메트릭스 dbt Metrics / Looker LookML 로 분석 레리어 구축 3주
dbt 프로젝트 실습 공공데이터를 활요한 dbt 파이프라인 기반 BI 대시보드 만들기 4주

면접 준비 가이드

유형 예시 질문 평가 포인트 모범 답안
SQL 어떤 데이터 테이블(Entity)들을 사용하여 구독 기반 서비스 유저들의 코호트 리텐션을 구할 것인지를 설명해주세요. 복잡한 쿼리 설계, 성능 고려, 가독성 코호트 리텐션은 가입일 등 특정 시점의 공통 경험을 공유한 사용자 집단을 시간 흐름에 따라 추적하여 유지율을 측정하는 방식입니다. 이를 위해 사용자 테이블, 가입/첫 방문 기록 테이블, 그리고 재방문이나 구매 등 특정 행동 로그 테이블을 JOIN하여 각 그룹의 기간별 잔존 비율을 계산합니다. 이를 통해 특정 시점 유입자의 잔존 비율 (Retention Rate)를 구할 수 있습니다.
Data Modeling 이커머스 주문 데이터를 Star Schema를 바탕으로 설계해주세요. Kimball 방법론 이해, SCD (Slow Changing Dimension) 처리, 정규화/비정규화 판단 Fact Table에 주문 수량 및 상품별 판매 금액 같은 수치 데이터를 담은 팩트 테이블을 배치하고, 이를 중심으로 고객, 제품, 날짜, 지역 등 설명 속성을 가진 차원 테이블들을 외래 키 (Foreign Key)로 연결합니다. 팩트 테이블에는 각 차원 테이블의 기본 키를 참조하는 외래 키를 포함시켜서 분석 쿼리를 작성할 시 필요한 Join만 사용할 수 있도록 성능을 최적화하는 구조로 설계합니다.
dbt dbt에서 incremental 모델을 사용하는 이유와 장단점은? dbt 핵심 개념 이해, 실무 경험, 트레이드오프(Trade-off) 분석 전체 데이터를 매번 재처리하는 대신 새로 추가되거나 변경된 데이터만 선택적으로 업데이트하여 계산 및 서버 비용을 절감하고 처리 속도를 높이기 위해 사용합니다. 장점으로는 대용량 데이터 처리 시 효율성이 뛰어나다는 점이 있지만, 단점으로는 로직이 복잡해질 수 있고, 데이터 불일치가 발생할 경우 전체 재가동를 통한 데이터 재적재가 필요할 수 있습니다.
데이터 거버넌스 질문 데이터 품질 이슈를 발견하고 해결한 경험을 공유해 주세요 문제 해결 능력, 재발 방지 체계 수립 및 자동화 특정 유저 리텐션을 계산하는 데이터 파이프라인에서 특정 수치가 비즈니스의 이해와 일치하지 않는 문제를 확인했습니다. 따라서 해당 시스템의 데이터 파이프라인 전체를 검토해 특정 Join이 지표를 과도하게 증대하고 있는다는 사실을 확인했습니다. 쿼리를 수정한 후 dbt 테스트와 Airflow 유효성 검사 단계를 추가하여 이상 데이터의 적재를 방지하고 자동 알림 및 모니터링 체계를 구축해 오류를 방지했습니다.
회사 컬처 핏 질문 데이터 분석팀과 데이터 엔지니어팀 사이에서 갈등이 발생했을 때 어떻게 하시겠습니까? 커뮤니케이션 역량, 우선순위 조정 먼저 비즈니스 목표를 우선시하여 각 입장을 경청한 다음, 갈등의 원인이 데이터 지표의 차이인지, 또는 기술적 오류인지를 먼저 파악합니다. 이후 필요에 따라 데이터 카탈로그나 표준화된 파이프라인 문서를 제시함으로써 각 부서별로 합의된 내용을 바탕으로 협업 프로세스를 개선하도록 하겠습니다.