
DATA/AI 직무 카테고리별로 정리한 가이드북입니다.
| 직무 카테고리 | 애널리틱스 엔지니어 | 데이터 분석가 | 데이터 엔지니어 | AI 엔지니어 | 전방 배치 엔지니어 (FDE) |
|---|---|---|---|---|---|
| 직무 설명 | 데이터 분석 영역과 데이터 엔지니어링 영역의 교차점에서 필요한 데이터 모델링과 시멘틱 레이어를 구축합니다. | 다양한 데이터를 기반으로 비즈니스 결정에 필요한 인사이트를 도출하고 의사결정을 지원합니다. | 데이터를 수집하고 해당 데이터를 저장·처리하는 데이터 파이프라인을 설계 및 구축하고 운영합니다. | LLM 모델을 활용한 어플리케이션/프로덕트에 배포하여 비즈니스 가치를 창출합니다. | 고객사의 실무 현장에 파견되어 현장 밀착형 문제를 정의하고, 프로덕트 환경에 솔루션을 구현하고 운영합니다. |
| 핵심 업무 | 데이터 품질을 신뢰할 수 있는 셀프 서비스 (Self-Service) 기반의 데이터를 활용할 수 있는 환경을 구축합니다. | W5H1, MECE 모델로 데이터 기반 의사결정을 지원합니다. | 안정적이고 확장 가능한 | ||
| 데이터 파이프라인 시스템 및 인프라 구축 | LLM 모델을 적용하여 사용자 경험을 혁신 | ||||
| 하고 비즈니스 프로세스를 효율화 | 고객 요구사항을 바탕으로 모호한 비즈니스 문제를 해결하는 솔루션을 전달합니다. | ||||
| 주요 업무 키워드 | • dbt 모델 개발 | ||||
| • 매트릭스/시맨틱 레이어 구축 | |||||
| • 데이터 품질 테스트 자동화 | • 비즈니스 지표 및 임팩트 측정 | ||||
| • EDA, 대시보드 구축 | |||||
| • A/B 테스트 분석 | • ETL/ELT 파이프라인 구축 | ||||
| • 데이터 웨어하우스 설계 | |||||
| • 배치/스트리밍 데이터 처리 | • LLM 모델 학습 및 튜닝 | ||||
| • MLOps/ LLMOps 구축 | |||||
| • LLM/GenAI 기반 어플리케이션 개발 | • 문제 기반 솔루션/시스템 아키텍처 도출• 비즈니스 문제 기반 PoC 및 MVP 제공• LLM 기반 엔터프라이즈 어플리케이션 개발/운영 | ||||
| 주요 협업 대상 | 데이터 분석가, 데이터 엔지니어, PM | PM, 마케팅, 운영 부서 및 경영진 | 백엔드 개발자, 데브옵스 개발자, 데이터 분석가 | 데이터 엔지니어, 백엔드 개발자, PM | 운영 부서 및 경영진, 인프라 엔지니어, 클라우드 아키텍트, PM |
| 평균 연봉 (US) | $90K - $140K | $75K - $120K | $100K - $160K | $120K - $200K | $230K - $240K |
| 커리어 로드맵 | Junior → Senior DAE | ||||
| → Staff DAE | |||||
| → Head of Analytics Engineering | Junior Analyst → Senior Analyst → Analytics Manager → Head of Analytics / CDO | Junior → Senior DE | |||
| → Staff/Principal DE | |||||
| → Data Architect / VP Eng | Junior → Senior AI Eng | ||||
| → Staff/Principal ML Eng | |||||
| → AI Director / CTO | Junior FDE → Senior FDE → Staff / Principal FDE → Chief Solution Architect / Distinguished Engineer | ||||
| 진입 난이도 | ★★★☆☆ | ★★☆☆☆ | ★★★★☆ | ★★★★★ | ★★★★★ |
| 핵심 기술 스택 | SQL, Python, dbt, Data Modeling, Git | SQL, Python(Pandas, Numpy), Tableau/Power BI, Statistics, Excel | SQL, Python, Spark, Airflow, Cloud (AWS/GCP/Azure) | Python (PyTorch/TensorFlow), MLOps, LLM, RAG, Docker/K8s | Frontend/ Backend / Database / DevOps / CloudOps / Agentic Stack |
| 관련 전공 | 데이터 사이언스, 소프트웨어공학 | 통계학, 경영학, 경제학, 사회과학, 심리학, 금융학 | 컴퓨터공학, 소프트웨어공학, 인프라/백엔드 | 컴퓨터공학, 수학, 통계학, AI 전공 | 컴퓨터공학, 소프트웨어공학, 데이터 과학, AI 전공 |
데이터 분석 영역과 데이터 엔지니어링 영역의 교차점에서 필요한 데이터 모델링과 시멘틱 레이어를 구축합니다.
<aside>
</aside>
| 직무 역할 | 데이터 엔지니어링과 데이터 분석의 중간에서, 데이터의 품질을 신뢰할 수 있도록 데이터 모델과 매트릭스 레이어를 구축하는 전문가입니다. |
|---|---|
| 핵심 미션 | 데이터 활용의 신빙성을 극대화하고, 조직 전체가 일관된 수치와 지표로 의사결정할 수 있는 분석 환경을 구축합니다. |
| 직무 스킬 | 데이터 모델링 × 시스템 디자인 × 분석적 해석력 = 에너레틱스 엔지니어 |
| 업무 내용 | 설명 | 빈도 |
|---|---|---|
| 데이터 모델 개발 및 개선 | 각 데이터 레이어별 모델링 및 구조 개선 | 매일 |
| 코드 버저닝 및 리팩토링 | 팀원의 dbt 모델 리뷰 및 피드백 | 매일 |
| 데이터 품질 테스트 및 검증 | dbt test, Python Great Expectations 등으로 데이터 품질 검증 | 매일 |
| 시맨틱/매트릭스 레이어 관리 | Metrics/Semantic Layer 설계 및 모델링 | 주 2-3회 |
| 데이터 모델 문서화 | Data Glossary, Entity Relationship Diagram, Data Lineage 등을 문서화 | 주 1-2회 |
| 신규 분석 모델 요청 대응 | 새로운 데이터 모델 요청 접수 및 우선순위 조정 | 주 2-3회 |
| 기존 데이터 모델 개선 및 리펙토링 | 데이터 모델의 쿼리 성능 개선, 정확도 증가, 구조 최적화 | 월 1-2회 |
| 신규 데이터 소스 연결 / 통합 | 새로운 데이터를 연결하여 분석 레이어에 통합 | 월 1-2회 |
| 카테고리 | Tool / Skill | 숙련도 기준 | 추천 학습 리소스 |
|---|---|---|---|
| 데이터 추출 | SQL | Window Function, CTE, Join, 쿼리 성능 최적화 | SQL 강좌, SQLZoo |
| 데이터 변환 | dbt | 데이터 모델링, 스크립트 매크로, 패키지 개발 및 관리 | dbt Learn (공식), dbt Community Slack |
| 프로그래밍 | Python | 데이터 처리 스크립트, dbt/airflow 통합 및 연결 | Real Python, Automate the Boring Stuff |
| 데이터 모델링 | Kimball / Inmon Modeling | Star Schema, Snowflake Schema를 활용한 웨어하우스 설계 | The Data Warehouse Toolkit (도서) |
| 코드 버전 관리 | Git / GitHub / GitLab / Bitbucket | Pull Request 프로세스화, Branch 관리, CI/CD 연동 가능 | GitHub Learning Lab, Atlassian Git Tutorial |
| 클라우드 웨어하우스 | BigQuery / Snowflake / Databricks | 테이블 파티셔닝, 클러스터링, 비용 최적화 | 각 플랫폼 공식 문서 및 인증 자격증 (Cetrificate) |
| 매트릭스 / 시맨틱 레이어 | Looker / Tableau / dbt Metrics | 매트릭스 레이어 /시맨틱 레이어 설계 및 관리 | Looker 공식 학습, dbt Metrics 문서 |
| 오케스트레이션 | Airflow / Dagster / Prefect | 데이터 처리 작업 스케줄링 및 의존성 관리 | Astronomer Academy, Dagster University |
| 데이터 품질 | dbt tests / Python Great Expectations | 데이터 품질 테스트 자동화 및 모니터링 | Great Expectations 공식 문서 |
| 역량 항목 | 초급 (0-1년) | 중급 (1-3년) | 고급 (3년+) |
|---|---|---|---|
| SQL 데이터 모델링 | 중급/고급 쿼리및 단순 모델 작성 가능 | Kimball 방법론 기반 Dimension/Fact 테이블 설계 | 조직 전체 데이터 모델 아키텍처 설계 및 거버넌스 수립 |
| dbt 활용 | 기본 모델, source, ref 사용 가능 | 매크로, 패키지, incremental 모델 활용 | 커스텀 materialization, dbt 패키지 개발, CI/CD 구축 |
| 데이터 품질 | 파이프라인 (ETL,ELT) 연결, 재시도, 품질 체크 | 커스텀 테스트, 데이터 계약(Contract) 설계 | 조직 전체 데이터 품질 시스템 구축 및 SLA 관리 |
| 소프트웨어 공학 원칙 | Git 기본 사용, 코드 포맷팅 | PR 리뷰 문화, DRY 원칙, 모듈화 설계 | 코딩 스탠다드 수립, 아키텍처 의사결정 기록(ADR) |
| 비즈니스 이해 | 데이터 모델 요청을 그대로 수행 | 비즈니스 메트릭스 정의에 참여, 용어 표준화 | 조직 전체 메트릭스 거버넌스 주도, 데이터 전략 기여 |
| 커뮤니케이션 | 팀 내 기술 공유 가능 | 분석가-엔지니어 간 브릿지 역할 수행 | 기술 방향성 제시, 팀 간 협업 프로세스 설계 |
| 단계 | 기간 | 핵심 목표 | 필요 역량 | 포트폴리오 예시 |
|---|---|---|---|---|
| 입문 | 0 - 6개월 | SQL 고급 마스터dbt 기초 학습 및 프로젝트 적용 | SQL 고급, Git 기초dbt 기초, 데이터 모델링 개념 | 개인 프로젝트에 dbt 적용 |
| 공공데이터 Staging→Mart 모델 구축 | ||||
| 주니어 | 6개월 - 2년 | 독립적 dbt 프로젝트 수행데이터 모델링 방법론 습득 | Kimball 방법론, dbt 중급, Jinja 매크로, 데이터 품질 테스트 | dbt 프로젝트 오픈소스 |
| 공개데이터 모델 문서화 포트폴리오 | ||||
| 시니어 | 2 - 5년 | 전사 데이터 모델 아키텍처 설계메트릭스 레이어 구축 주도 | 시맨틱 레이어, 성능 최적화데이터 거버넌스, 멘토링 | 시맨틱 레이어 구축 사례 |
| 데이터 품질 프레임워크 설계 | ||||
| 스태프/리드 | 5년+ | 전사 분석 인프라 전략 수립팀 구축 및 운영 | 기술 리더십, 조직 설계데이터 전략, 벤더 평가 | AE 팀 빌딩 사례 |
| 데이터 플랫폼 마이그레이션 리드 |
| 주제 | 추천 리소스 | 예상 기간 |
|---|---|---|
| SQL 고급 | Leetcode/HackerRank SQL Medium-Hard | 3주 |
| 데이터 모델링 | The Data Warehouse Toolkit/ Principle | 4주 |
| dbt 기초 ~ 중급 | dbt Learn / Metrics / Test | 4주 |
| Git & SWE 원칙 | GitHub를 바탕으로 브런치 및 CI/CD 파이프라인 구축하기 | 2주 |
| 시맨틱 레이어 & 메트릭스 | dbt Metrics / Looker LookML 로 분석 레리어 구축 | 3주 |
| dbt 프로젝트 실습 | 공공데이터를 활요한 dbt 파이프라인 기반 BI 대시보드 만들기 | 4주 |
| 유형 | 예시 질문 | 평가 포인트 | 모범 답안 |
|---|---|---|---|
| SQL | 어떤 데이터 테이블(Entity)들을 사용하여 구독 기반 서비스 유저들의 코호트 리텐션을 구할 것인지를 설명해주세요. | 복잡한 쿼리 설계, 성능 고려, 가독성 | 코호트 리텐션은 가입일 등 특정 시점의 공통 경험을 공유한 사용자 집단을 시간 흐름에 따라 추적하여 유지율을 측정하는 방식입니다. 이를 위해 사용자 테이블, 가입/첫 방문 기록 테이블, 그리고 재방문이나 구매 등 특정 행동 로그 테이블을 JOIN하여 각 그룹의 기간별 잔존 비율을 계산합니다. 이를 통해 특정 시점 유입자의 잔존 비율 (Retention Rate)를 구할 수 있습니다. |
| Data Modeling | 이커머스 주문 데이터를 Star Schema를 바탕으로 설계해주세요. | Kimball 방법론 이해, SCD (Slow Changing Dimension) 처리, 정규화/비정규화 판단 | Fact Table에 주문 수량 및 상품별 판매 금액 같은 수치 데이터를 담은 팩트 테이블을 배치하고, 이를 중심으로 고객, 제품, 날짜, 지역 등 설명 속성을 가진 차원 테이블들을 외래 키 (Foreign Key)로 연결합니다. 팩트 테이블에는 각 차원 테이블의 기본 키를 참조하는 외래 키를 포함시켜서 분석 쿼리를 작성할 시 필요한 Join만 사용할 수 있도록 성능을 최적화하는 구조로 설계합니다. |
| dbt | dbt에서 incremental 모델을 사용하는 이유와 장단점은? | dbt 핵심 개념 이해, 실무 경험, 트레이드오프(Trade-off) 분석 | 전체 데이터를 매번 재처리하는 대신 새로 추가되거나 변경된 데이터만 선택적으로 업데이트하여 계산 및 서버 비용을 절감하고 처리 속도를 높이기 위해 사용합니다. 장점으로는 대용량 데이터 처리 시 효율성이 뛰어나다는 점이 있지만, 단점으로는 로직이 복잡해질 수 있고, 데이터 불일치가 발생할 경우 전체 재가동를 통한 데이터 재적재가 필요할 수 있습니다. |
| 데이터 거버넌스 질문 | 데이터 품질 이슈를 발견하고 해결한 경험을 공유해 주세요 | 문제 해결 능력, 재발 방지 체계 수립 및 자동화 | 특정 유저 리텐션을 계산하는 데이터 파이프라인에서 특정 수치가 비즈니스의 이해와 일치하지 않는 문제를 확인했습니다. 따라서 해당 시스템의 데이터 파이프라인 전체를 검토해 특정 Join이 지표를 과도하게 증대하고 있는다는 사실을 확인했습니다. 쿼리를 수정한 후 dbt 테스트와 Airflow 유효성 검사 단계를 추가하여 이상 데이터의 적재를 방지하고 자동 알림 및 모니터링 체계를 구축해 오류를 방지했습니다. |
| 회사 컬처 핏 질문 | 데이터 분석팀과 데이터 엔지니어팀 사이에서 갈등이 발생했을 때 어떻게 하시겠습니까? | 커뮤니케이션 역량, 우선순위 조정 | 먼저 비즈니스 목표를 우선시하여 각 입장을 경청한 다음, 갈등의 원인이 데이터 지표의 차이인지, 또는 기술적 오류인지를 먼저 파악합니다. 이후 필요에 따라 데이터 카탈로그나 표준화된 파이프라인 문서를 제시함으로써 각 부서별로 합의된 내용을 바탕으로 협업 프로세스를 개선하도록 하겠습니다. |