AI 엔지니어로 일하다 보면 회사에 관련 조직이 막 생기기 시작해 역할과 책임 범위가 계속 바뀌는 시기를 겪습니다. 실무는 계속 늘고 있는데 이 조직에서 리드로 자리잡으려면 무엇을 더 쌓아야 하는지 판단하기 어려운 경우가 많아요. 커리어 로드맵은 지금까지 다룬 프로젝트와 커리어 기록, 목표 직무를 함께 읽어 현재 위치와 목표 사이의 격차를 짚고, 현 직장의 신설 조직에서 리드로 자리잡는 경로(A)·개인 프로젝트로 리드 역량을 증명하는 경로(B)·이직으로 전환하는 경로(C)를 각각 리포트로 제시해요. 아래는 AI 엔지니어(LLM/생성형) 4년차가 LLM 서비스 개발 리드를 목표로 받은 실제 리포트 예시입니다.
포함 직무: 데이터 분석가 · 데이터 엔지니어 · 데이터 사이언티스트 · 머신러닝 엔지니어 · AI 엔지니어(LLM/생성형)
커리어 로드맵은 아래처럼 입력한 커리어 데이터·기록·목표를 근거로 만들어져요. 내 데이터를 넣으면 내 리포트를 받습니다.
리포트 예시: AI 엔지니어(LLM/생성형) 4년차 → LLM 서비스 개발 리드
현재는 LLM 기능을 API 연결 수준으로 다루는 단계가 아니라, RAG 품질·평가·비용·운영 지표를 직접 설계한 중급 LLM 엔지니어에 가깝습니다. 목표인 LLM 서비스 개발 리드까지의 핵심 격차는 기술 선택 권한을 넘어 여러 엔지니어의 실행을 묶는 운영 표준, 실서비스 안전장치, 장기 품질 의사결정 경험입니다. 현재 3인 신설 AI팀에서 이미 전권을 가진 만큼 주력은 현 직장에서 평가와 운영 체계를 팀 표준으로 만드는 경로가 맞습니다. 개인 프로젝트는 공개 가능한 평가·서빙 사례를 보강하는 보조 수단으로 쓰고, 이직은 현재 팀에서 리드 범위와 실트래픽 운영 경험이 더 이상 커지지 않을 때 검토하는 편이 합리적입니다.
테크노바(AI 신설 조직)
데이터브릿지
AI 글쓰기 도우미 앱
경력 사다리로 보면 실행 중심 주니어를 넘어, 서비스 구조와 핵심 지표를 설계하는 미들 후반에 있습니다. RAG 정확도·지연, eval, 비용, 사용자 피드백을 한 서비스 안에서 다뤘고 데이터 엔지니어링 경력까지 있어 시스템 관점도 있습니다. 다만 리드 단계의 기준인 팀 기술 방향의 지속적 의사결정, 운영 표준 확산, 다른 사람의 설계와 실행을 끌어올린 증거는 아직 기록이 제한적입니다.
강점
공백
이미 준비된 것
비어 있는 것
현 직장 안에서 평가 기준, 운영 지표, 릴리스 승인, 설계 리뷰를 한 묶음으로 만드는 데 주력을 둡니다. 이 선택이 목표와 가장 가까운 품질 의사결정과 팀 리드 증거를 동시에 빠르게 채웁니다.
개인 프로젝트는 주당 3시간만 배정해 공개 RAG 평가 저장소 또는 서빙 벤치마크 중 하나를 90일 안에 완성하세요. 회사 자료를 복제하지 말고 공개 데이터와 재현 가능한 수치만 사용합니다.
현재는 이직보다 내부 역할 확장이 우선입니다. 2개 분기 뒤에도 릴리스 책임·설계 리뷰·운영 지표 오너십이 생기지 않거나 실서비스 규모가 제한되면 그때 이직을 재검토하세요.
평가 기준표 정립
당장 RAG와 요약 기능에 공통으로 적용할 평가 기준표를 제안하세요. 이미 200개 eval set과 회귀 감지율 90% 이상을 확보했지만, 리드가 되려면 검색·생성·근거성·안전성·비용·지연을 릴리스 판단으로 묶어야 합니다. 기준별 샘플 수, 임계값, 실패 사례, 변경 승인자를 문서와 저장소 이력으로 남기세요.
운영 지표 표준화
다음 4주 안에 서비스별 latency, 오류율, 토큰 비용, 사용자 불만족 비율을 한 화면에서 보는 대시보드를 제안하세요. 현재 비용을 월 850만원에서 510만원으로 낮추고 불만족 비율을 18%에서 9%로 줄인 경험은 있지만, 추세와 경보 기준이 있어야 운영 책임을 팀 단위로 넘길 수 있습니다. 지표 정의서, 대시보드 캡처, 경보 발생 기록과 조치 결과를 저장하세요.
릴리스 승인 흐름
다음 분기에는 프롬프트·모델·검색 설정 변경에 대한 실험과 승인 흐름을 맡으세요. 현재 기술 선택 전권은 있으나 평가·운영 체계가 없으므로, 변경 전 eval 실행과 회귀 여부 확인을 배포 조건으로 만들어야 합니다. 변경 요청 수, 통과·반려 결과, 회귀 사례와 복구 시간을 분기 기록으로 남기세요.
설계 리뷰 운영
팀 3인의 RAG·서빙·평가 작업을 주간 설계 리뷰로 묶고 ADR 형식으로 의사결정을 기록하세요. 세미나 2회와 프롬프트 가이드 문서는 지식 공유의 출발점이지만, 리드 판단은 다른 사람이 같은 기준으로 설계하고 실행하게 만드는 데서 확인됩니다. 리뷰 안건 수, 피드백 반영 PR, 담당자별 출시 결과를 기록하면 사람을 움직인 증거가 생깁니다.
공개 RAG 평가 저장소
공개 문서 코퍼스로 hybrid retrieval, reranking, chunking을 비교하는 RAG 저장소를 만드세요. 검색 recall만 제시하지 말고 eval set, 생성 답변의 근거성 판정, 지연·비용 비교, 실패 사례와 재현 절차까지 있어야 시장에서 설계 역량 신호로 통합니다. 6~8주 안에 코드 저장소, 실험 보고서, 결과 그래프와 설계 결정 문서를 산출하세요.
모델 서빙 벤치마크
소형 오픈소스 모델을 대상으로 캐싱, 배치 추론, 양자화 또는 모델 라우팅의 조건별 성능을 비교하세요. 단순 데모가 아니라 요청량, 품질 손실, 평균·p95 지연, 사용자당 비용을 같은 조건에서 기록해야 현재 회사의 비용 40% 절감 경험을 재현 가능한 기술 사례로 확장할 수 있습니다. 4~6주 안에 실행 스크립트, 벤치마크 결과, 비용 계산서와 운영 한계 문서를 공개하세요.
LLM 운영 장애 실험
개인 앱에 모델 timeout, 검색 결과 부족, 잘못된 근거, 비용 급증 상황을 주입하고 fallback과 알림 흐름을 구현하세요. 개인 프로젝트는 실트래픽 규모를 증명하지 못하지만, 장애를 가정한 상태 설계와 복구 기준은 공개 사례로 보여줄 수 있습니다. 4주 안에 장애 시나리오 목록, 대시보드, 복구 결과와 롤백 의사결정 기록을 산출하세요.
개인 프로젝트로는 안 되는 것
개인 프로젝트만으로 여러 엔지니어의 설계 리뷰, 업무 배분, 실제 조직 릴리스 승인 권한은 증명되지 않습니다. 이 격차는 현재 3인 AI팀에서 리뷰 운영과 릴리스 책임을 맡아 PR·ADR·출시 결과로 남겨야 하며, 그 기회가 구조적으로 없다면 리드 역할이 있는 조직으로 이직해야 합니다.
현 시점에는 이직이 필요하지 않습니다. 3인 신설 AI팀에서 기술 선택 전권이 있고, RAG·평가·비용·제품 출시 사례가 이미 있어 우선 현재 회사에서 리드 범위를 넓히는 편이 빠릅니다. 다만 2개 분기 동안 평가 기준의 팀 적용, 설계 리뷰, 운영 책임을 맡을 기회가 없거나 실서비스 트래픽·장애 대응이 구조적으로 제공되지 않으면 이직을 재검토하세요.
AI 제품 성장 조직
시리즈 B 이후 또는 중견 규모의 AI 제품 조직을 우선 보세요. 모델 품질과 비용이 제품 지표에 직접 연결되고 별도 ML·플랫폼 인력이 있는 회사라야 현재 경험을 더 큰 운영 범위로 확장할 가능성이 있습니다. 현 직장에서 공통 eval, 운영 대시보드, 릴리스 기준을 만든 뒤 지원해야 하며, 지금은 RAG 개선 수치는 통하지만 팀 리드 증거는 약합니다.
검색추천 플랫폼 조직
검색·추천·상담 자동화처럼 retrieval과 생성 품질을 핵심 제품 지표로 관리하는 중견 이상 조직을 보세요. 5만 건 문서 RAG와 top-3 recall 84% 개선 경험이 도메인 문제와 직접 연결되므로, 서비스별 평가와 장애 대응을 맡는 역할이 적합합니다. 2개 분기 동안 p95 지연·오류율·fallback 기록을 확보한 시점이 지원 기준이며, 단순 프롬프트 API 통합 역할은 피해야 합니다.
LLM 플랫폼 초기팀
LLM 플랫폼을 새로 만드는 5~20명 안팎의 초기 팀도 후보지만, 기술 결정만이 아니라 조직 표준과 운영 소유권을 직무 범위에 명시한 곳이어야 합니다. 현재 신설 3인 팀에서 스택 선정을 주도한 경험은 전이되지만, 평가·모델 레지스트리·관측 플랫폼을 직접 맡는 조건을 확인한 뒤 움직여야 합니다. 지금의 비용 절감과 eval 경험은 강점이지만 사람을 이끈 사례가 없으면 리드 직함만으로는 부족합니다.
달성 판정: 검색·생성·근거성·안전성·비용·지연을 포함한 평가 문서 1건과 200개 이상 케이스의 실행 결과, 릴리스 임계값을 기록하면 달성입니다.
달성 판정: latency, 오류율, 비용, 불만족 비율의 정의서와 대시보드 1개를 만들고 경보 또는 장애 조치 기록 2건을 남기면 달성입니다.
달성 판정: 공개 데이터 기반 저장소에 retrieval·reranking 비교, 생성 품질 평가, 지연·비용 수치, 실패 사례와 재현 문서를 게시하면 달성입니다.
3인 신설팀의 출시 일정 때문에 평가 기준과 설계 리뷰에 별도 시간이 배정되지 않을 수 있습니다.
대안가장 사용량이 큰 RAG 기능 하나를 대상으로 최소 기준표와 주간 리뷰만 먼저 적용하고, 기존 세미나 가이드와 eval set을 초기 자산으로 연결하세요.
현재 서비스의 트래픽과 장애 책임 범위가 작아 p95 지연, fallback, 온콜 수준의 운영 기록을 만들기 어려울 수 있습니다.
대안개인 앱에서 장애 주입·롤백 실험을 공개하고, 동시에 현 직장에서는 비용·불만족·회귀 지표의 릴리스 기준을 확보한 뒤 2개 분기 후 플랫폼 규모가 큰 조직을 검토하세요.
이력서 자체가 고민이라면 데이터·AI 이력서 피드백·진단 예시도 함께 보세요.
가상 예시가 아니라 직접 쌓아온 커리어 데이터와 기록으로 내 리포트를 받아보세요.
내 로드맵 만들기 →