LLMOps
Large Language Model Operations
LLMOps이란?
- LLM 서비스의 운영 관리 체계 (MLOps의 LLM판)
- 프롬프트 버전 관리·평가셋·비용 모니터링이 축
- 시작점은 도구가 아니라 평가셋 구축
LLMOps는 LLM을 활용한 서비스의 개발-배포-운영 전 과정을 체계화하는 실무 영역입니다. 전통적 MLOps가 모델 학습 파이프라인과 배포 자동화에 초점을 뒀다면, LLMOps는 대부분 외부 파운데이션 모델을 API로 쓰는 현실에 맞춰 무게중심이 다릅니다. 관리 대상이 모델 가중치가 아니라 프롬프트, 컨텍스트(RAG 파이프라인), 모델 선택과 라우팅, 출력 품질이기 때문입니다.
실무 구성 요소는 다섯 가지로 정리됩니다. 첫째, 프롬프트 엔지니어링의 산출물을 코드처럼 버전 관리하고 변경 영향을 테스트하는 프롬프트 관리. 둘째, '좋은 답'의 기준을 평가셋으로 만들어 모델·프롬프트 변경 때마다 자동 채점하는 평가(evals). 셋째, 토큰 비용과 응답 지연을 추적하고 캐싱·모델 라우팅으로 최적화하는 비용 관리. 넷째, 환각·유해 출력·프롬프트 인젝션을 막는 가드레일 운영. 다섯째, 실사용 로그에서 실패 사례를 수집해 평가셋과 프롬프트를 개선하는 피드백 루프입니다.
LLMOps가 필요해지는 시점은 명확합니다. 데모는 잘 되는데 실서비스에서 품질이 들쭉날쭉할 때, 모델 버전이 올라가면서 기존 프롬프트가 조용히 깨질 때, API 비용이 예상을 초과할 때입니다. 도구를 먼저 사는 것보다 평가셋 구축부터 시작하는 것이 정석입니다. '무엇이 좋은 출력인가'를 정의한 평가셋이 없으면 어떤 변경도 개선인지 개악인지 알 수 없기 때문입니다.
머신러닝 모델의 운영 체계인 MLOps(DevOps의 ML 확장)에서 파생된 말로, 2022년 말 챗GPT 이후 LLM 애플리케이션이 폭증하면서 프롬프트 관리·평가·비용 최적화라는 고유 과제를 다루는 별도 영역으로 분화했습니다.
고객 문의 자동응답에 LLM을 도입한 팀이 LLMOps 체계를 갖추는 상황입니다.
- 평가셋 구축 — 실제 문의 200건과 모범 답변을 정리해 자동 채점 가능한 평가셋을 만듭니다.
- 프롬프트 버전 관리 — 프롬프트를 저장소에서 관리하고, 변경 시 평가셋 점수 비교를 필수 절차로 둡니다.
- 모니터링 — 응답 지연, 토큰 비용, 사용자 불만족(👎) 비율을 대시보드로 추적합니다.
- 가드레일 — 개인정보 유출·환각이 잦은 질문 유형에 상담사 이관 규칙을 설정합니다.
- 피드백 루프 — 👎 받은 응답을 주간 단위로 검토해 평가셋에 추가하고 프롬프트를 개선합니다.