오픈소스 LLM · 오픈 웨이트
Open-Source Large Language Model / Open Weights
오픈소스 LLM이란?
- 가중치를 공개해 자체 인프라에서 실행 가능한 LLM
- 데이터 주권·비용 통제·커스터마이징이 도입 동기
- 민감 업무만 프라이빗으로 돌리는 하이브리드가 정석
가중치 파일을 손에 쥔다는 것은 AI를 서비스 구독에서 자산 보유로 옮긴다는 뜻입니다. 폐쇄형 API는 제공사가 모델을 올리거나 구버전을 종료하면 어제까지 잘 돌던 프롬프트의 출력이 달라지지만, 내려받은 모델은 버전을 통째로 고정할 수 있어 한 번 받은 검증 결과가 유효기간을 갖습니다. 모델이 바뀔 때마다 재검증 문서를 요구하는 금융·의료에서는 출력의 재현성이 도입 가능 여부를 가르는 조건이 되고, 외부 인터넷이 닫힌 망분리 환경에서도 같은 기능을 돌릴 수 있다는 점이 폐쇄형과 갈리는 지점입니다.
'오픈'이라는 단어 하나에는 최소 세 단계가 섞여 있습니다. 가중치만 푼 오픈 웨이트, 학습 코드와 데이터 구성까지 공개한 완전 공개, 특정 조건에서만 쓸 수 있는 제한 공개가 모두 '오픈 모델'로 불립니다. 아파치 2.0·MIT 계열은 상업 이용 조건이 단순하지만, 커뮤니티 라이선스를 쓰는 모델에는 월간 활성 사용자 상한, 파생 모델 명칭 규정, 출력물의 타사 모델 학습 금지 같은 조항이 붙습니다. 법무 검토 없이 PoC를 본서비스로 승격시켰다가 조항 위반을 뒤늦게 발견하면 모델을 통째로 교체하고 파인튜닝을 처음부터 다시 해야 합니다.
크기 선택은 곧 GPU 예산입니다. 8B급은 4비트 양자화로 VRAM 24GB 카드 한 장에 올라가지만, 70B급은 fp16 기준 140GB 안팎이 필요해 고사양 GPU를 여러 장 묶어야 합니다. 그래서 현실의 구성은 '큰 모델 하나'가 아니라 요약·분류·추출처럼 범위가 좁은 업무를 작은 모델에 나눠 맡기는 쪽으로 갑니다. 손익분기는 토큰 단가가 아니라 GPU 가동률에서 갈리므로, 하루 수십 건짜리 업무는 자체 서빙이 오히려 비쌉니다.
가장 흔한 오해는 '오픈소스니까 공짜'입니다. GPU 임대료와 전력, 모니터링, 야간 장애 대응 인건비가 매달 나가서 가동률이 낮으면 API보다 비싸지는 구간이 생깁니다. 두 번째는 '내려받았으니 안전하다'인데, 파인튜닝 학습셋과 추론 로그를 평문으로 쌓아 두면 결국 같은 유출 경로가 사내에 다시 만들어집니다. 세 번째는 리더보드 점수를 그대로 믿는 것으로, 영어 벤치마크 상위 모델이 자사 한국어 문서에서는 핵심 문장 누락과 사내 용어 오역을 쏟아내는 일이 흔합니다. 자사 데이터 100건으로 직접 붙여 보기 전에는 공개된 숫자를 결론으로 삼지 마십시오.
2023년 메타가 라마(LLaMA)를 연구용으로 공개하고 곧이어 상업적 이용이 가능한 라마 2를 내놓으면서 오픈 웨이트 생태계가 폭발적으로 성장했습니다. 이후 미스트랄, 큐원, 딥시크 등이 성능 격차를 좁히며 '공개 모델로도 충분한 업무'의 범위를 계속 넓혀 왔습니다.
가상의 사례로 살펴보겠습니다. 임직원 900명 규모의 국내 손해보험사 A사는 콜센터 상담 녹취를 자동 요약해 민원 유형을 분류하는 파이프라인을 폐쇄형 API로 6개월간 돌려 왔습니다. 월 토큰 비용이 2,300만 원까지 올랐고, 내부 감사에서 고객 성명과 계약번호가 외부로 나가는 구조라는 지적이 두 건 걸리면서 4개월짜리 전환 과제가 시작됐습니다.
- 디지털혁신팀 박 팀장이 3개월치 토큰 명세를 뽑아 CFO 앞에 놓자 '이 돈이면 GPU를 빌리는 게 낫지 않냐'는 한마디가 돌아왔고, 그 자리에서 전환 검토가 과제로 잡혔습니다.
- AI 엔지니어 2명이 실제 상담 녹취 200건으로 8B·32B 공개 모델 네 종을 붙여 비교했고, 32B 모델이 요약 정확도에서 기존 API 대비 94% 수준을 냈습니다.
- 법무팀 검토에서 1순위 후보의 라이선스에 '월 활성 사용자 7억 명' 조항과 파생 모델 명칭 규정이 걸린 것이 드러나, 조건이 단순한 아파치 2.0 계열로 순위를 바꿨습니다.
- 인프라팀 김 과장은 서버 구매 대신 자사 VPC에 L40S 2장을 임대해 vLLM으로 올렸는데, 첫 2주는 초당 처리량이 목표의 절반이라 배치 크기와 양자화 설정을 세 번 다시 잡았습니다.
- 박 팀장은 고객 정보가 담긴 녹취 요약만 프라이빗 모델에 맡기고, 보도자료 초안이나 회의록 정리는 기존 폐쇄형 API에 그대로 남겨 두 경로로 나눠 운영했습니다.
- 전환 4개월 뒤 월 운영비는 2,300만 원에서 GPU 임대·인건비를 포함해 980만 원으로 줄었고, 고객 정보 외부 전송은 0건이 되어 감사 지적 두 건이 모두 해소됐습니다.