휴먼 인 더 루프 · HITL
Human-in-the-Loop
휴먼 인 더 루프란?
- AI 프로세스에 사람의 검토·개입 지점을 두는 설계
- 오류·환각의 최종 방어선이자 책임 소재의 기준
- 위험도가 높은 결정일수록 사람의 개입을 강화
HITL을 설계하기 시작하면 조직 안의 질문이 바뀝니다. 'AI가 얼마나 정확한가'를 따지던 자리에 '틀렸을 때 누가, 어느 시점에 잡아내는가'라는 질문이 들어옵니다. 모델 성능을 100%로 끌어올리는 일은 불가능하지만, 오류가 실제 실행으로 넘어가기 전에 걸리는 관문을 만드는 일은 가능합니다. 정확도 경쟁이 아니라 통제 지점 설계로 논의가 옮겨가는 것이 HITL의 실질적인 효과입니다.
개입 방식은 보통 세 층으로 나뉩니다. 실행 전 사람이 승인해야 진행되는 사전 통제, 실행은 자동으로 하되 로그를 사후에 표본 점검하는 휴먼 온 더 루프(HOTL), 시스템의 가동·중단 권한 자체를 사람이 쥐는 휴먼 인 커맨드(HIC)입니다. 실무에서는 이를 섞어 씁니다. 예컨대 모델 확신도 90% 이상은 자동 처리, 70~90%는 검토 대기열, 70% 미만은 자동 반려로 나누는 식입니다. 주의할 경계가 하나 있습니다. 사람이 화면을 본다고 HITL이 되지는 않습니다. 결과를 뒤집을 권한과 판단할 시간이 함께 주어져야 통제 지점으로 기능합니다.
현장에서 가장 자주 무너지는 곳은 승인 버튼입니다. 검토자 한 명에게 하루 300건이 몰리면 사람은 AI 판단을 그대로 따르는 쪽으로 기울고(자동화 편향), 감사 로그에는 '사람 승인'만 가득 차지만 실제 검토는 사실상 0에 수렴합니다. 이 상태에서 사고가 나면 책임은 마지막에 클릭한 실무자 개인에게 떨어지고, HITL은 알리바이 장치로 전락합니다. 검토 건수 상한, 승인 사유 한 줄 입력, 반려율 모니터링을 같이 두십시오. 반려율이 계속 0%라면 검토가 작동하지 않는다는 신호입니다.
제어 시스템과 머신러닝의 인간 개입 연구에서 발전했으며, 생성형 AI·에이전트 확산과 함께 AI 거버넌스의 표준 용어가 되었습니다.
가상의 사례로 살펴보겠습니다. 임직원 420명 규모의 유통기업 A사가 하반기 공채에 AI 서류 스크리닝을 도입했습니다. 지원자가 2,400명인데 인사팀 서류 검토 인력은 3명, 전형 기간은 2주뿐이었습니다. 도입 첫 주에 '기준도 모르고 떨어뜨린다'는 지원자 문의가 들어오면서 인사팀장이 개입 지점을 다시 짰습니다.
- 인사팀장이 AI의 권한을 잘라냈습니다. 경력 연수·필수 자격증 같은 사실 확인형 미달만 AI가 거르고, 적합도 점수만으로 탈락시키는 것은 금지했습니다.
- 첫 3주는 AI 판정과 담당자 판정을 병행했습니다. AI가 탈락시킨 310건을 채용담당자 2명이 전수 재검토하니 17건이 오탈락이었고, 원인은 경력 기재 형식 차이였습니다.
- 재검토 회의에서 한 담당자가 "이건 사람이 안 봤으면 그냥 떨어졌을 이력서입니다"라고 말했고, 팀장은 점수 60~75점 구간을 '보류'로 빼서 전부 사람에게 넘기도록 규칙을 바꿨습니다.
- 승인 화면도 손봤습니다. 통과·탈락 버튼에 사유 한 줄 입력을 필수로 걸고, 검토자 1인당 하루 120건으로 상한을 둬 기계적인 연속 클릭을 막았습니다.
- 3개월 뒤 오탈락은 17건에서 2건으로 줄었고, 서류 전형 소요 기간은 11일에서 4일로 단축됐습니다. 지원자 이의 제기는 월 23건에서 4건으로 내려갔습니다.