지식 · AI 기초
RLHF · 인간 피드백 강화학습
Reinforcement Learning from Human Feedback
📂AI 기초⏱읽기 1분📊심화🔗관련 4
RLHF이란?
한 줄 정의
사람이 매긴 선호(어느 답이 더 좋은지)로 AI를 다듬어, 더 유용하고 안전하게 만드는 학습 기법. ChatGPT를 '쓸 만하게' 만든 비결.
⚡ 3줄 요약
- 사람 선호로 AI를 다듬음
- 더 유용·안전하게
- ChatGPT를 쓸 만하게 만든 비결
거대한 텍스트로 학습한 언어모델은 똑똑하지만 무례하거나 엉뚱할 수 있습니다. RLHF는 사람이 여러 답변 중 더 나은 것을 고르게 해 '선호 모델'을 만들고, 그 선호를 보상 삼아 AI를 강화학습으로 다듬습니다. 결과적으로 사람이 원하는 방식으로 답하게 됩니다.
ChatGPT가 갑자기 유용해진 핵심 이유가 이 기법입니다. 유용함·정직함·무해함 같은 인간의 가치에 AI를 '정렬(alignment)'하는 대표 방법으로, 최근엔 더 효율적인 변형들도 나오고 있습니다.
💡 쉽게 말하면
'이 답이 저 답보다 낫다'는 사람 평가로 AI를 길들이는 것 — 똑똑함을 예의 바르게 만듭니다.
실무에서 왜 중요한가
AI가 '똑똑함'을 넘어 '사람에게 도움이 되게' 만드는 기법입니다. AI 정렬·안전의 핵심입니다.
유래와 출처
2022년 OpenAI의 InstructGPT·ChatGPT에 적용되며 대중적으로 알려졌고, 대형 언어모델을 사람 선호에 맞추는 표준 정렬 기법으로 자리잡았습니다.
출처 · 크리스티아노(Christiano) 등, 「Deep RL from Human Preferences」(2017)
사례로 이해하기
예를 들어, RLHF로 AI 답변을 다듬는 과정을 봅시다.
- 생성 — AI가 한 질문에 여러 답을 만듭니다.
- 사람 평가 — 평가자가 더 나은 답을 고릅니다.
- 보상 모델 — 그 선호를 학습해 '좋은 답' 기준을 만듭니다.
- 강화학습 — AI가 그 보상을 높이도록 스스로 조정합니다.
- 결과 — 더 유용하고 안전한 답을 내놓습니다.
관련 용어
강화학습보상과 벌을 통해 '무엇이 좋은 행동인지'를 시행착오로 배우는 학습 방식. 게임·로봇·AI 정렬에 쓰인다.파인튜닝이미 학습된 AI 모델을 특정 분야·작업·말투에 맞춰 소량의 데이터로 추가 학습시키는 것.AI 거버넌스 · 윤리AI를 안전·공정·책임 있게 쓰기 위해 원칙·정책·통제 장치를 마련하는 조직의 관리 체계.가드레일AI가 위험·부적절·규정 위반 답변을 하지 않도록 미리 쳐 두는 안전 장치·규칙. AI의 '난간'.
이 용어와 연결된 교육
📚에이전트 AI 실무 입문나눔경영컨설팅 기업교육 · 대면/온라인과정 보기 →이 주제로 사내 교육이 필요하신가요?
담당자 맞춤 커리큘럼·견적을 바로 받아보세요.
자주 묻는 질문
모델을 '똑똑함'에서 '사람에게 유용·안전함'으로 정렬하기 때문입니다. ChatGPT 성공의 핵심입니다.
초기 선호 데이터에 사람이 필요합니다. 이후엔 학습된 보상 모델이 대신하며, 더 효율적인 변형도 연구됩니다.
사람 선호로 AI를 다듬어 더 유용·안전하게 만듭니다 — ChatGPT를 '쓸 만하게' 만든 비결입니다.
초기 다듬기에 사람 평가가 필요합니다. 이후 AI 피드백으로 보완하는 방법도 연구됩니다.