강화학습Reinforcement Learning
한마디로
정답을 알려주는 대신 '잘하면 보상'을 주는 방식으로 AI를 훈련하는 방법이에요. 시행착오를 반복하며 스스로 더 나은 행동을 찾아가요
강화학습은 '보상을 최대화하는 방향으로 행동을 학습'시키는 훈련 방식이에요. 바둑 AI(AlphaGo)가 대표 사례로, 이기면 보상, 지면 벌점을 주는 걸 수없이 반복해 사람을 넘어섰죠. 핵심 구성은 셋으로 볼 수 있습니다. 행동하는 에이전트, 행동의 결과를 돌려주는 환경, 그리고 무엇이 잘한 것인지 정하는 보상 함수예요.
요즘 다시 주목받는 이유는 추론 모델 때문이에요. o1, R1 같은 추론 모델들이 '수학, 코딩 문제를 맞히면 보상'을 주는 강화학습으로 추론 능력을 끌어올렸거든요. 사람 피드백을 보상으로 쓰는 변형이 RLHF입니다.
기억할 것은 보상 설계가 곧 결과라는 점이에요. 클릭만 보상하면 낚시성 제목을 배우는 식으로, 보상의 빈틈을 파고드는 보상 해킹이 흔합니다. 마케팅에서는 이미 쓰이고 있는데, 광고 입찰 자동화나 추천 시스템의 밴딧 알고리즘이 강화학습의 가벼운 형태예요.
헷갈리는 용어 구분
태그
관련 용어
- 인간 피드백 기반 강화학습사람의 피드백으로 모델을 사람 취향, 의도에 맞게 정렬, 개선하는 방식이에요. 챗봇이 '말이 통하게' 만든 핵심 기술이에요
- 추론 모델답하기 전에 내부적으로 사고 과정을 거치는 모델이에요. o 시리즈, Claude의 thinking 모드 등이 여기에 해당해요
- 사전학습대규모 데이터로 모델의 기본 능력을 만드는 1차 학습이에요. 모델의 '기초 교육' 단계라고 보면 돼요
- 파인튜닝사전학습된 모델을 특정 도메인, 작업에 맞게 추가 학습으로 조정하는 거예요. '범용 모델을 우리 일에 맞춰 특화'하는 단계예요
- 얼라인먼트(정렬)모델을 인간의 의도, 가치에 맞게 정렬하는 작업이에요. AI가 똑똑한 걸 넘어 '안전하고 의도대로' 행동하게 만드는 거예요
- AI 디시전잉AI가 고객 데이터를 실시간으로 분석해 어떤 메시지를, 어떤 채널로, 언제 보낼지 마케터 대신 자동으로 판단하고 실행하는 의사결정 방식이에요.
공유