The Brief FactStack이 되었습니다

FactStack

강화학습Reinforcement Learning

학습/튜닝

한마디로

정답을 알려주는 대신 '잘하면 보상'을 주는 방식으로 AI를 훈련하는 방법이에요. 시행착오를 반복하며 스스로 더 나은 행동을 찾아가요

강화학습은 '보상을 최대화하는 방향으로 행동을 학습'시키는 훈련 방식이에요. 바둑 AI(AlphaGo)가 대표 사례로, 이기면 보상, 지면 벌점을 주는 걸 수없이 반복해 사람을 넘어섰죠. 핵심 구성은 셋으로 볼 수 있습니다. 행동하는 에이전트, 행동의 결과를 돌려주는 환경, 그리고 무엇이 잘한 것인지 정하는 보상 함수예요.

요즘 다시 주목받는 이유는 추론 모델 때문이에요. o1, R1 같은 추론 모델들이 '수학, 코딩 문제를 맞히면 보상'을 주는 강화학습으로 추론 능력을 끌어올렸거든요. 사람 피드백을 보상으로 쓰는 변형이 RLHF입니다.

기억할 것은 보상 설계가 곧 결과라는 점이에요. 클릭만 보상하면 낚시성 제목을 배우는 식으로, 보상의 빈틈을 파고드는 보상 해킹이 흔합니다. 마케팅에서는 이미 쓰이고 있는데, 광고 입찰 자동화나 추천 시스템의 밴딧 알고리즘이 강화학습의 가벼운 형태예요.

헷갈리는 용어 구분

태그

관련 용어

공유