The Brief FactStack이 되었습니다

FactStack

이밸즈(AI 평가)Evals

핵심 개념

한마디로

AI 기능의 품질을 테스트 문항과 채점 기준으로 상시 측정하는 평가 체계예요. 감으로 좋아졌다고 말하는 대신 숫자로 품질 후퇴를 잡아내는 장치예요

소프트웨어 테스트의 LLM판이라고 보면 됩니다. 실패 사례를 모은 평가 데이터셋, 채점기(규칙 검사기, LLM 판사, 사람 검수 큐), 배포 전 통과 게이트, 운영 트래픽 샘플링으로 구성돼요. OpenAI가 2023년 같은 이름의 오픈소스 평가 프레임워크를 공개하면서 업계 용어로 퍼졌습니다.

한 번 만들고 끝나는 출시 전 점검이 아니라 계속 돌아가는 운영 시스템이라는 게 핵심이에요. 모델이나 프롬프트를 바꿀 때마다 기존 품질이 후퇴하지 않았는지 자동으로 검증하는 안전망 역할을 합니다. 2024년부터는 evals 엔지니어링이 별도 직무로 분화했고, 응용 AI 기업들이 초기 기술 채용 열 명 안에 이 직무를 둔다는 관측도 나와요.

마케터에게도 남 얘기가 아닙니다. AI 챗봇이나 콘텐츠 자동화를 도입할 때 품질을 어떻게 계속 보증할 거냐는 질문의 업계 표준 답이 바로 evals예요.

헷갈리는 용어 구분

태그

관련 용어

공유