Contact Us
블로그로 돌아가기

RAG 시스템 평가하기: RAGAS 지표를 실무에 어떻게 적용할까

Faithfulness, Answer Relevancy, Context Precision. RAG 평가 지표들이 실제로 무엇을 측정하는지, 그리고 프로젝트에서 어떤 지표를 우선시해야 하는지 정리합니다.

RAG 시스템을 만들었으면 제대로 평가해야 합니다. 막연히 "잘 되는 것 같다"는 직관보다 RAGAS 지표로 수치화하세요.

RAGAS가 측정하는 것

Faithfulness: 생성된 답변이 검색된 컨텍스트에 얼마나 충실한가 (hallucination 감지). Answer Relevancy: 답변이 질문에 얼마나 관련성 있는가. Context Precision: 검색된 문서 중 실제로 답변에 사용된 비율. Context Recall: 정답 도출에 필요한 문서가 검색됐는가.

어떤 지표를 먼저 봐야 하나

리스크가 높은 도메인(금융, 법률, 의료): Faithfulness 최우선. 환각이 가장 위험하기 때문입니다. 일반 Q&A 챗봇: Answer Relevancy와 Context Recall 균형. 검색 최적화가 목표라면: Context Precision에 집중해 불필요한 문서가 섞이지 않도록.

실무 적용시 함정

RAGAS는 평가 자체에도 LLM을 사용합니다. 평가용 모델이 약하면 평가 결과도 신뢰하기 어렵습니다. GPT-4o 이상을 평가자로 쓰는 것을 권장합니다. 또한 테스트셋을 실제 사용자 쿼리로 구성해야 의미있는 평가가 됩니다.

RAGAI실무 가이드

STAY UPDATED

AI 실무 인사이트를
가장 먼저 받아보세요.

뉴스레터 구독