RAG 시스템을 만들었으면 제대로 평가해야 합니다. 막연히 "잘 되는 것 같다"는 직관보다 RAGAS 지표로 수치화하세요.
RAGAS가 측정하는 것
Faithfulness: 생성된 답변이 검색된 컨텍스트에 얼마나 충실한가 (hallucination 감지). Answer Relevancy: 답변이 질문에 얼마나 관련성 있는가. Context Precision: 검색된 문서 중 실제로 답변에 사용된 비율. Context Recall: 정답 도출에 필요한 문서가 검색됐는가.
어떤 지표를 먼저 봐야 하나
리스크가 높은 도메인(금융, 법률, 의료): Faithfulness 최우선. 환각이 가장 위험하기 때문입니다. 일반 Q&A 챗봇: Answer Relevancy와 Context Recall 균형. 검색 최적화가 목표라면: Context Precision에 집중해 불필요한 문서가 섞이지 않도록.
실무 적용시 함정
RAGAS는 평가 자체에도 LLM을 사용합니다. 평가용 모델이 약하면 평가 결과도 신뢰하기 어렵습니다. GPT-4o 이상을 평가자로 쓰는 것을 권장합니다. 또한 테스트셋을 실제 사용자 쿼리로 구성해야 의미있는 평가가 됩니다.
