RAG 시리즈 4편 — 운영에서 만나는 RAG, 임베딩 파이프라인 4경로와 비용 통제
1~3편이 '검색을 어떻게 잘하느냐'였다면 4편은 운영의 시각이에요. 임베딩을 어떻게 채우고, 실패하면 어떻게 회복하고, 비용을 어떻게 통제하느냐. 실제 운영에서 만난 임베딩 파이프라인 4가지 경로, 리인덱싱 안전장치, 비용이 새는 자리 5곳까지 정리했어요.
2026년 6월 8일000
Blog Tag
Backend 태그로 정리한 개발 기록 4개를 모았습니다. 실제 프로젝트에서 마주한 문제, 구현 과정, 운영 경험을 중심으로 정리합니다.
1~3편이 '검색을 어떻게 잘하느냐'였다면 4편은 운영의 시각이에요. 임베딩을 어떻게 채우고, 실패하면 어떻게 회복하고, 비용을 어떻게 통제하느냐. 실제 운영에서 만난 임베딩 파이프라인 4가지 경로, 리인덱싱 안전장치, 비용이 새는 자리 5곳까지 정리했어요.
1편의 6단계 고정 파이프라인은 '안녕하세요'에도 LLM을 4번 호출해요. Tool Calling은 LLM에게 검색 도구를 쥐여주고 자율적으로 선택하게 해서 비용을 질문 복잡도에 비례시키는 패턴이에요. 두 방식의 비교, 도구 3종 설계, description 작성법, 안전장치와 함정을 정리했어요.
RAG 정확도가 안 나올 때 모델 교체나 파인튜닝부터 떠올리지 마세요. GPU 없이 OpenAI 임베딩만으로도 파인튜닝 효과의 85~90%를 낼 수 있어요. 시맨틱 청킹·메타데이터 주입 임베딩·쿼리 확장·Qdrant 사전 필터·Parent-Child 청킹·HyDE 6가지 입력 가공 기법을 정리했어요.
RAG 데모는 30분이면 만들지만 운영용은 다릅니다. 실제 서비스에서 쓰는 6단계 파이프라인(질문 분석 → 다중 검색 → 관련성 검증 → 컨텍스트 빌딩 → 응답 생성 → 답변 검증)과 하이브리드 검색·RRF까지 1~3년차 개발자 시점에서 정리했어요.