오픈북 시험과 암기: RAG와 파인튜닝의 차이
사내 문서와 최신 지식을 AI 시스템에 연결할 때 RAG(오픈북 시험)와 파인튜닝(암기 시험)의 구조적 차이, 비용, 선택 기준을 비교합니다.
무료 공개 · 최근 수정
사내 전용 AI를 만들 때 가장 먼저 부딪히는 오해
사내 지식 기반 AI 구축을 위해 수천만 원의 GPU 클라우드 예산을 집행하고, 노션과 규정집 5천 페이지를 긁어모아 며칠 밤낮을 새워 오픈소스 모델 파인튜닝을 마쳤습니다. 그러나 임원진 데모 데이 당일, "올해 개정된 사내 복지 포인트 지급일이 언제인가요?"라는 첫 질문에 모델은 이미 2년 전에 폐지된 옛날 규정을 천연덕스럽게 꾸며내어 답변했습니다. 게다가 "이 규정이 적힌 사내 문서 링크나 근거를 달라"고 요구하자 모델은 아예 존재하지도 않는 가짜 사내 위키 URL을 환각으로 쏟아냈습니다.
사람이 대학에서 두꺼운 전공 서적을 읽고 공부해 전문가가 되듯이, 언어 모델에도 사내 문서를 통째로 주입해 학습시키면 모든 사내 규정을 줄줄 꿰는 맞춤형 비서가 될 것이라 기대했던 결과입니다. 모델은 최신 사내 규정의 구체적인 날짜나 숫자를 쉽게 왜곡하며, 어제 개정된 정책을 반영하려면 비싼 GPU를 다시 가동해 처음부터 재학습해야 합니다. 더욱이 신경망 가중치 속에 흡수된 지식은 출처 링크를 역추적할 수도 없습니다. 모델에 새로운 '지식(Facts)'을 학습시키는 것과 모델의 '행동 양식(Behavior)'을 다듬는 것을 혼동한 까닭입니다.
오픈북 시험과 암기 시험의 직관적 차이
외부 지식을 언어 모델과 결합하는 두 핵심 기법인 RAG와 파인튜닝의 본질적 차이는 '시험을 치르는 방식'에 빗대어 명확히 이해할 수 있습니다.
- 검색 증강 생성(Retrieval-Augmented Generation; RAG)은 참고서와 교과서를 책상 위에 펼쳐 놓고 치르는 오픈북 시험과 같습니다. 모델은 모든 지식을 머릿속에 기억할 필요가 없으며, 질문이 들어왔을 때 외부 지식베이스(벡터 데이터베이스나 검색 엔진)에서 가장 관련성 높은 문서를 신속하게 찾아 읽고 그 자리에서 답안을 작성합니다.
- 미세 조정(Fine-Tuning)은 책을 미리 달달 외운 뒤 빈손으로 시험장에 들어가는 암기 시험과 같습니다. 사전 학습된 기본 모델의 수억, 수십억 개 가중치(Weights) 자체를 특정 도메인 데이터셋으로 추가 훈련하여, 모델의 신경망 파라미터 내부에 새로운 패턴과 어조를 물리적으로 각인시킵니다.
OpenAI는 공식 개발자 문서에서 이 둘의 경계를 명확한 한 문장으로 정리했습니다. "파인튜닝은 사실 지식을 주입하기 위한 것이 아니라, 형식과 스타일을 제어하기 위한 수단이다(Fine-tuning is for form and style, not facts)." 모델에게 방대한 회사 내규나 상품 카탈로그를 가르치고 싶다면 RAG를 써야 하며, 모델에게 특정 산업군의 전문 용어 표기법이나 고도로 규격화된 의료 진단서 양식으로만 말하도록 훈련하고 싶을 때 파인튜닝을 선택해야 합니다.
그림: RAG의 외부 지식 검색 경로와 파인튜닝의 내부 가중치 생성 경로 비교
위 그림은 사용자가 질문을 던졌을 때 외부 벡터 저장소에서 근거 문서를 동적으로 인출하는 RAG 파이프라인과, 사전 학습된 내부 가중치에서 훈련된 스타일을 꺼내어 응답하는 파인튜닝 파이프라인의 분기 경로를 대조하여 보여 줍니다.
구조와 비용, 유지보수 측면의 4대 핵심 비교
두 기술은 동작 메커니즘이 전혀 다른 만큼 지식 갱신 주기, 출처 신뢰성, 환각 통제, 비용 구조에서 확연한 차이를 보입니다.
| 비교 항목 | RAG (오픈북 시험) | 파인튜닝 (암기 시험) |
|---|---|---|
| 지식 갱신 주기 | 실시간 반영 (문서가 바뀌면 벡터 DB 즉시 재색인) | 주기적 재학습 필요 (새 데이터마다 GPU 학습 파이프라인 가동) |
| 출처 표시 (Citation) | 원본 문서의 페이지, URL, 작성자 메타데이터 인용 가능 | 신경망 내부 뉴런에 흡수되어 출처 역추적 불가능 |
| 환각 제어력 | 문맥에 답이 없으면 "모른다"고 거절하도록 통제 가능 | 가중치 내 지식이 왜곡되어 그럴듯한 거짓말을 할 위험 |
| 초기 및 운영 비용 | 벡터 DB 및 긴 프롬프트 주입 비용 발생 (검색 지연 추가) | 초기 학습 비용 높으나, 짧은 프롬프트로 요청당 토큰 비용 절감 |
신경망의 가중치에 수천 개의 사실 문장을 학습시키면 모델은 지식 주입의 한계(Knowledge Injection Limits)에 부딪힙니다. 인공 신경망은 지식을 데이터베이스 레코드처럼 격리하여 보관하지 않고 모든 뉴런의 분산 표현(Distributed Representation)으로 얽어 저장하기 때문입니다. 그 결과 특정 사실을 갱신하려다 기존에 잘 알고 있던 다른 상식을 잊어버리는 파국적 망각(Catastrophic Forgetting)이 발생하거나, 비슷한 두 개의 사실이 뒤섞여 그럴듯한 거짓 정보를 만들어내는 환각이 일어납니다.
[참고] LoRA(Low-Rank Adaptation)와 파인튜닝 비용 절감
과거에는 파인튜닝 시 모델의 모든 파라미터(Full Parameter)를 다시 계산해야 해서 천문학적인 비용이 들었지만, 최근에는 기본 가중치는 고정(Freeze)해 두고 아주 작은 크기의 저순위 어댑터 행렬만 추가로 학습시키는 LoRA 기법이 표준으로 정착했습니다. 이를 통해 전체 파라미터의 1% 미만만 훈련하여 일반 개발자용 GPU 단 한 대로도 효율적인 스타일 튜닝이 가능해졌습니다.
의사결정 매트릭스: 언제 무엇을 선택해야 하는가?
마이크로소프트 애저(Microsoft Azure) 및 아마존웹서비스(AWS)의 클라우드 아키텍처 가이드라인에서는 프로젝트 요구사항에 따라 다음과 같은 명확한 의사결정 순서도를 권고합니다.
1단계: RAG를 우선 도입해야 하는 상황
- 하루나 일주일 단위로 사내 문서나 정책이 빈번하게 수정되는 경우
- 고객에게 답변을 제공할 때 원본 약관 조항이나 제품 매뉴얼 링크를 반드시 함께 보여 주어야 하는 경우
- 접근 권한(Role-Based Access Control)에 따라 사용자마다 열람할 수 있는 문서 범위가 달라야 하는 경우
- 초기 AI PoC를 몇 시간 또는 며칠 안에 빠르게 검증해야 하는 경우
2단계: 파인튜닝을 적용해야 하는 상황
- 법률, 의료, 회계 등 일반 언어 모델이 전혀 구사하지 못하는 특수한 도메인 문체나 어휘를 고정해야 하는 경우
- 복잡한 퓨샷 예시를 매번 프롬프트에 넣느라 토큰 비용이 너무 많이 나와, 아예 모델 뇌리에 해당 출력 JSON 양식을 새겨 넣고 싶은 경우
- 소형 모델(예: 7B or 8B)을 파인튜닝하여 대형 모델(GPT-4o) 수준의 특정 단일 작업(단순 분류나 정형화된 코드 변환) 성능을 저렴하게 끌어내고 싶은 경우
3단계: 둘을 결합하는 하이브리드 아키텍처
실제 엔터프라이즈 환경에서 가장 이상적인 성능을 내는 패턴은 두 접근법의 장점을 결합한 하이브리드 아키텍처(Hybrid Architecture)입니다.
먼저 특수한 산업 도메인의 사고방식, 전문 용어 규칙, 정밀한 JSON 출력 구조를 체화한 파인튜닝 소형 모델을 준비합니다. 그다음 이 모델이 사용자의 구체적인 질문에 답할 때, 실시간 사내 벡터 데이터베이스에서 최신 규정 문서를 검색하여 프롬프트 문맥으로 건네주는 RAG 파이프라인을 연결합니다. 이렇게 구성하면 파인튜닝 모델이 고정된 규칙과 저렴한 추론 비용으로 형식을 책임지고, RAG 계층이 실시간 사실성과 정확한 출처 인용을 책임져 가장 강력한 시너지를 발휘합니다.
참고 문서
설명이 어렵거나 잘못된 부분을 발견하셨나요?
문서 수정 의견 보내기