지난 2~3년 사이 인공지능 업계에 일어난 가장 큰 변화도 비슷한 모양을 하고 있다. 다만 카메라를 들고 다니는 쪽은 사람이 아니라 AI다.

천재이지만 매번 새로 시작하는 사람

대형 언어 모델(LLM, ChatGPT나 Claude처럼 글을 읽고 쓰는 AI)의 정체를 한 문장으로 압축하면 이렇다. 어느 시점까지 인터넷에 올라온 거의 모든 글을 읽고 그 뒤로는 한 글자도 추가로 못 본 사람. 이 시점을 업계에서는 "지식 절단(knowledge cutoff)"이라 부른다. 절단 시점 이후의 사건은 모델 안에 존재하지 않는다.

문제는 모델이 그 사실을 본인이 잘 모른다는 데 있다. 모르면 모른다고 말해야 하는데, 학습 데이터의 패턴을 따라 그럴듯한 문장을 만들어내고 만다. 이걸 환각(hallucination, 사실이 아닌 내용을 사실처럼 말하는 현상)이라 한다.

수치로 보면 더 또렷하다. 2025년 환각 벤치마크 분석에 따르면 상위권 모델의 환각률은 작업 종류와 무관하게 평균적으로 10~20% 구간에 모인다(SQ Magazine, 2026 정리). 시점에 민감한 질문 — "지난주 누가 어떤 발표를 했는가" 같은 — 에 대해서는 검색 도구 없이 답한 모델의 환각률이 그렇지 않은 경우의 약 두 배로 올라간다. 정형화된 분석 작업에서도 15%를 넘는다.

레너드가 똑똑한 형사 출신이지만 매번 새로 시작하는 것과 정확히 같다. 사고 이전의 추리 능력은 멀쩡한데, 사고 이후 일은 묻지 말아야 한다.

주머니 속 폴라로이드

레너드의 해법은 두뇌 안쪽이 아니라 주머니 안쪽에 있다. 누군가가 "저 사람이 누구냐"고 물으면 그는 자기 기억을 짜내는 대신 사진 더미를 뒤져 그 얼굴이 박힌 폴라로이드 한 장을 꺼낸다. 사진 뒷면에는 자기 손글씨로 "테디, 거짓말을 믿지 마라"라고 적혀 있다. 사진과 메모를 본 다음에야 그는 입을 연다.

기술 업계에서는 이 동작을 RAG(Retrieval-Augmented Generation, 검색 증강 생성)이라 부른다. 2020년 Facebook AI Research의 패트릭 루이스(Patrick Lewis) 연구진이 arXiv:2005.11401에서 처음 정식화한 개념이다. 논문은 LLM의 머릿속에 들어 있는 지식을 "파라미터 메모리(parametric memory)"라 부르고, 따로 떨어진 데이터베이스를 "비파라미터 메모리(non-parametric memory)"라 부른다. RAG는 두 메모리를 동시에 쓰는 구조다.

작동 절차는 세 박자로 끝난다.

첫째, 검색(Retrieval). 사용자가 질문하면 시스템이 먼저 관련 문서를 외부 저장소에서 꺼낸다. 이 저장소는 회사 내부 매뉴얼일 수도 있고, 어제 자 뉴스 묶음일 수도 있고, 본인이 지난 5년간 받은 이메일일 수도 있다. 레너드의 사진 더미에 해당한다.

둘째, 증강(Augmentation). 꺼낸 문서를 질문과 함께 모델에게 들이민다. "이 자료를 보고 답해라"라고 명시한다. 사진 뒷면의 메모를 코앞에 펼치는 단계다.

셋째, 생성(Generation). 모델은 자기 머릿속 지식과 들이민 자료를 합쳐 답을 만든다. 레너드가 메모를 읽고 "너는 테디군, 하지만 난 널 믿지 않아"라고 입을 여는 그 순간이다.

모두가 갑자기 메모를 만들기 시작한 이유

이 구조가 왜 갑자기 모든 회사로 번졌을까. 답은 시간과 비용이다. 학습이 끝난 모델 안에 새 정보를 욱여넣으려면 모델 전체를 다시 학습시켜야 한다. 수십억 원이 들고 몇 주가 걸린다. 반면 외부 저장소에 PDF 한 장 더 올리는 데는 1분이면 된다. 회사가 어제 발표한 신제품 매뉴얼을 오늘 AI가 답할 수 있게 만드는 가장 빠른 길이 RAG였다.

도입 속도는 숫자로 확인된다. 2025년 산업 조사들을 종합하면 기업이 채택하는 생성 AI 사용 사례 가운데 30~60% 구간이 RAG 구조 위에서 작동한다. 같은 해 McKinsey의 〈State of AI〉 조사는 응답 기업의 71%가 어떤 형태로든 생성 AI를 정기적으로 사용한다고 보고했다(McKinsey, 2025). 산업별로 보면 법률·의료·금융처럼 "사실 관계를 틀리면 끝나는" 분야일수록 RAG 의존도가 높다.

흥미로운 부분은 같은 조사의 다른 한 줄이다. 71%가 쓴다고 답했지만 실제 영업이익(EBIT)에 5% 이상 기여한다고 답한 기업은 17%에 그쳤다. 도입과 가치 사이에 깊은 골이 있다는 뜻이다. 메모를 만들기 시작한 것과 메모를 잘 쓰는 것은 같은 일이 아니다.

그러나 메모도 거짓말을 한다

여기서 영화의 두 번째 장면이 떠오른다. 〈메멘토〉의 충격은 레너드가 메모를 들고 다닌다는 사실이 아니라, 그 메모를 그 자신이 잘못 적었을 수도 있다는 사실이다. 잘못 찍힌 사진, 잘못 해석된 단서, 의도적으로 왜곡된 한 줄. RAG에서도 똑같은 일이 벌어진다.

스탠퍼드 RegLab은 2024년 LexisNexis와 Thomson Reuters의 법률 AI 도구를 검증했다. 두 도구 모두 RAG 구조 위에서 운영된다. 결과는 차가웠다. 응답 17~33%가 환각이거나 출처를 잘못 인용한 것으로 분류됐다(Magesh et al., Journal of Empirical Legal Studies, 2025). RAG가 환각을 줄이는 것은 맞다. 같은 시기 학계 리뷰는 RAG가 환각을 40~71% 줄였다고 보고한다. 그러나 줄였다는 것이 없앴다는 뜻은 아니다.

원인은 둘로 나뉜다. 하나는 검색 단계의 실패다. 자료가 부실하거나, 질문을 잘못 해석해 엉뚱한 문서를 꺼내거나, 핵심 단락이 검색 결과의 중간에 묻혀 모델이 무시한다(이를 "lost in the middle" 현상이라고 부른다). 다른 하나는 생성 단계의 결함이다. 모델이 검색 결과와 자기 학습 데이터가 충돌할 때 학습 데이터 쪽을 우선시하거나, 자료에 없는 내용을 자신 있게 덧붙인다.

다시 영화로 돌아가면, 레너드가 진실에 가까이 가지 못한 진짜 이유는 메모지가 부족해서가 아니라 메모를 적는 그 순간이 이미 흔들렸기 때문이다. 도구는 도구를 쓰는 사람의 정확도를 넘어서지 못한다.

당신의 책상 위 RAG

이 이야기가 왜 본인 일과 닿느냐. 사실 본인은 이미 RAG를 쓰고 있다.

진료실의 의사는 머릿속 지식만으로 처방을 결정하지 않는다. 진료 가이드라인을 화면에 띄워놓고 본다. 변호사는 모든 판례를 외우지 않고 검색한다. 회계사는 세법 조문을 매뉴얼에서 다시 확인한다. 교사는 교과 지도서를 옆에 펼친 채 수업을 짠다. 영업하는 사람은 어제 작성한 거래 노트를 다시 읽고 미팅에 들어간다. 이 모든 동작이 그대로 검색-증강-생성이다. 머릿속에 든 지식은 추론을 담당하고, 외부에 보관한 자료는 사실 관계를 담당한다.

AI에게 일을 시킬 때도 같은 패턴을 쓰면 결과가 달라진다. 가장 단순하면서 가장 효과가 큰 두 가지를 권한다.

첫째, 모델에게 자료를 먼저 쥐어준다. ChatGPT나 Claude에 질문할 때 본인 회사 자료, 본인 산업 보고서, 본인 사업장 매출 데이터를 PDF로 올려놓고 "이 자료를 근거로 답해라"라고 명시한다. 모델 안의 흐릿한 일반 지식 대신 본인의 구체적 자료가 답의 근거가 된다.

둘째, 답을 받을 때 "어느 페이지의 어느 문장에서 그 결론이 나왔는지" 출처를 같이 요구한다. 출처를 답할 수 없는 답은 환각일 가능성이 높다. 레너드가 사진 뒷면의 메모를 보지 않고 입을 열면 영화의 결말이 어떻게 흘렀는지 본 사람은 안다.

진짜 변화는 모델이 아니라 모델 옆에 둔 메모지에서 일어났다. 그리고 메모를 어떻게 쓰는지가 결국 답의 품질을 결정한다. AI 시대에 잘 살아가는 사람은 더 똑똑한 모델을 찾아다니는 사람이 아니라, 자기 도메인의 메모지를 잘 만들고 잘 검색해서 잘 들이미는 사람이다.

레너드의 사진은 그를 구하지 못했다. 그러나 메모를 어떻게 쓰는지를 우리는 우리가 결정할 수 있다. 그것이 영화와 우리 일의 차이다.

신치훈 영양군AI협회 — yyaia.org