그런데 최근 학술 벤치마크는 일관되게 한 가지를 말하고 있다. 이 기술은 우리가 기대하는 것만큼 작동하지 않는다. 어떤 경우에는 오히려 답을 더 나쁘게 만든다.
벤치마크가 보여준 불편한 사실
2025년 12월에 나온 연구 한 편(arXiv 2512.05858, "Playing Pretend: Expert Personas Don't Improve Factual Accuracy")은 GPQA Diamond와 MMLU-Pro라는 두 가지 표준 사실 평가에서 전문가 페르소나의 효과를 측정했다. 결과는 단순했다. 페르소나가 있을 때와 없을 때 정확도 차이가 통계적으로 의미 있는 수준이 아니거나, 있더라도 부정적이었다. MMLU에서는 모든 전문가 페르소나 변형이 정확도를 떨어뜨렸다 — 평균 68.0% 대 페르소나 없을 때 71.6%.
이전 연구도 같은 방향을 가리켰다. arXiv 2311.10054("When 'A Helpful Assistant' Is Not Really Helpful")는 4개 LLM 패밀리에 2,410개 사실 질문을 던졌다. 페르소나는 의미 있는 향상을 만들지 못했다. 또 다른 연구(arXiv 2603.18507)는 한 발 더 나갔다. 전문가 페르소나는 alignment(원하는 어조·태도로의 정렬)에 도움이 되지만, 정확도는 떨어뜨린다. 트레이드오프다.
이게 왜 중요한가. 우리가 "당신은 의사입니다"라고 말할 때 진짜 원하는 것은 의사다운 톤이 아니라 의사 수준의 정확한 답이다. 그런데 톤은 좋아져도 답은 그대로거나 나빠진다. AI에게 무대 의상을 입혀도, 그 안의 배우 실력은 변하지 않는다.
왜 이런 일이 일어나나
연극 비유로 설명하면 직관적이다. "당신은 의사인 척 연기하라"고 시키는 순간, 모델은 두 가지 자료를 함께 끌어온다. 진짜 의학 지식과, 의사가 등장하는 소설·드라마·시나리오. arXiv 2406.17260("Mitigating Hallucination in Fictional Character Role-Play")이 정리한 메커니즘이 정확히 이거다. 캐릭터 환각(character hallucination) — 모델이 캐릭터의 정체성과 지식 경계에서 벗어나는 응답을 생성하는 현상. 의사 페르소나는 의사를 흉내 내는 출판물도 함께 호출한다.
게다가 페르소나 자체가 정보의 양을 늘리지 않는다. 모델 안에 의사 지식이 1만큼 있다면 페르소나를 줘도 1이고, 안 줘도 1이다. 직함은 보유 지식을 증폭시키지 않는다. 다만 그 지식을 "의사 같은 어조로" 꺼내올 뿐이다.
이 지점이 사용자가 흔히 오해하는 곳이다. "고급 사용자들은 다 페르소나를 쓰니까 나도 따라 하면 그들 수준이 된다"는 가정. 사실 OpenAI나 Anthropic이 사용자 데이터에서 학습하는 것은 직함을 어떻게 부여하는가가 아니다. 그들이 쫓는 것은 다른 차원의 패턴이다.
회사들이 진짜로 학습하는 것
대형 모델 회사들의 RLHF(인간 피드백 강화학습) 파이프라인을 들여다보면 한 가지가 명확하다. 그들이 모은 고급 사용자 데이터는 "어떤 페르소나로 시작했는가"가 아니라 "어떤 사실을 어떤 순서로 어떤 관계 속에서 다루었는가"다. 어떻게 질문을 좁혔는가. 어떤 출처를 어떻게 확인했는가. 답이 틀렸을 때 어떻게 되돌아갔는가.
전문가 지식 유도(expert elicitation) 연구가 같은 결론에 도달했다. arXiv 2602.02752 같은 최근 논문들은 "Recognition over Recall" 원칙을 따른다 — 전문가에게 프롬프트를 처음부터 쓰게 시키지 않는다. 대신 기존 프롬프트와 답을 보여주고, 어디가 틀렸고 어떻게 고쳐야 하는지를 비평하게 한다. 비평이 누적되면서 작업 패턴이 드러난다.
같은 연구 분야에서 또 한 번 확인된 사실이 있다. Chain-of-Thought(생각 과정 보여주기), few-shot(예시 제공), 검색 보강(retrieval-augmented)이 expert role mimicry보다 일관되게 정확도를 높였다. 직함 흉내는 가장 약한 도구다.
그렇다면 진짜 도구는 무엇인가.
사실의 구조를 모델 옆에 박아넣기 — 온톨로지와 RAG
페르소나가 "내가 누군가인 척"이라면, 다른 한쪽 끝에는 "무엇이 사실인지 모델 옆에 직접 깔아주기"가 있다. 두 개의 기술로 구현된다.
RAG(Retrieval-Augmented Generation, 검색 보강 생성) — 모델이 답하기 직전에 관련 문서를 끌어와 같이 보여준다. 모델이 외운 지식이 아니라 지금 끌어온 문서에 근거해 답하게 만든다.
온톨로지(ontology) — 한 도메인의 개념·관계·규칙을 명시적으로 적은 지도. "환자—증상—진단—약물—부작용"처럼 사실들이 서로 어떻게 연결되는지를 구조로 박아둔 것.
이 둘을 결합한 OG-RAG(Ontology-Grounded RAG)에 대한 2024년 12월 논문(arXiv 2412.15235)은 4개 LLM에 걸친 실험에서 다음을 측정했다. 사실 회수율 55% 향상, 응답 정확도 40% 향상, 출처 추적 30% 가속. 페르소나 프롬프트가 보여주지 못한 수치 변화가 여기서 나온다.
산업에서는 이미 자리 잡았다. Microsoft Research가 공개한 GraphRAG는 비공개 문서들에서 엔티티와 관계를 추출해 그래프로 만들고, 답할 때 이 그래프를 함께 참조한다. Neo4j는 같은 흐름의 GraphRAG 도구를 만들어 기업 RAG 시스템의 표준 구성요소로 밀고 있다. 법률·의료·금융 같은 사실이 무거운 분야일수록 이 방향이 강하다(arXiv 2505.00039 — 법률 도메인용 Ontology-Driven Graph RAG).
"그건 비싼 회사들 얘기 아닌가"
여기서 일반인이 흔히 멈춘다. 온톨로지를 만들고 RAG 파이프라인을 띄우는 일은 엔지니어의 영역처럼 느껴진다. 맞다, 정식 시스템은 그렇다. 그러나 개인 사용자에게도 똑같은 원리가 작은 단위로 옮겨와 있다.
Claude의 Projects, NotebookLM, ChatGPT의 Custom GPT 같은 도구는 본질적으로 개인 RAG다. 당신이 자기 도메인의 문서를 그 안에 넣어두면, 모델은 답할 때 그 문서를 우선 참조한다. 직함을 흉내 내는 게 아니라, 진짜 사실을 곁에 두고 답한다.
온톨로지는 더 단순하게 시작할 수 있다. 자기 일의 사실 구조를 글로 적어두는 것이 곧 작은 온톨로지다. 의사라면 "내가 보는 환자군—주된 호소—진단 기준—내가 자주 처방하는 약물 범위—주의해야 할 부작용"을 한 페이지로 정리. 변호사라면 "내가 다루는 사건 유형—적용 법령—판례 흐름—의뢰인의 전형적 오해". 디자이너라면 "내가 쓰는 디자인 원칙—참고 사례 폴더—클라이언트가 자주 쓰는 잘못된 용어와 그게 진짜 의미하는 것".
이 한 페이지를 모델에게 항상 같이 주면, 페르소나로 100번 흉내 낸 것보다 훨씬 정확한 답이 나온다. 이유는 단순하다. 모델이 추측해야 할 영역을 사람이 미리 적어주었기 때문이다.
AI를 잘 쓴다는 것의 진짜 의미
이쯤에서 한 가지가 분명해진다. AI를 정말 잘 쓴다는 말은 한 줄짜리 마법의 주문을 찾았다는 뜻이 아니다. 자기 일의 사실 구조를 명료하게 정리할 수 있다는 뜻이다. 그게 RAG에 들어갈 문서가 되고, 작은 온톨로지가 되고, 모델이 어떤 정보를 어떤 순서로 다루기를 바라는지에 대한 명세가 된다.
이건 가벼운 작업이 아니다. 자기 도메인을 처음부터 쓰는 일은 자기 일을 처음부터 다시 보는 일이다. 무엇이 진짜 핵심이고, 무엇이 관행적으로 따라온 외피인지를 가려야 한다. 시간이 걸린다. 집요해야 한다. 그리고 한 번 만들어두면 모델이 바뀌어도 그 자산은 그대로 남는다.
페르소나 프롬프트는 5초면 적는다. 그래서 그 효과도 5초만큼이다. 사실의 구조를 자기 도메인에서 정리하는 일은 며칠, 혹은 몇 달이 걸린다. 그 효과도 며칠·몇 달만큼이다. AI로 일한다는 말은 결국 일을 더 깊이 한다는 말과 같다. AI가 일을 대신해 주지 않는다. AI가 더 잘 일하게 하기 위해 사람이 더 정밀하게 일한다.
오늘 시도해볼 것 두 가지
하나. 자기 도메인의 "한 페이지"를 적어보라. 핵심 개념 5~10개, 그 사이 관계 3~5개, 자주 일어나는 오해 2~3개. 다음 AI 작업 때 이 페이지를 시스템 프롬프트나 프로젝트 컨텍스트에 같이 넣어보고, "당신은 [내 직업]입니다"만 넣었을 때와 답을 비교해보라. 차이가 보일 것이다.
둘. 평소에 "당신은 X 전문가입니다"로 시작하던 프롬프트가 있다면, 그 한 줄을 빼고 대신 "이 작업에서 다루어야 할 사실: [목록]"과 "이 작업에서 절대 추측하지 말 것: [목록]"을 적어보라. 모델은 직함이 아니라 경계와 규칙으로 일한다.
직함을 부르지 말고, 사실을 깔아라. 그게 회사들이 학습하는 고급 사용자의 진짜 패턴이다.
참고 문헌:
- arXiv 2512.05858 — Playing Pretend: Expert Personas Don't Improve Factual Accuracy
- arXiv 2311.10054 — When "A Helpful Assistant" Is Not Really Helpful
- arXiv 2603.18507 — Expert Personas Improve LLM Alignment but Damage Accuracy
- arXiv 2406.17260 — Mitigating Hallucination in Fictional Character Role-Play
- arXiv 2412.15235 — OG-RAG: Ontology-Grounded Retrieval-Augmented Generation
- arXiv 2505.00039 — An Ontology-Driven Graph RAG for Legal Norms
- Microsoft Research — GraphRAG: Unlocking LLM Discovery on Narrative Private Data
- Neo4j — Unifying LLMs & Knowledge Graphs for GenAI
- Anthropic — Effective Context Engineering for AI Agents