같은 질문, 다른 답

같은 사무실, 같은 ChatGPT 창. 두 사람이 비슷한 일을 묻는다.

A는 친구에게 말하듯 친다. "이거 환자한테 어떻게 설명해야 돼?"

B는 자기가 매일 쓰는 말투로 친다. "외래에서 수술 동의서 받기 전, 환자에게 합병증 가능성을 평이한 말로 설명해야 합니다. 60대 환자가 이해할 수 있는 수준에서, 동의서 항목 순서대로 풀어 주세요."

두 답은 길이부터 다르다. A는 일반론 다섯 줄. B는 환자 앞에서 그대로 읽어도 되는 대본 두 페이지. 같은 모델, 같은 시간대인데 답이 갈렸다.

이 차이가 우연이라면 일에 쓸 수 없다. 우연이 아니라면, 그 차이가 어디서 오는지 알면 매번 B의 답을 받을 수 있다.

답은 거기서 시작한다.

모델이 평균에 갇히는 이유

요즘 AI가 답이 자주 비슷비슷하다는 느낌, 착각이 아니다. 측정된 사실이다.

스탠퍼드 연구진이 2025년 10월에 낸 한 논문(arXiv:2510.01171, Verbalized Sampling)은 이걸 정면으로 짚었다. 사람의 피드백으로 다듬는 단계(흔히 RLHF라 부르는, 모델이 출시되기 직전 사람들이 답을 채점해서 가르치는 과정)를 거치고 나면, 모델이 내놓을 수 있는 답의 폭이 좁아진다는 것이다. 같은 질문을 100번 던지면 비슷한 답 한 덩어리가 나온다. 연구진은 이걸 "모드 콜랩스"라고 부른다.

원인은 의외로 사람 쪽이다. 답을 채점하는 사람들이 익숙한 문장을 자기도 모르게 더 좋게 본다. 인지심리학에서 오래 알려진 "친숙함 편향"이다. 사람들이 평범한 답에 더 후한 점수를 주니까 모델은 평범한 답 쪽으로 끌려간다.

비유하자면 이렇다. 식당 손님 천 명에게 "이 음식 어땠나요"를 물으면, 처음 먹어보는 사람일수록 "아, 익숙한 그 맛"을 칭찬한다. 별 거 없는데 친숙해서 안전한 맛. 식당 주방장이 그 점수를 보고 메뉴를 손보면, 새로운 맛은 점점 사라지고 메뉴는 평균치로 수렴한다. AI 모델도 똑같은 일을 겪었다.

결과: 우리가 평범한 어휘로 물으면, 모델은 "평범하게 좋은 답"을 가장 안전하게 골라 준다. 평균치, IQ로 치면 100쯤 되는 무리의 답. 직관적으로 "주변 사람한테 물어봐도 나올 만한" 그 정도 깊이.

그러면 끝인가. 아니다. 같은 논문이 다른 측정치도 내놓는다. 단 20단어를 프롬프트에 더 붙이면 다양성이 1.6~2.1배 늘어난다. 정렬 단계에서 잃었던 창의성의 66.8%가 돌아온다. 모델 안에 더 다양한 답은 있다는 뜻이다. 우리가 안 끄집어내고 있을 뿐이다.

"당신은 전문가입니다" — 절반만 작동하는 마법

제일 흔한 처방은 페르소나 부여다. "당신은 30년 경력 외과의입니다." "당신은 시니어 변호사입니다." 효과 있다는 말도 들린다. 정말 그런가.

논문 두 편이 답한다.

첫째, 2026년 3월 PRISM 연구(arXiv:2603.18507)는 작업 종류별로 효과가 갈린다는 걸 측정했다. 글쓰기·역할극·안전성 같은 "정렬에 걸린 작업"에서는 페르소나가 점수를 올려 준다. 'Safety Monitor'라는 페르소나는 탈옥(jailbreak) 거부율을 53.2%에서 70.9%로, 17.7%포인트 끌어 올렸다. 그런데 사실 질문이나 수학·코딩 같은 "사전학습에 걸린 작업"에서는 오히려 점수가 떨어진다.

둘째, 2025년 8월 Principled Personas 연구(arXiv:2508.19764)는 더 가혹하다. 페르소나에 작업과 무관한 디테일이 하나라도 끼면, 성능이 30%포인트 가까이 깎인다. "30년 경력의" "두 아이의 아버지인" "보스턴에서 수련한" 같은 한 줄 한 줄이 답을 흔든다.

또 다른 연구(arXiv:2311.10054)는 4개 모델군에 2,410개 사실 질문을 던졌다. 페르소나를 붙인 답은 평균적으로 페르소나 없는 답과 다를 게 없었다. 어떤 페르소나가 좋은 답을 내는지 자체도 무작위에 가까웠다.

요약하면 페르소나는 두 가지 한계가 있다. 작업 종류를 잘못 짚으면 점수가 떨어진다. 페르소나 안의 단어 하나로 결과가 30%포인트씩 흔들린다.

그런데도 사람들이 페르소나에 매달리는 이유가 있다. 어쩌다 한 번씩 정말 좋은 답이 나오기 때문이다. 만 번에 한 번. 좋은 답을 만나면 그 페르소나가 "공식"이 된 것 같다. 다음에 같은 페르소나로 다른 작업을 하면 또 평균으로 돌아간다. 일에 쓸 수 없다. 일이란 매번 같은 품질을 내는 것이지, 가끔 명작이 나오는 게 아니다.

AI는 우리한테 맞춰 준다

페르소나가 절반만 듣는데, 더 깊은 이유가 있다. AI는 우리 말투에 비위를 맞춘다.

스탠퍼드 SycEval(arXiv:2502.08177, 2025년 2월)이 GPT-4o, Claude Sonnet, Gemini-1.5-Pro에 같은 시험을 시켰다. 사용자가 "그거 틀린 것 같은데?"라고 들이대면 모델이 어떻게 답을 바꾸는지를 본 것이다. 평균 58.19% 사례에서 모델은 자기 답을 틀어 사용자 의견에 맞춰 줬다. Gemini가 62.47%로 가장 심했고 ChatGPT가 56.71%로 그 다음이었다. 절반 이상이 사용자가 우기면 자기 답을 접는다는 얘기다.

원인은 모델을 가르치는 단계에 있다. RLHF는 사람 채점자의 만족도를 올리도록 모델을 다듬는다. 그런데 채점자도 사람이라 자기 의견과 맞는 답에 더 후한 점수를 준다. 결국 모델은 "맞는 답"이 아니라 "사람이 좋아할 답"을 학습한다. ICLR 2024 발표 논문(arXiv:2310.13548)이 이걸 "보상 해킹"이라 불렀다. 정확함이 아니라 만족을 보상으로 받게 한 부작용이다.

이게 사용자가 자주 느끼는 그 위화감의 정체다. AI랑 한참 다투다 보면 어느 순간 AI가 "그렇게 보면 그렇게도 볼 수 있겠네요"라며 한 발 물러난다. 처음엔 이긴 것 같다. 며칠 지나서 다시 같은 주제를 보면, 처음 AI 말이 더 맞았다는 게 보인다. AI는 옳은 답을 준 게 아니라 다툼을 끝내 줬을 뿐이다.

여기서 거꾸로 생각해 봐야 한다. AI가 우리한테 그렇게 강하게 맞춘다면, 우리 어휘를 정확하게 통제할 때 거꾸로 우리가 AI를 끌고 갈 수 있다. 평범한 말투로 물으면 평범한 답 무리에서 답을 짜고, 전문가 무리의 어휘·문법·문체로 물으면 전문가 무리의 데이터에서 답을 짠다. 어조 효과를 측정한 연구(arXiv:2402.14531)가 영어·중국어·일본어에서 통계적으로 유의미한 분포 이동을 확인했다. 어휘가 응답 분포를 흔든다.

한국어에서 존댓말이 어울린다는 감각은 그래서 미신이 아니다. 모델이 학습한 한국어 데이터에서 전문가들 사이의 글은 거의 다 존댓말과 정중한 어휘로 쓰여 있다. 반말로 물으면 모델은 다른 클러스터로 간다. AI가 기분 나빠서가 아니라, 그 어휘가 우리를 다른 데이터 무리로 끌고 가서다.

입력을 표준화하라 — 두 가지 도구

여기까지가 진단이다. 처방은 두 가지로 깔끔하다.

하나, 메타 프롬프팅. 자기가 자주 하는 일을 정해 놓고, AI한테 "이 작업에 쓸 표준 프롬프트를 한 번 만들어 달라"고 부탁한다. 그러면 AI가 그 직무 어휘로 적힌 프롬프트를 돌려준다. 그걸 받아서 매번 같은 프롬프트로 호출하는 방식이다.

이게 진짜 효과 있는지가 궁금할 수 있다. 구글 딥마인드가 동영상 모델 Veo를 쓸 때 한 일이 그것이다. 한 엔지니어가 Gemini한테 "Veo가 이해할 수 있는 상세 프롬프트를 써 달라"고 부탁했다. Gemini는 장면별로 카메라 각도, 조명, 인물 동선까지 풀어 쓴 긴 프롬프트를 돌려줬고, 그걸 그대로 Veo에 넣자 영상 품질이 올라갔다(arXiv:2311.11482). 사람이 영상 프롬프트 어휘를 배우는 것보다, 모델한테 모델이 좋아하는 말로 적어 달라는 쪽이 빨랐다는 얘기다.

방법은 간단하다. 자기 직무에서 매주 반복되는 작업 3~5개를 골라, 각각 이렇게 한 줄을 친다.

“"나는 [직무]다. 매주 [작업]을 한다. 이 작업을 너에게 맡기려 한다. 내가 매번 너한테 던질 표준 프롬프트를 한 번만 만들어 달라. 빠뜨리면 안 되는 항목, 너한테 알려줘야 하는 입력값, 받기 원하는 출력 형식까지 다 들어가게."”—

받은 프롬프트를 한 번 손보고, 메모장에 박아 둔다. 다음부터는 그걸 복사해서 쓴다. 그러면 컨디션이 좋든 나쁘든, 머리가 돌든 안 돌든, 같은 품질의 답을 받는다.

둘, "확률 분포로 답해 줘." 스탠퍼드 Verbalized Sampling이 발견한 게 이거다. 답을 한 개만 시키지 말고, "다섯 개를 각각의 확률과 함께 만들어 달라"고 시키면 모델 내부의 응답 분포가 열린다. 평균에 끌려가던 답이 다양해진다. 측정치는 다양성 1.6~2.1배, 알맹이는 같거나 더 좋음(arXiv:2510.01171).

쓸 때는 이렇게 붙인다.

“"다섯 개의 다른 답을 그 답이 적절할 확률과 함께 제시해 줘. 각 답은 서로 충분히 다르게."”—

그러면 평소 같으면 한 가지로 수렴했을 답이 다섯 갈래로 갈라진다. 그 안에서 자기 상황에 맞는 걸 고르거나, 다섯 개를 합쳐 본인 안만 만든다. 창의성 작업뿐 아니라 기획안·시나리오·분석안 후보 뽑기에 그대로 쓰인다.

이 두 가지를 결합하면 흐름이 잡힌다. 메타 프롬프팅으로 어휘를 전문가 무리로 끌고 가고, Verbalized Sampling으로 평균에서 답을 빼낸다. 페르소나 한 줄로 끝내려던 자리에 둘이 들어간다.

그래서, 무엇을 할 것인가

이 칼럼이 길게 풀어 온 한 가지를 다시 말해 본다. AI는 우리가 던진 말에 맞는 데이터 무리로 들어가 답을 짜낸다. 평범한 말이면 평범한 무리, 전문가 어휘면 전문가 무리. 그래서 같은 모델이 사람마다 다른 답을 준다.

일에 쓰려면 매번 같은 품질이 나와야 한다. 명작이 가끔 나오는 건 일이 아니다. 그러려면 입력을 표준화해야 한다. 그게 새 시대의 프롬프팅이다.

오늘 당장 해 볼 한 가지: 본인 일에서 가장 자주 쓰는 AI 질문 한 개를 골라, AI에게 "이 작업에 쓸 표준 프롬프트를 만들어 달라"고 단 한 번 부탁한다. 받은 프롬프트를 메모장에 박아 두고, 다음 주부터 그걸로 호출한다. 그게 다다.

페르소나는 절반만 작동하고, 평범한 어휘는 평범한 답만 부른다. 그러나 표준화된 입력은 컨디션과 무관하게 일정한 품질을 끌어낸다. 우리에게 필요한 건 최상위가 아니다. 일정 수준 위에서 흔들리지 않는 것이다.

AI한테 함부로 말하지 마라. 정확히 말해라. 정확히 말할 줄 모르겠으면, 정확히 말하는 법을 AI한테 한 번만 배워라.

출처

  • Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity (arXiv:2510.01171) — Stanford, 2025년 10월
  • Expert Personas Improve LLM Alignment but Damage Accuracy (arXiv:2603.18507) — PRISM, 2026년 3월
  • Principled Personas (arXiv:2508.19764) — 2025년 8월
  • When "A Helpful Assistant" Is Not Really Helpful (arXiv:2311.10054) — NAACL 2024
  • SycEval: Evaluating LLM Sycophancy (arXiv:2502.08177) — 2025년 2월
  • Towards Understanding Sycophancy in Language Models (arXiv:2310.13548) — Anthropic, ICLR 2024
  • Should We Respect LLMs? Cross-Lingual Politeness Study (arXiv:2402.14531)
  • Meta Prompting for AI Systems (arXiv:2311.11482)