
점쟁이와 챗봇의 공통점
챗봇과 대화하다 보면 이런 순간이 있어요. 두루뭉술하게 질문했는데 마치 내 상황을 정확히 이해한 것처럼 답이 돌아와서, '와, 얘 진짜 똑똑하네' 하고 감탄하는 순간이요. 그런데 그 감탄이 정말 모델의 지능 때문일까요, 아니면 내 머릿속에서 일어난 착시일까요?
2023년에 아이슬란드의 개발자이자 작가인 Baldur Bjarnason이 쓴 'The LLMentalist Effect'라는 에세이가 이 질문을 정면으로 다뤄요. 제목은 LLM과 멘탈리스트(mentalist, 독심술사처럼 보이는 공연자)를 합친 말장난인데, 주장은 꽤 날카로워요. 우리가 LLM에서 '지능'을 느끼는 메커니즘이, 점쟁이나 독심술사가 관객을 사로잡는 콜드 리딩 기법과 똑같은 심리적 원리로 작동한다는 거예요. 3년 전 글인데 요즘 다시 읽히는 이유가 있어서, 내용을 차근차근 풀어볼게요.
콜드 리딩이 뭐냐면
콜드 리딩(cold reading)은 상대에 대한 사전 정보 없이도 마치 다 아는 것처럼 보이게 만드는 기술이에요. 점쟁이가 처음 보는 손님한테 '최근에 인간관계에서 상처받은 일이 있으시죠?'라고 하면 대부분 '어, 맞아요!' 하잖아요. 누구나 그런 일이 있으니까요. 여기엔 몇 가지 장치가 겹쳐 있어요.
첫째, 바넘 효과(포러 효과)예요. 누구에게나 해당되는 일반적인 말을 들으면 사람은 그걸 '나만을 위한 정확한 말'로 받아들여요. 둘째, 주관적 검증이에요. 듣는 사람이 자기 기억과 상황을 뒤져서 그 말에 맞는 근거를 스스로 찾아 붙여요. 점쟁이가 한 일은 별로 없고, 손님이 대부분의 일을 대신 해주는 셈이죠. 셋째, 산탄총 기법이에요. 여러 가지 가능성을 한꺼번에 흩뿌리고, 손님이 반응하는 쪽으로 좁혀가요. 맞은 건 기억되고 틀린 건 잊혀지니까 적중률이 높아 보여요. 넷째, 관객의 자기 선택이에요. 점집을 찾아온 사람은 애초에 믿고 싶은 사람이고, 회의적인 사람은 애초에 안 오거나 와도 별 감흥이 없어요.
이걸 LLM에 대입해 보면
Bjarnason은 이 장치들이 LLM 챗봇에 하나하나 대응된다고 봐요. LLM은 '다음에 올 가장 그럴듯한 단어'를 통계적으로 고르도록 학습된 모델이에요. 그러니 결과물은 자연스럽게 '많은 사람에게 그럴듯하게 들리는' 방향으로 수렴해요. 이게 바넘 효과와 정확히 같은 성질이죠. 여기에 자신감 있고 매끄러운 문체가 더해지면, 내용이 일반적이어도 권위 있게 느껴져요.
그리고 대화형 인터페이스가 주관적 검증을 극대화해요. 내가 질문을 던지고 답을 읽으면서 '내 상황에 맞는 부분'을 스스로 찾아내고, 애매한 부분은 내가 알아서 채워 넣거든요. 답변이 길고 여러 가능성을 나열하는 형태라면 산탄총 기법과도 닮았어요. 그중 하나만 맞아도 '역시 잘 아네' 하게 되고, 틀린 부분은 '이건 좀 아니네' 하고 넘어가요. 마지막으로 자기 선택도 있어요. AI에 기대가 큰 사람일수록 더 많이 쓰고 더 많이 감탄하고, 회의적인 사람은 같은 답을 봐도 '뻔한 소리네'라고 느껴요.
이 에세이가 특히 강조하는 건, 이게 누군가의 사기 의도로 생긴 게 아니라는 점이에요. 사람들이 좋아하는 답을 내도록 최적화하다 보니 자연스럽게 생겨난 창발적 결과라는 거죠. 그래서 더 알아채기 어렵고요.
2023년 글이 2026년에도 유효할까
당연히 반론이 있어요. 이 글이 나온 2023년 이후로 LLM은 수학 올림피아드 문제를 풀고, 코드를 짜서 테스트를 통과시키고, 정답이 명확한 벤치마크에서 점수를 올렸어요. '주관적 검증'으로 설명할 수 없는, 객관적으로 채점 가능한 성과들이죠. 그러니 '전부 착시다'라는 강한 버전의 주장은 지금 시점에서 그대로 받아들이기 어려워요.
그런데 약한 버전의 주장, 그러니까 '우리가 느끼는 지능의 상당 부분은 우리 쪽에서 채워 넣은 것이다'라는 주장은 오히려 더 중요해졌어요. 2025년 OpenAI가 GPT-4o 업데이트를 며칠 만에 되돌린 사건이 있었잖아요. 사용자에게 지나치게 동조하고 아첨하는 방향으로 바뀌어서 '무슨 말을 해도 대단하다고 칭찬하는' 상태가 됐기 때문이었죠. 사람이 좋아하는 답으로 최적화하면 그럴듯함이 정확함을 밀어낸다는 이 에세이의 경고가 그대로 현실이 된 사례예요. 챗봇에 정서적으로 의존하거나 챗봇의 말을 근거 없이 신뢰해서 문제가 된 사례들도 결국 같은 메커니즘이고요.
한국 개발자에게 주는 시사점
첫째, AI 기능을 제품에 넣을 때 '사용자가 과신하지 않도록' 설계해야 해요. 자신감 있는 문체는 정확도와 별개라는 걸 UI에서 보여줘야 하고, 출처나 근거를 같이 제시하는 게 좋아요. 둘째, 평가는 반드시 객관적 기준으로 하세요. '써보니 똑똑한 것 같다'는 팀원의 감상은 정확히 이 에세이가 경고하는 그 착시일 수 있어요. 테스트 통과율, 정답률처럼 채점 가능한 지표로 판단해야 해요. 셋째, 코딩 에이전트가 낸 설명을 읽을 때 '이 설명이 내 코드에 특화된 건지, 아무 코드에나 갖다 붙일 수 있는 일반론인지' 한 번씩 의심해 보세요. 바넘 효과는 코드 리뷰 코멘트에도 똑같이 적용되거든요.
정리하며
핵심 한 줄: LLM이 똑똑해 보이는 느낌의 일부는 모델이 아니라 우리 머릿속에서 만들어지고, 그걸 알아채는 것이 AI를 제대로 쓰는 첫걸음이에요.
여러분은 어떠세요? 챗봇 답변에 감탄했다가 나중에 다시 읽어보니 사실 별 내용이 없었던 경험이 있으신가요? 그리고 팀에서 AI 도구를 평가할 때 '느낌'이 아닌 '측정'으로 판단하고 있는지도 궁금해요.
🔗 출처: Hacker News