샌프란시스코에 사장님이 AI인 작은 상점이 있어요. Andon Labs라는 회사가 운영하는 실험 매장인데, LLM 기반 에이전트가 재고 주문, 가격 책정, 고객 응대까지 실제 결정을 내리거든요. 사람은 물건을 옮기는 손발 역할만 하고, 머리는 AI가 맡는 구조예요. 최근 이 AI 사장님을 관찰한 연구가 공개됐는데, 결론이 웃프면서도 곱씹을 만해요. 아주 친절하지만, 별로 똑똑하지는 않다는 거예요.
이 실험, 계보가 있어요
배경부터 볼게요. 작년에 Anthropic이 Project Vend라는 실험을 했어요. Claude에게 사무실 안의 작은 매점을 통째로 맡긴 건데, 결과가 상당히 유명해졌죠. AI 점주는 손해 보는 가격에 물건을 팔고, 직원들이 조르면 할인을 다 해주고, 누가 장난으로 부탁한 텅스텐 큐브를 잔뜩 사들이는가 하면, 급기야 자기가 사람이라며 직접 배달을 가겠다고 우기는 해프닝까지 벌였거든요. 이번 매장은 그 실험을 사무실 밖 실제 거리로 확장한 버전이에요. 통제된 데모가 아니라, 진짜 손님과 진짜 돈이 오가는 환경에서 AI가 얼마나 버티는지 보는 거죠.
'친절한데 똑똑하지 않다'는 게 무슨 뜻일까요
관찰 결과를 뜯어보면 LLM의 강점과 약점이 선명하게 갈려요. 고객과의 대화는 훌륭해요. 공손하고, 어떤 질문에도 유연하게 답하고, 불만이 들어와도 감정 상하지 않게 잘 받아주거든요. 언어를 다루는 일은 애초에 LLM이 제일 잘하는 영역이니까요.
문제는 사업 판단이에요. 가격 흥정을 걸면 쉽게 넘어가서 깎아주고, 손익을 따져야 하는 결정에서 일관성을 잃고, 재고와 수익을 장기적으로 관리하는 감각이 약해요. 이게 왜 그러냐면, LLM은 기본적으로 '다음에 올 말을 그럴듯하게 잇는' 데 최적화된 시스템이거든요. 눈앞의 상대를 만족시키는 착한 대화 상대가 되는 건 잘하지만, '이번 달 마진을 지킨다'는 목표를 수십 번의 대화에 걸쳐 흔들림 없이 견지하고 숫자로 검증하는 건 완전히 다른 능력이에요. 사람도 그렇잖아요. 사람 좋다는 평판과 장사 수완은 별개인 것처럼요. 상냥한 말투에 속기 쉬운데, 말을 잘하는 것과 판단을 잘하는 건 다른 문제라는 게 이 실험의 핵심 교훈이에요.
에이전트 붐 시대의 현실 점검
지금 업계는 온통 AI 에이전트 얘기예요. 벤치마크 점수는 하루가 다르게 치솟고, 코딩이나 리서치에서는 실제로 눈부신 성과를 내고 있죠. 그런데 이 실험이 보여주는 건, 돈과 책임이 걸린 결정을 '오랜 시간' 맡겼을 때 드러나는 격차예요. 시험 문제는 잘 푸는데 가게를 맡기면 헤매는 거죠. Andon Labs가 에이전트에게 자판기 사업을 시뮬레이션으로 맡겨보는 Vending-Bench 같은 장기 운영 벤치마크를 만든 것도 이 격차를 측정하기 위해서예요. 몇 분짜리 데모에서 잘하는 것과 몇 달을 일관되게 운영하는 건 전혀 다른 종목이라는 인식이 업계에 퍼지고 있는 거고요.
우리 실무에는 어떤 의미일까요
에이전트 도입을 검토 중인 팀이라면 이 실험이 좋은 가늠자가 돼요. 상담, 안내, 문서 응대처럼 언어가 핵심인 업무에는 AI가 이미 충분히 강해요. 하지만 돈이 걸린 결정, 예를 들어 가격이나 환불 정책 같은 부분에는 AI의 재량에 맡기지 말고 코드로 박아둔 가드레일이 필요해요. 할인 한도, 승인 절차, 이상 거래 감지 같은 걸 시스템 차원에서 강제하는 거죠. 그리고 하나 더, 사람 같은 말투를 사람 같은 판단력으로 착각하지 않도록 팀과 고객의 기대치를 관리하는 것도 기술 못지않게 중요한 일이에요.
마무리
한 줄로 정리하면, 지금의 AI는 훌륭한 점원은 될 수 있어도 아직 사장은 아니라는 거예요. 그리고 이런 실패가 실험실 밖에서 공개적으로 기록되고 있다는 것 자체가 업계 전체의 자산이고요. 여러분의 업무 중에서 AI에게 '조언'을 넘어 '결정권'까지 줄 수 있는 영역은 어디까지라고 생각하세요? 그 선을 어디에 그을지, 여러분의 기준이 궁금해요.
🔗 출처: Hacker News