TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 28 READS

AI에게 도덕을 가르치려면 누구에게 물어야 할까? Anthropic이 종교학자들과 마주 앉은 이유

엔지니어링 회사가 종교학자를 만났다

AI 회사 회의실이라고 하면 보통 GPU 수급이나 벤치마크 점수 얘기가 오갈 것 같잖아요. 그런데 뉴욕타임스 보도에 따르면 Anthropic이 Claude의 도덕적 판단을 주제로 여러 종교 전통의 학자들과 만났다고 해요. 언뜻 보면 어색한 조합인데요, 조금만 생각해 보면 왜 이런 자리가 필요해졌는지 이해가 가요.

요즘 사람들은 AI에게 코드만 물어보지 않거든요. 이별 후에 마음을 추스르는 법, 부모님 간병과 내 커리어 사이의 고민, 신앙에 대한 회의처럼 아주 개인적인 질문까지 던져요. 이런 대화에서 모델이 어떤 답을 내놓든, 그 답에는 “무엇이 옳은가”에 대한 어떤 입장이 깔려 있을 수밖에 없어요. 모델의 가치관이 철학 수업 주제를 넘어 제품 품질의 문제가 된 거예요.

AI의 ‘가치관’은 어디서 오나

먼저 모델에 가치가 들어가는 과정을 쉽게 짚어볼게요. 첫 단계는 사전학습이에요. 인터넷의 방대한 텍스트를 읽으면서 다음 단어를 맞히는 훈련인데, 이 과정에서 모델은 인류가 써 놓은 온갖 가치관을 뒤섞인 채로 흡수해요. 성인군자의 글도, 악플도 다 들어가 있죠.

그다음이 사후학습이에요. 대표적인 게 RLHF(사람 피드백 기반 강화학습)인데요. 이게 뭐냐면, 사람 평가자가 모델의 답변 두 개를 보고 더 나은 쪽을 고르면 모델이 그 선호를 따라가도록 조정하는 방식이에요. 강아지가 잘했을 때 간식을 주는 것과 비슷하다고 보면 돼요.

Anthropic은 여기에 Constitutional AI라는 방법을 더했어요. 2022년에 발표한 기법인데, 사람이 일일이 좋고 나쁨을 판정하는 대신 ‘헌법’이라고 부르는 원칙 문서를 주고, 모델이 그 원칙에 비춰 자기 답변을 스스로 비평하고 고치게 하는 방식이에요. 기준이 평가자 개개인의 감이 아니라 글로 적힌 원칙이 되니까, 무엇을 기준으로 삼았는지 공개하고 토론할 수 있다는 장점이 있어요. 실제로 Anthropic은 Claude가 어떤 가치와 성격을 지향하는지 설명하는 문서를 공개해 왔고요.

여기서 자연스럽게 다음 질문이 나와요. 그 원칙 문서는 누가, 무엇을 참고해서 쓰나요? 정직, 자비, 정의, 고통을 대하는 태도 같은 주제는 인류가 수천 년 동안 고민해 왔고, 그 생각의 상당 부분이 종교 전통 안에 쌓여 있어요. 게다가 전 세계 사용자 중 상당수가 종교적 세계관 안에서 살아가죠. 신앙 문제로 괴로워하는 사용자에게 모델이 무조건 세속적인 관점만 내밀면, 그건 중립이라기보다 또 하나의 입장을 밀어붙이는 셈이 될 수도 있어요. 종교학자들과 나눈 대화는 이런 사각지대를 점검하는 과정으로 볼 수 있어요.

다른 곳들은 어떻게 하고 있나

이 문제를 고민하는 건 Anthropic만이 아니에요. OpenAI는 Model Spec이라는 문서를 공개해서, 개발자 지시와 사용자 요청이 부딪힐 때 무엇을 우선하는지 같은 행동 규칙을 꽤 구체적으로 적어 두었어요. 비유하자면 OpenAI 쪽은 ‘업무 매뉴얼’에 가깝고, Anthropic 쪽은 ‘이런 사람이 되었으면 좋겠다’는 인성 교육에 조금 더 가까운 느낌이에요. 규칙을 촘촘히 정하면 예측하기 쉽고, 성품과 판단력을 기르면 매뉴얼에 없는 상황에서 유연하게 대처할 수 있다는 차이가 있죠.

종교계도 AI에 적극적으로 목소리를 내고 있어요. 바티칸은 2020년에 ‘AI 윤리를 위한 로마 선언’을 발표하고 마이크로소프트, IBM 같은 기업의 서명을 받았어요. 2025년에 선출된 교황 레오 14세는 AI가 가져올 변화를 교회가 마주한 큰 과제로 꼽기도 했고요. 기술 기업과 종교 공동체가 같은 테이블에 앉는 일이 점점 낯설지 않게 되고 있어요.

물론 비판도 있어요. 특정 종교의 관점이 모델에 은근히 스며드는 것 아니냐는 우려도 있고, 결국 미국 회사가 고른 사람들의 목소리만 반영되는 것 아니냐는 지적도 나와요. 다양한 생각이 공존하는 사회에서 ‘누구의 도덕’을 기준으로 삼을지는 앞으로도 쉽게 결론이 나지 않을 질문이에요.

한국 개발자에게 주는 시사점

먼 나라 철학 토론처럼 들릴 수 있는데요, 사실 LLM으로 서비스를 만드는 개발자라면 이미 비슷한 일을 하고 있어요. 시스템 프롬프트에 “이런 질문엔 이렇게 답하고, 이런 건 하지 마”라고 적는 순간, 우리 서비스만의 작은 헌법을 쓰고 있는 거거든요.

한국 서비스라면 신경 쓸 부분이 더 있어요. 대부분의 기본 모델은 영어권, 특히 미국식 가치 감각을 기본값으로 갖고 있어요. 그런데 한국 사용자는 존댓말과 위계에 대한 감각, 가족 관계를 대하는 방식, 민감하게 받아들이는 주제가 꽤 달라요. 심리 상담, 교육, 시니어 서비스처럼 가치 판단이 들어가는 분야라면 이런 걸 해볼 만해요.

마무리

한 줄로 정리하면, AI의 가치관도 이제 코드처럼 설계하고 검증해야 하는 대상이 되었고, 그 설계에 누구의 목소리를 담을지가 새로운 숙제가 되었다는 거예요.

여러분이 만드는 서비스의 AI가 가치 판단이 필요한 질문을 받는다면, 그 기준은 누가 정해야 한다고 생각하세요? 개발팀, 사용자, 아니면 외부 전문가일까요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.nytimes.com/2026/09/29/us/anthropic-claude-moral...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...