TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 27 READS

AI가 숙제를 다 풀어버린 뒤, 교수는 평가 방식을 이렇게 바꿨다

AI가 숙제를 다 풀어버린 뒤, 교수는 평가 방식을 이렇게 바꿨다
SOURCE IMAGE · HACKER NEWS

ChatGPT가 등장하기 전인 2021년경, 한 동료가 이 강의의 독해 퀴즈에 GPT-3를 시험해 보라고 권했다. 모델은 지정된 논문을 읽지 않고도 채점 기준을 통과하는 설득력 있는 답을 내놓았다. 그때는 아무것도 바꾸지 않았다. 그러나 5년이 지나 AI 에이전트가 강의의 모든 과제를 대신 수행할 수 있게 되자, 교수는 배우게 하려는 목표는 거의 그대로 둔 채 평가 방식 대부분을 다시 설계했다. 핵심 전략은 하나다. 집에서 수행하는 어떤 결과물로도 더 이상 이해도를 검증하지 않고, 조교와의 대면 대화, 시험, 그리고 영상 시연으로 검증의 축을 옮기는 것이다.

대상은 카네기멜런의 상급 과목 '프로덕션을 위한 머신러닝'으로, ML 모델을 감싸는 실서비스 소프트웨어와 MLOps를 다루며 매 학기 100~170명이 듣는다. 강의가 입문 과목이 아니고, 학습 목표가 코드 작성이나 특정 도구 사용이 아니라 엔지니어링 트레이드오프, 위험 예측과 완화, 팀워크에 있다는 점이 이번 개편을 상대적으로 쉽게 만들었다. 이런 역량은 일부를 모델에 넘길 수 있더라도 여전히 익힐 가치가 있다는 판단이다. 만약 입문 과목이나 전통적인 소프트웨어 공학 과목이었다면 학습 목표 자체를 훨씬 크게 손봐야 했을 것이다.

주목할 점은 정책의 방향이다. 이 강의는 필기·구술 시험을 제외한 모든 상황에서 AI를 출처 표기 없이 어떤 형태로든 쓰도록 허용하고, 많은 경우 오히려 권장한다. AI 사용을 단속하는 일은 현실적으로 불가능하며, 무엇보다 학생들이 이 기술을 책임감 있게 쓰는 법을 어차피 배워야 한다고 보기 때문이다.

검증된 교육법과의 충돌

곤란한 지점은 AI가 교육학에서 근거가 축적된 관행들을 무너뜨리고 있다는 사실이다. 연구는 소수의 고부담 시험보다 잦은 저부담 평가와 피드백(숙제, 퀴즈)을 선호하지만, AI는 바로 그 저부담 영역을 무력화하며 우리를 시험 쪽으로 떠민다. 예전에는 학생이 실수한 과제를 제한된 횟수 안에서 재제출해 잃은 점수를 회복하는 안전망을 뒀는데, AI로 생성한 답을 일단 던지고 채점에서 지적된 부분만 고쳐 다시 내는 식으로 남용되면서, 지금은 재제출에 10%의 감점을 매기게 됐다. 수업 중 토론 질문도 여러 조가 모델에 떠넘기는 모습이 관찰됐다.

그럼에도 교수는 남용 가능성을 감수하고 반복적인 저부담 상호작용을 유지하는 쪽으로 기운다. 일부 학생은 깊이 배우지 않고 통과하겠지만, 배우려는 학생에게는 더 나은 환경이 되기 때문이다. 그는 자신이 독일에서 겪은, 학기 말 단 한 번의 시험이 성적의 100%를 좌우하고 탈락률이 50~80%에 달하던 모델로 돌아가고 싶지 않다고 말한다.

글쓰기 답안을 조교 면담으로

실제 변화의 핵심은 서술형 답안을 요구하던 부분을 전부 포기한 것이다. 해법을 설명하고 관련 코드를 링크하는 보고서는 남겼지만, 이는 결과물 탐색용일 뿐 AI 생성 문서를 받아도 무방하다. 반면 '어려웠던 부분', '팀워크 개선 방안' 같은 성찰 문서나 독해 퀴즈의 시나리오형 질문은 통째로 위임 가능해져 무의미해졌다. 좋은 답의 기준을 진술하는 순간 그것이 곧 LLM에게 주는 완벽한 지시가 되어버리기 때문이다.

그래서 성찰 문서는 조교와의 15분 대면 면담으로 대체됐다. 학생은 과제마다 조교를 만나 실시간 대화로 몇 가지 질문에 답해야 한다. LLM으로 초안을 만들 수는 있지만 일부를 외워야 하고, 조교는 후속 질문으로 압박한다. 이 체크인은 과제 점수의 20%를 차지하며 통과/실패로 채점되고, 실패해도 감점 없이 재도전할 수 있어 조교의 주관적 채점에 대한 공정성 우려를 낮춘다. 첫 시도에서 꽤 많은 학생이 탈락한다. 20:1 학생-조교 비율에 조교당 주 10시간 근무로, 2주마다 조교 한 명이 약 300분을 쓰는 수준이라 운영이 가능하다. 다만 화상 면담에서 AI를 몰래 쓰는 사례가 있어 앞으로는 대면 체크인만 제공할 방침이다.

독해 퀴즈는 포기했다. 대신 읽기 분량을 절반으로 줄이고 점수를 떼지 않은 채 수업 토론에 녹여 넣는다. 주간 실습과 과제, 팀 프로젝트에도 같은 대면 체크인을 적용해, 조교가 팀원 아무나 지목해 구현을 설명하게 하는 '컴포트존 초과' 보너스를 준다. 특히 구현한 기능을 실제 UI 워크플로에서 보여주는 짧은 영상 시연은, 기능이 진짜 작동해야 하기 때문에 효과가 좋았다.

채점도 LLM에게

평가의 무게추도 이동했다. 시험 비중은 15%에서 25%로 올랐고 앞으로 더 높일 것으로 보인다. 커밋 메시지에 'Authored by Claude Code'가 적힌 답안을 채점하며 허탈해했다는 조교의 말이 전환점이었다. 이후 이 강의는 기관 승인 LLM으로 코드와 보고서를 자동 채점하는 인프라를 구축했다. 명세 기반 채점의 명확한 통과/실패 기준에 맞춰 LLM이 '통과' 또는 '검토 필요'로 판정하고 조교용 코멘트를 붙인다. 조교는 '검토 필요' 답안에 시간을 집중하고, 채점 시간이 50~80% 줄어 학생과 얼굴을 맞대는 시간이 늘었다. 다만 점수 감점은 반드시 사람이 검토한 뒤에만 이뤄진다.

같은 LLM-as-a-judge 방식은 수업 중 토론 피드백에도 쓰인다. 매 강의의 짝-공유 세션에서 학생들이 슬랙 채널에 답을 올리면 커스텀 봇이 수업에서 다룬 기준으로 검증하고 건설적 피드백을 생성해 수정을 유도한다. 100~170명 규모에서 개별 피드백이 어렵던 문제를 자동화로 푼 셈이다. 한국의 실무 교육이나 사내 온보딩을 설계하는 이들에게 이 사례가 던지는 메시지는 분명하다. 집에서 만든 결과물로 이해도를 재는 방식은 이미 신뢰를 잃었으며, 대면 대화·시연·시험처럼 그 자리에서 설명하게 하는 검증만이 남는다는 것이다. 이는 검증된 저부담 학습법과 정면으로 충돌하는 타협이지만, 지금으로선 감수할 만한 트레이드오프라는 게 그의 결론이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://thelastsoftwareengineer.substack.com/p/how-i-changed...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...