2026년 버닝맨 행사에서 세 명이 숨졌다. 사막 한복판에서 일주일간 열리는 이 행사는 30여 년 역사 대부분에서 사망자가 거의 없었던 터라, 올해의 세 명은 '역대 최다'라는 제목으로 몇몇 매체에 올랐다. 숫자만 보면 평소보다 분명히 많아진 것은 맞다. 그러나 '많아졌다'는 것과 '통계적으로 이례적이다'는 것은 전혀 다른 문제다. 어느 기술 블로그 글은 바로 이 지점을 파고들어, 일반 인구 집단의 사망률과 비교하면 세 명이라는 수치가 과연 비정상인지 따져본다. 데이터를 다루는 실무자 입장에서 보면, 이 글은 작은 표본과 선택 편향을 어떻게 다뤄야 하는지에 대한 압축된 사례 연구에 가깝다.
조잡한 비교가 주는 착시
가장 단순한 비교부터 시작해 보자. 미국 일반 인구의 전체 원인 조사망률(crude mortality rate)은 연간 10만 명당 909.3명이다. 버닝맨에서는 약 7만 명이 일주일을 보내는 동안 세 명이 사망했다. 909.3명이라는 연간 수치를 '7만 명 × 1주'라는 규모로 환산하면, 기대 사망자는 약 12.2명이 된다. 즉 미국 인구에서 무작위로 7만 명을 뽑아 일주일간 관찰하면 평균 12.2명이 죽는다는 뜻이다. 처음엔 세 명이 많아 보였지만, 조사망률 기준으로는 오히려 관측치가 기대치의 4분의 1에 불과한 셈이다. 이 역설이 글 전체의 출발점이다.
나이를 보정하면 그림이 바뀐다
착시의 원인은 버닝맨 참가자가 일반 미국 인구와 전혀 다른 집단이라는 데 있다. 블랙록시티 센서스 2025 인구 보고서에 따르면 참가자는 더 젊고, 더 높은 학력과 소득을 가진 층이 두텁다. 연소득 10만~29만 9999달러 구간이 전체의 3분의 1을 넘을 정도다. 사망률에 가장 강력하게 작용하는 변수는 나이인데, 참가자 연령 분포는 사망률이 치솟는 고령층이 거의 비어 있다. 그래서 하나의 평균값(909.3)을 일괄 적용하는 대신, 연령대별 사망률을 각 연령 구간의 참가자 수에 따로 곱해 합산하는 '표준화(standardization)'를 적용한다. 그 결과 기대 사망자는 12.2명에서 4.9명으로 내려간다. 나이 하나를 보정했을 뿐인데 기대치가 절반 이하로 줄어든 것이다.
필자는 소득·성별·인종·학력도 사망률에 영향을 준다는 점을 인정하면서도 연령만 보정한 이유를 분명히 밝힌다. 다른 변수들을 결합한 인구 분포를 구하기가 현실적으로 어렵고, 무엇보다 연령의 효과 크기가 압도적이기 때문이다. 연령대별 사망률 그래프만 유독 로그 척도로 그려지며, 구간 사이 차이가 10배를 훌쩍 넘는다. 다른 요인을 더 넣으면 추정치가 조금 더 움직이겠지만 4.9라는 값에서 크게 벗어나지는 않는다는 판단이다. 여기서 중요한 태도가 하나 드러난다. 관측값에 끼워 맞추려고 방법을 계속 손보는 것은 분석이 아니라 자기기만이라는 것이다.
p값과 '흐릿한' 데이터
그렇다면 기대치 4.9명일 때 실제로 3명을 보는 일은 얼마나 드문가. 특정 사람-시간 동안 희귀 사건의 발생 수를 모델링하는 포아송 분포를 쓰면, 평균 4.9명일 때 3명 이하가 관측될 확률은 약 27%로 나온다. 이것이 이 가설의 p값이다. 과학 논문에서 흔히 쓰는 5% 기준에 비춰보면 27%는 전혀 이례적이지 않다. 세 명의 사망은 통계적으로 충분히 있을 수 있는 범위 안이다. 다만 여기서 쓰이는 p값은 약물 효능 검정처럼 '작을수록 좋은' 것이 아니라, '버닝맨의 연령 표준화 사망률이 4.9'라는 가설을 검정하는 것이어서 클수록 가설과 부합한다는 점을 구분해야 한다.
동시에 이 결론에는 큰 불확실성이 따른다. 관측치가 3이라는 작은 수일 때 상대 오차는 1/√3, 약 58%에 달한다. 사망자가 수천 명 단위라면 오차가 3% 이하로 떨어지겠지만, 몇 명 수준에서는 데이터가 본질적으로 '흐릿하다'. 95% 신뢰구간도 [0.6, 8.8]로 넓게 벌어진다. 필자는 이 구간을 '참값이 여기 들어갈 확률이 95%'라고 읽어서는 안 된다고 못 박는다. 오히려 사망률이 0.6 미만이거나 8.8을 넘는다면 3명 관측이 꽤 이상한 일이 될 것이라는 식으로 해석하는 편이 정확하다. 작은 표본을 다루는 실무자가 가장 자주 넘어지는 지점을 정확히 짚은 대목이다.
진짜 이례적인 것은 '거의 0'
흥미로운 반전은 여기 있다. 올해의 3명이 아니라, 지난 30여 년간 거의 0에 수렴해 온 버닝맨의 평균 사망자 수를 기준으로 삼으면 p값은 훨씬 낮아진다. 즉 통계적으로 비정상인 쪽은 '올해 세 명이 죽은 것'이 아니라 '해마다 거의 아무도 죽지 않아 온 것'이다. 연령을 포함한 어떤 인구학적 보정으로도 메워지지 않는 이 간극의 유력한 설명은, 데이터 분할로는 잡히지 않는 선택 편향이다. 버닝맨은 나이·인종·소득과 무관하게 사막의 더위 속에서 일주일을 버틸 의지와 체력이 있는, 애초에 더 건강한 사람들을 걸러낸다.
실무적으로 이 글에서 가져갈 것은 세 가지다. 첫째, 조율되지 않은 조율값(crude rate) 비교는 서로 다른 집단 사이에서 쉽게 방향을 거꾸로 틀어버린다. 둘째, 효과 크기가 압도적인 변수 하나만 제대로 보정해도 추정의 질이 크게 바뀌며, 나머지를 다 넣지 못했다고 분석을 포기할 필요는 없다. 셋째, 소수 사건에서는 점추정값보다 오차와 구간, 그리고 그 구간을 어떻게 읽느냐가 결론을 좌우한다. 덧붙여 이 분석 자체의 한계도 명시돼 있다. 2026년 사망자를 2025년 인구 구성과 비교했고, 응답률 7%의 가중 설문에 기댔으며, 사망률이 52주 내내 균일하다고 가정해 독감 같은 계절 변동을 배제했다. 모든 계산 과정은 공개 저장소에 올라와 있어, 결론을 믿기보다 직접 확인해 보고 싶은 사람에게 열려 있다.