단원 홈
2단원 · 3차시

데이터가 세상을 닮지 않으면
전체 85%가 누구에겐 20%

2차시에서 우리는 급식 잔반을 예측할 데이터를 모았습니다. 오늘은 잘 모은 것처럼 보이는 사진 400장으로 강아지 품종 인식기를 만듭니다. 보고서에는 정확도 85.0%라고 적힐 것입니다. 그런데 어떤 사진에서는 20.0%입니다. 이 둘은 같은 프로그램입니다.

성취기준 12인기02-01
표집 편향 이름표 편향 역사적 편향 분할 평가 집단 간 격차 처방의 대가
🎯 학습 목표
  • 편향이 데이터의 어느 단계에서 들어오는지 세 갈래로 나누어 설명할 수 있다.
  • 하나로 뭉쳐진 정확도를 집단별로 갈라 재고, 그 차이를 %p로 나타낼 수 있다.
  • 표집을 고쳤을 때 전체 정확도가 어떻게 되는지 직접 재고, 처방마다의 대가를 근거를 들어 말할 수 있다.
🤔

여는 장면 — 보고서의 첫 줄은 늘 숫자 하나다

동아리에서 강아지 품종 인식기를 만들었습니다. 사진 한 장을 넣으면 푸들·비글·시바견·진돗개·리트리버 중 하나를 답합니다. 학습에 쓴 사진은 400장, 성능을 잰 시험지는 1,000장이었습니다. 보고서 첫 줄에 이렇게 적었습니다.

📄 보고서 1쪽

강아지 품종 인식기 — 시험지 1,000장 기준 정확도 85.0%

발표는 잘 끝났습니다. 그런데 다음 날 한 학생이 찾아왔습니다. 집에서 키우는 검은 진돗개를 열 번 찍어 넣어 봤는데 여덟 번이 틀렸다는 것입니다. "우리 개만 이상한 건가요?"

이상한 건 그 개가 아니었습니다. 시험지 1,000장을 사진의 밝기로 둘로 갈라 다시 재 보니 이렇게 나왔습니다.

무엇을 쟀나정확도이 숫자의 뜻
시험지 1,000장 전체85.0%보고서에 적힌 그 숫자
밝은 털 강아지 사진 500장92.2%거의 다 맞힌다
어두운 털 강아지 사진 500장20.0%다섯 번에 한 번 맞힌다
같은 프로그램, 같은 시험지입니다. 나눗셈을 두 번 더 했을 뿐인데 숫자가 셋이 되었습니다.

다섯 품종 중에서 아무거나 찍어도 20%는 맞습니다. 어두운 털 사진에서 이 인식기는 찍는 것과 다를 게 없었습니다. 그런데 보고서에는 85.0%라고 적혀 있었고, 그 숫자는 거짓이 아니었습니다.

🎯 오늘 답할 물음
  • 85.0%와 20.0%가 동시에 참일 수 있는 까닭은 무엇인가?
  • 이 치우침은 어디서 들어왔는가 — 알고리즘인가, 데이터인가?
  • 어두운 털 사진을 더 모으면 해결되는가? 그 대가는 무엇인가?
1

편향은 알고리즘이 아니라 데이터의 세 곳에서 들어온다

인식기를 만든 사람 중 누구도 "어두운 털 강아지를 틀리게 만들자"고 하지 않았습니다. 코드에는 털 색을 보는 줄이 한 줄도 없습니다. 그런데 결과는 저렇습니다. 편향(bias)은 대개 알고리즘이 아니라 데이터를 만드는 과정에서 들어옵니다. 들어오는 문이 셋입니다.

문 ①

표집 편향

누구를 모았는가. 세상에 있는 것과 다른 비율로 데이터를 모으면, 모델은 덜 모은 쪽을 덜 배웁니다.

우리 사진 400장은 밝은 털 360장, 어두운 털 40장이었습니다. 누가 고른 게 아니라 인터넷에서 그냥 모았더니 그 비율이 되었습니다.

문 ②

이름표 편향

누가 어떤 기준으로 정답을 달았는가. 같은 자료에 사람마다 다른 이름표를 답니다. 그 사람의 기준이 그대로 모델의 기준이 됩니다.

'악성 댓글'을 판정해 이름표를 다는 일을 세 사람이 나눠 했다고 합시다. 한 사람이 유난히 관대했다면, 그 사람이 맡은 몫만큼 모델도 관대해집니다.

문 ③

역사적 편향

과거의 차별이 이미 데이터 안에 '사실'로 들어 있다. 데이터를 정확하게 모을수록 그 차별도 정확하게 옮겨집니다.

지난 10년 합격자 명단으로 채용 AI를 학습시키면, 그동안의 치우침이 '합격의 조건'으로 학습됩니다. 데이터가 틀린 게 아니라서 더 어렵습니다.

셋을 갈라 두는 이유는 처방이 다르기 때문입니다. 표집 편향은 덜 모은 쪽을 더 모으면 줄어들 여지가 있습니다. 이름표 편향은 기준을 문서로 못 박고 여러 사람이 같은 자료를 겹쳐 다는 방법으로 줄입니다. 그런데 역사적 편향은 데이터를 더 모아도 사라지지 않습니다. 더 모을수록 과거가 더 또렷하게 재현될 뿐입니다. "데이터를 많이 모으면 공정해진다"는 말이 통하지 않는 자리가 바로 여기입니다.

⚠️ 자주 하는 오해

"편향은 나쁜 사람이 넣는 것이다." 대개는 아닙니다. 오늘 우리가 다룰 400장은 아무도 손대지 않고 있는 그대로 모은 사진입니다. 편향은 악의가 아니라 무관심으로 들어옵니다 — "누가 빠졌는지"를 아무도 묻지 않으면 그대로 들어옵니다.

실제로 있었던 일 셋

① 채용 서류를 걸러 주는 AI (2018년 보도). 한 회사가 지난 10년치 이력서와 채용 결과로 서류 심사 모델을 학습시켰습니다. 그 기간 채용된 사람이 한쪽 성별로 치우쳐 있었기 때문에, 모델은 '여성' 관련 표현이 들어간 이력서에 낮은 점수를 주는 쪽으로 학습되었습니다. 회사는 결국 그 도구를 실제 채용에 쓰지 않기로 했습니다. 알고리즘은 시킨 일을 정확히 했습니다. 시킨 일이 "과거를 닮아라"였을 뿐입니다. 이것이 역사적 편향입니다.

② 얼굴을 분석하는 상용 프로그램 (2018년 연구). 여러 회사의 얼굴 분석 기능을 피부색과 성별로 갈라 재 보니, 밝은 피부의 남성 얼굴에서는 세 제품 모두 오류율이 1% 아래였는데 어두운 피부의 여성 얼굴에서는 다섯에 하나에서 많게는 셋에 하나 넘게 틀렸습니다. 회사들이 내세운 전체 정확도는 90% 안팎이었습니다. 갈라 재기 전까지 아무도 이 사실을 몰랐습니다. 학습에 쓴 얼굴 사진이 어느 쪽으로 치우쳐 있었는지가 원인으로 지목되었습니다 — 표집 편향입니다.

토론회 탁자에 앉은 네 사람 중 오른쪽 세 사람의 얼굴에만 초록색 검출 상자가 그려져 있고, 맨 왼쪽에서 고개를 숙인 사람에게는 상자가 없는 사진
얼굴 검출 알고리즘이 토론회 사진에 상자를 친 결과입니다. 네 사람 중 세 사람의 얼굴에는 상자가 있는데, 맨 왼쪽에서 고개를 숙인 사람에게는 상자가 없습니다. '네 명 중 세 명을 찾았다'는 숫자만 보면 이 한 사람은 보이지 않습니다. 오늘 배울 물음이 바로 그것입니다 — 찾지 못한 얼굴은 누구의 얼굴이었나. 출처: Beatrice Murch (원본) / Sylenius (2차 저작), Wikimedia Commons (CC BY 3.0)

③ 재범 위험을 점수로 매기는 프로그램 (2016년 보도). 미국의 여러 법원이 쓰던 이 도구를 언론이 집단별로 갈라 재 봤더니, 실제로는 다시 죄를 짓지 않은 사람을 '위험함'으로 잘못 표시한 비율이 집단에 따라 약 두 배 차이가 났습니다. 만든 회사는 "우리 도구는 집단마다 같은 점수면 같은 재범률을 보이므로 공정하다"고 반박했습니다. 양쪽 다 자기 숫자를 정확히 계산했습니다. 서로 다른 '공정'을 말하고 있었을 뿐입니다. 이 논쟁이 어디까지 갔는지는 Ⅲ단원 7차시(편향과 공정성)에서 다룹니다. 오늘은 그 앞 단계 — 데이터 단계에서 무엇이 들어왔고, 어떻게 발견하는가까지만 갑니다.

참가자 명찰을 목에 건 어른들이 야외 담장 앞에 모여 찍은 셀카 단체 사진
행사 참가자 명찰을 목에 건 사람들이 야외에서 찍은 단체 사진입니다. 얼굴이 이만큼 많으면 "다양한 사람을 담았다"고 말하고 싶어집니다. 그런데 세어 보면 어린이나 십 대는 한 명도 없습니다. 이 사진 한 장이 세상의 비율을 담고 있는지는 얼굴이 많다는 것만으로 알 수 없습니다 — 어떤 나이대가, 어떤 지역이 빠졌는지 세어 보기 전까지는요. 출처: Nattes à chat, Wikimedia Commons (CC BY-SA 4.0)
2

전체 정확도 하나가 소수 집단의 실패를 완벽하게 가린다

인식기가 사진에서 재는 값은 딱 하나입니다 — 귀 끝 각도 점수(0~100). 품종마다 이 점수가 다르게 나오도록 만들어 두었습니다. 아래가 우리가 모은 400장을 품종별로 평균 낸 표입니다.

품종진짜 점수밝은 사진 평균
(360장)
어두운 사진 평균
(40장)
푸들1515.143.7
비글3333.246.3
시바견5150.850.7
진돗개6968.354.9
리트리버8786.358.8
밝은 사진에서는 평균이 진짜 점수와 거의 같습니다(15 → 15.1, 87 → 86.3). 어두운 사진에서는 다섯 품종이 모두 51점 언저리로 뭉쳤습니다(43.7 ~ 58.8). 같은 강아지인데 사진이 어두웠을 뿐입니다. 그런데 숫자가 달라졌습니다.

왜 뭉칠까요? 어두운 털은 배경과의 윤곽이 흐려서 귀 끝이 어디까지인지 재기 어렵습니다. 재기 어려우면 값은 가운데로 몰립니다. 이건 알고리즘의 잘못이 아니라 측정 자체가 두 집단에서 다르게 이루어진다는 사실입니다. 2차시에서 급식 잔반을 "무엇으로 맞힐까" 하며 잴 것을 골랐던 일을 떠올려 보세요. 같은 자를 댔는데 한쪽에서만 눈금이 안 보이는 상황입니다.

밝은 털 사진 360장 — 다섯 품종이 서로 떨어져 있다 푸들 15.1 비글 33.2 시바견 50.8 진돗개 68.3 리트리버 86.3 어두운 털 사진 40장 — 다섯이 51점 언저리로 겹쳐 버린다 43.7 · 46.3 · 50.7 · 54.9 · 58.8 이 폭 안에 다섯 품종이 전부 02550 75100 귀 끝 각도 점수
보라색 점선 넷은 인식기가 품종을 가르는 경계값입니다(26.2 · 42.6 · 58.9 · 75.2). 이 경계는 밝은 사진 360장이 정했습니다. 어두운 털 사진 다섯 품종의 평균은 43.7부터 58.8까지인데, 이 다섯이 42.6 ~ 58.9 한 칸 안에 몽땅 들어가 버립니다. 그 칸의 이름이 '시바견'입니다 — 그래서 어두운 사진은 무엇을 넣어도 대개 시바견이라고 답합니다.

모델이 배운 것 — 대표 점수 다섯과 경계값 넷

이 인식기의 학습은 아주 단순합니다. 품종마다 사진들의 점수를 평균 내어 '대표 점수'로 삼습니다. 새 사진이 오면 다섯 대표 점수 중 가장 가까운 것을 답합니다. 400장 전체로 학습한 결과가 이것입니다.

품종푸들비글시바견진돗개리트리버
대표 점수18.034.550.866.983.6
이웃한 두 대표 점수의 한가운데가 경계값입니다 — 26.2 · 42.6 · 58.9 · 75.2. 이 넷은 잠시 뒤 손으로 채점할 때 씁니다. 공책에 옮겨 적어 두세요.
표의 대표 점수는 소수 첫째 자리로 반올림한 값입니다(참값은 17.9763 · 34.4788 · …). 그래서 표의 값으로 한가운데를 직접 구하면 (18.0+34.5)÷2 = 26.25가 나와 26.2와 0.05만큼 어긋납니다. 오늘 채점할 스무 장에서는 판정이 달라지지 않습니다 — 반올림한 대표 점수로 재든 위 경계값으로 자르든 스무 장 모두 같은 답이 나옵니다(확인했습니다).
💡 대표 점수가 진짜 점수와 조금씩 다른 까닭

푸들의 진짜 점수는 15인데 대표 점수는 18.0입니다. 어두운 사진 40장의 푸들 점수(평균 43.7)가 같은 통에 섞여 평균을 끌어올렸기 때문입니다. 소수 집단은 결과를 못 바꿀 만큼 적지만, 아주 안 보이지도 않습니다. 40장은 다섯 대표 점수를 조금씩 가운데로 밀어 놓았습니다.

85.0%는 어떻게 나온 숫자인가

여는 장면의 85.0%가 "시험지 1,000장 중 850장을 맞혔다"는 뜻일까요? 아닙니다. 시험지는 밝은 털 500장 · 어두운 털 500장으로 일부러 반반 만들었습니다. 두 집단을 각각 넉넉히 재려면 그래야 하니까요. 그런데 우리가 알고 싶은 것은 "이 인식기를 세상에 내놓으면 몇 %를 맞히나"입니다. 세상에 굴러다니는 강아지 사진은 밝은 털이 90%, 어두운 털이 10%입니다. 그래서 두 정확도를 그 비율로 저울질합니다.

집단별로 잰 값 세상의 구성으로 저울질 보고서에 적히는 숫자 밝은 털 사진 92.2% 시험지 500장 어두운 털 사진 20.0% 시험지 500장 92.2 × 0.9 = 82.98 20.0 × 0.1 = 2.00 82.98 + 2.00 = 84.98 전체 정확도 85.0% 어두운 털 사진의 실패는 전체에 10분의 1만큼만 반영된다 — 20.0%가 들고 온 몫은 2.00점뿐이다. 92.2%와 20.0%의 차이가 72.2%p인데, 전체 숫자는 85.0%로 조용하다.
전체 = 밝은 × 0.9 + 어두운 × 0.1. 이 식을 못 박아 두지 않으면, 잠시 뒤 나올 다른 숫자와 어느 것이 맞는지 영영 알 수 없습니다.

같은 모델인데 숫자가 달라진다 — 전체 정확도는 시험지의 성질이다

여기서 조심할 것이 하나 있습니다. 만약 시험지 500장씩을 그냥 세었다면, 즉 두 집단을 반반으로 저울질했다면 전체 정확도는 56.1%가 됩니다(92.2 × 0.5 + 20.0 × 0.5). 85.0%와 56.1% — 둘 다 맞습니다. 틀린 계산이 하나도 없습니다. 다만 서로 다른 질문에 답하고 있습니다.

  • 85.0% — "세상이 밝은 털 90 : 어두운 털 10일 때, 이 인식기는 몇 %를 맞히나?"
  • 56.1% — "두 집단이 반반인 곳에서 쓴다면 몇 %를 맞히나?"

그렇다면 세상의 구성을 여러 값으로 바꿔 가며 같은 모델을 다시 재 보면 어떻게 될까요? 모델은 한 글자도 고치지 않았습니다. 대표 점수 다섯 개도 그대로입니다.

세상의 구성 (밝은 : 어두운)밝은 털어두운 털전체 정확도
90 : 10 (기본값)92.2%20.0%85.0%
75 : 2592.2%20.0%74.2%
50 : 5092.2%20.0%56.1%
25 : 7592.2%20.0%38.0%
10 : 9092.2%20.0%27.2%
가운데 두 열은 한 줄도 움직이지 않았습니다. 모델이 그대로니까요. 그런데 맨 오른쪽 열은 85.0%에서 27.2%까지 내려갑니다.
⚠️ 오늘 가장 중요한 한 문장

전체 정확도는 모델의 성질이 아니라 시험지의 성질입니다. 누구를 시험지에 넣었느냐에 따라 같은 모델이 85%가 되기도 하고 27%가 되기도 합니다. 그러니 "정확도 85%"라는 문장만 들고는 아무것도 알 수 없습니다. 반드시 물어야 합니다 — "누구를 대상으로 잰 숫자입니까?"

3

갈라 재기 — 나눗셈 두 번이면 보인다

편향을 찾는 방법 중에 가장 싸고 가장 먼저 해야 하는 것이 하나 있습니다. 시험지를 집단별로 갈라서 따로 재는 것입니다. 이것을 분할 평가라고 부릅니다. 어려운 수학이 필요하지 않습니다. 우리가 방금 한 일이 전부입니다.

  1. 집단을 정한다. 사진의 밝기 · 성별 · 나이대 · 지역 · 기기 종류처럼 결과가 달라질 만한 축을 고릅니다.
  2. 시험지를 그 축으로 나눈다. 밝은 털 500장, 어두운 털 500장.
  3. 각각 정확도를 낸다. 나눗셈 두 번입니다 — 461÷500, 100÷500.
  4. 격차를 적는다. 92.2 − 20.0 = 72.2%p.
💡 %와 %p는 다른 말입니다

92.2%와 20.0%의 차이는 72.2%p(퍼센트포인트)입니다. "72.2% 차이"가 아닙니다. 퍼센트끼리의 뺄셈은 %p로 적습니다. 보고서에서 이 둘을 섞어 쓰면 읽는 사람이 크기를 완전히 잘못 잡습니다.

비용이 이렇게 싼데도 잘 하지 않는 이유가 있습니다. 전체 정확도 하나만 적으면 보고서가 더 좋아 보이기 때문입니다. 85.0%는 성공처럼 읽히고, 92.2 / 20.0은 실패처럼 읽힙니다. 그런데 두 줄 다 같은 프로그램의 이야기입니다.

무엇으로 나눌 것인가 — 이미 여기서 결정이 시작된다

분할 평가에는 함정이 하나 있습니다. 나누지 않은 축은 영영 보이지 않는다는 것입니다. 우리는 사진의 밝기로 나눴기 때문에 밝기에 따른 격차를 찾았습니다. 만약 강아지의 크기로 나눴다면 다른 격차가 보였을 수도, 아무것도 안 보였을 수도 있습니다.

그래서 축을 고르는 일은 기술이 아니라 판단입니다. "이 인식기를 누가 쓸 것인가", "누가 잘못 판정되면 실제로 손해를 보는가"를 먼저 생각하고 그 사람들이 갈리는 축으로 나눠야 합니다. 얼굴 분석 프로그램의 사례에서 연구자들이 피부색과 성별로 갈라 재기 전까지 아무도 그 격차를 몰랐던 것이 바로 이 이야기입니다.

ℹ️ 우리 반에서 당장 해 볼 수 있는 분할 평가

지난 시간 만든 급식 잔반 예측을 이렇게 갈라 보세요.

  • 요일로 — 금요일만 유난히 크게 틀리지 않는가
  • 메뉴 종류로 — 국물 메뉴에서만 빗나가지 않는가
  • 시험 기간 여부로 — 평소에는 맞는데 시험 기간만 틀리지 않는가

전체 평균 오차 하나로는 이 중 어느 것도 보이지 않습니다. 갈라 재기는 강아지 사진에만 쓰는 도구가 아닙니다.

💻

손으로 ① — 경계값 넷으로 스무 장을 직접 채점한다

지금부터는 여러분이 인식기가 됩니다. 규칙은 딱 하나입니다.

📏 판정 규칙 (이것만 쓰면 됩니다)

사진에서 잰 점수와 가장 가까운 대표 점수의 품종을 답한다.

품종푸들비글시바견진돗개리트리버
대표 점수18.034.550.866.983.6
빠르게 하려면 경계값을 쓰세요 — 26.2 아래는 푸들, 26.2~42.6은 비글, 42.6~58.9는 시바견, 58.9~75.2는 진돗개, 75.2 위는 리트리버. 경계값에 딱 걸리는 점수(예: 42.6)는 두 대표 점수까지의 거리를 직접 재어 가까운 쪽으로 정합니다.

아래는 시험지에서 뽑은 스무 장입니다. 앞 열 장은 밝은 털, 뒤 열 장은 어두운 털입니다. '정답 품종' 열은 사람이 확인한 진짜 품종이고, '잰 점수'는 인식기가 사진에서 뽑은 값입니다. 각 줄에서 인식기가 무엇이라고 답할지를 골라 보세요. 다 고른 뒤 채점을 누르면 실제 답과 맞춰 봅니다.

✍️ 활동 1 — 스무 장 채점하기 (약 7분)
번호사진정답 품종잰 점수인식기의 답 (내가 계산)채점
1밝은 털푸들16.5
2밝은 털비글41.9
3밝은 털시바견53.7
4밝은 털진돗개66.6
5밝은 털리트리버83.0
6밝은 털푸들17.1
7밝은 털비글35.1
8밝은 털시바견53.6
9밝은 털진돗개60.1
10밝은 털리트리버79.7
11어두운 털푸들44.2
12어두운 털비글46.2
13어두운 털시바견51.4
14어두운 털진돗개53.9
15어두운 털리트리버60.3
16어두운 털푸들42.6
17어두운 털비글49.2
18어두운 털시바견49.6
19어두운 털진돗개56.9
20어두운 털리트리버60.1
스무 칸을 모두 고른 뒤 채점하기를 누르세요. 채점 칸에는 인식기가 실제로 고른 답과, 그 답이 정답이었는지가 함께 나옵니다.
⚠️ 채점 전에 예측해 보세요

밝은 털 열 장 중 몇 장을 인식기가 맞힐 것 같습니까? 어두운 털 열 장은요? 공책에 두 숫자를 먼저 적고 채점을 누르세요. 예측이 빗나간 쪽이 오늘 배울 것이 있는 쪽입니다.

11번(어두운 털 푸들, 44.2점) — 진짜 푸들의 점수는 15 언저리인데 어두운 사진이라 44.2로 재어졌습니다. 44.2는 42.6과 58.9 사이, 즉 시바견 칸입니다. 점수를 재는 단계에서 이미 답이 정해졌습니다. 판정 규칙은 아무 잘못이 없습니다.

16번(어두운 털 푸들, 42.6점) — 경계값 42.6에 딱 걸린 줄입니다. 비글의 대표 점수 34.5까지는 8.1, 시바견의 50.8까지는 8.2이므로 비글이 됩니다. 한 끗 차이로 갈렸지만 어차피 정답(푸들)은 아닙니다.

13번과 18번 — 어두운 털 열 장 중 맞은 두 장입니다. 둘 다 시바견이지요. 어두운 사진의 점수가 51점 언저리로 뭉치는데 시바견의 대표 점수가 50.8이니, 어두운 사진에서는 무엇을 넣어도 대개 시바견이라고 답합니다. 그래서 다섯 품종 중 시바견만 살아남아 정확히 20%가 나옵니다. 이 20%는 우연이 아니라 구조에서 나온 값입니다.

💻

손으로 ② — 표집 저울, 비율을 고치면 무엇이 따라 움직이나

이제 문제를 고쳐 볼 차례입니다. 가장 먼저 떠오르는 처방은 이것이지요 — "어두운 털 사진을 더 모으면 되잖아요." 아래 저울에서 직접 해 보겠습니다. 다만 조건이 하나 있습니다. 학습 사진은 400장 그대로입니다. 어두운 사진을 늘리면 밝은 사진이 그만큼 줄어듭니다. 실제 프로젝트에서도 시간과 예산이 정해져 있으니까요.

⚖️ 표집 저울 — 400장을 어떻게 나눠 모을 것인가 INTERACTIVE

슬라이더 셋을 밀 때마다 학습 사진 400장을 다시 모아 다시 학습하고, 시험지 1,000장으로 그 자리에서 다시 잽니다. 미리 적어 둔 표를 여는 것이 아니라, 여러분이 만든 배분으로 매번 새로 계산합니다. ① 어두운 사진 비율 — 400장 중 몇 %를 어두운 사진으로 모을지. ② 가중치 — 어두운 사진 한 장을 몇 장인 셈 치고 셀지. ③ 세상의 구성 — 전체 정확도를 잴 때 두 집단을 어떤 비율로 저울질할지.

밝은 털 사진 어두운 털 사진 전체 정확도 목표선 (전체 90%)
10% (40장) ×1
90 : 10
밝은 털92.2%
어두운 털20.0%
집단 간 격차72.2%p
전체 정확도85.0%
[대표 점수]
✍️ 활동 2 — 네 가지 배분을 넣고 표를 채우세요 (약 8분)

③ 세상의 구성은 90 : 10에 그대로 두고 ①과 ②만 움직입니다. 네 줄을 다 채운 뒤 맨 아래 물음에 답하세요.

배분① 비율② 가중치밝은 털어두운 털격차(%p)전체
그대로 두면10%×1
어두운 사진을 하나도 안 모으면0%×1
반반까지 모으면50%×1
가중치를 끝까지 올리면10%×40
내가 찾은 가장 좋은 배분

과제 — 문턱 찾기. ①과 ②를 어떻게 움직여도 좋습니다. 전체 90% 이상이면서 동시에 격차 10%p 이내인 배분을 찾아보세요. 찾았다면 마지막 줄에 적고, 찾지 못했다면 가장 가까이 간 배분 둘과 왜 못 찾는지를 적으세요. 못 찾는 것도 정답입니다 — 잠시 뒤 파이썬으로 1,040가지를 전부 확인해 보겠습니다.

💡 ③ 세상의 구성 슬라이더는 이 실험을 위한 것입니다

①과 ②를 손도 대지 않은 채 ③만 90 : 10에서 10 : 90까지 밀어 보세요. 밝은 털과 어두운 털 칸은 한 번도 안 움직입니다. 모델을 안 바꿨으니까요. 그런데 전체 정확도만 85.0%에서 27.2%까지 내려갑니다. 보고서의 그 숫자 하나가 무엇에 달려 있는지를 이 실험이 보여 줍니다.

💻

손으로 ③ — 1,040가지 배분을 전부 돌려 본다

저울을 손으로 미는 것만으로는 "정말 하나도 없나"를 확신할 수 없습니다. 슬라이더로 다 눌러 보려면 (비율 26가지 × 가중치 40가지) = 1,040가지를 손으로 밀어야 합니다. 이런 일이 컴퓨터가 할 일이지요. 아래 프로그램이 그 전부를 돌립니다.

프로그램은 저울과 똑같은 계산을 합니다. 같은 사진, 같은 학습 방법, 같은 판정 규칙입니다. 그러니 저울에서 본 숫자와 파이썬이 찍는 숫자가 소수점 첫째 자리까지 같아야 합니다. 다르면 둘 중 하나가 틀린 것입니다 — 반드시 맞춰 보세요.

⚠️ 빈칸은 네 곳입니다

채우지 않고 실행하면 SyntaxError가 납니다 — 정상입니다.

  • 빈칸 ① learn() — 대표 점수는 (점수의 합) ÷ (장수). v[0]이 합, v[1]이 장수입니다.
  • 빈칸 ② guess() — 잴 값은 대표 점수와 이 사진 점수의 차이의 절댓값입니다. 절댓값을 빼먹으면 늘 가장 작은 품종만 답합니다.
  • 빈칸 ③ 전체 정확도 — 두 집단 정확도를 P_A, P_B로 저울질해 더합니다.
  • 빈칸 ④ 격차 — 두 집단 정확도의 차이입니다.
💡 빈칸 ③을 두 가지로 다 계산해 보세요

accA * P_A + accB * P_B로 쓰면 85.0%, (accA + accB) / 2로 쓰면 56.1%가 나옵니다. 뒤엣것은 틀린 계산이 아닙니다. "두 집단이 반반인 세상"을 가정한 답일 뿐입니다. 한 번씩 바꿔 실행해 보고, 두 숫자가 어떤 가정 하나만큼 다른지 말로 적어 보세요.

다 돌리면 이런 줄이 찍힙니다

【7】의 결론만 먼저 적어 둡니다. 여러분이 저울에서 못 찾은 것이 여러분 탓이 아님을 확인하려는 것입니다.

ℹ️ 【7】 1,040가지를 전부 돌린 결과
  • '전체 90% 이상 + 격차 10%p 이내'를 만족하는 배분 — 0가지. 하나도 없습니다.
  • 전체가 가장 높았던 배분: 비율 0% · ×1 → 전체 86.8% (그런데 격차 74.2%p)
  • 격차가 가장 작았던 배분: 비율 10% · ×40 → 격차 0.2%p (그런데 전체 52.8%)
  • 격차 10%p 이내 중 전체가 가장 높았던 배분: 비율 36% · ×6 → 전체 54.1% (격차 9.2%p)

전체를 올리면 격차가 벌어지고, 격차를 줄이면 전체가 무너집니다. 데이터의 비율만 만지는 처방으로는 여기까지가 한계입니다.

🎯 프로그램을 부숴 보세요 (여유가 있으면)

코드 맨 위의 값을 하나씩 바꿔 다시 돌려 보세요. 무엇이 편향을 만드는지가 드러납니다.

  • SQUASH를 0.22에서 1.00까지 올린다 — "어두운 사진도 밝은 사진과 똑같이 찍힌다"는 뜻입니다. 그러면 어두운 털 정확도가 20.0% → 96.4%로 올라가고 편향이 사라집니다. 편향의 근원은 알고리즘이 아니라 데이터가 두 집단에서 다르게 생겼다는 사실입니다.
  • SPREAD를 4.6에서 2.0으로 줄인다 — 밝은 털이 100.0%가 되는데 어두운 털은 20.0% 그대로입니다. 다수 집단을 아무리 잘 맞혀도 소수 집단은 저절로 좋아지지 않습니다.
  • 【5】의 비율 목록 [0, 5, 10, 20, 30, 40, 50]에 90을 덧붙인다 — 어두운 사진 360장이 되고, 밝은 털 48.8% / 어두운 털 74.0%가 나옵니다. 고쳐진 것이 아니라 편향의 방향만 뒤집혔습니다. 이제 밝은 털이 절반도 못 맞힙니다.
4

처방에는 반드시 대가가 있다

이제 저울에서 본 것을 표로 정리합니다. 처방은 넷입니다. 공짜인 것은 하나도 없습니다. 무엇을 내줄지 고르는 일이 만드는 사람의 몫입니다.

처방 ① 덜 모은 쪽을 더 모은다

어두운 사진 비율밝은 털어두운 털격차전체
0% (0장)94.2%20.0%74.2%p86.8%
5% (20장)93.6%20.0%73.6%p86.2%
10% (40장) — 지금 상태92.2%20.0%72.2%p85.0%
20% (80장)88.8%20.0%68.8%p81.9%
30% (120장)82.6%20.4%62.2%p76.4%
40% (160장)75.6%22.8%52.8%p70.3%
50% (200장) — 반반68.4%26.4%42.0%p64.2%
학습 사진은 400장으로 고정입니다. 어두운 사진을 늘린 만큼 밝은 사진이 줄어듭니다.

표에서 두 가지를 반드시 읽어야 합니다.

첫째, 0장에서 40장까지 늘리는 동안 어두운 털 정확도는 20.0%에서 한 발짝도 움직이지 않았습니다. 40장은 아무 일도 하지 못했습니다. "데이터를 조금 더 모으자"는 흔한 처방이 소량으로는 정말 아무것도 안 한다는 것을 이 세 줄이 보여 줍니다. 어두운 털이 처음으로 20.0%를 넘는 것은 120장(30%)부터입니다 — 그것도 20.4%입니다.

둘째, 반반(200장)까지 모으면 어두운 털이 26.4%로 올라가는 대신 밝은 털이 94.2% → 68.4%로, 전체가 86.8% → 64.2%로 무너집니다. 비율 0%에서 50%까지 가는 동안 전체 정확도는 한 번도 오르지 않고 계속 내려갔습니다. 이것이 오늘의 반전입니다 — 표집을 고치면 전체 정확도가 내려갈 수 있습니다. 아니, 이 데이터에서는 예외 없이 내려갔습니다.

⚠️ 그러면 고치지 말아야 하나요?

그 질문 자체가 오늘의 요점입니다. "전체 정확도가 내려갔으니 나쁜 변경"이라고 판단하는 순간, 우리는 다시 숫자 하나만 보는 자리로 돌아갑니다. 내려간 것은 전체 정확도이고, 줄어든 것은 격차입니다. 어느 쪽을 얼마나 내줄 것인가는 계산이 정해 주지 않습니다. 이 인식기를 누가 쓰는지, 틀렸을 때 누가 손해를 보는지를 보고 사람이 정해야 합니다.

처방 ② 적은 집단을 여러 장인 셈 치고 센다 (가중치)

사진을 더 모을 수 없다면, 가지고 있는 40장을 여러 장인 셈 치고 셀 수도 있습니다. 대표 점수를 평균 낼 때 어두운 사진 한 장을 두 장, 세 장, 마흔 장으로 세는 것입니다. 사진은 한 장도 늘지 않습니다. 세는 방법만 바뀝니다.

가중치밝은 털어두운 털격차전체
×1 — 지금 상태92.2%20.0%72.2%p85.0%
×289.0%20.0%69.0%p82.1%
×384.6%20.2%64.4%p78.2%
×577.6%22.0%55.6%p72.0%
×967.6%27.0%40.6%p63.5%
×1857.6%35.8%21.8%p55.4%
×4052.8%53.0%-0.2%p52.8%
가중치 ×40에서 격차가 마침내 0에 닿습니다(-0.2%p). 그 줄의 나머지 숫자를 함께 보세요.

가중치를 40배까지 올리면 격차가 -0.2%p가 됩니다. 거의 완전히 공평해졌습니다. 그런데 그 줄의 두 집단 정확도는 52.8%와 53.0%입니다. 두 집단이 똑같이 못 맞히게 되었을 뿐입니다. 다섯 품종 중 하나를 찍으면 20%인데, 이건 그보다는 낫지만 원래 밝은 털에서 얻던 92.2%는 통째로 사라졌습니다.

⚠️ '공평해졌다'와 '좋아졌다'는 다른 말입니다

격차 하나만 보고 판단하면 모두를 똑같이 못 하게 만드는 것이 최고의 처방이 됩니다. 실제로 위 표의 마지막 줄이 격차 기준으로 1등입니다. 그래서 격차는 정확도와 반드시 함께 봐야 합니다. 한 줄에 네 숫자를 나란히 적는 이유입니다.

처방 ③ 그 용도로는 쓰지 않는다

가장 자주 잊히는 선택지입니다. 하지만 실제 현장에서는 가장 자주 옳은 답이기도 합니다. 어두운 털 사진에서 20%밖에 못 맞히는 인식기라면, "강아지 품종을 정확히 알아맞히는 서비스"로 내놓아서는 안 됩니다. 대신 "밝은 곳에서 찍은 사진에서만 참고용으로 알려 준다"고 쓸 범위를 좁혀 내놓거나, 그마저 어려우면 내놓지 않는 것이 답입니다. 앞의 채용 AI 사례에서 회사가 마지막에 고른 것도 이 처방이었습니다.

처방 ④ 두 집단을 같은 자로 재지 않는다

여기까지 우리는 데이터의 비율만 만졌습니다. 다른 길도 있습니다. 모델에게 "이 사진은 어둡다"고 알려 주고, 밝은 사진용 대표 점수와 어두운 사진용 대표 점수를 따로 배우게 하는 것입니다. 어두운 사진은 여전히 40장뿐입니다. 한 장도 더 모으지 않았습니다.

쓰는 대표 점수푸들비글시바견진돗개리트리버
밝은 사진용 (360장으로 학습)15.133.250.868.386.3
어두운 사진용 (40장으로 학습)43.746.350.754.958.8
어두운 사진용 대표 점수 다섯은 43.7 ~ 58.8로 서로 아주 가깝습니다. 가깝지만 순서는 그대로입니다 — 푸들이 가장 낮고 리트리버가 가장 높습니다. 자를 그 폭에 맞춰 다시 만들면 그 순서를 읽어 낼 수 있습니다.
방법밝은 털어두운 털격차전체
하나의 자로 잰다 (지금까지)92.2%20.0%72.2%p85.0%
집단마다 다른 자로 잰다94.2%89.0%5.2%p93.7%
같은 40장으로 어두운 털이 20.0% → 89.0%가 되었습니다. 밝은 털도 92.2% → 94.2%로 올랐습니다(섞여 있던 40장이 빠졌으니까요).

문제는 어두운 사진의 수가 아니었습니다. 두 집단을 같은 자로 잰 것이었습니다. 대표 점수 하나로 400장을 뭉뚱그리는 동안, 어두운 사진 40장 안에 있던 "푸들 43.7 < 비글 46.3 < 시바견 50.7 < 진돗개 54.9 < 리트리버 58.8"이라는 순서 정보가 통째로 버려지고 있었습니다.

⚠️ 처방 ④도 만능은 아닙니다

이 방법이 돌아가려면 사진이 밝은지 어두운지를 기계가 먼저 판정해야 합니다. 그 판정기도 데이터로 학습해야 하고, 그 데이터가 또 편향될 수 있습니다. 게다가 사람 집단에 이 방법을 그대로 쓰면 "집단마다 다른 기준을 적용해도 되는가"라는 전혀 다른 물음이 생깁니다. 그 물음은 Ⅲ단원 7차시의 몫입니다. 오늘은 여기서 멈춥니다.

📖

정리 — 오늘 손에 남은 것

물음오늘의 답근거가 된 숫자
85.0%와 20.0%가 동시에 참일 수 있나 그렇다. 전체는 세상의 구성으로 저울질한 평균이라 소수 집단의 실패가 10분의 1만큼만 반영된다 92.2×0.9 + 20.0×0.1 = 85.0
치우침은 어디서 왔나 알고리즘이 아니라 데이터. 400장을 세상 비율 그대로 모았고, 어두운 사진에서는 측정 자체가 다르게 이루어졌다 밝은 360 : 어두운 40
어두운 평균 43.7~58.8
어떻게 발견하나 집단으로 갈라 따로 잰다(분할 평가). 나눗셈 두 번이면 된다 격차 72.2%p
더 모으면 해결되나 40장으로는 아무 일도 안 일어난다. 반반까지 가야 조금 오르는데 그때 전체가 무너진다 20.0% → 20.0%
전체 86.8% → 64.2%
가중치를 주면 되나 격차는 0에 닿지만 두 집단이 똑같이 못 맞히게 된다 ×40 → 52.8 / 53.0
둘 다 만족시킬 수 있나 이 데이터에서는 없다. 데이터 비율만 만지는 처방의 한계다 1,040가지 중 0가지
그러면 무엇이 문제였나 사진의 수가 아니라 두 집단을 같은 자로 잰 것 같은 40장으로 20.0% → 89.0%
📖 오늘 얻은 습관 하나

앞으로 어디서든 "정확도 몇 %"라는 문장을 만나면 머릿속에서 이 두 물음이 자동으로 떠올라야 합니다.

① 누구를 대상으로 잰 숫자입니까?
② 집단으로 갈라 재면 어떻게 됩니까?

이 두 물음은 강아지 사진에만 쓰는 것이 아닙니다. 3단원에서 다룰 인공지능의 사회적 영향, 그리고 여러분이 앞으로 만들 모든 모델에 그대로 적용됩니다.

다음 시간에는 데이터를 손질합니다. 빠진 칸, 잘못 적힌 값, 유난히 튀는 값을 어떻게 다룰지 배웁니다. 그때 한 가지를 꼭 기억해 두세요 — "이상해 보이는 줄을 지운다"는 결정도 오늘 배운 표집 편향을 만들어 냅니다. 지워진 줄이 특정 집단에 몰려 있다면, 그 집단은 데이터에서 통째로 사라집니다.

✅

확인 문제

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. 표집 편향 · 이름표 편향 · 역사적 편향의 예를 하나씩 드시오. 그리고 셋 중 데이터를 더 모아도 해결되지 않는 것은 무엇이며, 그 까닭은 무엇인지 쓰시오.
📖 모범 답안

표집 편향 — 강아지 사진 400장을 밝은 털 360 : 어두운 털 40으로 모은 것. 점심시간에 운동장에서만 설문을 받아 실내에 있던 학생이 통째로 빠지는 것도 같은 종류다.

이름표 편향 — 악성 댓글 여부를 세 사람이 나눠 판정했는데 기준이 서로 달랐던 경우. 같은 댓글에 사람마다 다른 이름표가 붙는다.

역사적 편향 — 지난 10년 채용 결과로 서류 심사 모델을 학습시킨 경우.

데이터를 더 모아도 해결되지 않는 것은 역사적 편향이다. 앞의 둘은 "덜 모은 쪽을 더 모은다", "이름표 기준을 통일한다"로 줄일 여지가 있다. 그런데 역사적 편향은 데이터가 세상을 정확히 옮겼기 때문에 생긴다. 과거 자료를 더 모으면 과거의 치우침이 더 또렷해질 뿐이다. 데이터가 아니라 "무엇을 정답으로 볼 것인가"를 다시 정해야 줄어든다.

2. 전체 85.0%, 밝은 털 92.2%, 어두운 털 20.0%인 인식기가 있다. 이 인식기를 그대로 서비스로 내놓으면 안 되는 이유를 '누가 어떤 피해를 보는가'로 답하시오. "정확도가 낮아서"라고만 쓰면 안 된다.
📖 모범 답안

피해는 고르게 퍼지지 않고 한 집단에만 쌓인다. 어두운 털 강아지를 키우는 사람은 이 서비스를 쓸 때마다 다섯 번에 네 번 틀린 답을 받는다. 밝은 털 강아지를 키우는 사람은 거의 늘 맞는 답을 받는다. 같은 값을 내고(또는 같은 서비스를 쓰고) 받는 품질이 다르다.

더 나쁜 것은 피해자가 자기 탓으로 여기게 된다는 점이다. 여는 장면의 학생은 "우리 개만 이상한 건가요?"라고 물었다. 공개된 숫자가 85.0% 하나뿐이면, 계속 틀리는 사람은 자기가 사진을 잘못 찍는다고 생각하게 된다. 실패가 개인의 문제로 보이도록 만드는 것이 전체 정확도 한 줄의 부작용이다.

덧붙여, 이 인식기가 다섯 품종 중 하나를 찍는 것과 같은 20.0%라는 점도 근거가 된다. 어두운 털 사진에서는 이 프로그램이 아무 정보도 주지 않는다.

3. 오늘 손으로 채점한 스무 장의 결과를 적으시오. 밝은 털 10장 중 몇 장, 어두운 털 10장 중 몇 장, 전체 20장 중 몇 장이었는가? 그리고 11번(어두운 털 푸들, 44.2점)이 왜 '시바견'으로 판정되었는지 경계값을 근거로 설명하시오.
📖 모범 답안

밝은 털 10장 중 10장(100%), 어두운 털 10장 중 2장(20%), 전체 20장 중 12장(60%). 어두운 털에서 맞은 두 장은 13번과 18번이고 둘 다 시바견이다.

11번 — 진짜 푸들의 귀 끝 각도 점수는 15 언저리다. 그런데 사진이 어두워 윤곽이 흐려지면서 44.2점으로 재어졌다. 경계값은 26.2 · 42.6 · 58.9 · 75.2이므로 44.2는 42.6과 58.9 사이, 곧 시바견 칸이다. 대표 점수로 확인해도 같다 — 시바견 50.8까지 6.6, 비글 34.5까지 9.7이므로 시바견이 더 가깝다.

판정 규칙은 아무 잘못이 없다는 점이 중요하다. 점수를 재는 단계에서 이미 답이 정해졌다. 그래서 분류 규칙을 아무리 고쳐도 이 실패는 사라지지 않는다.

4. 오늘 표집 저울에서 채운 기록표를 보고 답하시오. ① 어두운 사진을 10%에서 50%로 늘렸을 때 어두운 털 · 전체는 각각 어떻게 되었는가? ② '전체 90% 이상 + 격차 10%p 이내'인 배분을 찾았는가? 찾지 못했다면 가장 가까이 간 배분 둘을 적고, 왜 못 찾는지 한 문장으로 쓰시오.
📖 모범 답안

① 어두운 털은 20.0% → 26.4%로 6.4%p 올랐다. 그 대신 밝은 털이 92.2% → 68.4%로 내려가고 전체는 85.0% → 64.2%로 20.8%p 무너졌다. 얻은 것보다 내준 것이 훨씬 크다.

② 찾을 수 없다. 파이썬으로 (비율 26가지 × 가중치 40가지) = 1,040가지를 전부 돌려도 두 조건을 동시에 만족하는 배분은 하나도 없다. 가장 가까이 간 것 둘은 —

· 전체가 가장 높았던 배분: 비율 0% · ×1 → 전체 86.8% (그런데 격차 74.2%p)
· 격차 10%p 이내에서 전체가 가장 높았던 배분: 비율 36% · ×6 → 전체 54.1% (격차 9.2%p)

왜 못 찾는가 — 어두운 사진의 점수가 51점 언저리로 뭉쳐 있어서, 대표 점수를 어디로 옮겨도 다섯 품종을 갈라낼 폭이 나오지 않는다. 비율과 가중치는 대표 점수를 밝은 쪽과 어두운 쪽 사이 어디에 놓을지만 정할 뿐이라, 한쪽으로 옮기면 반드시 반대쪽이 나빠진다.

5. 앞의 채용 AI 사건에서 잘못은 알고리즘에 있었는가, 데이터에 있었는가? 근거를 들어 답하시오. 그리고 오늘 저울의 ③ 세상의 구성 슬라이더 실험을 근거로, "우리 모델은 정확도 92%입니다"라는 문장 하나만으로는 왜 아무것도 판단할 수 없는지 쓰시오.
📖 모범 답안

데이터 쪽이다. 알고리즘은 "지난 10년의 합격자를 닮은 이력서에 높은 점수를 주라"는 시킨 일을 정확히 수행했다. 코드에는 성별을 보라는 줄이 없었다. 치우침은 학습에 쓴 과거 채용 결과 안에 이미 들어 있었다. 역사적 편향이다.

다만 "그러니 만든 사람에게는 책임이 없다"는 뜻은 아니다. 과거 자료를 그대로 정답으로 삼기로 결정한 것은 사람이고, 내놓기 전에 집단별로 갈라 재지 않은 것도 사람이다. 알고리즘에 잘못이 없다는 말과 아무에게도 잘못이 없다는 말은 다르다.

③ 슬라이더 실험 — 모델을 한 글자도 바꾸지 않은 채 세상의 구성만 90:10에서 10:90으로 밀면 전체 정확도가 85.0% → 74.2% → 56.1% → 38.0% → 27.2%로 움직인다. 즉 전체 정확도는 모델의 성질이 아니라 시험지의 성질이다. "정확도 92%"라는 문장은 어떤 시험지로 쟀는지를 말하지 않으므로 그 자체로는 정보가 아니다. 반드시 되물어야 한다 — 누구를 대상으로 쟀고, 집단으로 갈라 재면 어떻게 되는가.

6. 우리 학교에서 만들어 볼 만한 인공지능을 하나 정하시오 (예: 급식 잔반 예측, 분실물 사진 분류, 동아리 추천). 그 데이터에 들어올 수 있는 편향 두 가지를 세 갈래 중에서 골라 적고, 각각을 어떻게 점검할 것인지 — 어떤 축으로 갈라 재고 무엇을 비교할지 — 함께 쓰시오.
📖 모범 답안

주제 — 분실물 사진을 종류별로 분류하는 AI

편향 ① 표집 편향 — 사진을 교무실에서 형광등 아래 낮에만 찍어 모았다면, 복도나 운동장에서 어두울 때 찍은 사진이 들어왔을 때 성능이 떨어진다. 오늘 강아지 사진과 같은 구조다.
점검 — 시험지를 촬영 장소(실내/실외)와 시간(낮/저녁)으로 갈라 네 칸의 정확도를 따로 내고 격차를 %p로 적는다.

편향 ② 이름표 편향 — '전자기기'와 '학용품' 사이에 있는 물건(계산기, 전자사전)에 사람마다 다른 이름표를 달았을 수 있다.
점검 — 같은 사진 30장을 세 사람이 겹쳐서 이름표를 달아 보고 세 사람의 답이 갈린 사진이 몇 장인지 센다. 갈린 사진이 많은 종류부터 기준 문장을 다시 쓴다.

어떤 주제를 고르든 "누가 빠졌는가"와 "누가 정답을 정했는가" 두 물음이면 대부분의 편향이 걸린다.

🔁 되돌아보기

오늘 우리는 전체 정확도 85.0% 뒤에 숨어 있던 20.0%를 손으로 찾아냈고, 그것을 고치려는 처방마다 무엇을 내주어야 하는지를 숫자로 확인했습니다. 가장 크게 남길 문장은 이것입니다 — 문제는 어두운 사진의 수가 아니라, 두 집단을 같은 자로 잰 것이었다. 아직 개운하지 않은 것을 한 줄 적어 두세요 (예: "격차를 줄이려면 전체를 얼마나 내줘도 되는지 아직 모르겠다"). 다음 시간에는 데이터를 손질합니다 — 빠진 칸과 튀는 값을 다루면서, 그 손질이 또 하나의 표집 편향을 만들 수 있다는 것을 함께 봅니다.

🔎

더 알아보기

갈라 재기가 실제로 무엇을 찾아냈고, 합친 숫자가 어디까지 속일 수 있나

어두운 강당 무대에서 발표하는 조이 부올람위니. 왼쪽 화면에는 WIKIMANIA CAPE TOWN, 오른쪽 화면에는 AJL 가면 로고와 www.AJLUnited.org Thank You가 떠 있다
역사

시험지를 다시 만든 연구 — 젠더 셰이즈(Gender Shades)

본문 사례 ②의 연구를 한 사람은 MIT 미디어랩의 대학원생이던 조이 부올람위니(Joy Buolamwini)입니다. 얼굴을 따라가는 프로그램을 만들다가, 카메라가 자기 얼굴은 잘 잡지 못하는데 흰 가면을 쓰자 곧바로 잡는 것을 겪은 것이 시작이었다고 합니다.

그가 먼저 부딪힌 벽은 시험지였습니다. 당시 얼굴 인식 성능을 재던 공개 자료는 대부분 밝은 피부의 얼굴이어서, 그 자료로 재면 어두운 피부에서의 실패가 전체 숫자에 거의 드러나지 않았습니다 — 오늘 본 85.0%와 같은 구조예요. 그래서 팀닛 게브루(Timnit Gebru)와 함께 아프리카 세 나라와 북유럽 세 나라의 국회의원 얼굴 1,270장으로 피부색과 성별이 고르게 섞인 시험지를 새로 만들었습니다. 우리가 시험지를 밝은 털 500장 · 어두운 털 500장으로 일부러 반반 만든 것과 같은 이유입니다.

2018년에 발표된 결과가 본문의 그 숫자입니다. 밝은 피부 남성에서는 세 회사 제품 모두 오류율이 1% 아래였고, 어두운 피부 여성에서는 가장 나쁜 제품이 셋에 하나 넘게 틀렸습니다. 이듬해 같은 방법으로 다시 재어 보니 세 회사 모두 격차를 크게 줄인 새 버전을 내놓은 뒤였습니다. 갈라 재서 공개한 것만으로 제품이 바뀐 것입니다. 사진은 그가 세운 단체 알고리즘 정의 연맹(AJL)을 소개하던 2018년 위키매니아(남아프리카공화국 케이프타운) 발표 장면입니다.

사진: 위키매니아 2018에서 발표하는 조이 부올람위니 · 출처: Rainer Halama, Wikimedia Commons (CC BY-SA 4.0)

치료 A 치료 B 작은 결석 A가 높다 81/87명 93% 234/270명 87% 큰 결석 A가 높다 192/263명 73% 55/80명 69% 둘을 합치면 B가 높다 273/350명 78% 289/350명 83% A는 어려운 큰 결석 환자를 263명, B는 80명 맡았다. 어느 칸에 누가 몰렸는지가 합친 숫자를 뒤집는다.
원리 더 깊이

합친 숫자는 가리기만 하지 않는다 — 뒤집기도 한다

오늘 본 85.0%는 20.0%를 가렸습니다. 합친 숫자는 한 걸음 더 나아가 순위를 뒤집기도 합니다. 1986년 영국에서 신장 결석을 없애는 두 수술법을 비교한 연구가 유명한 예입니다. 그림처럼 결석이 작은 환자끼리 비교해도, 큰 환자끼리 비교해도 치료 A가 더 잘 들었습니다. 그런데 두 칸을 합치면 치료 B가 78% 대 83%로 앞섭니다.

계산은 하나도 틀리지 않았습니다. 비밀은 환자가 어느 칸에 몰렸는가입니다. 치료 A는 성공하기 어려운 큰 결석 환자를 263명이나 맡았고, 치료 B는 쉬운 작은 결석 환자를 270명 맡았습니다. 그래서 전체 성공률은 치료법의 실력보다 '누구를 맡았나'를 더 많이 반영합니다. 이렇게 칸마다 본 결론과 합쳐서 본 결론이 거꾸로 되는 현상을 심슨의 역설이라고 부릅니다.

오늘의 식 전체 = 밝은 × 0.9 + 어두운 × 0.1과 뿌리가 같습니다. 합친 숫자는 늘 칸마다의 숫자를 칸의 크기로 저울질한 평균이라, 칸의 크기가 바뀌면 결론도 바뀝니다. 두 모델이나 두 방법을 비교할 때 전체 숫자만 나란히 놓지 말고 같은 칸끼리 비교해야 하는 이유입니다.

손가락 끝에 끼운 파란색 집게형 맥박 산소 측정기. 화면에 산소포화도 96과 맥박 85가 표시되어 있다
현장

같은 자를 댔는데 한쪽에서만 눈금이 흐리다 — 맥박 산소 측정기

사진의 기계는 손가락에 끼우면 피 속 산소가 얼마나 차 있는지(산소포화도)를 알려 주는 맥박 산소 측정기입니다. 붉은빛과 적외선을 손가락에 비추고, 피가 그 빛을 얼마나 흡수하는지로 값을 계산합니다. 병원에서는 이 숫자를 보고 산소 치료를 할지 정하기도 합니다.

그런데 빛은 피만이 아니라 피부의 색소에도 흡수됩니다. 2020년 미국의 한 병원 연구진이 측정기 값과 혈액을 직접 뽑아 잰 값을 나란히 비교했더니, 측정기는 정상 범위라고 했지만 실제로는 산소가 위험하게 낮았던 경우가 흑인 환자에서 백인 환자보다 약 세 배 자주 나타났습니다. 측정기의 보정이 주로 밝은 피부의 사람들을 대상으로 이루어져 왔다는 점이 원인으로 지목되었습니다.

오늘 인식기에서 어두운 털 사진의 점수가 51점 언저리로 뭉친 것과 같은 측정의 편향입니다. 이런 편향은 데이터를 더 모아도 사라지지 않고, 재는 방법 자체를 집단별로 확인하고 고쳐야 줄어듭니다. 그래서 미국 식품의약국(FDA)은 안전 공지를 내고, 더 다양한 피부색의 사람으로 측정기를 시험하도록 기준을 다시 짜고 있습니다.

사진: 손가락에 끼운 맥박 산소 측정기 · 출처: Stefan Bellini, Wikimedia Commons (CC0)