단원 홈

Ⅳ. 데이터 과학 프로젝트1차시

500곳만 파 볼 수
있다면

데이터가 결정을 바꾼 자리, 되돌린 자리

땅속 어느 집 수도관이 납인지 아무도 모릅니다. 시 기록으로 납관일 가능성을 매겨 그 순서대로 팠더니 열에 일곱이 맞았습니다. 그런데 이듬해, 시는 그 순서를 내려놓았습니다. 잘 맞히던 분석이 되돌려지는 자리를 숫자로 끝까지 따라가 봅니다.

  • [12데과04-01]
  • 50분네 정거장
  • 오늘의 틀사례를 읽는 일곱 칸
  • 자료가상 도시 6,000채 · 플린트 실제 숫자 넷 · 사례 카드 다섯

학습 목표

  1. 개념에서

    사례를 읽는 일곱 칸(질문·데이터·비교·행동·검증·전달 + 수용)으로 한 사례를 끝까지 해부할 수 있다.

  2. 손으로

    자원을 나누는 규칙 넷과 최소 보장 m의 대가를 효율(찾은 납관)과 형평(그 구역 몫) 두 축으로 잴 수 있다.

  3. 확인에서

    잃는 것과 얻는 것을 숫자로 대고 주민에게 설명할 한 문장을 쓸 수 있다.

1
여는 장면 · 3분

잘 맞히던 방법을, 시는 왜 버렸나

2016년 미국 미시간주 플린트. 수돗물에 납이 녹아 나온 사태 뒤, 시는 땅속 수도관 가운데 납관을 찾아 바꿔야 했습니다. 문제는 어느 집 관이 납인지 기록이 부실했다는 것이었어요. 파 보기 전에는 아무도 모르는데, 파는 데는 돈과 시간이 듭니다.

대학 연구진이 시 기록(지은 해·구역 따위)으로 집집마다 납관일 가능성을 매겼습니다. 2017년 그 순서대로 살핀 8,833곳 가운데 6,228곳에서 실제로 납관을 찾아 바꿨습니다 — 약 70%. 그런데 2018년, 시는 그 순서를 내려놓았습니다. 그해 12월 중순까지 판 10,531곳 가운데 납관은 1,567곳, 약 15%였습니다.

숫자만 보면 손해가 분명합니다. 그렇다면 물음은 하나예요 — 시는 왜 잘 맞히던 방법을 버렸을까요? 그 결정은 틀렸나요?

플린트 두 해같은 도시, 다른 순서
판 곳 가운데 납관을 바꾼 비율2017년70.5%2018년14.9%2017년 8,833곳을 파서 6,228채2018년 10,531곳을 파서 1,567채

막대 길이는 비율에 비례한다(180 ÷ 70.5% = 38 ÷ 14.9%). 자료: The Atlantic(Alexis Madrigal, 2019-01) 요약

표 1플린트가 판 곳과 찾은 납관 — 두 해적중률 = 찾은 납관 ÷ 판 곳
해판 곳납관을 바꾼 집적중률판 순서를 정한 것
2017년8,8336,22870.5%대학 연구진이 매긴 위험 점수
2018년10,5311,56714.9%점수 순서를 내려놓았다

2018년에는 삽을 더 들었는데 찾은 납관은 4분의 1 아래로 떨어졌습니다. 이 표에는 '왜 내려놓았나'가 없습니다 — 표가 세는 칸이 적중률 하나뿐이기 때문입니다. 자료: The Atlantic(Alexis Madrigal, 2019-01) 「How a Feel-Good AI Story Went Wrong in Flint」 요약. 2018년 숫자는 그해 12월 중순 기준

먼저 예측

답을 보기 전에 한 문장으로 적어 보세요 — "시가 순서를 내려놓은 까닭은 ○○○ 때문이고, 그 결정은 (옳다 / 틀렸다) 고 생각한다." 오늘 3정거장에서 같은 일을 여러분이 직접 겪은 뒤, 정리 시간에 이 한 줄을 고쳐 씁니다.

체크포인트 1

두 해의 적중률(70.5% → 14.9%)을 읽었고, '왜 버렸나'에 대한 내 짐작을 한 문장으로 적어 두었다.

다음 정거장 · 개념 9분 →
2
개념 · 9분

사례를 '조사해서 분석한다'는 것 — 일곱 칸으로 읽는다

2-1여섯 칸으로는 플린트를 설명할 수 없다

남의 사례를 조사한다는 것은 이야기를 옮겨 적는 일이 아닙니다. 칸을 정해 놓고 그 칸을 채우는 일이에요. Ⅰ-1 에서 제멜바이스를 읽을 때 우리는 여섯 칸을 썼습니다. 그 여섯 칸으로 플린트 2017년을 채워 보면 — 여섯 칸이 모두 깨끗하게 찹니다. 그런데도 이듬해 그 방법은 버려졌어요. 그렇다면 칸이 하나 모자란 것입니다.

Ⅰ-1 에서 가져옴사례를 읽는 여섯 칸 — 질문 · 데이터 · 비교 · 행동 · 검증 · 전달. 제멜바이스의 손 씻기가 옳았는데도 30년 넘게 받아들여지지 않은 일을 그때 '제멜바이스 반사'라는 이름으로 잠깐 만났습니다. 오늘 그 자리가 정식 칸이 됩니다.

그림 1사례를 읽는 일곱 칸 — 그리고 플린트 2017년왼쪽: 칸의 뜻 · 오른쪽: 플린트를 채운 결과
칸마다 물어야 할 것1질문무엇을 정하려고 했나2데이터무엇을 가지고 있었나3비교무엇과 무엇을 견주었나4행동그래서 무엇을 바꾸었나5검증정말 나아졌는지 어떻게 쟀나6전달누구에게 어떻게 알렸나7수용누가 받아들이고, 누가 거부했나앞의 여섯은 Ⅰ-1 에서 쓴 칸 · 일곱째가 오늘 더하는 칸 플린트 2017년을 채워 보면질문어느 집부터 파야 하나데이터시 기록 — 지은 해 · 구역비교점수 높은 순서 대 그 밖의 순서행동점수 순서대로 8,833곳을 팠다검증적중률 70.5% — 6,228채를 바꿨다전달시와 연구진이 결과를 알렸다수용"이웃집은 파 주고 우리 집은 왜?"여섯 칸이 다 찼는데 일곱째에서 무너졌다 칸마다 물어야 할 것1질문무엇을 정하려고 했나2데이터무엇을 가지고 있었나3비교무엇과 무엇을 견주었나4행동그래서 무엇을 바꾸었나5검증나아졌는지 어떻게 쟀나6전달누구에게 어떻게 알렸나7수용누가 받아들이고 거부했나앞의 여섯은 Ⅰ-1 에서 쓴 칸 플린트 2017년을 채워 보면질문어느 집부터 파야 하나데이터시 기록 — 지은 해 · 구역비교점수순 대 그 밖의 순서행동점수 순서대로 팠다검증적중률 70.5%전달시와 연구진이 알렸다수용"우리 집은 왜 안 파나"여섯 칸이 다 찼는데 일곱째에서 무너졌다

수용은 '사람들이 좋아했나'를 묻는 칸이 아닙니다. 그 결정을 실제로 받는 사람이 그것을 받아들일 수 있었나를 묻는 칸이에요. 플린트에서 주민이 던진 물음은 "왜 우리 집은 안 파 주나"였고, 그 물음에 답할 숫자가 적중률 칸에는 없습니다. 도해: 일곱 칸의 이름과 물음은 이 차시가 세우는 틀이다. 플린트 쪽 값은 표 1 과 같은 출처

2-2삽 500자루 — 전부 파 볼 수는 없다

이제 숫자로 만져 보기 위해 가상 도시 하나를 세웁니다. 6개 구역에 집 6,000채가 있고, 그 가운데 2,030채의 수도관이 납입니다. 우리는 이 도시의 땅속을 다 알지만 시청도 주민도 모릅니다 — 알 수 있다면 애초에 분석이 필요 없겠지요.

삽 500자루란 올해 파 볼 수 있는 곳이 500군데뿐이라는 뜻입니다. 시청이 아는 것은 위험 점수 하나뿐이에요. 시 기록으로 매긴 '납관일 가능성'이고, 오래된 집일수록 높습니다. 표 2 를 보면 구역마다 오래된 집의 비율이 크게 다릅니다 — 가 구역은 열에 일곱이 1950년 이전 집인데 바 구역은 백에 셋뿐이에요.

그래서 점수가 높은 순서대로 500곳을 파면 삽이 어디로 몰릴지는 이미 정해져 있습니다.

표 2가상 도시 6구역 — 집 6,000채와 땅속 납관 2,030채'숨은 납관'은 우리만 안다
구역집1950년 이전숨은 납관100채당 납관
가1,30070%67551.9
나1,20057%54845.7
다1,00039%32532.5
라90024%22825.3
마90012%16918.8
바7003%8512.1

바 구역에도 납관이 85채 있습니다. 100채당으로 보면 12.1채 — 가 구역(51.9채)의 4분의 1쯤이지만 0 은 아닙니다. 점수순은 이 85채를 거의 보지 못합니다. 자료: 가상 도시 ../data/flint_city.csv(6,000행) — 3정거장 코드 ①의 [1]이 찍는 값과 같다. 100채당 납관은 숨은 납관 ÷ 집 × 100

2-3형평은 '판 곳 수'가 아니라 '그 구역 몫'으로 잰다

규칙을 바꾸면 무엇이 달라지는지 두 숫자를 나란히 놓고 봅니다. 여기서 몫이란 그 구역 납관 가운데 찾아 준 비율입니다 — 판 곳이 몇 군데인지가 아니라, 그 동네 사람이 실제로 받은 것이 얼마인지예요. 그리고 최소 보장 m은 구역마다 점수가 높은 m곳은 반드시 판다는 규칙이고, 남은 삽은 도시 전체 점수순으로 나갑니다.

전체로 찾은 납관 — 줄 세우는 잣대만 바꾸면
392점수순(곳)
vs
355구역균등·점수순(곳)
점수순392곳균등355곳

효율은 37곳을 잃는다 — 한 해 전체에서.

'바' 구역이 받은 몫 — 같은 두 계획
5%점수순
vs
35%구역균등·점수순
점수순5%균등35%

형평은 30%포인트가 오른다 — 같은 삽 500자루로.

'공평하게' 나눈 두 계획 — 구역 안을 어떻게 고르나
355구역마다 83곳 · 점수순
vs
158구역마다 83곳 · 무작위
점수순355곳무작위158곳

곳 수를 고르게 나눠도 구역 안에서 순위를 버리면 둘 다 잃는다.

두 해 합계 — 주민이 받아들였나
765받아들임(곳)
vs
525항의 → 강제(곳)
수용765곳항의525곳

받아들여지지 않은 규칙은 이듬해에 값을 치른다 — 240곳.

자료: 가상 도시 6,000채(seed 2016) — 위 여덟 숫자는 모두 3정거장 코드 ① · ②가 찍는 값이다. 막대 길이는 값에 비례한다(80 ÷ 큰 값 = 작은 막대 ÷ 작은 값).

2-4수용 — 받아들여지지 않은 규칙은 이듬해의 규칙을 바꾼다

여기까지는 한 해짜리 셈이었습니다. 그런데 결정은 한 해에서 끝나지 않아요. 점수순으로 팠더니 바 구역은 100채당 0.71곳을 받았습니다. 주민이 시청 앞에 팻말을 들면 시장은 어떻게 할까요? 이 수업에서는 규칙을 하나 정해 두고 시작합니다 — 한 구역이라도 항의하면 이듬해에는 구역마다 똑같이, 구역 안은 무작위로 판다. 게임의 가정이지만, 플린트에서 실제로 일어난 일과 모양이 같습니다.

그러면 장부가 이렇게 갈립니다. 받아들여졌다면 두 해에 765곳, 항의로 강제됐다면 525곳. 차이 240곳은 분석이 틀려서 잃은 것이 아니라 받아들여지지 않아서 잃은 것입니다.

규칙자원을 나누는 규칙을 보고할 때는 적중률 한 칸이 아니라 누가 얼마를 받았나(형평)와 누가 받아들였나(수용)를 함께 적는다.

두 해 장부같은 2017년, 다른 2018년
점수순으로 판 2017년 뒤에 갈리는 길2017년392곳받아들임 · 2018년 373곳두 해 합계 765곳항의 → 구역마다 83곳 무작위두 해 합계 525곳차이 240곳 — 받아들여지지 않은 규칙의 값

코드 ②의 [4]가 찍는 값(m = 0). 2018년 강제 판은 seed 2018 의 한 판이다.

체크포인트 2

일곱 칸을 말할 수 있고, 형평을 '그 구역 몫'으로 재야 하는 까닭과 최소 보장 m 의 뜻을 안다. 이제 직접 삽을 나눠 본다.

다음 정거장 · 손으로 30분 →
3
손으로 · 30분

여러분이 시 데이터팀장입니다 — 삽 500자루를 나눠 보세요

1

시장실 두 해 — 나누고, 편지를 받고, 이듬해를 치른다

8분

여는 장면에 적어 둔 내 한 줄입니다. 이제 여러분이 그 자리에 섭니다 — 2017년 삽 500자루를 나누기 전에, 올해 찾을 납관과 두 해 합계를 먼저 잠급니다.

말 풀이 — 말뚝은 "이 구역은 최소한 여기까지 판다"고 박아 두는 표시입니다. 하나가 그 구역 점수 상위 5집이고, 남은 삽은 도시 전체 점수순으로 나갑니다(= 개념 2-3 의 최소 보장 m, m = 말뚝 × 5). 게시판에는 주민이 볼 수 있는 숫자만 있습니다 — 판 곳과 100채당 판 곳뿐이고, 땅속 진실은 없어요. 편지는 100채당 판 곳이 반이 정한 문턱보다 적은 구역이 보내는 항의입니다. 땅속 보기는 파고 난 뒤에만 열리는, 우리(분석가)만 보는 눈입니다.

시뮬레이터

시장실 두 해

적중률이 가장 높은 계획이 이듬해에도 가장 많이 찾을까

  1. 1전략 카드를 고르거나 구역에 말뚝을 꽂아 계획을 짠다
  2. 2수 바퀴 둘과 '항의할 구역'으로 예측을 잠근다
  3. 3[파기] — 편지가 오면 2018년 규칙이 바뀐다
① 주민의 문턱 — 100채당 몇 곳 아래면 항의하나
② 계획 — 전략 카드
② 계획 — 보장 말뚝 (톡 할 때마다 하나씩, 9 다음은 0)
③ 예측 — 잠그면 삽이 나간다
④ 실행
2017년 · 계획을 짜는 중구역을 톡 하면 말뚝이 하나씩 선다

계획 — 말뚝 하나 = 그 구역 점수 상위 5집을 반드시 판다 · 남은 삽은 도시 전체 점수순 · 삽은 두 해 모두 500자루(구역균등은 83 × 6 = 498곳)

항의 — 100채당 판 곳이 반이 정한 문턱보다 적은 구역이 편지를 보낸다 · 한 구역이라도 항의하면 2018년은 구역마다 83곳 무작위로 강제된다(규칙 카드에 처음부터 적힌 게임의 가정) · 문턱은 1~5 — 시 평균이 100채당 8.3곳(500 ÷ 6,000 × 100)이라 그보다 높은 문턱은 어떤 계획으로도 못 맞춘다

몫 — 그 구역 납관 가운데 찾아 준 비율이다(판 곳 수가 아니다) · 결산의 가로축 이름표를 톡 하면 형평의 눈이 [바 구역] ⇄ [가장 적게 받은 구역]으로 바뀐다

두 해 합계—곳
2017년 찾은 납관—
2018년 찾은 납관—
편지를 보낸 구역—
'바' 구역 두 해 몫—
시도0
도전 1

편지 0통으로 두 해 700곳을 넘겨라 — 점수순에 말뚝을 몇 개만 더하면 된다. 어느 구역에 몇 개인가?

도전 2

두 해 750곳을 넘기고 여섯 구역이 모두 두 해 몫 20% 이상이 되게 하라. 모든 구역에 똑같이 꽂는 것으로는 안 된다.

도전 3

문턱 5(엄격한 주민)에서 편지 0통으로 두 해 745곳을 넘겨라. 말뚝 하나가 다른 구역의 몫을 민다는 것을 보게 된다.

자료: 가상 도시 ../data/flint_city.csv — 6,000행(집 · 구역 · 지은해 · 점수 · 납관), 원장이 random.seed(2016)으로 구웠다. 판과 실행 칸이 같은 파일을 읽으므로 숫자가 같다. 무작위 카드의 첫 판은 코드 ①과 같은 씨앗 7 의 뽑기(쪽 안에 실은 뽑힘 번호)이고, 같은 카드를 다시 톡 하면 판이 그 자리에서 새로 뽑는다 — 파고 나면 시도마다 기록판에 점이 하나씩 쌓인다. 2018년 강제 판도 판이 그 자리에서 뽑는다. 가상 자료 — 원에듀가 수업을 위해 지어낸 도시입니다. 실제가 아닙니다. 실제 플린트 숫자는 결산 띠에만 있습니다.

내가 고른 계획은 이고, 2017년에 곳을 잃는 대신 두 해 합계는 곳이 되었다. 가장 적게 받은 구역은 이고 그 몫은 이다. 주민에게 할 한 문장은 .

확인 문제 3의 결정문에 적어 제출 →
2

전략 넷을 코드로 — 판이 낸 숫자가 정말 그 숫자인가

4분

판에서 본 것을 떠올리며 한 가지만 먼저 정해 두세요 — 구역마다 83곳씩 무작위로 나누면 '바' 구역의 몫은 점수순보다 커질까요, 같을까요, 작아질까요? 셋 중 하나와 까닭 한 줄.

기본 빈칸 ①(무엇으로 줄을 세우나)과 빈칸 ②(형평의 분모)를 채우고 ▶ 실행하세요. 이 칸은 꾸러미를 받지 않아 바로 돕니다. [1]은 표 2 와, [2]는 판의 전략 카드 넷과 같은 숫자여야 합니다.

도전 몫() 안의 분모 납관수[g]를 max(1, sum(h['구역'] == g for h in 판집))(그 구역에서 판 곳 수)로 바꿔 보세요. 점수순의 '바 구역 몫'이 5% → 80%로 치솟습니다 — 그 80%는 형평이 아니라 바 구역에서 판 다섯 곳의 적중률입니다. 무작위는 8% → 13%, 균등·점수순은 35% → 36%가 됩니다.

틀린 길 빈칸 ①에 땅속의 진실 h["납관"]을 넣으면 적중률이 점수순 100.0%, 균등·점수순 100.0%가 되고 바 구역 몫은 0%와 98%가 됩니다. 숫자가 완벽해지면 쓸 수 없는 열로 줄을 세운 것은 아닌지 먼저 의심하세요 — 파 보기 전에는 아무도 납관을 모릅니다.

탐구 무작위 186곳과 균등·무작위 158곳은 씨앗 7 의 한 판입니다. 판에서 같은 카드를 다시 톡 해 새로 뽑고 파 보면 기록판에 점이 흩어집니다 — 1,000번 평균은 168.5곳과 154.5곳이에요. 186은 운이 좋았던 판일까요, 아니면 그 정도는 흔한 흔들림일까요?

구역마다 곳 수를 고르게 나눈 가 효율도 형평도 잃은 까닭은, 나누기는 로 했지만 구역 안에서는 을 버렸기 때문이다.

확인 문제 2에 표의 두 숫자로 적어 제출 →
3

최소 보장 m — 손잡이를 어디에 둘 것인가

3분

m 을 0 에서 20 으로 올리면 도시 전체로 몇 곳을 잃을까요? 한 자리 수 / 수십 곳 / 백 곳 넘게 가운데 하나를 고르고 까닭 한 줄을 적어 두세요.

기본 빈칸 ③(보장한 m곳을 구역 안에서 어떻게 고르나)을 채우고 ▶ 실행하세요. 미션 ②에서 얻은 교훈을 그대로 옮기는 자리입니다. [3]은 판에서 모든 구역에 말뚝을 m ÷ 5 개 꽂은 것과 같습니다.

도전 [3]의 m 목록을 [15, 16, 17, 18, 19, 20]으로 바꿔 촘촘히 보세요. 찾은 납관은 391 · 390 · 389 · 389 · 389 · 389로 계단처럼 내려가고 바 구역 몫은 13% → 15%로 오르는데, 가장 적게 받은 구역은 여섯 줄 모두 '마 9%'로 꿈쩍하지 않습니다. 손잡이를 돌리는데 가장 약한 자리가 안 움직이는 구간이 있다는 뜻이에요.

틀린 길 빈칸 ③을 random.sample로 바꾸면(구역 안의 m곳을 제비뽑기로) m = 20 에서 찾은 납관이 389 → 340곳으로 떨어지고 바 구역 몫도 15% → 11%가 됩니다. 두 해 합계는 756 → 664곳이에요. '공평하게 나눈다'는 말은 구역 사이에만 쓰는 말입니다 — 구역 안에서까지 순위를 버리면 그냥 손해입니다.

탐구 m 이 커질수록 [3]의 '가장 적게 받은 구역'이 바 → 마 → 다 → 가로 바통처럼 옮겨 갑니다. 형평을 끝까지 밀면 왜 새 피해 구역이 생길까요? m = 83(구역마다 83곳)에서 가장 적게 받는 곳이 가 구역인 까닭을 표 2 의 '숨은 납관' 열로 설명해 보세요.

내가 고른 m 은 이다. 잃는 것은 전체 곳이고, 얻는 것은 구역의 몫이 가 되는 것이다. 이 선택을 주민에게 설명한다면 라고 말하겠다.

확인 문제 3에 근거 숫자 둘과 함께 적어 제출 →
4

다른 분야, 같은 일곱 칸 — 사례 카드 다섯을 읽고 우리 주제를 세운다

15분

표 3 의 여섯 분야를 훑어보고, 어느 분야가 일곱째 칸에서 가장 크게 걸릴까 먼저 짚어 보세요. "점검을 더 자주 받는 쪽"과 "덜 받는 쪽"이 분명하게 갈리는 분야일수록 크게 걸립니다.

표 3 은 모양만 모은 표입니다. 그 아래 표 4 · 표 5 에는 실제로 일어난 사례 다섯이 숫자와 출처까지 들어 있어요 — 여러분이 읽고 판정할 카드입니다.

기본 ㉠ · 4분 표 4 · 표 5 의 카드 다섯 가운데 서로 다른 분야 둘을 골라 네 칸씩 읽으세요(정할 것 · 데이터 · 한 일 · 무엇이 나아졌나). 숫자는 값보다 분모를 먼저 봅니다 — "70%"가 무엇 가운데 70%인지가 카드마다 다릅니다.

표 3여섯 분야, 같은 구조 — 한정된 점검 자원 × 위험 순위모두 '전부는 못 한다'에서 시작한다
분야한정된 자원순서를 매기는 데 쓸 수 있는 기록덜 받게 되는 쪽
도시 안전 — 건물 점검 점검관이 하루에 갈 수 있는 곳민원 기록 · 건물 나이 · 용도 변경 이력민원을 넣지 않는 동네
보건 — 식당 위생 점검 한 해에 돌 수 있는 업소 수지난 점검 결과 · 신고 · 업종신고가 잘 안 들어오는 지역
교통 — 도로 보수 한 해 보수 예산통행량 · 파손 신고 · 사고 기록통행량이 적은 이면도로
교통 — 심야 버스 노선 밤에 굴릴 수 있는 버스 대수심야 이동 기록 · 기존 노선사람이 적게 모이는 동네
기후 — 폭염 쉼터 배치 새로 열 수 있는 쉼터 수동별 고령 인구 · 기존 쉼터 · 여름 기온이미 쉼터가 없어 이용 기록도 없는 동네
에너지 — 노후 설비 교체 한 해 교체할 수 있는 설비 수설치 연도 · 고장 이력 · 사용량고장을 신고하지 않고 견디는 곳

여섯 줄이 모두 같은 모양입니다 — 전부는 못 하니 순서를 매긴다, 그런데 순서를 매기는 데 쓰는 기록 자체가 한쪽으로 기울어 있다. 플린트의 '1950년 이전에 지은 집' 자리에 각 줄의 셋째 칸이 들어갑니다. 도해가 아니라 구조 대조표다. 이 표는 '누가 순서를 매기는가'라는 모양만 모았다 — 실제 숫자·연도·출처는 아래 표 4 · 표 5 의 사례 카드에 있다.

표 4사례 카드 다섯 — 무엇을 정하려고, 무엇으로, 무엇을 했나일곱 칸 가운데 ① 질문 · ② 데이터 · ③ 비교 · ④ 행동
분야 · 사례① 정할 것② 쓴 데이터③④ 한 일 — 견준 것과 실제 행동
교통
서울 심야버스
밤 12시부터 새벽 5시까지 다닐 버스를 서울 어디에 어떤 노선으로 놓을까 심야 시간대 통화 발신 기록 30억 건(2013년 3월 한 달, 통신사와 협약해 익명·집계 처리) + 심야 택시 승·하차 500만 건 서울 전역을 반경 1km 셀 1,250개로 나눠 셀마다 심야 유동인구 밀도를 지도로 만들고 두 자료를 서로 맞대 확인했다 → 시범 2개 노선(2013년 4~7월)을 2013년 9월 12일부터 9개 노선으로 확대(7개 신설)
보건
하수 기반 감염병 감시
병원에 오기 전의 감염을 어떻게 볼까 — 지역사회에 바이러스가 돌기 시작한 시점을 확진 집계보다 먼저 알 수 있나 하수처리장에서 뜬 24시간 혼합 시료(바르셀로나 광역권 인구 약 270만 명분) · 네덜란드 7개 도시와 공항의 하수 시료에서 바이러스 유전자를 재고, 보관해 둔 옛 시료까지 거슬러 올라가며 다시 검사해 하수에서 처음 잡힌 날과 임상 확진이 공식 집계된 날을 맞댔다
도시 안전
뉴욕시 불법 개조 점검
해마다 18,000건 넘게 들어오는 불법 개조 신고 가운데 어느 것을 먼저 나가 볼까 시민 신고 기록(311) + 건축 연도 · 과거 신고와 위반 이력 · 세금 체납과 담보권 — 여러 부서에 흩어져 있던 기록을 이었다 과거에 실제로 적발된 위반 사례로 위험 요인을 찾아 위험 필터를 만들고 신고를 위험도 순으로 줄 세웠다 → 퀸즈 조사팀에서 시범 적용한 뒤 뉴욕시 전역으로 확대(2013년 말 상시 가동)
에너지
전력 수요 예측(초단기)
지금부터 6시간 앞까지의 전국 전력 수요를 15분 간격으로 얼마나 정확히 맞힐 수 있나 전력거래소의 실제 전력 수요와 계량되지 않는 소규모 태양광 추정 발전량(2021~2023년 · 15분 간격) + 기상청 자료 논문이 기준선으로 삼은 칼만필터 모형에 맞서, 익일 예측 결과와 부하 변동 특성을 넣은 새 모형을 같은 자료 · 같은 과제에서 오차로 맞댔다(Ⅳ-6 의 '공정한 비교'와 같은 수)
스포츠
축구 기대득점(xG)
결과(골이냐 아니냐) 말고 이 슛이 얼마나 들어갈 만한 슛이었나를 숫자로 잴 수 있나 과거 슈팅 약 100만 건으로 학습했고, 지금까지 400만 건이 넘는 슛에 값을 매겼다 골대까지 거리·각도, 골키퍼 위치, 수비 압박, 슈팅 종류, 플레이 패턴 등 20개가 넘는 변수로 골 확률을 내고 같은 자료에서 다른 모형과 견줬다 → 상황이 굳은 페널티킥에는 과거 성공률로 고정한 값 0.76을 준다

다섯 줄 모두 앞 네 칸입니다 — 정할 것 · 데이터 · 견준 것 · 행동. 나머지 세 칸(⑤ 검증 · ⑥ 전달 · ⑦ 수용)은 표 5 에 있어요. 숫자는 모두 그 기관·연구진이 스스로 낸 문서에서 옮겼다 — 신문 기사에서 옮긴 숫자는 한 개도 싣지 않았다.
서울 심야버스 — 서울특별시 뉴스포털, 「심야전용 '올빼미버스' 9개 노선 출발!」, 2013 · 서울정책아카이브, 「빅데이터를 이용한 교통계획」, 2017
하수 기반 감염병 감시 — Rusiñol 외, 『Applied and Environmental Microbiology』 87(7), 2021 · Medema 외, 『Environmental Science & Technology Letters』 7(7), 2020
뉴욕시 불법 개조 점검 — 뉴욕시 시장실 데이터분석실(MODA), 『NYC by the Numbers: Annual Report 2013』, 2013
전력 수요 예측 — Song 외, 『Electronics』 14(18) 3747, 2025(전력거래소 2021~2023년 자료)
축구 기대득점(xG) — 옵타 애널리스트(스탯츠퍼폼), 「What Is Expected Goals (xG)?」, 2023 · Mead 외, 『PLOS ONE』, 2023

표 5같은 다섯 — 무엇이 나아졌나, 누가 받아들였나일곱 칸 가운데 ⑤ 검증 · ⑥ 전달 · ⑦ 수용
사례⑤ 검증 — 숫자와 그 분모⑥ 전달⑦ 수용 · 걸린 자리
서울 심야버스 시범 기간(2013년 4~7월) 이용 21만 8,212명 → 9개 노선으로 늘린 뒤 첫 50일 1일 평균 6,079명. 이용자 만족도 80.15점(서울시 일반 시내버스 평균 74.3점, 둘 다 100점 환산)
※ 이 사례에는 '적중률'이 없다 — 성과가 이용객 수와 만족도로 나온다
서울시가 보도자료와 정책 아카이브로 쓴 데이터 · 방법 · 성과를 함께 공개했다 이용객 설문 응답자 1,000명 중 88.4%가 확대 운행을 원했다. 한편 배차 간격이 40~45분으로 길고 이용의 52.2%가 오전 1~3시에 몰려 그 밖 시간대는 적자 우려가 있다는 것도 서울시 자체 자료에 함께 적혀 있다
하수 기반 감염병 감시 바르셀로나 하수 최초 양성 2020-01-15 — 논문이 첫 확진 공식 선언일로 삼은 2020-02-25 보다 41일 앞섰다. 네덜란드는 2020-02-06 시료가 네 표적 모두 음성이었고, 3월 5일 검출된 날 그 도시에 보고된 확진자는 0명이었다
※ 41일은 '한 사람의 감염을 41일 먼저 알았다'가 아니다 — 수백만 명분 하수에서 유행이 시작된 시점을 먼저 잡았다는 뜻이다
먼저 심사 전 원고로 공개하고, 동료 연구자의 심사를 거쳐 학술지에 실었다 심사 전 원고에 있던 가장 극적인 주장('2019년 3월 시료도 양성')이 확인 검사와 음성 대조가 없다는 비판을 받아 최종판에서 빠졌다. 같은 논문 안에서도 첫 확진일이 서론에는 2월 15일, 결과에는 2월 25일로 다르게 적혀 있다
뉴욕시 불법 개조 점검 신고 100건 가운데 실제로 강제 퇴거가 필요할 만큼 위험한 것은 8건 미만. 위험도 상위 30%만 먼저 점검하면 진짜 위험한 사례의 70%를 잡는다
※ 70%는 적중률이 아니라 '얼마나 놓치지 않았나' — 아무렇게나 30%를 골랐다면 약 30%만 잡았을 자리다
시장실 데이터분석실이 연차보고서로 방법과 수치를 공개했다 퀸즈 시범 뒤 전역으로 확대됐다. 그런데 바깥에서는 이 결과가 '적중률 13% → 70%'로 옮겨져 여러 책과 기사에 퍼졌다 — 기준선(8% 미만)과 70%는 분모가 다른 숫자인데 한 축에 이어 붙인 서술이다
전력 수요 예측 2022년 자료에서 평균 오차율 1.31% → 0.94%, 오차 크기 1,239MW → 870MW. 평균 오차율은 실제 수요를 분모로 한 상대 오차라 작을수록 정확하다
※ 6시간 앞 · 15분 간격의 초단기 예측이다 — 하루 앞 예측이나 10년 단위 수급 계획의 오차와 섞으면 안 된다
동료 심사를 거친 학술지에 방법 · 자료 · 오차를 모두 공개했다 더 잘 맞히는 모형이 나와도 계통 운영은 바로 바꾸지 않는다 — 이 논문이 기준선으로 삼은 칼만필터는 2015년 전력거래소 기술보고서의 모형이고, 10년 뒤에도 그것이 '지금 쓰는 모형'으로 인용된다
축구 기대득점(xG) 선수 능력·팀 전력 같은 변수를 더하자 예측 손실이 0.29209 → 0.28184로 줄었다(작을수록 실제에 가깝다). 다음 경기 승·무·패를 맞힌 비율은 xG 66~78% vs 슈팅 수 55~60% vs 골 수 54~59%
※ 맞힌 비율의 분모는 '예측한 경기 수'다
회사는 모델 설명 페이지를, 연구진은 동료 심사 논문을 낸다. 중계 화면에도 값이 뜬다 널리 쓰이지만 경기 결과를 직접 맞히지는 못한다 — xG 가 높아도 진다. 검증한 모든 리그에서 무승부 확률을 0%로 예측했고, 일부 모델은 골키퍼의 실제 위치를 모른 채 추정치를 쓴다

다섯 사례의 숫자가 모두 다른 종류입니다 — 이용객 수 · 앞선 날수 · 놓치지 않은 비율 · 오차 · 예측 손실. 그래서 사례를 견줄 때 첫 물음은 "몇 %인가"가 아니라 "무엇을 분모로 한 숫자인가"예요. 여섯째 분야로 잡아 두었던 기후(폭염 쉼터)는 카드를 싣지 못했다 — 전국 쉼터 수 · 도보권 사각지대 비율 · 이용 경험률이 모두 신문 보도로만 확인되고, 기관이 낸 원 문서를 열지 못했기 때문이다. 확인하지 못한 숫자는 싣지 않는다. 표 3 에는 분야만 남겨 두었다.

기본 ㉡ · 6분 고른 사례마다 판단 칸 둘을 확인 문제 4 의 표에 적으세요 — ㉮ 수용 판정(누가 받아들이고 누가 거부할까, 그 까닭은 앞의 여섯 칸 가운데 어디서 오나)과 ㉯ 부딪친 자리(효율과 형평이, 또는 다른 두 가치가 부딪친 자리 한 줄).

기본 ㉢ · 5분 이제 우리 차례입니다. 모둠이 다뤄 보고 싶은 주제 후보 셋을 확인 문제 5 의 표에 적으세요 — 후보마다 분야 · 바꾸고 싶은 결정(누가 · 무엇을 정하나) · 그 결정을 바꿀 수 있는 데이터 한 줄씩. 셋을 채우는 것이 목표입니다(하나만 붙들면 Ⅳ-2 에서 막혔을 때 돌아갈 곳이 없습니다).

도전 표 3 의 넷째 칸(덜 받게 되는 쪽)을 보고, 그 분야에서 최소 보장 m 에 해당하는 규칙이 무엇일지 한 줄로 지어 보세요. 예: 도로 보수라면 "구마다 이면도로 ○곳은 통행량과 무관하게 해마다 보수한다".

탐구 표 4 · 표 5 밖에서 우리 학교나 우리 동네의 사례를 하나 찾아 같은 칸으로 적어 보세요. 이때 출처를 함께 적습니다 — 신문 기사를 찾았다면 그 기사가 가리키는 기관의 원 문서까지 가 보세요. 못 가면 그 숫자는 쓰지 않습니다(표 5 의 기후 사례가 그래서 빠졌습니다). 과제로 돌려도 좋습니다.

분야가 달라도 되풀이되는 것은 이고, 분야마다 다른 것은 이다. 그래서 사례를 견줄 때는 을 같은 칸으로 맞춰 놓고 읽는다. 숫자를 견줄 때 먼저 맞춰야 하는 것은 이다.

확인 문제 4의 표에 두 사례를 적어 제출 → 확인 문제 5의 표에 주제 후보 셋을 적어 제출 →
체크포인트 3

삽 500자루를 직접 나눠 편지를 받아 보았고, 코드로 전략 넷과 최소 보장 m 의 대가를 숫자로 쟀고, 실제 사례 카드 둘을 일곱 칸으로 판정했고, 우리 주제 후보 셋을 세웠다.

다음 정거장 · 정리·확인 8분 →
4
정리·확인 · 8분

오늘의 탐험 일지

  1. 찾은 것

    적중률이 가장 높은 계획(392곳)이 가장 좋은 계획은 아니었다 — 두 해로 보면 받아들여진 계획(761곳)이 이겼다.

  2. 도구의 한계

    적중률은 도시 전체의 몫만 센다. 누가 얼마를 받았는지는 분모를 그 구역 납관으로 바꿔야 보인다.

  3. 보고의 규칙

    자원을 나누는 규칙은 잃는 것과 얻는 것을 둘 다 숫자로 대고, 일곱째 칸(수용)을 함께 적는다.

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. 플린트에서 2017년 적중률은 약 70%, 2018년은 약 15%였다. 이 두 숫자만으로 "2018년의 결정은 틀렸다"고 말할 수 있는가? 말할 수 있다면 왜이고, 말할 수 없다면 무엇을 더 보아야 하는지 쓰시오.
📖 모범 답안

두 숫자만으로는 말할 수 없다. 적중률은 일곱 칸 가운데 검증 칸 하나, 그것도 효율 쪽만 재는 숫자다. 2018년의 결정은 수용 칸과 형평 칸에서 나왔다 — "이웃집은 파 주는데 우리 집은 왜 안 파나"라는 물음에 점수순은 답할 말이 없었다.

틀렸다고 말하려면 함께 보아야 할 것이 있다 — ① 같은 예산으로 실제로 바꾼 관의 수, ② 구역별 몫(어느 동네가 자기 납관의 몇 %를 찾아 받았나), ③ 주민이 그 방법을 다시 받아들일 수 있는가. 다만 한 가지는 숫자로 분명하다 — 같은 돈으로 찾은 납관이 크게 줄었다. 좋은 답은 "틀렸다/옳다" 한 낱말이 아니라 무엇을 얻고 무엇을 잃었는지를 둘 다 적은 답이다.

2. 가상 도시에서 구역균등·무작위는 찾은 납관이 158곳으로 넷 가운데 가장 적은데, '바' 구역 몫도 5%로 점수순과 같았다. 왜 이렇게 되는지 표의 두 숫자를 들어 쓰시오.
📖 모범 답안

곳 수는 고르게 나눴지만 구역 안에서 위험 순위를 버렸기 때문이다. 전체로는 점수순 392곳 → 158곳으로 234곳을 잃는다(적중률 78.4% → 31.7%).

'바' 구역 몫이 안 오른 까닭은 분모가 작아서가 아니라 뽑기가 얇아서다. 바 구역에는 납관이 85채뿐인데 집은 700채다. 83곳을 무작위로 파면 기댓값이 83 × 85 ÷ 700 ≈ 10곳이고, 이번 판에서는 4곳이었다(85채의 5%). 같은 83곳을 점수순으로 파면 35%가 된다 — 같은 곳 수, 다른 고르는 법이다.

그러므로 형평은 판 곳 수가 아니라 그 구역 납관을 찾아 준 비율로 재야 하고, '공평하게 나눈다'는 말은 구역 사이에만 쓰는 말이다.

3. 결정문. 최소 보장 m 을 0 에서 20 으로 올리면 전체로 3곳을 덜 찾고 바 구역 몫은 5% → 15%가 된다. 당신이 시장이라면 m 을 몇으로 하겠는가? ① 고른 값과 ② 잃는 것(전체 몇 곳) ③ 얻는 것(어느 구역 몫이 몇 %) 을 숫자로 대고, ④ 주민에게 설명할 한 문장을 쓰시오(판의 결정문에 나온 숫자를 그대로 옮겨도 좋다).
📖 모범 답안

정해진 답은 없다. 좋은 답은 잃는 것과 얻는 것을 둘 다 숫자로 대고, 그 선택을 누구에게 어떻게 설명할지까지 적은 답이다.

예 — "m = 20 으로 한다. 잃는 것은 전체 3곳(392 → 389)이고, 얻는 것은 바 구역 몫이 5% → 15%가 되는 것이다. 주민에게는 '어느 구역도 자기 구역 납관의 15% 아래로 두지 않는다'고 말하겠다."

다른 답도 좋다 — "m = 40. 16곳을 잃고(392 → 376) 바 구역이 20%를 받는다. 대신 이때 가장 적게 받는 곳은 바가 아니라 다 구역(18%)이 되므로, 약속은 '바 구역'이 아니라 '가장 적게 받는 구역'을 기준으로 해야 한다."

피해야 할 답은 셋이다 — ① 숫자 없이 "형평이 중요하다"만 쓴 답, ② 잃는 것을 적지 않은 답, ③ 바 구역만 보고 가장 적게 받은 구역이 옮겨 가는 것을 못 본 답.

4. 사례 조사표. 표 4 · 표 5 의 사례 카드 다섯 가운데 서로 다른 분야 둘을 골라 아래 표를 채우시오. 그리고 표 아래에, 고른 두 사례 가운데 일곱째 칸 '수용'을 더 채우려면 어떤 자료를 찾아야 하는지 한 사례를 골라 쓰시오.
고른 사례㉮ 수용 — 누가 받아들이고, 누가 거부할까㉯ 효율과 형평이 부딪친 자리
📖 모범 답안

표(예) — 도시 안전 · 뉴욕시 불법 개조 점검: ㉮ 위험한 집에 살던 세입자와 점검 인력을 아껴 쓴 시청은 받아들이고, 민원을 넣지 않는 동네가 거부한다. 그 거부는 데이터 칸에서 온다 — 순서를 매긴 기록이 '신고'라서 신고하지 않는 곳은 애초에 0 으로 잡힌다. ㉯ "한 번 나가서 위험을 가장 많이 잡기"(효율)와 "점검이 한 번도 안 간 곳부터 가기"(형평)가 부딪친다.

보건 · 하수 기반 감염병 감시: ㉮ 유행 시점을 먼저 알고 싶은 방역 당국과 연구자는 받아들였고, 과학 공동체가 한 번 거부했다 — 가장 극적인 주장(2019년 시료도 양성)을 확인 검사와 음성 대조 없이 냈기 때문이다. 그 거부는 비교·검증 칸에서 왔다. ㉯ 여기서 부딪친 두 가치는 효율과 형평이 아니라 빨리 알리기와 틀리지 않기다 — 심사 전 공개는 앞엣것을, 최종판에서의 삭제는 뒤엣것을 택한 결과다.

수용 칸을 더 채우려면 — 후속 보도와 감사 보고서, 정책이 바뀐 기록, 당사자 반응(민원·설문·소송·주민 회의록), 그리고 몇 해 뒤에도 그 방법이 쓰이고 있는지. 뉴욕 사례라면 '지금도 그 필터로 순서를 매기는가'와 '점검을 더 받게 된 동네의 반응'을, 전력 수요 예측이라면 '전력거래소가 실제로 모형을 바꿨는가'를 찾아야 한다 (표 5 는 아직 바꾸지 않았다고만 말한다). 성공 발표만 있고 그 뒤 기록이 없는 사례는 수용 칸이 비어 있기 쉽다 — 비어 있다는 것 자체가 읽어야 할 정보다.

피해야 할 답은 둘이다 — ① 카드의 숫자를 분모 없이 옮겨 적은 답("적중률 70%"처럼), ② ㉮ 를 '모두가 좋아한다'로 끝낸 답. 거부하는 쪽이 아무도 없으면 일곱째 칸을 아직 안 읽은 것이다.

5. 우리 주제 후보 셋. 모둠이 다뤄 보고 싶은 주제 후보를 셋 골라 아래 표를 채우시오 — 후보마다 분야 · 바꾸고 싶은 결정(누가 · 무엇을 정하나) · 그 결정을 바꿀 수 있는 데이터. 그리고 표 아래에, 셋 가운데 하나를 골라 그 주제에서 덜 받게 되는 쪽이 누구일지 한 줄로 쓰시오.
후보분야바꾸고 싶은 결정 — 누가 · 무엇을 정하나그 결정을 바꿀 수 있는 데이터
후보 1
후보 2
후보 3
📖 모범 답안

예 — 세 후보를 이렇게 적을 수 있다.

① 기후 · "○○구는 폭염 쉼터를 어느 동에 더 열까" ← 동별 고령 인구 · 기존 쉼터 위치 · 여름 기온
② 교통 · "우리 시는 심야 버스를 어느 구간에 놓을까" ← 심야 이동 기록 · 기존 노선 · 택시 승하차 기록
③ 학교 · "영양 교사가 어느 요일 메뉴를 바꿀까" ← 요일별 잔반량 · 메뉴 · 급식 인원

셋 다 결정 주체 · 행동 · 데이터가 한 줄에 다 있다. "환경을 지키자"처럼 결정이 없는 문장은 아직 주제가 아니고, "우리 학교 급식 잔반을 줄이자"도 결정 주체와 행동이 빠져 있다 — ③처럼 바꾸면 주제가 된다.

덜 받게 되는 쪽은 대개 기록이 없다는 이유로 순위에서 밀리는 쪽이다 — ①이라면 "이미 쉼터가 없어 이용 기록이 0인 동", ③이라면 "잔반을 남기지 않고 그냥 굶는 학생". 오늘 배운 최소 보장 m 은 바로 그 자리에 바닥을 놓는 장치다.

왜 셋인가 — 하나만 붙들면 Ⅳ-2 의 "그 질문, 이 표로 답할 수 있나"를 통과하지 못했을 때 돌아갈 곳이 없다. 셋 가운데 적어도 하나는 실제로 받을 수 있는 데이터를 적어 두자.

+
더 알아보기

탐험 밖의 이야기 셋

한 번의 비용 절감 결정이 부른 5년2014비용을 줄이려 수돗물 원천을 바꿨다2014 ~ 2015부식을 막는 처리를 하지 않아 납이 녹았다2015의사가 아이들 혈중 납 기록을 앞뒤로 갈랐다2015 ~ 2016공식 인정 · 원천을 되돌리고 관을 바꾸기로2017위험 점수 순서로 8,833곳 → 6,228채2018점수 순서를 내려놓았다 · 10,531곳 → 1,567채주황 두 자리가 이 차시가 파고든 곳이다
역사

플린트의 물 — 결정이 부른 5년

2014년 플린트시는 비용을 줄이려 수돗물의 원천을 바꿨습니다. 그런데 새 물이 오래된 납 수도관을 지나가는데도 관 안쪽을 보호하는 부식 억제 처리를 하지 않았어요. 관에서 납이 녹아 나오기 시작했지만, 처음 주민들이 "물 색과 냄새가 이상하다"고 말했을 때 돌아온 답은 "검사 결과는 기준 안"이었습니다.

흐름을 바꾼 것은 이미 있던 기록이었습니다. 지역 소아과 의사 모나 해나-아티샤가 아이들의 혈중 납 수치 기록을 원천을 바꾸기 앞과 뒤로 갈라 견주어 보였고(2015), 이 분석이 사태를 공식 인정으로 밀어 올렸습니다. 새 자료를 모은 것이 아니라, 있던 자료를 결정 시점으로 잘라서 보인 것이지요 — Ⅰ-1 의 제멜바이스가 한 일과 같은 모양입니다.

그래서 이 사태에는 데이터가 두 번 나옵니다. 한 번은 결정을 바꾼 데이터(2015년의 혈중 납 분석), 또 한 번은 되돌려진 데이터(2017년의 위험 점수). 같은 도시에서 3년 사이에 둘이 함께 일어났다는 것이 이 사례가 단원 첫 차시에 선 까닭입니다.

도해: 연표 여섯 자리는 본문에서 다룬 흐름이다. 2017·2018년 숫자는 표 1 과 같은 출처(The Atlantic, 2019-01). 혈중 납 분석은 Hanna-Attisha 외(2016, American Journal of Public Health)로 알려져 있다.

구역에 삽을 나누는 잣대를 바꿔 보면(구역 안은 모두 점수순 · 찾은 납관, 곳)점수순(잣대 없음)392곳위험 점수 합383곳옛집×5 + 새집380곳집 수365곳똑같이 83곳355곳네 잣대 모두 점수순보다 적게 찾는다(−9 ~ −37곳).그런데 넷 가운데 형평을 약속하는 잣대는 하나도 없다 —몫은 잣대가 아니라 '분모'가 정한다.
방법 더 깊이

공평해 보이는 잣대 넷 — 나누는 자를 바꿔 봐도

"구역균등이 너무 거칠다면, 더 그럴듯한 잣대로 나누면 되지 않을까?" 자연스러운 생각입니다. 그래서 네 가지를 실제로 돌려 보았습니다 — ① 똑같이(구역마다 83곳) ② 집 수에 비례 ③ 1950년 이전 집에 다섯 배 가중치를 주고 비례 ④ 구역의 위험 점수 합에 비례. 넷 다 구역 몫을 정한 뒤, 구역 안에서는 점수순으로 팠습니다.

결과는 355 · 365 · 380 · 383곳. 잣대가 정교해질수록 점수순(392곳)에 가까워지지만 끝내 넘지는 못합니다. 당연합니다 — 점수순은 효율만 재는 자로는 최선이니까요. 중요한 것은 그다음입니다. 네 잣대 가운데 어느 것도 "그 구역 납관의 몇 %를 찾아 주겠다"고 약속하지 않습니다. 넷 다 나눠 주는 곳 수만 정하는 자예요.

형평은 분모를 무엇으로 두느냐가 정합니다. 그래서 이 차시의 답은 더 똑똑한 잣대가 아니라 최소 보장 m — "구역마다 m곳은 반드시 판다"는 바닥이었습니다. 잣대는 나눗셈이고, 보장은 약속입니다. 주민에게 설명할 수 있는 쪽은 뒤엣것이에요.

도해: 원장이 Pyodide 로 잰 값(구역 몫은 비율대로 나누고 내림). 막대 길이는 값에 비례한다(220 ÷ 392곳). '똑같이 83곳'은 코드 ①의 구역균등·점수순과 같은 계획이다.

현장에 닿아야 한 바퀴가 돈다기관의 문제무엇을 정해야 하나데이터 팀기록을 잇고 순서를 짓는다현장 적용받는 사람이 받아들이나되돌림 점검몇 해 뒤에도 쓰이나고리가 끊기는 자리는 대개 왼쪽 아래다 —성공 발표는 있는데 몇 해 뒤 기록이 없다.그 빈칸이 곧 일곱째 칸이다.
진로

공익을 위한 데이터 과학 — 일의 절반은 현장이다

플린트의 위험 점수를 만든 사람들은 대학 연구진이었습니다. 이런 일 — 공공기관이나 비영리단체의 문제를 데이터 팀이 현장과 함께 푸는 일 — 을 묶어 부르는 이름이 있어요. 시카고대에서 2013년에 시작한 여름 프로그램 Data Science for Social Good이 대표적이고, 국내에도 지자체·공공기관의 데이터 분석 직무가 같은 일을 합니다.

이 일의 흐름은 도해의 네 칸입니다. 기관의 문제를 받아 데이터 팀이 여러 부서에 흩어진 기록을 잇고 순서를 짓습니다(여기까지가 흔히 상상하는 '분석'). 그런데 실제로 어려운 곳은 그다음 두 칸이에요 — 현장 적용에서 받는 사람이 받아들이는가, 그리고 되돌림 점검에서 몇 해 뒤에도 그 방법이 쓰이고 있는가.

플린트에서 끊긴 자리도 거기였습니다. 모델은 맞혔지만 현장이 받아들일 수 있는 모양이 아니었어요. 그래서 이 분야의 사람들은 자주 이렇게 말합니다 — "정확도를 1%p 올리는 일보다, 왜 이 집을 먼저 파는지 주민에게 설명할 수 있게 만드는 일이 더 어렵고 더 중요하다." 오늘 여러분이 결정문의 마지막 칸을 직접 쓴 까닭이 여기에 있습니다.

도해: 네 칸과 고리는 이 차시가 정리한 흐름이다. Data Science for Social Good은 2013년 시카고대에서 시작한 여름 프로그램이다.