단원 홈

Ⅱ. 데이터 준비와 분석12차시

'가장 잘 갖춰진 구'는
몇 등인가

무엇으로 나누느냐가 등수를 정한다

11차시에 만든 자치구 25행 표는 그대로입니다. 그런데 분모만 바꾸면 1등이 바뀝니다 — 대여소 수로는 송파구, 주민 1만 명당으로는 중구. 둘 다 참이에요. 같은 표에서 왜 등수가 뒤집히는지, 그리고 어느 제목이 어느 질문에 맞는 답인지를 오늘 가립니다.

  • [12데과02-04]
  • 50분네 정거장
  • 새 도구pandas rank · corr
  • 자료서울 25개 구(따릉이 2024) · 가상 25개 구
Ⅱ 단원 지도12 / 14차시
  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14

학습 목표

  1. 개념에서

    같은 자료에 분모가 다른 네 잣대를 대면 무엇이 달라지는지, 비율 순위가 왜 원점에서 본 기울기의 순서인지 말할 수 있다.

  2. 손으로

    pandas 의 rank 로 네 잣대의 등수를 매기고, corr(method="spearman") 로 잣대끼리 같은 순서를 내는지 잴 수 있다.

  3. 확인에서

    등수가 움직인 까닭을 분모로 설명하고, 비율 순위 기사에 붙일 경고 문장을 한 줄로 적을 수 있다.

1
여는 장면 · 5분

한 표에서 나온 두 개의 1위 기사

7차시에서는 그래프가 무엇을 부풀리는지 보았고, 11차시에서는 네 파일을 이어 자치구 25행 표를 만들었습니다. 오늘은 그 표를 그대로 두고 나누는 수만 바꿔 봅니다.

오른쪽 두 기사 제목은 둘 다 참입니다. 대여소 수를 세면 송파구가 220곳으로 1위이고, 주민 1만 명당으로 고쳐 세면 중구가 7.63곳으로 1위예요. 중구는 대여소 수로는 14위입니다.

Ⅰ-7 에서는 '주민 수 ÷ 대여소 수' 하나로 대여소가 모자란 구를 골랐습니다. 잣대가 넷이면 1등은 몇 번 바뀔까요?

도시 · 가상 기사

송파구, 따릉이 대여소 수 1위 — 220곳으로 서울 최다

중구, 주민 1만 명당 대여소 1위 — 대여소 수로는 14위

2024년 자치구별 따릉이 자료 · 이 기사는 수업을 위해 지어낸 것입니다
표 1두 기사가 인용한 숫자같은 표의 같은 줄에서 나왔다
자치구대여소(곳)주민등록 인구(명)1만 명당(곳)수 등수1만 명당 등수
송파구220650,1103.3817
중구92120,5447.63141
종로구98138,3367.08112
강북구57283,5972.012522

두 기사는 같은 표의 같은 네 칸을 읽었습니다. 송파구는 대여소도 1위지만 주민도 1위(650,110명)라 1만 명당으로 고치면 7위로 내려앉고, 주민이 가장 적은 중구(120,544명)가 1위로 올라옵니다. 자료: ../data/gu_bike_2024.csv — 대여소 2026-06 목록 · 대여 2024 · 주민등록 2024-12 · 면적 2025(11차시가 만든 25행 표). 1만 명당은 코드 ①이 찍는 값과 같다.

먼저 예측

오늘 쓸 잣대는 넷입니다 — 대여소 수 · 주민 1만 명당 · km²당 · 대여소 한 곳당 대여 건수. 네 잣대의 1등 구를 하나씩 적어 보세요. 1등은 몇 번 바뀔까요? 3정거장 미션 ①의 「분모 등대」가 그 순서를 빛으로 켜고, 코드 ①이 숫자로 확인합니다.

체크포인트 1

같은 표에서 참인 1위 기사가 둘 나올 수 있다는 것을 보았고, 네 잣대의 1등을 예측해 적어 두었다.

다음 정거장 · 개념 15분 →
2
개념 · 15분

분모가 질문을 정한다

2-1'잘 갖춰진'이라는 한 낱말이 네 뜻이 된다

'가장 잘 갖춰진 구'를 뽑으려면 먼저 무엇을 세고 무엇으로 나눌지를 정해야 합니다. 분자는 '얼마나 있는가', 분모는 '누구의 · 무엇의 몫으로 볼 것인가'를 정합니다.

분모를 바꾸는 순간 답하는 질문이 바뀝니다. 대여소 수는 규모를, 주민 1만 명당은 주민 한 사람의 몫을, km²당은 촘촘함을, 대여소 한 곳당 대여 건수는 갖춤이 아니라 쓰임을 잽니다. 네 잣대는 서로 틀린 것이 아니라 서로 다른 질문에 답합니다.

그러니 순위표를 만났을 때 먼저 할 일은 1등이 누구인지 보는 것이 아니라, 무엇으로 나눴는지를 찾아 그 잣대가 답하는 질문을 적어 두는 것입니다.

규칙순위를 견주기 전에 '무엇으로 나눴나'와 그 잣대가 답하는 질문을 표 옆에 적는다.

표 2잣대 넷 — 분모가 정하는 네 개의 질문1~3등은 코드 ①이 찍는 값과 같다
잣대세는 식답하는 질문1 · 2 · 3등
수대여소규모 — 이 구에 얼마나 많이 있나송파구 · 강서구 · 강남구
1만명당대여소 ÷ 인구 × 10000주민의 몫 — 주민 한 사람 앞에 얼마나 돌아가나중구 · 종로구 · 영등포구
km2당대여소 ÷ 면적촘촘함 — 걸어가면 얼마나 금방 만나나중구 · 영등포구 · 송파구
곳당대여대여건수 ÷ 대여소쓰임 — 한 곳이 얼마나 바쁜가강서구 · 양천구 · 광진구

Ⅰ-7 에서 가져옴그때는 '주민 수 ÷ 대여소 수' 한 잣대로 대여소가 모자란 구를 골랐고, 주민 ≠ 이용자라는 한계를 짚었습니다. 오늘은 그 잣대를 넷으로 늘려 그 한계가 등수를 얼마나 움직이는지를 잽니다.

2-2비율 순위는 원점에서 본 기울기의 순서다

가로에 분모, 세로에 분자를 놓고 25개 구를 점으로 찍어 봅시다. 두 축 모두 진짜 0에서 시작합니다. 그러면 한 구의 비율은 원점에서 그 점까지 그은 선의 기울기가 됩니다. 총량 순위와 비율 순위의 차이가 같은 그림 위에서 보입니다.

그림 1같은 25개 구, 두 가지 줄 세우기가로 주민등록 인구 · 세로 대여소 수 — 둘 다 0에서 시작
① 총량으로 줄 세우면 — 가로 막대를 내린다0100200020만40만60만대여소(곳)주민등록 인구(명)가로 막대를 여기까지 내렸다1. 송파구 220곳주민 650,110명2. 강서구 196곳주민 556,171명3. 강남구 179곳주민 557,345명 ② 비율로 줄 세우면 — 원점의 빛을 눕힌다0100200020만40만60만대여소(곳)주민등록 인구(명)빛을 여기까지 눕혔다등대 — 원점3. 영등포구 177곳주민 373,773명2. 종로구 98곳주민 138,336명1. 중구 92곳주민 120,544명 ① 총량으로 줄 세우면 — 가로 막대를 내린다0100200020만40만60만대여소(곳)주민등록 인구(명)가로 막대를 여기까지 내렸다1. 송파구 220곳주민 650,110명2. 강서구 196곳주민 556,171명3. 강남구 179곳주민 557,345명 ② 비율로 줄 세우면 — 원점의 빛을 눕힌다0100200020만40만60만대여소(곳)주민등록 인구(명)빛을 여기까지 눕혔다등대 — 원점3. 영등포구 177곳주민 373,773명2. 종로구 98곳주민 138,336명1. 중구 92곳주민 120,544명

①은 높이로 줄을 세웁니다 — 가로 막대를 내리면 세로로 높은 구(대여소가 많은 구)부터 닿아요. ②는 기울기로 줄을 세웁니다 — 원점의 빛을 눕히면 세로축에 바짝 붙은 구(주민이 적은 구)부터 닿습니다. 송파구는 ①에서 가장 먼저 닿지만 ②에서는 가로로 가장 멀어(주민 650,110명) 한참 뒤에 켜집니다. 자료: 25개 구 대여소 수 · 주민등록 인구(2024-12) — 코드 ①·②가 읽는 표와 같다.

2-3잣대끼리 같은 순서를 내나 — 순위 상관

잣대가 넷이면 표도 넷입니다. 그런데 넷이 모두 다른 이야기를 하는 것은 아니에요. 두 잣대가 얼마나 같은 순서를 내는지는 순위 상관(스피어만 ρ)으로 한 숫자에 담을 수 있습니다 — 값끼리가 아니라 등수끼리 견주는 상관입니다.

1이면 두 잣대가 완전히 같은 순서, 0이면 서로 상관없는 순서, −1이면 정확히 거꾸로 된 순서입니다. '수'는 사실 분모가 1인 비율이라, 분모 칸에 1을 넣으면 비율 순위와 총량 순위가 겹쳐 ρ 는 1.00이 됩니다.

그림 2끈 그림 — 두 잣대의 등수를 이으면왼쪽 줄이 한 잣대, 오른쪽 줄이 다른 잣대 · 1등이 맨 위 · 굵은 끈은 가장 많이 움직인 셋
수 → 1만명당ρ = 0.56수1만명당용산구 184 용산구중구 141 중구금천구 2110 금천구1등이 맨 위25등이 맨 아래 1만명당 → 곳당대여ρ = 0.091만명당곳당대여서초구 524 서초구용산구 423 용산구중구 119 중구1등이 맨 위25등이 맨 아래 수 → 1만명당ρ = 0.56수1만명당용산구 184 용산구중구 141 중구금천구 2110 금천구1등이 맨 위25등이 맨 아래 1만명당 → 곳당대여ρ = 0.091만명당곳당대여서초구 524 서초구용산구 423 용산구중구 119 중구1등이 맨 위25등이 맨 아래

왼쪽(ρ 0.56)은 끈이 대체로 나란하지만 세 가닥이 크게 엇갈립니다 — 용산구 18 → 4등, 중구 14 → 1등, 금천구 21 → 10등. 오른쪽(ρ 0.09)은 끈이 마구 엇갈려 두 잣대가 서로 상관없는 순서를 낸다는 것을 보여 줍니다. ρ 0.09 는 '거꾸로 간다'가 아니라 '서로 관계가 없다'는 뜻이에요 — 네 잣대 사이에 음수인 쌍은 하나도 없습니다. 자료: 25개 구 · 스피어만 순위 상관 — 코드 ③이 찍는 표와 같은 값(원장 run/l12).

표 3잣대끼리 순위 상관(스피어만)코드 ③의 출력과 같다
수1만명당km2당곳당대여
수1.000.560.360.42
1만명당0.561.000.430.09
km2당0.360.431.000.51
곳당대여0.420.090.511.00

가장 닮은 쌍은 수 × 1만명당 0.56, 가장 무관한 쌍은 1만명당 × 곳당대여 0.09입니다. '주민 한 사람 몫으로 대여소가 많은 구'와 '한 곳이 바쁜 구'는 거의 관계가 없어요. 자료: 25개 구 · M.corr(method="spearman") 를 소수 둘째 자리로 — 코드 ③의 출력.

2-4작은 분모의 함정 — 비율 1등은 대개 작은 곳에서 나온다

분모가 작으면 비율이 커지기만 하는 것이 아닙니다. 크게 흔들립니다. Ⅱ-1 에서 본 대로 흩어짐은 1/√n 으로 줄어드니, n 이 작은 곳의 비율은 우연만으로도 크게 튑니다.

그래서 25개 구의 참 비율이 모두 똑같은 도시를 상상해 조사해 보면, 관측 비율 1등과 꼴찌는 대개 가장 작은 구에서 나옵니다. 가로가 물어본 주민 수, 세로가 관측 비율인 그림을 그리면 왼쪽이 넓고 오른쪽이 좁은 깔때기가 되지요.

깔때기의 테두리 두 줄은 '우연만으로 흔히 나오는 폭' — 30% ± 2 × √(0.3 × 0.7 ÷ n) 입니다. 한 번 조사해 보면 이 폭 밖으로 나간 구는 25곳 가운데 둘뿐이었어요. 참 비율은 모두 같은데도 말입니다.

가상 25개 구참 비율 모두 30%
0.00.30.6물어본 주민 수 →
1등 구 14명에게 물었다꼴찌 구 36명에게 물었다

자료: 가상 25개 구 · 물어본 수 10~795명 · 씨앗 12 — 코드 ④가 그리는 그림과 같은 값

같아야 할 두 숫자가 어긋나는 자리를 나란히 놓아 봅니다. 그 어긋남이 곧 분모가 한 일입니다.

중구 · 대여소 수와 주민 1만 명당
14수 등수
→
11만 명당 등수
141

주민이 120,544명으로 가장 적다 — 분모가 작다.

서초구 · 분모를 인구에서 면적으로
51만 명당 등수
→
23km²당 등수
523

면적이 46.97km²로 가장 넓다 — 분모가 크다.

강남구 · 갖춤과 쓰임
3수 등수
인데
25곳당대여 등수
325

수로는 셋째, 한 곳의 바쁨으로는 꼴찌.

영등포구 · 네 잣대 모두
4가장 낮은 등수
vs
2가장 높은 등수
수1만명당km2당곳당대여4324

4 · 3 · 2 · 4 — 넷 모두 5등 안인 유일한 구.

자료: 위 네 쌍의 등수는 모두 25개 구 표에서 코드 ① · ②가 찍는 값이다(rank(ascending=False, method="min")).

비율 순위를 읽는 나침반 — 네 방향을 차례로

  1. 분자무엇을 셌나 — 갖춤(대여소)인가 쓰임(대여건수)인가
  2. 분모무엇으로 나눴나 — 사람인가 넓이인가 대여소인가, 아니면 나누지 않았나
  3. 크기그 분모가 얼마나 작은가 — 작을수록 비율이 크게 흔들린다
  4. 질문이 잣대가 답하는 질문은 무엇인가 — 내가 묻고 싶은 질문과 같은가

그래서 '가장 잘 갖춰진 구'는 잣대를 말하기 전에는 없는 말입니다. 한 낱말 안에 규모 · 주민의 몫 · 촘촘함 · 쓰임 네 뜻이 겹쳐 있고, 넷은 서로 다른 구를 1등으로 올립니다.

체크포인트 2

분모가 질문을 정한다는 것, 비율 순위는 원점에서 본 기울기의 순서라는 것, 작은 분모는 비율을 크게 흔든다는 것을 말할 수 있다.

다음 정거장 · 손으로 20분 →
3
손으로 · 20분

분모를 바꿔 가며 25개 구를 네 번 줄 세운다

오늘의 장비

pandas 의 rank 와 corr — 값을 등수로 바꾸는 도구

지금까지 pandas 는 값을 다뤘습니다. 오늘은 값을 등수로 바꿉니다. 순위·순위 상관은 pandas 가 맡는 일이라 scikit-learn 은 쓰지 않아요. 코드 ④에서만 matplotlib 으로 그림 한 장을 그립니다.

부르는 모양

R = M.rank(ascending=False,
           method="min")

M.corr(method="spearman")

오늘 쓰는 것 넷

rank
값을 등수로 — ascending 이 방향을 정한다
method="min"
같은 값은 같은 등수(작은 쪽)를 받는다
corr
열끼리의 상관 — method 로 셈법을 고른다
sort_values
등수 차례로 세워 위에서 몇 개만 본다

값을 다루던 때와 다른 셋

  1. 방향을 적어야 한다큰 값이 1등이면 ascending=False — 빠뜨려도 오류가 나지 않는다
  2. 동점 규칙을 골라야 한다대여소 92곳인 성동구·중구는 "min" 으로 둘 다 14등
  3. 스피어만은 등수끼리피어슨은 값끼리 — 튀는 값이 있으면 두 셈이 갈린다

대가 — 등수로 바꾸면 얼마나 차이 나는지가 지워집니다. 중구 7.63과 종로구 7.08은 1·2등이지만, 그 절반도 안 되는 강북구 2.01도 '22등'일 뿐입니다.

1

분모 등대 — 빛을 눕혀 켠 순서가 곧 등수다

7.5분

여는 장면에 적어 둔 내 예측입니다. 네 잣대의 1등이 정말 같은 구일까요?

판에서 주민 1만 명당 1 · 2 · 3등이라고 보는 구 셋을 골라 꼬리표를 붙이고 잠그세요. 잠가야 빛이 돕니다 — 예측을 적기 전에 답을 보지 않도록 한 잠금입니다.

가로 막대를 내리면 총량 순으로, 원점의 빛을 눕히면 비율 순으로 구가 하나씩 켜집니다. 칩으로 분모를 갈아 끼우면 같은 25점이 미끄러지고, 아래 끈 그림이 직전 잣대와 지금 잣대의 등수를 이어 줍니다. 도전 셋을 풀면 카드가 스스로 닫힙니다.

시뮬레이터

분모 등대

원점에서 빛을 돌리면 비율 순위가 켜진다 — 분모가 작은 구가 먼저다

  1. 1점 셋을 톡 쳐 1 · 2 · 3등 예언 꼬리표를 붙이고 잠근다
  2. 2가로 막대를 내리고, 원점의 빛을 눕힌다
  3. 3칩으로 분모를 갈아 끼우고 끈 그림을 톡 쳐 까닭을 본다
판
세로축 — 분자(무엇을 세나)
가로축 — 분모(무엇으로 나누나)
빗질 — 무엇으로 줄을 세우나
예언 꼬리표 — 셋을 붙이고 잠근다
빗질 손잡이
서울 25개 구 · 대여소 ÷ 인구점을 톡 쳐 예언 꼬리표를 붙이세요

켜지는 차례 — 가로 막대는 분자가 큰 구부터, 원점의 빛은 분자 ÷ 분모(원점에서 본 기울기)가 큰 구부터. 같은 값은 같은 등수(rank(method="min") 와 같은 규칙)

끈 그림과 ρ — 왼쪽 줄은 직전에 빗질한 잣대, 오른쪽 줄은 지금 잣대의 등수다. ρ 는 그 두 줄의 순위 상관(스피어만)이고 코드 ③의 표와 같은 셈이다

지금 1등—
잣대—
켜진 구0/25
ρ · 직전 잣대와—
가장 많이 움직인 구—
예언0/3
도전 1

분모 인구 · 원점의 빛으로 1 · 2 · 3등을 켜라 — 셋 다 세로축에 붙어 있는가? 내 예언과 맞대어 보라.

도전 2

분모를 인구 → 면적으로 갈아 끼우고, 끈 그림에서 가장 많이 떨어진 끈을 톡 쳐 그 구의 까닭을 열어라.

도전 3

잣대 넷(수 · 1만명당 · km2당 · 곳당대여)을 모두 한 번씩 빗질하라 — 네 잣대 모두 5등 안인 구와 모두 10등 밖인 구는 몇 곳인가?

자료: 정거장 1 — ../data/gu_bike_2024.csv(11차시가 만든 25행 표) 를 쪽 안에 그대로 실었다. 정거장 2 — 참 비율 30%가 같은 가상 25개 구, 물어본 수 10~795명(1.2배씩), random.seed(12) 로 뽑은 조사 201번(첫 조사 + 200번 되풀이)의 '탔다' 인원을 쪽 안에 실었다. 코드 ④가 브라우저에서 만드는 값과 같다(원장 run/l12).

기본 빈칸 ①에 순위의 방향을 채우고 ▶ 실행해, 빛이 켠 순서와 코드가 찍은 등수가 같은지 맞대어 보세요.

도전 ascending=False 를 지우고 다시 실행해 보세요. 오류는 한 줄도 나지 않는데 '수' 1등이 강북구(57곳)로 바뀝니다 — 작은 값이 1등이 된 것이지요. 순위를 매길 때마다 방향을 확인해야 하는 까닭입니다.

탐구 다섯째 잣대를 하나 만든다면(예: 대여건수 ÷ 인구) 그것은 어떤 질문에 답하나요? M 에 한 줄을 더해 1~3등을 찍고, 그 잣대가 답하는 질문을 한 줄로 적어 보세요.

'잘 갖춰진'이라는 한 낱말은 네 잣대에서 각각 · · · 을 뜻한다. 그래서 잣대를 밝히지 않은 '가장 잘 갖춰진 구'는 .

확인 문제 1에 적어 제출 →
2

등수가 가장 많이 움직인 구 — 분모로 설명한다

3분

'수' 등수와 '1만 명당' 등수가 가장 많이 벌어질 구는 어떤 구일까요 — 인구가 많은 구일까요, 적은 구일까요? 판의 끈 그림에서 굵게 표시된 세 가닥을 떠올리며 짐작해 두세요.

기본 빈칸 ②에 견줄 잣대의 이름을 채우고 ▶ 실행합니다. 두 등수의 차가 클수록 분모가 등수를 많이 움직였다는 뜻이에요.

도전 "1만명당" 을 "km2당" 으로 바꾸려면 M 에 그 열을 먼저 더해야 합니다. 더해 보면 가장 많이 움직인 구가 달라져요 — 서초구는 1만 명당 5등에서 km²당 23등으로 떨어집니다. 면적이 46.97km²로 가장 넓기 때문입니다.

탐구 도심 구(중구 · 종로구)의 '주민 1만 명당'이 높은 것을 '주민이 살기 좋다'로 읽으면 안 되는 까닭은 무엇일까요? 낮에 일하러 오는 사람을 떠올려 한 줄로 적어 보세요.

○○구가 1만 명당 상위인 것은 때문이다. 같은 대여소 수라도 가 작으면 비율은 .

확인 문제 2에 세 구를 한 줄씩 적어 제출 →
3

잣대끼리 같은 순서를 내나 — 순위 상관

2분

'수'와 '1만 명당'의 순위 상관은 1에 가까울까요? 그리고 네 잣대 가운데 가장 무관한 쌍은 어느 둘일까요? 판의 ρ 수치를 보기 전에 먼저 짐작해 두세요.

기본 빈칸 ③에 값이 아니라 등수끼리 견주는 상관의 이름을 채우고 ▶ 실행합니다.

도전 method="spearman" 을 지우고 실행하면 pandas 는 피어슨(값끼리)으로 셉니다. 1만명당 × 곳당대여는 0.09 → 0.03, 수 × 1만명당은 0.56 → 0.20 으로 내려가요. 값끼리 세면 몇몇 큰 값에 끌리기 때문입니다.

탐구 시가 '따릉이 우수 구'를 뽑을 때 거의 같은 순서를 내는 두 잣대를 함께 쓰면 무엇이 문제일까요? 표에서 가장 닮은 쌍을 찾아 한 줄로 적어 보세요.

ρ 0.09 는 두 잣대가 는 뜻이 아니라 는 뜻이다. −1 이었다면 였을 것이다.

확인 문제 3에 적어 제출 →
4

작은 분모의 함정 — 그리고 질문에 맞는 잣대 고르기

7.5분

이제 참 비율이 25곳 모두 30%인 도시를 상상합니다. 다른 것은 물어본 주민 수(10~795명)뿐이에요. 이 도시를 200번 조사하면, 관측 비율 1등이 가장 작은 다섯 구에서 나오는 비율은 몇 %일까요? 크기와 아무 상관이 없다면 5 ÷ 25 = 20% 여야 합니다.

먼저 미션 ①의 「분모 등대」 로 올라가 [정거장 2 · 가상 25개 구] 를 켜세요. 점 하나를 톡 쳐 '답을 바꾼 사람'을 늘려 보고, [펴기] · [다시 조사] · [200번 모아 보기] 를 차례로 누른 뒤 여기로 돌아옵니다. [펴기]가 만드는 깔때기가 바로 아래 코드 ④가 그리는 그림입니다.

기본 산점도는 채워져 있습니다. 빈칸 ④에 '가장 작은 다섯 구'를 가리키는 수를 채우고 ▶ 실행하세요. 구는 작은 것부터 번호가 붙어 있으니, 앞에서 몇 번째까지인지만 적으면 됩니다. 처음 실행은 몇 초 멈춥니다 — 고장이 아니라 matplotlib 과 한글 글꼴을 준비하는 중이에요.

도전 sizes 의 10 을 100 으로 바꿔(구마다 물어본 수를 열 배로) 다시 돌려 보세요. 깔때기는 눈에 띄게 좁아지는데, 1등 60% · 꼴찌 65% 로 여전히 20%와 한참 멉니다 — 작은 구가 양 끝을 차지하는 일은 사라지지 않습니다.

탐구 실제 25개 구 표에서 '곳당대여' 1등은 강서구입니다. 이것도 작은 분모 때문일까요? 강서구의 대여소가 196곳(25개 구 가운데 둘째로 많다)이라는 것을 근거로 판단해 적어 보세요.

비율 순위 기사에 경고 한 줄을 붙인다면 — "1등 구는 일 수 있으니, 를 함께 보아야 한다."

확인 문제 4에 적어 제출 →

마지막 2분 — 질문 3장. 아래 세 질문마다 네 잣대 가운데 하나를 고르고 까닭을 한 줄로 적습니다. 같은 표를 보고도 질문이 다르면 골라야 할 잣대가 다릅니다.

  1. 질문 1

    시가 대여소를 새로 놓을 구를 고른다면?

  2. 질문 2

    따릉이가 모자라 주민 불만이 많을 구를 짐작한다면?

  3. 질문 3

    정비 인력을 더 보낼 구를 정한다면?

확인 문제 5의 표에 세 줄을 채워 제출 →
체크포인트 3

같은 표를 네 번 줄 세워 1등이 셋으로 갈리는 것을 보았고, 움직인 까닭을 분모로 설명했고, 잣대끼리의 일치를 ρ 로 쟀고, 작은 분모가 만드는 극단을 가상 실험으로 확인했다.

다음 정거장 · 정리·확인 10분 →
4
정리·확인 · 10분

오늘의 탐험 일지

  1. 찾은 것

    같은 25행 표에서 분모만 바꾸자 1등이 셋으로 갈렸다 — 송파 · 중구 · 강서. 잣대 넷 모두 5등 안인 구는 영등포구 하나뿐이다.

  2. 도구의 한계

    등수는 얼마나 차이 나는지를 지운다. 순위 상관은 두 잣대가 같은 순서를 내는지만 말하고, 어느 잣대가 옳은지는 말해 주지 않는다.

  3. 보고의 규칙

    비율 순위를 실을 때는 분모와 그 분모의 크기를 함께 적는다 — 분모가 작으면 1등은 우연일 수 있다.

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. '잘 갖춰진'이라는 한 낱말이 네 잣대(수 · 1만명당 · km2당 · 곳당대여)에서 각각 무엇을 뜻하는지 쓰고, 잣대를 밝히지 않은 채 "○○구가 따릉이가 가장 잘 갖춰진 구다"라고 말하면 왜 안 되는지 쓰시오.
📖 모범 답안

수는 규모('이 구에 얼마나 많이 있나'), 1만명당은 주민 한 사람의 몫('주민 앞에 얼마나 돌아가나'), km2당은 촘촘함('걸어가면 얼마나 금방 만나나'), 곳당대여는 갖춤이 아니라 쓰임('한 곳이 얼마나 바쁜가')을 뜻한다.

네 잣대의 1등이 송파구 · 중구 · 중구 · 강서구로 갈린다 — 1등이 선 구가 셋이다. 그러니 잣대를 밝히지 않은 '가장 잘 갖춰진 구'는 넷 가운데 무엇을 말하는지 알 수 없는 문장이다. 네 잣대는 서로 틀린 것이 아니라 서로 다른 질문에 답하므로, 순위를 말할 때는 반드시 '무엇으로 나눴나'를 함께 적어야 한다. 실제로 네 잣대 모두 5등 안에 드는 구는 영등포구(4 · 3 · 2 · 4) 하나뿐이고, 어느 잣대에서도 10등 밖인 구는 일곱 구다.

2. 코드 ②가 찾은 세 구(용산구 18→4등, 중구 14→1등, 금천구 21→10등)가 움직인 까닭을 분모로 한 줄씩 설명하시오. 그리고 주민등록 인구가 적은 구가 '1만명당' 상위권에 오르기 쉬운 까닭을 두 가지 쓰시오.
📖 모범 답안

용산구가 1만 명당 4등인 것은 대여소가 87곳으로 많아서가 아니라 주민이 203,854명으로 세 번째로 적기 때문이다(수로는 18등). 중구가 1위인 것은 주민이 120,544명으로 25개 구 가운데 가장 적기 때문이다(대여소는 92곳, 수로는 14등). 금천구가 21등에서 10등으로 오른 것도 주민이 225,159명으로 적은 쪽이기 때문이다. 셋 다 분자(대여소)가 커진 것이 아니라 분모(인구)가 작다.

까닭 두 가지 — ① 분모가 작으면 같은 대여소 수로도 비율이 크게 나온다. ② 도심 구는 낮에 일하러 오는 사람이 많아 실제 이용자가 주민등록 인구보다 훨씬 많다. 주민등록 인구는 '밤에 자는 사람'에 가까우므로, 도심 구에서는 이 분모가 이용자를 대표하지 못한다.

3. 순위 상관표에서 '1만명당 × 곳당대여'는 0.09, '수 × 곳당대여'는 0.42이고 음수인 쌍은 하나도 없다. 0.09가 "두 잣대는 거꾸로 간다"가 아니라 "서로 상관없다"인 까닭을 1 · 0 · −1 의 뜻으로 설명하시오.
📖 모범 답안

순위 상관은 1이면 두 잣대가 완전히 같은 순서, 0이면 두 순서 사이에 아무 규칙이 없음, −1이면 정확히 뒤집힌 순서를 뜻한다. 0.09는 0에 아주 가까우므로 '거꾸로'가 아니라 서로 관계가 없다는 뜻이다. 거꾸로라면 값이 음수여야 하는데, 네 잣대 사이에 음수인 쌍은 하나도 없다.

뜻을 풀면 — 주민 한 사람 몫으로 대여소가 많은 구라고 해서 그 대여소들이 더 바쁜 것도, 덜 바쁜 것도 아니다. 두 잣대는 서로 다른 것(갖춤 대 쓰임)을 재기 때문이다. 그래서 '잘 갖춰진 구'와 '잘 쓰이는 구'를 한 잣대로 말하면 안 된다. 참고로 값끼리 견주는 피어슨으로 세면 같은 쌍이 0.03, '수 × 1만명당'은 0.56에서 0.20으로 내려간다 — 어떤 셈으로 쟀는지도 함께 적어야 한다.

4. 가상 실험에서 참 비율이 25곳 모두 30%인데도 관측 비율 1등은 200번 가운데 66%가 가장 작은 다섯 구에서 나왔다(꼴찌는 74%). ① 그 까닭을 쓰고, ② 비율 순위 기사에 붙일 경고 문장 한 줄을 쓰시오.
📖 모범 답안

① 표본이 작을수록 비율의 흩어짐이 크기 때문이다(흩어짐은 1/√n 으로 줄어든다 — Ⅱ-1). 10명에게 물은 구는 한 사람만 달라져도 비율이 10%p 움직이지만, 795명에게 물은 구는 한 사람이 0.13%p밖에 못 움직인다. 그래서 작은 구는 우연만으로도 극단값을 내기 쉽고, 1등과 꼴찌를 함께 차지한다. 산점도가 왼쪽은 넓고 오른쪽은 좁은 깔때기인 것도 같은 까닭이다. 실제로 200번 가운데 가장 큰 일곱 구는 1등도 꼴찌도 한 번도 하지 못했다.

② 예: "1등 구는 실력이 아니라 분모가 작아서일 수 있으니, 순위와 함께 각 구의 분모(조사 인원 또는 인구)를 함께 보아야 한다." 또는 "이 순위는 참 비율이 모두 같아도 나올 수 있는 순위다 — 우연만으로 흔히 나오는 폭을 넘었는지 먼저 확인하라."

5. 아래 세 질문마다 네 잣대(수 · 1만명당 · km2당 · 곳당대여) 가운데 하나를 골라 표를 채우고, 고른 까닭을 한 줄씩 쓰시오. 그리고 주민 1만 명당 대여소가 가장 높게 나온 구가 도심 구라면, 그 숫자를 "가장 살기 좋은 구"의 근거로 쓰면 안 되는 까닭을 쓰시오.
질문고른 잣대고른 까닭 · 함께 볼 자료
질문 1 · 대여소를 새로 놓을 구
질문 2 · 주민 불만이 많을 구
질문 3 · 정비 인력을 더 보낼 구
📖 모범 답안

질문 1 · 대여소를 새로 놓을 구 — 1만명당(또는 km2당) 하위권이면서 곳당대여가 많은(붐비는) 곳. 모자란 곳을 찾는 질문이므로 '주민의 몫'이나 '촘촘함'이 낮고, 있는 대여소가 바쁜 곳이 새 대여소가 필요한 곳이다. 함께 볼 자료: 낮 인구(생활인구) · 지하철역 위치 · 자전거 도로.

질문 2 · 주민 불만이 많을 구 — 1만명당. '주민 한 사람에게 얼마나 돌아가는가'가 곧 주민이 느끼는 부족함이다. 다만 주민 ≠ 이용자이므로(Ⅰ-7) 민원 건수·설문을 함께 본다.

질문 3 · 정비 인력을 더 보낼 구 — 곳당대여. 한 곳이 바쁠수록 자전거가 더 닳고 재배치가 더 필요하다. 갖춤이 아니라 쓰임을 재는 잣대다. 함께 볼 자료: 고장 신고 건수 · 대여소별 회전율.

도심 구의 1만 명당이 높은 것은 분모인 주민등록 인구가 작기 때문이다(중구 120,544명 · 종로구 138,336명 — 25개 구 가운데 가장 적은 둘). 게다가 도심 구는 낮에 일하러 오는 사람이 많아 실제 이용자가 주민등록 인구보다 훨씬 많다. 그러니 그 비율은 주민의 편의를 대표하지 못하고, '가장 살기 좋은 구'의 근거가 될 수 없다. 같은 중구가 '곳당대여'로는 19등이라는 것도 함께 보아야 한다 — 잘 갖췄다고 해서 잘 쓰이는 것은 아니다.

+
더 알아보기

분모 밖의 이야기 셋

참 비율이 25곳 모두 30% 인 도시를 200번 조사하면관측 비율 1등이 된 횟수02040관측 비율 꼴찌가 된 횟수02040← 10명에게 물은 구795명에게 물은 구 →가장 작은 다섯 구(주황)가 1등의 132번, 꼴찌의 149번을 가져갔다— 가장 큰 일곱 구는 0번.
역사

가장 위험한 공식

미국 군(county)별 신장암 발생률 지도를 펼치면 발생률이 가장 높은 군들이 시골에 몰려 있습니다. 공기가 나쁜 것도 아닌 한적한 곳이라 연구자들은 까닭을 찾기 시작했지요. 그런데 발생률이 가장 낮은 군들도 같은 시골에 몰려 있었습니다. 두 지도가 거의 겹쳤던 것입니다.

까닭은 병이 아니라 분모였습니다. 인구가 적은 군은 환자 한 명만 있어도 발생률이 크게 뛰고, 한 명도 없으면 0이 됩니다. 통계학자 하워드 웨이너는 이 현상을 「가장 위험한 방정식」(2007)이라 부르며, 작은 학교가 성적 상위와 하위에 함께 몰린 것을 보고 '작은 학교 늘리기'에 큰돈을 쓴 일까지 이 오해에서 나왔다고 적었습니다. 오늘 우리가 25곳의 참 비율을 모두 30%로 맞춰 놓고도 1등과 꼴찌가 작은 구에서 나오는 것을 본 것과 같은 이야기입니다.

도해: 수업의 가상 25개 구를 200번 조사해, 구마다 관측 비율 1등이 된 횟수와 꼴찌가 된 횟수를 센 것이다(씨앗 12 · 코드 ④와 같은 수). · 참고: H. Wainer, "The Most Dangerous Equation", American Scientist 95(3), 2007

같은 분자 92곳, 분모를 바꾸면중구 대여소92곳÷주민등록 인구120,544명7.63곳 / 1만 명주민등록 인구 + 낮에 오는 사람낮에 오는 사람120,544명 + ?7.63보다 작다분모가 커지면 값은 내려간다서울시 생활인구는 시간대별 추정값으로 공개된다 —이 그림에는 그 값을 싣지 않고 방향만 표시했다.
현장

주민등록 인구와 생활인구

우리가 쓴 분모는 주민등록 인구입니다. 주소를 그 구에 둔 사람의 수이니, 거칠게 말하면 밤에 자는 사람에 가깝습니다. 그런데 따릉이를 타는 사람은 밤에 자는 사람이 아니라 낮에 그 자리에 있는 사람이지요.

서울시는 통신 자료와 공공 데이터를 합쳐 시간대별로 그 자리에 있던 사람을 추정한 생활인구를 서울 열린데이터 광장에 공개합니다. 같은 구라도 새벽과 한낮의 인구가 크게 다르고, 특히 중구·종로구 같은 도심 구는 낮에 크게 불어납니다. 분모를 주민등록 인구에서 낮 인구로 바꾸면 분모가 커지므로 1인당 지표는 내려가고, 도심 구가 차지하던 1·2위는 흔들립니다. 무엇으로 나눌 것인가는 자료를 고르는 문제이기도 한 것입니다. 이 그림에는 생활인구 값을 싣지 않았습니다 — 분모가 커지면 값이 내려간다는 관계만 보인 것이니, 실제 숫자는 직접 내려받아 확인해 보세요.

도해: 중구의 대여소 92곳을 두 가지 분모로 나눈 관계를 보였다. 왼쪽 값 7.63은 주민등록 인구 120,544명(2024-12)으로 나눈 실제 값이고, 오른쪽은 분모에 낮에 오는 사람이 더해지면 값이 내려간다는 방향만 표시한 것이다(생활인구 값은 싣지 않았다).

지표는 거울이 아니라 손잡이다① 지표를 고른다‘대여소 수’ 로 평가한다② 행동이 바뀐다구청은 대여소를 늘린다③ 지표는 올라간다수치는 해마다 좋아진다④ 그런데 목적은?붐비는 곳은 그대로일 수 있다굿하트의 법칙측정값이 목표가 되는 순간좋은 측정값이기를 그친다그래서 서로 무관한 잣대 둘을 함께 둔다 —‘1만명당’ 과 ‘곳당대여’ 는 순위 상관 ρ 0.09 다.한 잣대만 올려서는 둘 다 올릴 수 없다.
진로

지표를 설계하는 사람

지자체 평가, 학교 평가, 병원 평가에는 늘 지표가 있습니다. 그 지표를 고르는 일 — '무엇을 잘한 것으로 셀 것인가'를 정하는 일 — 을 하는 사람이 있어요. 오늘 우리가 잣대 넷을 놓고 고민한 바로 그 일입니다.

이 일이 어려운 까닭은 지표가 거울이 아니라 손잡이이기 때문입니다. '대여소 수'로 평가하면 구청은 대여소를 늘리고, '곳당대여'로 평가하면 붐비지 않는 대여소를 치우는 것이 유리해집니다. 지표는 올라가는데 주민의 불편은 그대로일 수 있지요. 이것을 굿하트의 법칙(1975)이라 부릅니다 — 어떤 측정값이 목표가 되는 순간 그것은 좋은 측정값이기를 그친다. 그래서 지표를 설계하는 사람은 잣대 하나를 고르는 대신 서로 무관한 잣대 둘 이상을 함께 두고 (오늘 표에서 ρ 0.09 인 '1만명당'과 '곳당대여'처럼), 지표가 바꿔 놓을 행동까지 미리 적어 둡니다.

도해: 지표 하나만으로 평가할 때 생기는 되먹임 고리를 그린 것이다. 함께 두는 두 잣대의 ρ 0.09 는 이 차시 표 3의 값이다. · 참고: C. Goodhart(1975) 의 논의에서 비롯한 이름