단원 홈

Ⅱ. 데이터 준비와 분석단원 마무리

같은 자료에서
어떻게 다른 답이 나왔나

열네 차시가 남긴 것은 숫자가 아니라 적어 둘 목록이다

Ⅱ 단원은 누구에게 물을지 고르는 일에서 시작해 표를 잇고 비율을 내는 데까지 왔습니다. 열네 차시 내내 같은 장면이 되풀이됐어요 — 코드는 오류 한 줄 없이 돌았는데 선택 하나가 답을 옮겼습니다. 이 쪽은 그 선택들을 한자리에 모으고, 다음 표 앞에서 여러분이 무엇을 적어야 하는지 확인합니다.

  • [12데과02-01] ~ [12데과02-04]
  • 범위1 ~ 14차시
  • 하는 일점검 · 확인 문제
  • 다음Ⅲ. 데이터 모델링과 평가
1
되돌아보기

열네 차시가 한 이야기는 하나였다

  1. 찾은 것

    답이 갈린 자리는 늘 같았다 — 누구를 세느냐 · 무엇을 빈칸으로 보느냐 · 어디를 자르느냐 · 무엇으로 나누느냐.

  2. 도구의 한계

    pandas 도 matplotlib 도 고른 것을 되묻지 않는다. 기울어진 표집 틀도, 잘린 축도, 사라진 행도 오류가 아니다.

  3. 보고의 규칙

    숫자 하나 대신 분모 · 뺀 줄 · 기준 · 범위를 함께 적는다. 열네 차시의 ‘보고의 규칙’이 모두 이 한 줄이었다.

Ⅱ 단원의 차시 이름을 차례로 읽어 보면 서로 다른 주제처럼 보입니다. 표집 · 신상명세서 · 빈칸 · 튀는 값 · 히스토그램 · 축 · 정규화 · 속성 쌍 · 잇기 · 비율 · 다중우주. 그런데 열네 편 모두 끝에서 같은 말을 했습니다.

자료를 모으는 곳(Ⅱ-1 · Ⅱ-2)에서는 누가 잡힐 수 있었나가 답을 옮겼고, 자료를 들여다보는 곳(Ⅱ-3 ~ Ⅱ-5)에서는 무엇을 빈칸으로 보고 무엇을 뺐나가 옮겼습니다. 그림으로 옮기는 곳(Ⅱ-6 ~ Ⅱ-8)에서는 구간 · 축 · 자가, 표를 잇고 나누는 곳(Ⅱ-9 ~ Ⅱ-14)에서는 열쇠와 분모가 같은 일을 했어요.

네 자리 모두 코드는 오류를 내지 않았습니다. 오류가 아니니까요 — 전부 사람이 고른 것입니다. 그래서 Ⅱ 단원이 여러분에게 남기는 것은 새 함수 목록이 아니라, 고른 것을 적어 두는 보고의 습관입니다.

규칙숫자를 보고할 때는 그 숫자를 만든 선택을 함께 적는다 — 누구를 세었나 · 무엇을 뺐나 · 어디를 잘랐나 · 무엇으로 나눴나.

2
한 줄로 · 남는 숫자

답을 옮긴 여덟 자리

열네 차시 가운데 답이 눈에 보이게 움직인 여덟 자리를 골랐습니다. 오른쪽 숫자는 제가 계산한 값이 아니라 그 차시의 실행 칸이 실제로 찍은 값이에요. 차시 이름을 누르면 그 자리로 돌아갑니다.

표 1Ⅱ 단원, 답이 갈린 여덟 자리숫자는 그 차시가 찍은 값 그대로
차시한 줄로남는 숫자
Ⅱ-1 사람 수를 16배로 늘려도 편향은 꿈쩍하지 않는다. 줄어드는 것은 흩어짐뿐이다. 1.23회 → 6.56회
Ⅱ-4 빈칸의 뜻을 읽지 않고 채우면 같은 .mean() 한 줄이 다른 답을 낸다. 8.20mm → 3.58mm
Ⅱ-5 규칙은 이상해 보이는 줄의 명단만 준다. 판정은 다른 열을 맞대어 사람이 한다. 21.26분 → 14.40분
Ⅱ-6 평균과 표준편차가 같아도 모양은 넷이 다 달랐다 — 봉우리 하나 · 둘 · 꼬리 · 튀는 값. 30.0분 · 10.0분 — 네 학교 모두
Ⅱ-7 숫자를 하나도 고치지 않아도 그림은 열 배로 부풀린다. 자른 자리만이 그 배수를 정한다. +1.42% → +14.2%
Ⅱ-11 표를 이으면 행이 사라지고 불어난다. 셋 다 오류 없이 일어난다. 1.937배 · 오류 0개
Ⅱ-13 합친 비율은 실력과 구성을 섞어 놓은 숫자다. 나눠 보면 방향이 뒤집힌다. 남 +14.2%p → 여 +4.3%p
Ⅱ-14 합리적인 선택을 모두 돌리면 답은 하나가 아니라 띠다. −74.6% ~ −22.1%

여덟 줄 모두 왼쪽 값과 오른쪽 값이 같은 자료에서 나왔다. 바뀐 것은 자료가 아니라 고른 손이다 — 그래서 어느 쪽도 ‘틀린 계산’이 아니고, 그래서 더 적어 두어야 한다. 자료: Ⅱ 단원 각 차시의 실행 칸 출력

3
스스로 점검

네 가지 성취기준, 지금 할 수 있는가

Ⅱ 단원의 성취기준은 넷입니다. 아래 네 줄은 그 넷을 ‘할 수 있다’의 말로 풀어 쓴 것이에요. 지금 처음 보는 표를 하나 받는다면 정말 할 수 있을지 생각하며 체크해 보세요.

이 체크는 이 기기에만 남습니다 — 선생님께 전달되지 않아요. 그러니 잘 안 되는 칸은 비워 두고, 그 칸에 해당하는 차시로 돌아가면 됩니다(표 1의 고리를 쓰세요).

4
확인 문제

두 차시를 맞대어야 풀리는 넷

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. Ⅱ-1의 B팀은 자전거 도로에서 1,600명에게 물어 6.56회라는 답을 가져왔고, Ⅱ-2의 따릉이 기록 4,385만 건은 20대를 인구 몫의 2.14배로, 70대 이상을 0.048배로 담고 있었다. 두 자료에서 ‘더 많이 모으는 것’이 고치지 못한 것이 무엇인지 한 문장으로 쓰고, 각각 어디를 고쳐야 하는지 쓰시오.
📖 모범 답안

고치지 못한 것은 편향이다. 사람 수는 흩어짐만 줄인다 — Ⅱ-1에서 B팀의 치우침은 16배를 물은 뒤 오히려 +5.251에서 +5.372로 커졌고, 줄어든 것은 흩어짐(0.544 → 0.119)뿐이었다.

고칠 곳은 계산이 아니라 수집이다. Ⅱ-1은 뽑는 방법(표집 틀과 응답)을 고쳐야 한다 — 자전거 도로에 선 채로는 자전거를 타지 않는 사람이 애초에 잡히지 않는다. Ⅱ-2는 가중치로 담긴 목소리를 키울 수는 있어도 담기지 않은 사람을 만들지는 못한다 — 따릉이를 한 번도 타지 않은 사람은 기록에 없으므로, 그들을 말하려면 모집단 자료나 설문 같은 다른 자료를 함께 써야 한다.

2. 아래 네 자리는 Ⅱ 단원에서 답이 갈린 자리다. 자리마다 무엇을 고르면 답이 움직이는지와 보고서에 무엇을 함께 적어야 하는지를 표에 채우시오. 그리고 네 줄을 관통하는 공통점을 한 문장으로 쓰시오.
자리답을 옮기는 선택보고서에 적을 것
Ⅱ-4 빈칸
Ⅱ-5 튀는 값
Ⅱ-7 그림의 축
Ⅱ-11 표 잇기
📖 모범 답안

표 — Ⅱ-4 빈칸: 무엇을 빈칸으로 볼지와 어떻게 채울지(강수량 빈칸 206일을 빼느냐 0으로 채우느냐로 8.20mm ↔ 3.58mm) / 채우는 방법 · 분모(몇 칸을 채웠나) · 채점에 쓴 시험지.
Ⅱ-5 튀는 값: 어떤 규칙으로 찾고 어디까지 뺄지(IQR 울타리 밖 196행을 다 빼면 21.26분 → 14.40분) / 뺀 줄 수 · 기준 · 처리 전후 값.
Ⅱ-7 그림의 축: 세로축 바닥을 어디에 둘지(+1.42%가 +14.2%로 보인다) / 바닥 값과 그 까닭(자르지 않았다면 그것도 한 줄로).
Ⅱ-11 표 잇기: 어떤 열쇠로, 어떤 how 로 이을지(합이 파일 합의 1.937배가 된다) / 잇기 전후 행 수와 검산표.

공통점 — 네 자리 모두 코드가 오류를 내지 않는다. 고른 것은 사람이고, 고른 것은 결과 표에 남지 않는다. 그래서 숫자 옆에 선택과 그 까닭을 적는 것이 유일한 기록이다.

3. Ⅱ-7에서는 5월 479.0만 건과 6월 485.8만 건의 차이 +1.42%가 그림에서 +14.2%로 보였고, Ⅱ-13에서는 합격률이 남 44.5% · 여 30.4%로 남학생이 14.2%p 높았는데 학과별로 나눠 보면 여학생이 앞선 학과가 여섯 가운데 넷이었다. 두 경우 모두 계산은 하나도 틀리지 않았다. 그런데도 읽는 사람이 속는 방식이 어떻게 다른지 쓰고, 각각 무엇을 함께 실으면 속지 않는지 쓰시오.
📖 모범 답안

Ⅱ-7은 그리는 손이 만든다. 숫자는 그대로인데 세로축 바닥을 올려 앞 막대를 짧게 보이게 했다. 눈이 읽는 것은 막대의 길이 비라서, 자른 자리만으로 배수가 정해진다(막대에서는 1 ÷ (1 − f)). 데이터는 손대지 않고 표현만 부풀린 경우다. → 그림 옆에 바닥 값과 자른 까닭을 적고, 자르지 않았다면 그것도 한 줄로 적는다.

Ⅱ-13은 합치는 손이 만든다. 그림이 아니라 숫자 자체가 가중평균이다 — 합친 합격률은 학과별 합격률을 ‘누가 어느 학과에 몰렸나’로 가중한 값이라, 지원한 학과의 구성이 한 숫자에 섞여 있다. 표현이 아니라 요약의 층이 하나 접힌 경우다. → 칸별 비율과 칸의 비중을 함께 싣고, 표준화를 했다면 어느 분포를 기준으로 삼았는지 밝힌다.

차이를 한 줄로: Ⅱ-7은 같은 숫자를 다르게 보이게 했고, Ⅱ-13은 다른 숫자들을 하나로 접었다. 앞은 그림을 펴면 드러나고, 뒤는 표를 나눠야 드러난다.

4. Ⅱ-14는 같은 366일에 합리적인 선택 네 개만 바꿔 −74.6%에서 −22.1%까지 스물네 개의 답을 얻었고, 두 답 사이의 거리는 52.5%p였다. ① 이때 보고서에 숫자 하나 대신 적어야 할 네 가지를 쓰고, ② 같은 방식을 Ⅱ-5의 ‘한 번 탈 때 평균 21.26분 → 14.40분’에 적용하면 무엇을 적게 되는지 한 문단으로 쓰시오.
📖 모범 답안

① 범위 · 대푯값 · 가장 흔드는 선택 · 날 수(그 답이 몇 건 위에 섰는가). Ⅱ-14에서 범위는 −74.6% ~ −22.1%(52.5%p)이고, 가장 크게 흔든 것은 ‘비 온 날을 몇 mm로 정했나’ 하나였다. 가장 극적인 답은 가장 얇은 칸에서 나왔으므로 믿음이 낮다고 밝힌다.

② Ⅱ-5에서도 21.26분 하나만 적어서는 안 된다. 범위는 그대로 두었을 때 21.26분, IQR 울타리 밖 196행을 모두 뺐을 때 14.40분이고, 가장 흔드는 선택은 ‘울타리 밖 196행 가운데 상식으로 멀쩡한 182행을 어떻게 할 것인가’다. 대푯값은 튀는 값에 덜 끌리는 중앙값(11.5분 → 10.0분)을 함께 적고, 분모로 2,000행 가운데 몇 행을 어떤 기준으로 뺐는지를 적는다. 그러면 읽는 사람이 “7분 차이는 자료가 아니라 판정에서 나왔다”를 스스로 확인할 수 있다.

+
다음 단원으로

Ⅱ 단원이 답하지 못한 물음 셋

Ⅱ 단원은 표를 읽을 수 있게 만드는 데까지 왔습니다. 빈칸의 뜻을 읽었고, 튀는 값을 판정했고, 두 파일을 이었고, 비율을 어떻게 내느냐로 등수가 뒤집히는 것도 보았어요.

그런데 여기까지의 답은 전부 이미 일어난 일에 대한 것이었습니다. Ⅲ 단원 데이터 모델링과 평가는 같은 표로 아직 일어나지 않은 값을 맞혀 보는 자리예요. 아래 셋은 Ⅱ 단원이 열어 놓고 답하지 않은 물음입니다.

  1. 깨끗하게 만든 표로 무엇을 맞힐 수 있나?Ⅱ는 표를 설명하는 데서 멈췄다 — Ⅲ-1 「365개의 숫자를 12개로 줄이면 무엇이 남는가」부터는 그 표로 값을 예측한다.
  2. ‘잘 맞는다’는 것은 무엇으로 재나?Ⅱ-4의 채점표는 채우기 한 가지를 쟀다. Ⅲ은 모형 전체를 재는 자를 만들고, 그 자가 속는 경우까지 본다.
  3. 모델링에서도 선택이 답을 옮길까?Ⅱ-14의 스물네 가지는 준비 단계의 선택이었다. 같은 일이 모형을 고르고 평가하는 자리에서도 일어나는지 Ⅲ에서 확인한다.