우리는 무엇을 했고, 무엇이 손에 남았나
Ⅳ 단원에는 새 도구가 많지 않았습니다. 회귀도 나무도 Ⅲ 단원에서 이미 만났고, pandas 와 matplotlib 은 Ⅱ 단원에서 손에 쥐었어요. 이 단원이 새로 가르친 것은 도구 밖의 일입니다 — 질문과 표를 맞추는 일, 비교의 조건을 맞추는 일, 막혔을 때 무엇을 바꿀지 정하는 일, 그리고 낸 숫자에 경계를 새기는 일.
그래서 되돌아보기도 '무엇을 배웠나'가 아니라 차시마다 써 온 세 칸으로 합니다 — 찾은 것 · 도구의 한계 · 보고의 규칙. 열한 장의 일지를 단원 하나로 겹쳐 놓으면 이렇게 됩니다.
- 찾은 것
같은 두 열이 −0.158 이 되기도 하고 +0.854 가 되기도 했다(Ⅳ-4). 바뀐 것은 자료가 아니라 축이었고, 도일 전처리를 더하자 R² 가 0.01 에서 0.849 까지 올랐다(Ⅳ-5).
- 도구의 한계
LinearRegression은 기준 온도를 정해 주지 않고,train_test_split은 목적을 모른 채 섞으며, 부호 섞기는 ‘딱지가 뜻이 없다’는 가정 하나만 흉내 낸다. 도구는 계산을 대신할 뿐 결정을 대신하지 않는다. - 보고의 규칙
한 숫자에는 단위 · 범위 · 조건 · 모르는 날 네 칸을, 비교에는 네 레인(재료 · 나누기 · 잣대 · 물음)을, 결론에는 옮겨 말할 수 있는 경계를 적는다.
규칙이 단원이 만든 산출물 열하나는 모두 ‘무엇을 했다’ 옆에 ‘무엇은 못 했다’가 함께 적힌 문서다. 뒤 칸이 비어 있으면 아직 덜 쓴 것이다.
여덟 걸음으로 되짚는 열한 차시
차시 이름을 누르면 그 쪽으로 돌아갑니다. 남는 숫자 칸은 그 차시의 실행 칸이 실제로 찍은 값이에요 — 외울 숫자가 아니라, 그 한 줄이 어디서 나왔는지를 되짚는 손잡이입니다.
| 차시 | 한 줄로 | 남는 숫자 |
|---|---|---|
| Ⅳ-1 | 사례는 여섯 칸이 아니라 일곱 칸으로 읽는다 — 일곱째가 ‘수용’이다. | 392 → 355곳 · 바 구역 몫 5% → 35% |
| Ⅳ-2 | 답할 수 있는 질문을 가르는 것은 자료의 양이 아니라 한 행의 알갱이다. | 질문 10 가운데 5 |
| Ⅳ-4 | 관계가 없어 보인 것은 관계가 없어서가 아니라 축이 하나였기 때문이다. | −0.158 → +0.854 (16℃에서 접은 뒤) |
| Ⅳ-5 | 한 숫자를 내놓을 때는 단위 · 범위 · 조건 · 모르는 날을 함께 적는다. | +1,454MW (기준 17~19℃ 면 1,285~1,636) |
| Ⅳ-7 | ‘가장 적절한 모델’은 고르는 것이 아니라 약점을 겨눠 짓는 것이다. | 검증 2,158 · 시험 2,490MW (한 번만) |
| Ⅳ-9 | 차이가 우연인지 묻는 일은 딱지를 섞어 그 가정의 세상을 만들어 보는 일이다. | 5,000번 가운데 0번 |
| Ⅳ-10 | 기록은 위에서 잘린다 — 쓴 양은 필요한 양이 아니다. | 0.96 대 1.36 MWh/℃ |
| Ⅳ-11 | 질문도 점수도 자료다 — 세어 보면 가장 약한 고리가 보인다. | 질문 카드 57장 · 자기−동료 +0.8점 |
여덟 줄이 성취기준 다섯을 모두 지난다 — 04-01(Ⅳ-1 · Ⅳ-2) · 04-02(Ⅳ-4) · 04-03(Ⅳ-5 · Ⅳ-7) · 04-04(Ⅳ-9) · 04-05(Ⅳ-10 · Ⅳ-11). 빠진 셋(Ⅳ-3 첫 20분 · Ⅳ-6 두 방법 겨루기 · Ⅳ-8 막힘 기록)은 이 여덟 줄이 설 수 있게 한 받침이라 단원 홈의 차시 목록에서 다시 볼 수 있다. 자료: 각 차시의 실행 칸 출력과 원장 값 그대로
다섯 기준, 스스로 짚어 보기
아래 체크는 이 기기에만 남습니다 — 선생님께 가지 않아요. 점수를 매기려는 것이 아니라 아직 흐릿한 줄이 어디인지만 보려는 것입니다. 켜지지 않는 줄이 있으면 줄 끝에 적힌 차시로 돌아가면 됩니다.
네 문제 — 두 차시를 맞대어 보는 자리
차시 안에서는 한 차시의 물음에 답했습니다. 여기서는 떨어져 있던 두 차시를 맞대야 답이 나오는 것만 골랐어요. 답을 쓰기 전에 그 차시로 돌아가 숫자를 확인해도 좋습니다 — 표 1 의 차시 이름이 고리입니다.
✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.
① 쓴 양 쪽이다. 전력거래소 표에 실린 수요는 실제로 흘러간 전력이고, 더워서 켜고 싶었지만 못 켠 몫은 애초에 기록되지 않는다.
② 낮게 틀린다. Ⅳ-10 의 가상 도시에서 기록은 쓴 양 = min(필요, 한도) 로 위에서 잘렸고,
잘린 자료로 맞춘 기울기 0.96 은 참값 1.36 보다 누웠다. 같은 구조가 전국 표에도 있으므로
+1,454MW 를 ‘필요’로 읽으면 실제 필요보다 작게 잡는 쪽으로 틀린다. 그리고 그 차이는 아무에게나 고르게 오지 않는다 —
못 쓴 몫의 61.0% 가 가구의 25%인 소득 하 집단에 몰렸다.
③ 예: “2018~2025년 여름 평일, 냉방도일이 1 늘 때 전국 하루 평균 실제 수요가 약 1,454MW 많았다 (기준 18℃; 17~19℃ 로 바꾸면 1,285~1,636MW). 이는 쓴 전기이며, 더위에 전기를 못 쓴 몫은 포함하지 않는다.” — Ⅳ-5 의 네 칸(단위 · 범위 · 조건 · 모르는 날) 가운데 ‘모르는 날’ 칸이 곧 Ⅳ-10 의 발견을 담는 자리다.
피해야 할 답은 둘이다 — ㉮ “필요보다 크게 잡는다”처럼 방향을 반대로 쓴 답, ㉯ ‘쓴 양과 필요가 다르다’만 적고 어느 쪽으로 틀리는지와 누가 잘려 나가는지를 빠뜨린 답.
| 차시 | 쓴 도구 | ㉮ 대신해 준 것 | ㉯ 끝내 알려 주지 않은 것 |
|---|---|---|---|
| Ⅳ-5 | LinearRegression | ||
| Ⅳ-6 | train_test_split | ||
| Ⅳ-9 | 부호 섞기 |
Ⅳ-5 · LinearRegression — ㉮ 여러 열을 한꺼번에 받아 계수를 가장 작은 제곱오차로 풀어 준다(손으로 풀던 식과 한 번 대조했다). ㉯ 기준 온도를 무엇으로 둘지, 모양이 직선이 맞는지, 계수가 얼마나 흔들리는지는 말하지 않는다 — 기준을 17~19℃ 로 옮기면 답이 1,285 ~ 1,636MW 로 1.27배 흔들린다.
Ⅳ-6 · train_test_split — ㉮ 자료를 훈련과 시험으로 한 줄로 갈라 준다.
㉯ 기본값이 섞기라는 것과, 그 섞기가 ‘미래를 맞힌다’는 우리 물음과 어긋난다는 것은 말해 주지 않는다.
mean_absolute_error 도 크기만 재고 방향(치우침)을 버려, 2,681 대 2,635MW 로 비슷해 보이던 두 방법이
치우침에서는 −1,197 대 −358 로 갈렸다.
Ⅳ-9 · 부호 섞기 — ㉮ ‘우연이라면 이만큼 벌어질까’를 5,000번 다시 살아 보게 해 준다(0번). ㉯ 왜 벌어졌는지는 말하지 않는다. 흉내 내는 가정은 ‘딱지가 뜻이 없다’ 하나뿐이라, 그 가정이 흔들렸다는 말은 되어도 무엇이 흔들었는지(태양광인지 다른 것인지)는 남는다.
가장 위험한 하나(예) — “Ⅳ-9 가 원인을 말하지 않는다는 점. 우리 보고서의 문장이 ‘맑은 날에는 한낮 수요가 준다’에서 ‘태양광 때문에 준다’로 한 발만 미끄러져도, 계산이 전혀 다루지 않은 주장을 계산의 권위로 말하게 된다.” Ⅳ-5 를 고른 답도 좋다 — “기준 온도는 내가 고른 것인데 보고서에는 결과만 남기 쉽다.”
피해야 할 답은 ㉯ 칸에 도구의 사용법을 적은 답이다(“옵션을 잘 몰라서” 같은). 여기 적을 것은 도구가 원리상 대답할 수 없는 것이다.
① 둘 다 첫 숫자를 ‘자료가 말한 것’으로 받지 않았다. 첫 숫자는 자료만의 결과가 아니라 자료 + 내가 고른 틀의 결과다 — Ⅳ-4 의 틀은 ‘직선 하나로 잰다’였고, Ⅳ-8 의 틀은 ‘맑은 날 전부와 흐린 날 전부를 통째로 견준다’였다.
② 틀이 틀린 방향이 서로 반대였기 때문이다. Ⅳ-4 에서는 틀이 신호를 지우고 있었다 — V자의 두 팔이 반대로 기울어 두 몫(−0.315 · +0.156)이 서로 상쇄됐다. 그래서 축을 바꾸자 숨어 있던 관계가 드러나 주장이 커졌다. Ⅳ-8 에서는 틀이 남의 것을 섞어 넣고 있었다 — 맑은 무리와 흐린 무리는 기온부터 3.0℃ 달랐다. 그래서 주말 · 계절 · 공휴일 · 기온을 하나씩 치우자 남은 것은 더 작고 조건이 촘촘한 주장(같은 해 · 같은 달 짝 296쌍)이 되어 작아졌다.
③ 예 — (가) 그 숫자를 만든 틀을 먼저 한 줄로 적는다(무엇을 무엇과, 어떤 모양으로 견줬나). (나) 그 숫자를 크게 만들 수 있는 것과 작게 만들 수 있는 것을 각각 하나 이상 적고, 하나씩 치우거나 축을 바꿔 다시 잰다.
피해야 할 답은 “첫 숫자는 믿으면 안 된다”로 끝난 답이다. 그 말은 무엇을 해야 하는지를 말해 주지 않는다 — Ⅳ-4 는 틀을 바꿨고, Ⅳ-8 은 비교 대상을 좁혔다. 두 가지 길이 있다는 것이 이 문제의 답이다.
① 예 — “2018~2025년 여름 평일, 냉방도일이 1 늘 때 전국 하루 평균 실제 전력 수요가 약 1,454MW 많았다 (기준 18℃, 17~19℃ 로 바꾸면 1,285 ~ 1,636MW). 쓴 전기를 잰 값이며, 더위에 전기를 못 쓴 몫은 들어 있지 않다.” — Ⅳ-11 의 문장 판이 가른 세 가지(인과 · 조언 · 옮겨 말하기) 가운데 어느 쪽으로도 넘지 않았다: 원인을 말하지 않았고, 누구에게 무엇을 하라고 하지 않았으며, 잰 범위(여름 평일 · 전국 · 하루 평균)를 넓히지 않았다.
② 예 — 폭염에 에어컨을 켜지 못한 가구와 그들을 대변하는 쪽. 문장이 정확해도, 이 숫자가 정책에 쓰이는 순간 ‘여름에 필요한 전기’의 자리에 앉게 되고 그러면 못 쓴 사람의 필요는 0 으로 잡힌다. 또 지역 · 시간대가 다른 곳도 거부한다 — 전국 하루 평균은 어느 한 지역의 한낮 이야기가 아니기 때문이다.
③ 앞엣것은 ‘데이터’ 칸에서 온다. 기록 자체가 min(필요, 한도) 로 위에서 잘려 있어(Ⅳ-10),
문장을 아무리 조심해서 써도 자료가 이미 어떤 사람을 빠뜨린 채 만들어졌다.
뒤엣것은 ‘전달’ 칸이다 — 범위를 적지 않으면 읽는 쪽이 제 마음대로 넓히고, 넓게 읽힐수록 이득을 보는 구조다.
‘수용’ 칸은 이 둘이 낳은 결과이지 출발점이 아니다.
피해야 할 답은 ② 를 “모두가 좋아한다”로 끝낸 답이다. Ⅳ-1 이 가르친 대로, 거부하는 쪽이 아무도 없으면 일곱째 칸을 아직 안 읽은 것이다.
48차시가 세운 규칙 셋
Ⅰ 단원에서 우리는 기록은 있었는데 묻는 사람이 없었던 병원 이야기로 문을 열었습니다. Ⅱ 단원에서 표를 손질했고, Ⅲ 단원에서 모델을 세우고 평가했으며, Ⅳ 단원에서 그것을 하나의 프로젝트로 굴렸어요.
남는 것은 도구 목록이 아닙니다. 네 단원을 지나며 우리가 우리에게 건 규칙 셋이에요. 다음에 낯선 표를 받았을 때, 배운 함수 이름은 잊어도 이 셋은 그대로 씁니다.
- 한 숫자에는 네 칸을 붙인다 — 단위 · 범위 · 조건 · 모르는 날Ⅱ-14 에서 한 질문이 스물네 갈래로 갈리는 것을 본 뒤 Ⅳ-5 에서 규칙이 됐다. 네 칸이 없는 숫자는 읽는 쪽이 제 마음대로 넓힌다.
- 견주기 전에 레인을 맞추고, 시험은 맨 끝에 한 번 연다Ⅲ-5 에서 두 모델에게 같은 것을 묻는 법을, Ⅲ-12 에서 성적표가 여러 장일 때를 배웠고 Ⅳ-6 · Ⅳ-7 이 규칙으로 굳혔다. 재료 · 나누기 · 잣대 · 물음이 어긋난 비교는 ‘무엇이 나은가’가 아니라 ‘내가 무엇을 맞춰 주었나’를 잰다.
- 결론에는 무엇을 잰 값인지와 옮겨 말할 수 있는 경계를 새겨 내보낸다Ⅱ-2 의 “따릉이 기록은 따릉이를 타는 사람의 기록”에서 출발해 Ⅳ-10 · Ⅳ-11 에서 닫혔다. 경계를 적는 일은 겸손이 아니라, 퍼진 뒤에는 거둬들일 수 없는 것을 미리 막는 일이다.
마지막이 셋 가운데 가장 자주 어기게 되는 것은 셋째다 — 앞의 둘은 분석하는 동안 스스로 걸리지만, 셋째는 다 끝난 뒤에 어기기 때문이다. 그래서 공유회에서 받은 질문을 세는 Ⅳ-11 을 이 책의 마지막 차시에 두었다.