단원 홈

Ⅳ. 데이터 과학 프로젝트단원 마무리

열한 차시를
한 장의 보고서로

우리가 낸 숫자는 어디까지 옮겨 말할 수 있나

Ⅳ 단원은 남의 사례 한 편을 읽는 데서 시작해 공유회에서 우리 문장 한 줄을 고치는 데서 끝났습니다. 열한 차시 동안 손에 남은 것은 전력 수요를 잘 맞히는 요령이 아니라, 숫자 하나를 내놓을 때 함께 적어야 할 칸들이었어요. 여기서 그 칸들을 한자리에 모으고, 스스로 점검한 뒤 확인 문제 넷으로 이 책을 닫습니다.

  • [12데과04-01] ~ [12데과04-05]
  • 11차시Ⅳ-1 … Ⅳ-11
  • 공통 과제전국 전력 수요 8년치
  • 산출물열한 장의 기록
1
되돌아보기

우리는 무엇을 했고, 무엇이 손에 남았나

Ⅳ 단원에는 새 도구가 많지 않았습니다. 회귀도 나무도 Ⅲ 단원에서 이미 만났고, pandas 와 matplotlib 은 Ⅱ 단원에서 손에 쥐었어요. 이 단원이 새로 가르친 것은 도구 밖의 일입니다 — 질문과 표를 맞추는 일, 비교의 조건을 맞추는 일, 막혔을 때 무엇을 바꿀지 정하는 일, 그리고 낸 숫자에 경계를 새기는 일.

그래서 되돌아보기도 '무엇을 배웠나'가 아니라 차시마다 써 온 세 칸으로 합니다 — 찾은 것 · 도구의 한계 · 보고의 규칙. 열한 장의 일지를 단원 하나로 겹쳐 놓으면 이렇게 됩니다.

  1. 찾은 것

    같은 두 열이 −0.158 이 되기도 하고 +0.854 가 되기도 했다(Ⅳ-4). 바뀐 것은 자료가 아니라 축이었고, 도일 전처리를 더하자 R² 가 0.01 에서 0.849 까지 올랐다(Ⅳ-5).

  2. 도구의 한계

    LinearRegression 은 기준 온도를 정해 주지 않고, train_test_split 은 목적을 모른 채 섞으며, 부호 섞기는 ‘딱지가 뜻이 없다’는 가정 하나만 흉내 낸다. 도구는 계산을 대신할 뿐 결정을 대신하지 않는다.

  3. 보고의 규칙

    한 숫자에는 단위 · 범위 · 조건 · 모르는 날 네 칸을, 비교에는 네 레인(재료 · 나누기 · 잣대 · 물음)을, 결론에는 옮겨 말할 수 있는 경계를 적는다.

규칙이 단원이 만든 산출물 열하나는 모두 ‘무엇을 했다’ 옆에 ‘무엇은 못 했다’가 함께 적힌 문서다. 뒤 칸이 비어 있으면 아직 덜 쓴 것이다.

2
한자리에

여덟 걸음으로 되짚는 열한 차시

차시 이름을 누르면 그 쪽으로 돌아갑니다. 남는 숫자 칸은 그 차시의 실행 칸이 실제로 찍은 값이에요 — 외울 숫자가 아니라, 그 한 줄이 어디서 나왔는지를 되짚는 손잡이입니다.

표 1Ⅳ 단원이 남긴 한 줄과 숫자성취기준 다섯을 모두 지나가는 여덟 걸음
차시한 줄로남는 숫자
Ⅳ-1 사례는 여섯 칸이 아니라 일곱 칸으로 읽는다 — 일곱째가 ‘수용’이다. 392 → 355곳 · 바 구역 몫 5% → 35%
Ⅳ-2 답할 수 있는 질문을 가르는 것은 자료의 양이 아니라 한 행의 알갱이다. 질문 10 가운데 5
Ⅳ-4 관계가 없어 보인 것은 관계가 없어서가 아니라 축이 하나였기 때문이다. −0.158 → +0.854 (16℃에서 접은 뒤)
Ⅳ-5 한 숫자를 내놓을 때는 단위 · 범위 · 조건 · 모르는 날을 함께 적는다. +1,454MW (기준 17~19℃ 면 1,285~1,636)
Ⅳ-7 ‘가장 적절한 모델’은 고르는 것이 아니라 약점을 겨눠 짓는 것이다. 검증 2,158 · 시험 2,490MW (한 번만)
Ⅳ-9 차이가 우연인지 묻는 일은 딱지를 섞어 그 가정의 세상을 만들어 보는 일이다. 5,000번 가운데 0번
Ⅳ-10 기록은 위에서 잘린다 — 쓴 양은 필요한 양이 아니다. 0.96 대 1.36 MWh/℃
Ⅳ-11 질문도 점수도 자료다 — 세어 보면 가장 약한 고리가 보인다. 질문 카드 57장 · 자기−동료 +0.8점

여덟 줄이 성취기준 다섯을 모두 지난다 — 04-01(Ⅳ-1 · Ⅳ-2) · 04-02(Ⅳ-4) · 04-03(Ⅳ-5 · Ⅳ-7) · 04-04(Ⅳ-9) · 04-05(Ⅳ-10 · Ⅳ-11). 빠진 셋(Ⅳ-3 첫 20분 · Ⅳ-6 두 방법 겨루기 · Ⅳ-8 막힘 기록)은 이 여덟 줄이 설 수 있게 한 받침이라 단원 홈의 차시 목록에서 다시 볼 수 있다. 자료: 각 차시의 실행 칸 출력과 원장 값 그대로

3
스스로 점검

다섯 기준, 스스로 짚어 보기

아래 체크는 이 기기에만 남습니다 — 선생님께 가지 않아요. 점수를 매기려는 것이 아니라 아직 흐릿한 줄이 어디인지만 보려는 것입니다. 켜지지 않는 줄이 있으면 줄 끝에 적힌 차시로 돌아가면 됩니다.

4
확인 문제

네 문제 — 두 차시를 맞대어 보는 자리

차시 안에서는 한 차시의 물음에 답했습니다. 여기서는 떨어져 있던 두 차시를 맞대야 답이 나오는 것만 골랐어요. 답을 쓰기 전에 그 차시로 돌아가 숫자를 확인해도 좋습니다 — 표 1 의 차시 이름이 고리입니다.

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. Ⅳ-5 에서 우리는 냉방도일 1 당 +1,454MW 라는 숫자를 얻었습니다. Ⅳ-10 에서는 같은 도시를 두고 1℃ 당 기울기가 0.96(쓴 양)과 1.36(필요) 둘로 갈렸고요. ① +1,454MW 는 둘 가운데 어느 쪽 성격의 값인가? ② 이 숫자를 “여름에 필요한 전기”로 옮겨 말하면 어느 방향으로 틀리는가? ③ 그 사실을 보고서 한 줄 안에 어떻게 새겨 넣겠는가?
📖 모범 답안

① 쓴 양 쪽이다. 전력거래소 표에 실린 수요는 실제로 흘러간 전력이고, 더워서 켜고 싶었지만 못 켠 몫은 애초에 기록되지 않는다.

② 낮게 틀린다. Ⅳ-10 의 가상 도시에서 기록은 쓴 양 = min(필요, 한도) 로 위에서 잘렸고, 잘린 자료로 맞춘 기울기 0.96 은 참값 1.36 보다 누웠다. 같은 구조가 전국 표에도 있으므로 +1,454MW 를 ‘필요’로 읽으면 실제 필요보다 작게 잡는 쪽으로 틀린다. 그리고 그 차이는 아무에게나 고르게 오지 않는다 — 못 쓴 몫의 61.0% 가 가구의 25%인 소득 하 집단에 몰렸다.

③ 예: “2018~2025년 여름 평일, 냉방도일이 1 늘 때 전국 하루 평균 실제 수요가 약 1,454MW 많았다 (기준 18℃; 17~19℃ 로 바꾸면 1,285~1,636MW). 이는 쓴 전기이며, 더위에 전기를 못 쓴 몫은 포함하지 않는다.” — Ⅳ-5 의 네 칸(단위 · 범위 · 조건 · 모르는 날) 가운데 ‘모르는 날’ 칸이 곧 Ⅳ-10 의 발견을 담는 자리다.

피해야 할 답은 둘이다 — ㉮ “필요보다 크게 잡는다”처럼 방향을 반대로 쓴 답, ㉯ ‘쓴 양과 필요가 다르다’만 적고 어느 쪽으로 틀리는지와 누가 잘려 나가는지를 빠뜨린 답.

2. 도구 가계부. 이 단원에서 쓴 도구 셋에 대해, 도구가 대신해 준 것과 도구가 끝내 알려 주지 않은 것을 표에 채우시오. 그리고 표 아래에, 셋 가운데 우리 팀 분석에서 가장 위험했을 ‘알려 주지 않은 것’ 하나를 고르고 그 까닭을 쓰시오.
차시쓴 도구㉮ 대신해 준 것㉯ 끝내 알려 주지 않은 것
Ⅳ-5LinearRegression
Ⅳ-6train_test_split
Ⅳ-9부호 섞기
📖 모범 답안

Ⅳ-5 · LinearRegression — ㉮ 여러 열을 한꺼번에 받아 계수를 가장 작은 제곱오차로 풀어 준다(손으로 풀던 식과 한 번 대조했다). ㉯ 기준 온도를 무엇으로 둘지, 모양이 직선이 맞는지, 계수가 얼마나 흔들리는지는 말하지 않는다 — 기준을 17~19℃ 로 옮기면 답이 1,285 ~ 1,636MW 로 1.27배 흔들린다.

Ⅳ-6 · train_test_split — ㉮ 자료를 훈련과 시험으로 한 줄로 갈라 준다. ㉯ 기본값이 섞기라는 것과, 그 섞기가 ‘미래를 맞힌다’는 우리 물음과 어긋난다는 것은 말해 주지 않는다. mean_absolute_error 도 크기만 재고 방향(치우침)을 버려, 2,681 대 2,635MW 로 비슷해 보이던 두 방법이 치우침에서는 −1,197 대 −358 로 갈렸다.

Ⅳ-9 · 부호 섞기 — ㉮ ‘우연이라면 이만큼 벌어질까’를 5,000번 다시 살아 보게 해 준다(0번). ㉯ 왜 벌어졌는지는 말하지 않는다. 흉내 내는 가정은 ‘딱지가 뜻이 없다’ 하나뿐이라, 그 가정이 흔들렸다는 말은 되어도 무엇이 흔들었는지(태양광인지 다른 것인지)는 남는다.

가장 위험한 하나(예) — “Ⅳ-9 가 원인을 말하지 않는다는 점. 우리 보고서의 문장이 ‘맑은 날에는 한낮 수요가 준다’에서 ‘태양광 때문에 준다’로 한 발만 미끄러져도, 계산이 전혀 다루지 않은 주장을 계산의 권위로 말하게 된다.” Ⅳ-5 를 고른 답도 좋다 — “기준 온도는 내가 고른 것인데 보고서에는 결과만 남기 쉽다.”

피해야 할 답은 ㉯ 칸에 도구의 사용법을 적은 답이다(“옵션을 잘 몰라서” 같은). 여기 적을 것은 도구가 원리상 대답할 수 없는 것이다.

3. Ⅳ-4 의 첫 숫자는 −0.158(기온과 수요의 상관계수)이었고, 우리는 그것을 ‘관계 없음’으로 받지 않고 16℃에서 접어 +0.854 를 찾아냈습니다. Ⅳ-8 의 첫 숫자는 6,243MW(맑은 봄 한낮이 더 낮다)였고, 우리는 그것을 결론으로 받지 않고 설명 후보 넷을 하나씩 치워 296쌍만 남겼습니다. ① 두 장면에서 첫 숫자를 대한 태도는 어떻게 같은가? ② 그런데 결과는 반대였다 — 한쪽은 주장이 커졌고 한쪽은 작아졌다. 무엇이 이 차이를 만들었는가? ③ 우리 팀 프로젝트에서 ‘첫 숫자’를 만났을 때 할 일을 두 줄로 쓰시오.
📖 모범 답안

① 둘 다 첫 숫자를 ‘자료가 말한 것’으로 받지 않았다. 첫 숫자는 자료만의 결과가 아니라 자료 + 내가 고른 틀의 결과다 — Ⅳ-4 의 틀은 ‘직선 하나로 잰다’였고, Ⅳ-8 의 틀은 ‘맑은 날 전부와 흐린 날 전부를 통째로 견준다’였다.

② 틀이 틀린 방향이 서로 반대였기 때문이다. Ⅳ-4 에서는 틀이 신호를 지우고 있었다 — V자의 두 팔이 반대로 기울어 두 몫(−0.315 · +0.156)이 서로 상쇄됐다. 그래서 축을 바꾸자 숨어 있던 관계가 드러나 주장이 커졌다. Ⅳ-8 에서는 틀이 남의 것을 섞어 넣고 있었다 — 맑은 무리와 흐린 무리는 기온부터 3.0℃ 달랐다. 그래서 주말 · 계절 · 공휴일 · 기온을 하나씩 치우자 남은 것은 더 작고 조건이 촘촘한 주장(같은 해 · 같은 달 짝 296쌍)이 되어 작아졌다.

③ 예 — (가) 그 숫자를 만든 틀을 먼저 한 줄로 적는다(무엇을 무엇과, 어떤 모양으로 견줬나). (나) 그 숫자를 크게 만들 수 있는 것과 작게 만들 수 있는 것을 각각 하나 이상 적고, 하나씩 치우거나 축을 바꿔 다시 잰다.

피해야 할 답은 “첫 숫자는 믿으면 안 된다”로 끝난 답이다. 그 말은 무엇을 해야 하는지를 말해 주지 않는다 — Ⅳ-4 는 틀을 바꿨고, Ⅳ-8 은 비교 대상을 좁혔다. 두 가지 길이 있다는 것이 이 문제의 답이다.

4. 우리 결론을 한 문장으로 바깥에 내보냅니다. Ⅳ-11 에서 본 대로, 기사에서 부푼 문장의 91% 는 신문사가 아니라 보도자료에서 시작합니다. ① 부풀리지 않은 한 문장을 쓰시오(무엇을 잰 값인지 · 언제 · 어디서 · 무엇은 들어 있지 않은지가 문장 안에 있어야 한다). ② 그렇게 적어도 여전히 거부할 사람이 있다면 누구인가? ③ 그 거부는 Ⅳ-1 의 일곱 칸(질문 · 데이터 · 비교 · 행동 · 검증 · 전달 · 수용) 가운데 어느 칸에서 오는지 쓰시오.
📖 모범 답안

① 예 — “2018~2025년 여름 평일, 냉방도일이 1 늘 때 전국 하루 평균 실제 전력 수요가 약 1,454MW 많았다 (기준 18℃, 17~19℃ 로 바꾸면 1,285 ~ 1,636MW). 쓴 전기를 잰 값이며, 더위에 전기를 못 쓴 몫은 들어 있지 않다.” — Ⅳ-11 의 문장 판이 가른 세 가지(인과 · 조언 · 옮겨 말하기) 가운데 어느 쪽으로도 넘지 않았다: 원인을 말하지 않았고, 누구에게 무엇을 하라고 하지 않았으며, 잰 범위(여름 평일 · 전국 · 하루 평균)를 넓히지 않았다.

② 예 — 폭염에 에어컨을 켜지 못한 가구와 그들을 대변하는 쪽. 문장이 정확해도, 이 숫자가 정책에 쓰이는 순간 ‘여름에 필요한 전기’의 자리에 앉게 되고 그러면 못 쓴 사람의 필요는 0 으로 잡힌다. 또 지역 · 시간대가 다른 곳도 거부한다 — 전국 하루 평균은 어느 한 지역의 한낮 이야기가 아니기 때문이다.

③ 앞엣것은 ‘데이터’ 칸에서 온다. 기록 자체가 min(필요, 한도) 로 위에서 잘려 있어(Ⅳ-10), 문장을 아무리 조심해서 써도 자료가 이미 어떤 사람을 빠뜨린 채 만들어졌다. 뒤엣것은 ‘전달’ 칸이다 — 범위를 적지 않으면 읽는 쪽이 제 마음대로 넓히고, 넓게 읽힐수록 이득을 보는 구조다. ‘수용’ 칸은 이 둘이 낳은 결과이지 출발점이 아니다.

피해야 할 답은 ② 를 “모두가 좋아한다”로 끝낸 답이다. Ⅳ-1 이 가르친 대로, 거부하는 쪽이 아무도 없으면 일곱째 칸을 아직 안 읽은 것이다.

+
이 책을 마치며

48차시가 세운 규칙 셋

Ⅰ 단원에서 우리는 기록은 있었는데 묻는 사람이 없었던 병원 이야기로 문을 열었습니다. Ⅱ 단원에서 표를 손질했고, Ⅲ 단원에서 모델을 세우고 평가했으며, Ⅳ 단원에서 그것을 하나의 프로젝트로 굴렸어요.

남는 것은 도구 목록이 아닙니다. 네 단원을 지나며 우리가 우리에게 건 규칙 셋이에요. 다음에 낯선 표를 받았을 때, 배운 함수 이름은 잊어도 이 셋은 그대로 씁니다.

  1. 한 숫자에는 네 칸을 붙인다 — 단위 · 범위 · 조건 · 모르는 날Ⅱ-14 에서 한 질문이 스물네 갈래로 갈리는 것을 본 뒤 Ⅳ-5 에서 규칙이 됐다. 네 칸이 없는 숫자는 읽는 쪽이 제 마음대로 넓힌다.
  2. 견주기 전에 레인을 맞추고, 시험은 맨 끝에 한 번 연다Ⅲ-5 에서 두 모델에게 같은 것을 묻는 법을, Ⅲ-12 에서 성적표가 여러 장일 때를 배웠고 Ⅳ-6 · Ⅳ-7 이 규칙으로 굳혔다. 재료 · 나누기 · 잣대 · 물음이 어긋난 비교는 ‘무엇이 나은가’가 아니라 ‘내가 무엇을 맞춰 주었나’를 잰다.
  3. 결론에는 무엇을 잰 값인지와 옮겨 말할 수 있는 경계를 새겨 내보낸다Ⅱ-2 의 “따릉이 기록은 따릉이를 타는 사람의 기록”에서 출발해 Ⅳ-10 · Ⅳ-11 에서 닫혔다. 경계를 적는 일은 겸손이 아니라, 퍼진 뒤에는 거둬들일 수 없는 것을 미리 막는 일이다.

마지막이 셋 가운데 가장 자주 어기게 되는 것은 셋째다 — 앞의 둘은 분석하는 동안 스스로 걸리지만, 셋째는 다 끝난 뒤에 어기기 때문이다. 그래서 공유회에서 받은 질문을 세는 Ⅳ-11 을 이 책의 마지막 차시에 두었다.