단원 홈
4단원 · 마무리 · 한 학기의 끝

만든 것을 두고 무엇을 말할 수 있는가

이 단원에서 여러분은 처음으로 만드는 쪽에 섰습니다. 주제를 고르고, 데이터를 구하고, 모델을 만들고, 성능을 쪼개어 보고, 카드에 적어 내놓았죠. 그 과정에서 가장 많이 배운 것은 아마 잘된 것보다 안 된 것일 겁니다.

12인기04-01 ~ 04-04
🗺️

개념 지도

한 줄기입니다. 앞 마디의 산출물이 다음 마디의 재료가 됩니다.

🎯 주제 — 1~3차시 자를 바꾸면 1위가 바뀐다 카드 📋 계획 — 4~5차시 플랜 B 를 못 쓰면 계획이 아니다 계획서 🧪 개발 — 6~8차시 뼈대는 하나, 데이터만 바뀐다 모델 🔬 평가 9~10차시 "해도 되는 문제인가" 16 후보 중 레드라인 5 "데이터를 못 구하면?" 직접 만드는 길을 계산한다 "기준선을 넘었는가" 60.4% → 85.4% (+25.0%p) "누구의 85%인가" 밝음 96.4 · 어두움 70.0 🗣 공유회 — 11차시 모델 카드만 보고 남이 같은 결과를 낼 수 있는가 칸 하나를 지우면 답이 얼마나 흔들리나 특성 목록을 지우면 47.9% ~ 85.4% — 폭 37.5%p 그래서 한계 칸을 비우면 카드가 아니다
📋

열한 차시 한 줄 정리

숫자는 견본 데이터(페트병 사진 160장)로 돌렸을 때의 값입니다 — 지어낸 자료입니다.

차시한 줄로남는 숫자
1 자를 바꾸면 1위가 바뀐다. 순위 · 목표까지의 거리 · 개선 속도가 다른 답을 낸다. OECD 20개국 × 지표 8 (세계은행 WDI)
2 세 조건에 네 번째를 더한다 — 우리가 학기 안에 할 수 있는가. 후보 16 중 레드라인 5 · 점수 1등이 손대면 안 되는 주제였다
3 큰 말은 좁혀야 시작할 수 있다. 중요도와 다룰 수 있는 정도, 두 축으로. 카드 10장 중 오른쪽 위 1장
4 공개 데이터가 없으면 직접 만든다. 몇 명 × 몇 문항 × 며칠인지 계산한다. 견본 20행 × 6열 · 심어 둔 흠 4개
5 플랜 B 를 못 쓰면 계획이 아니다. 무너지는 곳은 대개 데이터다. 카드 넘김 세 갈래 — 어느 쪽으로 와도 캔버스가 비지 않는다
6 여기서 만든 뼈대를 네 차시가 그대로 다시 쓴다. 바뀌는 것은 데이터뿐. 160행 → 정제 158 → 훈련 110 / 테스트 48
7 정확도는 홀로는 뜻이 없다. 기준선과의 차이로만 읽힌다. 기준선 60.4% → k=7 85.4% (+25.0%p)
8 가장 위험한 버그는 돌긴 도는데 값이 틀리는 것이다. ㄱ만 고치면 k 일곱 개가 전부 100.0% — 그게 신호다
9 "전체 85.4%"는 누구의 85.4%인가. 밝음 96.4% · 어두움 70.0% — 그 집단 기준선 대비 +5.0%p
10 한 번에 하나만 바꾸고 한 줄 남긴다. 성능이 내려간 줄도 지우지 않는다. 특성만 늘렸더니 −2.1%p · k만 키웠더니 +10.4%p
11 모델 카드만 보고 남이 같은 결과를 낼 수 있는가가 시험이다. 특성 목록을 지우면 47.9% ~ 85.4% — 폭 37.5%p
🔢

이 단원이 남긴 숫자 여섯

전부 견본 데이터에서 나온 ② 계산입니다. 가정이 바뀌면 값도 바뀝니다.

5 / 16
후보 주제 열여섯 가운데 손대면 안 되는 것. 게다가 점수만으로 뽑은 1등이 그중 하나였다 — 점수는 그것을 가려내지 못한다.
+25.0 %p
우리 모델이 기준선을 넘은 폭(60.4% → 85.4%). 이 차이가 없으면 모델을 만든 뜻이 없다.
96.4 / 70.0
밝은 사진과 어두운 사진에서의 정확도. 어두움 집단에서는 그 집단 기준선을 +5.0%p밖에 못 넘는다.
100.0 %
k=7 의 정밀도. 자랑처럼 보이지만 대신 7개를 놓쳤다(재현율 75.9%). 하나가 좋으면 하나가 나쁘다.
−2.1 %p
특성을 둘에서 다섯으로 늘렸더니 오히려 내려간 폭. 더 많은 정보가 늘 더 나은 것은 아니다.
37.5 %p
모델 카드에서 쓴 특성 목록 한 칸을 지웠을 때 남이 낼 수 있는 값의 폭(47.9% ~ 85.4%). 카드의 칸마다 이런 폭이 있다.
⚠️

프로젝트가 무너지는 자리 넷

다음에 또 하게 된다면, 여기서 막힐 겁니다. 미리 알아 두세요.

① 주제가 너무 크다

'기후 위기 해결' 같은 말로는 첫 줄을 못 씁니다. 무엇을 입력으로 받아 무엇을 맞힐지가 한 문장으로 안 나오면 아직 좁힌 것이 아닙니다. 3차시의 두 축을 다시 쓰세요 — 중요한데 못 하는 것은 올해 할 일이 아닙니다.

② 데이터가 없다 — 가장 흔한 실패

주제를 정한 뒤에 데이터를 찾으면 늦습니다. 4차시에서 본 대로 데이터가 있는지부터 확인하고 주제를 고르는 편이 낫습니다. 정 없으면 직접 만드세요 — 우리 반 30명 × 3문항 × 10일이면 300행입니다.

③ 조용히 틀리는 버그를 못 찾는다

오류가 나면 오히려 다행입니다. 8차시에서 본 대로 돌긴 도는데 값이 틀리는 것이 가장 위험합니다. "정확도가 갑자기 100%가 됐다"는 성공 신호가 아니라 버그 신호인 경우가 많습니다. 검산 규칙을 미리 정해 두세요.

④ 전체 성능만 보고 끝낸다

9차시에서 확인했듯 전체 한 줄은 최악의 집단을 감춥니다. 그리고 집단이 작으면 숫자가 크게 튑니다 — 3명 중 2명이라 67%인 것을 성능이라 부르면 안 됩니다. 집단 크기를 표에 함께 적으세요.

✍️

서·논술형 자기 점검

먼저 스스로 써 본 뒤에 예시 답안을 여세요.

1. 어떤 팀이 "우리 모델은 정확도 92%"라고 발표했습니다. 여러분이 상호평가자라면 무엇을 더 물어야 하는지 세 가지를 쓰고, 각각 이 단원의 어느 차시에서 배운 것인지 밝히시오. 12인기04-04

📖 예시 답안 ① "기준선은 몇 %인가요?"(7차시) — 늘 한쪽만 답하는 모델이 이미 90%를 받는 문제라면 92%는 아무 뜻이 없다. 우리 견본에서도 기준선 60.4%를 알아야 85.4%가 +25.0%p로 읽혔다.
② "집단별로 쪼개면 어떻게 되나요?"(9차시) — 전체 한 줄은 최악의 집단을 감춘다. 우리 모델은 전체 85.4%인데 어두운 사진에서는 70.0%였고, 그 집단의 기준선(65.0%)과 견주면 +5.0%p밖에 안 됐다. 집단 크기도 함께 물어야 한다 — 작으면 숫자가 튄다.
③ "테스트가 몇 개인가요? 훈련 정확도인가요 테스트 정확도인가요?"(6·7차시) — 테스트가 열 개면 가능한 값이 10% 단위로만 나온다. 그리고 훈련 정확도라면 92%는 외운 것일 수 있다.
덧붙여 "정밀도와 재현율은 어떤가요?"(Ⅱ-12)도 좋다. 우리 모델은 정밀도 100.0%였지만 대신 일곱 개를 놓쳤다(재현율 75.9%).

2. 모델 카드에서 「한계와 쓰면 안 되는 곳」 칸을 비운 팀이 있습니다. 11차시의 재현 시험 결과를 근거로, 그 칸이 왜 필요한지 설명하시오. 12인기04-03 · 04-04

📖 예시 답안 모델 카드가 하는 일은 자랑이 아니라 남이 같은 결과를 다시 낼 수 있게 하는 것이다. 11차시에서 칸을 하나씩 지우고 실제로 재 봤더니, 「쓴 특성 목록」을 지우자 남이 낼 수 있는 값이 47.9%에서 85.4%까지 벌어졌다 — 폭이 37.5%포인트다. 「데이터」나 「집단 열」을 지우면 아예 돌릴 수도 없다. 곧 카드의 칸은 장식이 아니라 재현에 꼭 필요한 정보다.
「한계와 쓰면 안 되는 곳」은 그중에서도 특별하다. 다른 칸이 "어떻게 만들었나"를 적는다면 이 칸은 "어디에 쓰면 안 되나"를 적는다. 우리 모델은 어두운 사진에서 기준선을 겨우 5%포인트 넘었으므로, 어두운 곳에서 쓰면 안 된다고 카드에 적어야 한다. 그것을 비우면 읽는 사람이 모든 상황에서 85.4%인 줄 안다. 그때 카드는 정보가 아니라 오해를 만드는 종이가 된다.

3. 이 프로젝트를 한 학기 더 한다면 무엇부터 다시 하겠습니까? 무너지는 자리 넷 중 하나를 골라, 구체적으로 무엇을 언제 하겠다는 계획으로 쓰시오. 12인기04-02 · 04-03

📖 예시 답안 데이터부터 다시 하겠다. 우리 팀은 주제를 먼저 정하고 데이터를 찾았는데, 찾다 보니 공개된 것이 없어 2주를 잃었다. 4차시의 판정기를 그때 썼다면 「공개돼 있나」에서 바로 걸렸을 것이다.
다시 한다면 순서를 바꾸겠다. ① 첫 주에 후보 주제 다섯 개에 대해 데이터가 있는지부터 확인한다(4차시 판정기 네 조건). ② 둘째 주에 데이터가 확인된 것만 남겨 3차시의 두 축에 올린다. ③ 공개 데이터가 없으면 직접 만든다 — 우리 반 30명에게 3문항씩 10일 걷으면 300행이고, 테스트 20개는 충분히 나온다(6차시 규칙).
그리고 플랜 B를 먼저 쓰겠다. 5차시에서 플랜 B를 계획서 맨 끝에 썼는데, 사실은 맨 앞에 써야 했다. 무너질 자리를 알고 시작하는 것과 무너진 뒤에 찾는 것은 다르다.
📊

성취기준 자가 평가

이 단원은 만든 것이 있으니, 그것을 보며 고르세요.

12인기04-01  인공지능으로 풀 수 있는 문제를 찾고, 손대면 안 되는 문제인지 가려 주제를 좁힐 수 있다.

12인기04-02  데이터를 어디서 어떻게 구할지 정하고, 플랜 B가 든 계획서를 쓸 수 있다.

12인기04-03  팀으로 데이터를 다듬고 모델을 만들며, 서로의 코드를 검산해 버그를 함께 고칠 수 있다.

12인기04-04  성능을 집단별로 쪼개어 재고, 실험 기록과 모델 카드로 남겨 개선할 수 있다.

🎓

한 학기를 닫으며 — 48차시를 돌아보면

네 단원이 각각 다른 물음에 답했습니다.

🎯 한 학기가 남긴 습관

외운 지식보다 다음에 비슷한 것을 만났을 때 하게 되는 행동이 남습니다. 이 교과서가 남기려 한 것은 넷입니다.

  • 숫자를 들으면 되묻는다 — "몇 명에게 쓰나요?" "기준선은 얼마인가요?" "누구의 성능인가요?" "그건 무엇을 가정한 값인가요?"
  • 먼저 예측하고 나서 돌린다 — 빗나간 자리가 아직 이해가 덜 된 자리입니다.
  • 안 되는 것을 말한다 — 모델 카드의 한계 칸, 실험 기록의 실패한 줄, 발표에서 감추지 않은 것. 그것이 신뢰를 만듭니다.
  • 할 수 있는가와 해도 되는가를 따로 묻는다 — 이 둘을 섞지 않는 것이 3단원과 4단원이 함께 가르친 것입니다.
ℹ️ 더 가고 싶다면

이 교과서의 코드는 전부 남의 라이브러리 없이 순수 파이썬이었습니다. 원리를 보이려고 그렇게 했어요. 다음 단계는 그 원리를 그대로 두고 도구를 바꾸는 것입니다 — 같은 k-NN을 scikit-learn으로 두 줄에, 같은 신경망을 PyTorch로 열 줄에 쓸 수 있습니다. 그때도 물음은 같습니다: 기준선을 넘었는가, 누구의 성능인가, 한계는 무엇인가. 도구는 바뀌어도 그 물음은 안 바뀝니다.