개념 지도
한 줄기입니다. 앞 마디의 산출물이 다음 마디의 재료가 됩니다.
열한 차시 한 줄 정리
숫자는 견본 데이터(페트병 사진 160장)로 돌렸을 때의 값입니다 — 지어낸 자료입니다.
| 차시 | 한 줄로 | 남는 숫자 |
|---|---|---|
| 1 | 자를 바꾸면 1위가 바뀐다. 순위 · 목표까지의 거리 · 개선 속도가 다른 답을 낸다. | OECD 20개국 × 지표 8 (세계은행 WDI) |
| 2 | 세 조건에 네 번째를 더한다 — 우리가 학기 안에 할 수 있는가. | 후보 16 중 레드라인 5 · 점수 1등이 손대면 안 되는 주제였다 |
| 3 | 큰 말은 좁혀야 시작할 수 있다. 중요도와 다룰 수 있는 정도, 두 축으로. | 카드 10장 중 오른쪽 위 1장 |
| 4 | 공개 데이터가 없으면 직접 만든다. 몇 명 × 몇 문항 × 며칠인지 계산한다. | 견본 20행 × 6열 · 심어 둔 흠 4개 |
| 5 | 플랜 B 를 못 쓰면 계획이 아니다. 무너지는 곳은 대개 데이터다. | 카드 넘김 세 갈래 — 어느 쪽으로 와도 캔버스가 비지 않는다 |
| 6 | 여기서 만든 뼈대를 네 차시가 그대로 다시 쓴다. 바뀌는 것은 데이터뿐. | 160행 → 정제 158 → 훈련 110 / 테스트 48 |
| 7 | 정확도는 홀로는 뜻이 없다. 기준선과의 차이로만 읽힌다. | 기준선 60.4% → k=7 85.4% (+25.0%p) |
| 8 | 가장 위험한 버그는 돌긴 도는데 값이 틀리는 것이다. | ㄱ만 고치면 k 일곱 개가 전부 100.0% — 그게 신호다 |
| 9 | "전체 85.4%"는 누구의 85.4%인가. | 밝음 96.4% · 어두움 70.0% — 그 집단 기준선 대비 +5.0%p |
| 10 | 한 번에 하나만 바꾸고 한 줄 남긴다. 성능이 내려간 줄도 지우지 않는다. | 특성만 늘렸더니 −2.1%p · k만 키웠더니 +10.4%p |
| 11 | 모델 카드만 보고 남이 같은 결과를 낼 수 있는가가 시험이다. | 특성 목록을 지우면 47.9% ~ 85.4% — 폭 37.5%p |
이 단원이 남긴 숫자 여섯
전부 견본 데이터에서 나온 ② 계산입니다. 가정이 바뀌면 값도 바뀝니다.
프로젝트가 무너지는 자리 넷
다음에 또 하게 된다면, 여기서 막힐 겁니다. 미리 알아 두세요.
① 주제가 너무 크다
'기후 위기 해결' 같은 말로는 첫 줄을 못 씁니다. 무엇을 입력으로 받아 무엇을 맞힐지가 한 문장으로 안 나오면 아직 좁힌 것이 아닙니다. 3차시의 두 축을 다시 쓰세요 — 중요한데 못 하는 것은 올해 할 일이 아닙니다.
② 데이터가 없다 — 가장 흔한 실패
주제를 정한 뒤에 데이터를 찾으면 늦습니다. 4차시에서 본 대로 데이터가 있는지부터 확인하고 주제를 고르는 편이 낫습니다. 정 없으면 직접 만드세요 — 우리 반 30명 × 3문항 × 10일이면 300행입니다.
③ 조용히 틀리는 버그를 못 찾는다
오류가 나면 오히려 다행입니다. 8차시에서 본 대로 돌긴 도는데 값이 틀리는 것이 가장 위험합니다. "정확도가 갑자기 100%가 됐다"는 성공 신호가 아니라 버그 신호인 경우가 많습니다. 검산 규칙을 미리 정해 두세요.
④ 전체 성능만 보고 끝낸다
9차시에서 확인했듯 전체 한 줄은 최악의 집단을 감춥니다. 그리고 집단이 작으면 숫자가 크게 튑니다 — 3명 중 2명이라 67%인 것을 성능이라 부르면 안 됩니다. 집단 크기를 표에 함께 적으세요.
서·논술형 자기 점검
먼저 스스로 써 본 뒤에 예시 답안을 여세요.
1. 어떤 팀이 "우리 모델은 정확도 92%"라고 발표했습니다. 여러분이 상호평가자라면 무엇을 더 물어야 하는지 세 가지를 쓰고, 각각 이 단원의 어느 차시에서 배운 것인지 밝히시오. 12인기04-04
② "집단별로 쪼개면 어떻게 되나요?"(9차시) — 전체 한 줄은 최악의 집단을 감춘다. 우리 모델은 전체 85.4%인데 어두운 사진에서는 70.0%였고, 그 집단의 기준선(65.0%)과 견주면 +5.0%p밖에 안 됐다. 집단 크기도 함께 물어야 한다 — 작으면 숫자가 튄다.
③ "테스트가 몇 개인가요? 훈련 정확도인가요 테스트 정확도인가요?"(6·7차시) — 테스트가 열 개면 가능한 값이 10% 단위로만 나온다. 그리고 훈련 정확도라면 92%는 외운 것일 수 있다.
덧붙여 "정밀도와 재현율은 어떤가요?"(Ⅱ-12)도 좋다. 우리 모델은 정밀도 100.0%였지만 대신 일곱 개를 놓쳤다(재현율 75.9%).
2. 모델 카드에서 「한계와 쓰면 안 되는 곳」 칸을 비운 팀이 있습니다. 11차시의 재현 시험 결과를 근거로, 그 칸이 왜 필요한지 설명하시오. 12인기04-03 · 04-04
「한계와 쓰면 안 되는 곳」은 그중에서도 특별하다. 다른 칸이 "어떻게 만들었나"를 적는다면 이 칸은 "어디에 쓰면 안 되나"를 적는다. 우리 모델은 어두운 사진에서 기준선을 겨우 5%포인트 넘었으므로, 어두운 곳에서 쓰면 안 된다고 카드에 적어야 한다. 그것을 비우면 읽는 사람이 모든 상황에서 85.4%인 줄 안다. 그때 카드는 정보가 아니라 오해를 만드는 종이가 된다.
3. 이 프로젝트를 한 학기 더 한다면 무엇부터 다시 하겠습니까? 무너지는 자리 넷 중 하나를 골라, 구체적으로 무엇을 언제 하겠다는 계획으로 쓰시오. 12인기04-02 · 04-03
다시 한다면 순서를 바꾸겠다. ① 첫 주에 후보 주제 다섯 개에 대해 데이터가 있는지부터 확인한다(4차시 판정기 네 조건). ② 둘째 주에 데이터가 확인된 것만 남겨 3차시의 두 축에 올린다. ③ 공개 데이터가 없으면 직접 만든다 — 우리 반 30명에게 3문항씩 10일 걷으면 300행이고, 테스트 20개는 충분히 나온다(6차시 규칙).
그리고 플랜 B를 먼저 쓰겠다. 5차시에서 플랜 B를 계획서 맨 끝에 썼는데, 사실은 맨 앞에 써야 했다. 무너질 자리를 알고 시작하는 것과 무너진 뒤에 찾는 것은 다르다.
성취기준 자가 평가
이 단원은 만든 것이 있으니, 그것을 보며 고르세요.
12인기04-01 인공지능으로 풀 수 있는 문제를 찾고, 손대면 안 되는 문제인지 가려 주제를 좁힐 수 있다.
12인기04-02 데이터를 어디서 어떻게 구할지 정하고, 플랜 B가 든 계획서를 쓸 수 있다.
12인기04-03 팀으로 데이터를 다듬고 모델을 만들며, 서로의 코드를 검산해 버그를 함께 고칠 수 있다.
12인기04-04 성능을 집단별로 쪼개어 재고, 실험 기록과 모델 카드로 남겨 개선할 수 있다.
한 학기를 닫으며 — 48차시를 돌아보면
네 단원이 각각 다른 물음에 답했습니다.
🔍 어떻게 고르는가
문제를 지도로 바꾸고 덜 뒤지는 법. 그리고 사람이 규칙을 적어 주는 길.
2단원 · 17차시🧠 어떻게 배우는가
규칙을 사람이 적는 대신 데이터에서 찾게 하기. 그리고 잘했는지 재는 법.
3단원 · 8차시⚖️ 놓으면 어떻게 되는가
규모 · 전기 · 일 · 확신도 · 공정성을 숫자로 재고, 규약을 토론으로 정하기.
4단원 · 11차시🛠 내가 만들면 어떤가
주제를 좁히고, 만들고, 쪼개어 재고, 내놓아 평가받기.
외운 지식보다 다음에 비슷한 것을 만났을 때 하게 되는 행동이 남습니다. 이 교과서가 남기려 한 것은 넷입니다.
- 숫자를 들으면 되묻는다 — "몇 명에게 쓰나요?" "기준선은 얼마인가요?" "누구의 성능인가요?" "그건 무엇을 가정한 값인가요?"
- 먼저 예측하고 나서 돌린다 — 빗나간 자리가 아직 이해가 덜 된 자리입니다.
- 안 되는 것을 말한다 — 모델 카드의 한계 칸, 실험 기록의 실패한 줄, 발표에서 감추지 않은 것. 그것이 신뢰를 만듭니다.
- 할 수 있는가와 해도 되는가를 따로 묻는다 — 이 둘을 섞지 않는 것이 3단원과 4단원이 함께 가르친 것입니다.
이 교과서의 코드는 전부 남의 라이브러리 없이 순수 파이썬이었습니다.
원리를 보이려고 그렇게 했어요. 다음 단계는 그 원리를 그대로 두고 도구를 바꾸는 것입니다 —
같은 k-NN을 scikit-learn으로 두 줄에, 같은 신경망을 PyTorch로 열 줄에 쓸 수 있습니다.
그때도 물음은 같습니다: 기준선을 넘었는가, 누구의 성능인가, 한계는 무엇인가.
도구는 바뀌어도 그 물음은 안 바뀝니다.