지난 시간에 팀마다 주제를 한 줄로 좁혔습니다. 그런데 그 인공지능에게
무엇을 보여 줄 것인가 — 그 자료는 정말 우리 손에 들어옵니까?
오늘은 후보를 네 잣대로 재고, 안 나오면 우리가 만들면 몇 행이 되는지를 계산합니다.
성취기준 12인기04-02
데이터를 구하는 세 길수집 가능성 판정개인정보 관문첫인상 보고서규격 70행이름표 값
🎯 학습 목표
데이터를 구하는 세 길(직접 모으기 · 공개 데이터 · 공개 데이터셋)과
각각이 요구하는 대가를 대고, 우리 팀 후보를 네 잣대로 재어 판정할 수 있다.
개인정보는 점수가 아니라 관문이라는 규칙을 세우고,
합계 점수가 높아도 멈춰야 하는 후보를 내 손으로 만들어 보일 수 있다.
구한 자료의 첫인상 보고서를 돌려 행 · 열 · 빈칸 · 이상한 값을 찾고,
이 자료로 모델을 만들 수 있는지를 규격 표로 판정할 수 있다.
🤔
여는 장면 — 계획서보다 먼저 무너지는 것
지난 시간 팀마다 카드 한 장에 주제를 적었습니다. “급식 잔반을 줄이자”,
“분리수거장의 페트병을 가려내자”, “우리 학교 등굣길 미세먼지를 알려 주자”.
좋은 주제들입니다. 그런데 프로젝트가 실제로 무너지는 자리는 주제가 아닙니다.
이 단원을 설계하면서 일어날 수 있는 위험을 아홉 가지 적어 두었습니다.
그중 네 가지는 오늘 이 차시 안에서 이미 눈에 보입니다.
나머지 다섯은 6차시 이후에나 드러나고, 그때는 되돌리는 값이 훨씬 비쌉니다.
위험
무엇이 보이면 아나
플랜 B
그 대가
데이터를 못 구한다
판정에 ‘간다’가 하나도 없다
견본 데이터로 간다
우리 학교 이야기가 아니게 된다
데이터가 모자란다
규격 점검에서 70행을 못 넘는다
기간을 늘리거나 사람을 늘린다
6차시까지 못 끝낸다
이름표를 못 붙인다
한 차시에 붙일 수 있는 것이 165장뿐
장 수를 줄인다
적어지면 성능이 흔들린다
개인정보가 걸린다
신호등이 빨강
다른 후보로 간다
주제를 처음부터 다시 좁혀야 한다
위험 아홉 가운데 오늘 보이는 넷. 이 넷을 오늘 못 보면 6차시에 가서 코드를 앞에 두고 알게 됩니다.
가장 흔한 실패는 이것입니다. 주제는 멋진데 데이터가 없다.
“인터넷에 있겠지”라고 넘어간 팀이 6차시에 컴퓨터실에 앉아
빈 DATA 를 내려다보게 됩니다. 그때 남은 시간은 다섯 차시뿐입니다.
그래서 오늘은 순서를 뒤집습니다. 계획서를 쓰기 전에 자료부터 손에 넣을 수 있는지 봅니다.
계획서는 다음 시간(5차시)에 씁니다. 오늘 판정한 결과가 그 계획서의 세 번째 칸이 됩니다.
💭 오늘의 물음
우리 주제에 필요한 자료는 어디에 있고,
그것을 우리가 실제로 손에 넣을 수 있는가?
못 넣는다면 — 우리가 만들면 몇 행이 되는가?
오늘 40분은 이렇게 씁니다. 개념은 8분, 나머지 22분은 여러분 팀의 자료를 다루는 시간입니다.
1차시부터 3차시까지가 ‘생각하는 시간’이었다면, 오늘부터는 ‘손이 움직이는 시간’입니다.
1
데이터를 구하는 세 길 — 그리고 각각의 대가
자료를 얻는 길은 크게 셋입니다. 셋 다 공짜가 아니고, 무엇을 치르느냐가 서로 다릅니다.
먼저 예측해 봅시다 — 우리 문제에 가장 잘 맞는 자료는 어느 길에서 나올까요?
① 직접 모은다
설문 · 측정 · 촬영. 우리가 종이를 돌리고, 자를 대고, 사진을 찍습니다.
좋은 점 우리 문제에 꼭 맞습니다.
대가 시간이 가장 많이 듭니다. 이름표도 우리가 붙여야 합니다.
② 공개 데이터
공공데이터포털 · 기상자료개방포털 · KOSIS 국가통계포털에서 받습니다.
좋은 점 양이 많고 공짜입니다.
대가 우리 문제에 딱 맞는 것은 거의 없습니다.
③ 공개 데이터셋
AI 허브처럼 학습용으로 만들어 둔 자료 묶음입니다.
좋은 점이름표가 이미 붙어 있습니다.
대가 남의 문제를 풀게 됩니다. 우리 학교 이야기가 아닙니다.
한 줄로 줄이면 이렇습니다. 우리 문제에 맞을수록 손이 많이 갑니다.
공짜인 것은 남의 문제에 맞춰져 있습니다.
셋 중에 정답은 없고, 우리 팀이 가진 시간과 맞바꾸는 선택만 있습니다.
여기서 자주 놓치는 대가가 하나 더 있습니다. 이름표입니다.
사진 3,000장을 찍어 오는 것은 하루면 됩니다. 그런데 그 3,000장에 ‘가능/불가’를 붙이는 일은
누가 합니까? 우리입니다. 그 시간이 얼마인지는 오늘 손으로 재 볼 것입니다.
먼저 짐작해 보세요 — 네 명이 나눠서 붙이면 몇 분쯤 걸릴까요?
②번 길의 모습 — 어느 도시가 운영하는 공공데이터 포털의 첫 화면입니다(미국 버펄로시).
이미 열려 있는 자료를 목록에서 고르기만 하면 됩니다. 우리나라에서 이 자리에 해당하는 곳은
공공데이터포털(www.data.go.kr)과
기상자료개방포털(data.kma.go.kr)입니다.
출처: Danapaigeglantz, Wikimedia Commons (CC BY-SA 4.0)
ℹ️ 1단원에서 세운 조건이 여기서 시험을 치릅니다
Ⅰ-2 에서 “인공지능을 쓸 만한 문제”의 세 조건을 세웠습니다 —
반복되는 패턴이 있을 것, 데이터가 있을 것, 규칙으로 적을 수 있을 것.
그때는 남의 사례를 놓고 조건을 확인했지요. 오늘은 우리 주제가 두 번째 조건을 통과하는지 봅니다.
조건을 아는 것과 우리 것이 조건을 넘는지 아는 것은 다른 일입니다.
2
받기 전에 따지는 네 잣대 — 넷째는 점수가 아니라 관문이다
후보가 하나 떠오르면 우리는 보통 “쓸 만한가?” 하고 한 번에 판단합니다.
그런데 그 한 번의 판단 안에는 서로 다른 물음 넷이 뒤엉켜 있습니다.
따로 떼어 놓으면 팀원끼리 다투지 않고 결정할 수 있습니다.
여기서 오늘의 핵심이 나옵니다. ④번은 왜 점수가 아닐까요?
점수로 만들면 다른 점수로 덮을 수 있기 때문입니다.
개인정보에 −3점을 주었다고 합시다. 공개 3점 · 형식 3점 · 양 3점짜리 자료라면
9 − 3 = 6점, 여전히 ‘보류’쯤에 남습니다. 그리고 ‘보류’는 언젠가 ‘간다’가 됩니다.
그래서 ④번을 관문으로 둡니다.
빨강이 하나 뜨면 합계를 보지도 않고 거기서 멈춥니다.
네 잣대의 모양이 다른 까닭. ①②③ 는 더해지고, ④ 는 지나가거나 막히거나 둘 중 하나입니다.
🟢 초록 — 사람과 무관하다
기온 · 미세먼지 농도 · 급식 잔반 무게 · 페트병 사진.
누구의 것도 아닌 값입니다. 합계 점수대로 판정합니다.
🟡 노랑 — 고치면 쓸 수 있다
이름 칸이 있는 우리 반 설문 같은 것. ‘안 된다’가 아니라 ‘조건부’입니다.
이름 · 학번 열을 1, 2, 3… 번호로 바꾸면 초록이 됩니다.
🔴 빨강 — 특정한 개인이 드러난다
보건실 건강 기록, 단톡방 내보내기, 남이 올린 게시물.
허락을 받아도 학생 프로젝트가 다룰 것이 아닙니다. 여기서 멈춥니다.
⚠️ 노랑에서 가장 자주 틀리는 순서
이름 열을 지우면 초록이 된다고 했지요. 그런데 더 나은 길은 걷기 전에 안 받는 것입니다.
설문지에서 이름 칸을 아예 빼면 지울 것이 없습니다.
한 번 받은 파일은 지웠다고 사라지지 않습니다 — 누군가의 내려받기 폴더, 단톡방, 인쇄물에 남습니다.
지우는 것보다 안 받는 것이 먼저입니다.
ℹ️ 3단원이 여기서 규칙이 됩니다
Ⅲ-2 에서 “95% 맞히는 AI를 마을에 놓았더니” 무슨 일이 벌어졌는지 봤습니다.
Ⅲ-7 에서는 “정확도는 같은데 차별은 어디에” 있는지를 집단별로 쪼개 보았고요.
그때는 남이 만든 시스템을 놓고 따졌습니다.
오늘은 그것이 우리 팀의 결정이 됩니다.
‘손대면 안 되는 문제’라는 판단을 ④번 신호등 한 칸으로 옮겨 적은 것이 이 표입니다.
판단을 규칙으로 바꾸면, 마음이 급한 날에도 같은 결정이 나옵니다.
3
어디를 먼저 열어 볼까 — 공개 데이터 창구
“공개 데이터를 찾아보세요”라는 말은 도움이 되지 않습니다. 어디를 열어야 하는지가 문제니까요.
아래 목록은 2026년 9월 1일에 실제로 한 번씩 열어 보고 적은 것입니다.
맨 오른쪽 칸을 유심히 보세요 — 확인한 정도가 서로 다릅니다.
창구
주소
누가 운영하나
무엇이 있나
확인
공공데이터포털
www.data.go.kr
대한민국 정부
파일데이터 · 오픈API 를 한곳에
✅ 열림
KOSIS 국가통계포털
kosis.kr
국가데이터처
국가승인통계 표
✅ 열림
기상자료개방포털
data.kma.go.kr
기상청 국가기후데이터센터
지상 · 해양 · 고층 관측 · 기후통계
✅ 열림
서울 열린데이터광장
data.seoul.go.kr
서울특별시
서울시 자료
✅ 열림
AI 허브
aihub.or.kr
한국지능정보사회진흥원
AI 학습용 데이터 · 회원가입 필요
✅ 열림
에어코리아
airkorea.or.kr
한국환경공단
대기질 최종확정 측정자료
✅ 열림
국가법령정보센터
law.go.kr
법제처
법령 원문(개인정보 보호법 등)
✅ 열림
교육통계서비스
kess.kedi.re.kr
한국교육개발원
— 열어 보지 못해 못 적는다
⚠ 이름만 확인
학교알리미
schoolinfo.go.kr
교육부 · 한국교육학술정보원
— 열어 보지 못해 못 적는다
⚠ 못 열었다
LOCALDATA
localdata.go.kr
행정안전부
— 열어 보지 못해 못 적는다
⚠ 못 열었다
⚠ 가 붙은 셋은 이름과 운영기관까지만 확인했습니다. 무엇을 어떤 형식으로 받을 수 있는지는 직접 열어 봐야 압니다.
이 표에서 배울 것은 목록 자체가 아닙니다. “확인했다”에도 등급이 있다는 사실입니다.
‘열린다’와 ‘쓸 수 있다’는 다릅니다.
우리 팀 계획서에 창구를 적을 때도 내가 어디까지 확인했는지를 함께 적으세요.
“검색해 보니 있는 것 같다”와 “내려받아서 열어 봤다” 사이에는 프로젝트 하나가 들어갑니다.
⚠️ 이 표를 쓸 때 조심할 것 셋
기관 이름은 화면에 적힌 것을 그대로 옮기세요. KOSIS 화면은 운영기관을
국가데이터처로 적고 있습니다(2026년 9월 1일 확인). 오래된 안내 자료에 남아 있는 옛 이름을
그대로 베끼지 말고, 그날 화면을 열어 보고 적으세요.
포털의 자료 건수를 적지 마세요. 화면에 뜨는 건수는 날마다 바뀝니다.
“○○건이 공개돼 있다”는 문장은 적는 순간 낡습니다.
목록에 없는 창구는 직접 열어 보고 적으세요. 여러분 지역에도 자료 포털이 있을 수 있고,
없을 수도 있습니다. 지역마다 다릅니다. 목록에 없는 곳을 계획서에 적으려면
그날 열어 보고 ‘열림’이라고 적으세요.
💡 라이선스 — 받는 것과 쓰는 것은 다르다
공개 데이터에는 대개 라이선스가 붙어 있습니다.
“출처를 밝히면 자유롭게”가 가장 흔하지요. 우리 프로젝트는 수업 산출물이니 대부분 문제가 없지만,
출처를 적는 일은 예외 없이 해야 합니다.
내려받은 날짜와 주소를 그 자리에서 메모해 두세요. 발표 자료를 만들 때 다시 찾으려면 훨씬 오래 걸립니다.
💻
손으로 ① — 우리 후보를 판정기에 넣는다
아래 판정기에는 두 개의 칸이 있습니다.
[판정] 칸에서는 후보 하나를 네 잣대로 재고,
[직접 만들기] 칸에서는 공개 데이터가 없을 때 우리가 만들면 몇 행이 되는지를 셉니다.
두 칸 다 여러분이 밀어 놓은 값에서 그 자리에서 계산합니다 — 미리 적어 둔 답이 열리는 것이 아닙니다.
🔍 수집 가능성 판정기INTERACTIVE
[판정] 후보 이름을 적고 ①②③ 를 밀고 ④ 신호등을 고르면,
합계와 판정과 다음 할 일이 그 자리에서 나옵니다. [표에 담기]로 여섯 개까지 쌓아 견줄 수 있습니다. [직접 만들기] 사람 수 · 걷는 날 수 · 응답률을 밀면 날마다 행이 쌓이는 그림이 그려지고,
규격 70행과 테스트 20개를 언제 넘는지 알려 줍니다. 문항 수도 밀어 보세요.
④ 개인정보
방식
합계 (①+②+③)—
개인정보—
판정—
규격 70행—
테스트 개수—
담은 후보0개
[안내] 잣대를 밀면 그 자리에서 다시 계산합니다. 합계 9점짜리를 ‘중단’으로 만들어 보세요.
과제 ① — 우리 팀 후보 셋을 재어 적는다
3차시에서 좁힌 주제에 필요한 자료를 세 개 떠올려 보세요.
하나는 공개 데이터, 하나는 우리가 만드는 것, 하나는 아무거나 좋습니다.
셋을 판정기에 넣고 아래 표를 채웁니다. 판정이 ‘중단’인 것도 반드시 한 줄 적으세요 —
왜 안 되는지를 적어 두는 것이 5차시 계획서의 ‘위험’ 칸이 됩니다.
후보 이름
①
②
③
합계
④ 신호등
판정
과제 ② — 반례를 만든다
판정기로 합계 9점인데 판정이 ‘중단’인 후보를 하나 만들어 보세요.
만들고 나서 스스로 물어보세요 — 9점이라는 것은 바로 받을 수 있고, CSV이고, 1,000행이 넘는다는 뜻입니다.
그렇게 좋은 자료를 왜 못 쓸까요? 그 답을 한 문장으로 공책에 적으세요.
견본 후보 열 개를 넣어 보면 실제로 그런 줄이 나옵니다.
‘인스타그램 해시태그 게시물’은 합계 7점입니다 — ‘간다’ 줄에 설 뻔했지요.
그런데 판정은 ‘중단’입니다. 빨강 하나가 7점을 멈춰 세웠습니다.
만약 ④번을 점수로 만들었다면 이 후보는 그대로 나갔을 것입니다.
과제 ③ — 문턱을 찾는다
[직접 만들기] 칸으로 옮겨 갑니다. 설문을 고르고 사람 수를 30명, 응답률을 100%로 둡니다.
이제 ‘걷는 날 수’를 1부터 하나씩 올리면서, 규격 70행을 처음 넘는 날을 찾으세요.
그다음 응답률을 60%로 낮추고 다시 찾으세요. 두 날짜를 공책에 적습니다.
그리고 마지막으로 문항 수 슬라이더를 3에서 12까지 끝까지 밀어 보세요.
행 수가 얼마나 늘어납니까? 이것이 오늘 가장 많이 틀리는 자리입니다.
①번 길 — 설문. 이 강의 평가지에는 문항이 열 개 있지만
한 사람이 한 장을 채우면 1행입니다. 문항 열 개는 그 한 줄의 칸 열 개가 될 뿐이고,
문항을 몇 개 넣든 행은 늘지 않습니다.
출처: Wiki episteme, Wikimedia Commons (CC BY 3.0)①번 길 — 측정. 호주 빅토리아주 환경보호청(EPA)의 대기측정소입니다.
한 지점에서 한 번 잰 것이 1행입니다.
공개 데이터도 결국 누군가 이렇게 만든 것입니다.
출처: Environment Protection Authority Victoria, Wikimedia Commons (CC BY 4.0)
왜 70행일까요? 6차시부터 우리는 자료의 30%를 떼어
테스트 데이터로 씁니다.
훈련과 테스트를 가르는 일은 Ⅱ-11 ‘외운 것인가 이해한 것인가’에서 배웠지요.
거기서 관례가 훈련 60~80%라고 했고(그 차시 실습은 75% / 25%였습니다),
4단원은 그 안에서 70%로 못 박았습니다. 70행이면 테스트가 21개가 됩니다.
같은 Ⅱ-11 에서 훈련을 90%까지 올려 테스트를 6명으로 줄였더니
한 명이 16.7%p가 되어 점수가 실력이 아니라 눈금의 거칠기를 보여 주었습니다.
테스트가 스무 개도 안 되면 정확도가 너무 크게 튀어서 읽을 수가 없습니다.
테스트가 4개면 나올 수 있는 정확도가 0 · 25 · 50 · 75 · 100% 다섯 개뿐입니다.
그런 숫자로는 “k를 키우니 좋아졌다” 같은 말을 할 수 없습니다.
💻
손으로 ② — 자료를 받자마자 여는 첫인상 보고서
판정에서 ‘간다’가 나왔다고 끝이 아닙니다. 파일을 받으면 가장 먼저 할 일은 세어 보는 것입니다.
몇 행인가, 몇 열인가, 빈칸은 몇 칸인가, 각 열의 최소와 최대는 얼마인가.
여기서 이상하면 뒤의 모든 단계가 이상해집니다.
아래 코드는 CSV 를 붙여 넣으면 그것을 표로 세우고 열마다 통계를 찍습니다.
표를 다루는 도구(pandas)의 info() · describe() 두 줄이 하는 일을
손으로 적은 것입니다. 두 줄로 넘어가면 편하지만, 손으로 세어 보면
빈칸을 어떻게 할지가 남의 결정이 아니라 우리 팀의 결정이 됩니다.
가운데의 summary() 는 6차시부터 열 차시까지 계속 쓰게 될 골격의 일부입니다.
6차시에서 같은 표를 다시 만나게 되니, 오늘 눈에 익혀 두세요.
그 위의 mean · median · stdev 셋은
Ⅱ-4 에서 만들어 둔 것을 한 글자도 안 고치고 옮겨 온 것입니다.
실행하면 아래와 같은 표가 나옵니다. 견본은 급식 4주치(20일)를 손으로 옮겨 적은 표인데,
지어낸 자료이고 흠을 네 개 일부러 심어 두었습니다. 찾아보세요.
열 이름
종류
빈칸
최소 / 가짓수
중앙값
평균
최대
표준편차
날짜
범주
0
20가지 — 값이 전부 하나씩
—
요일
범주
0
5가지
월 · 화 · 수 · 목 · 금 각 4
메뉴
범주
0
5가지
한식 8 · 양식 4 · 중식 4 · 일식 3 · ‘한식 ’ 1
배식인원
수치
0
388
402.5
587.75
4120
810.38
잔반kg
수치
1
8.8
18.6
17.69
27.3
5.93
기온
수치
1
7.2
13.8
13.45
18.1
2.98
행 20개 · 열 6개 · 빈칸 합계 2칸. 이 표는 지어낸 급식 자료에서 나온 값이며,
어느 학교의 실제 기록도 아닙니다. 화면 출력에서 ‘날짜’ 줄이 유난히 긴 것도 그대로 두었습니다 —
그 길이 자체가 식별자 열이라는 신호이기 때문입니다.
심어 둔 흠 넷은 이렇습니다.
빈칸 2칸 — 잔반kg 하나, 기온 하나. 표에서 ‘빈칸’ 칸에 1이 찍힙니다.
이 칸을 0으로 채우면 안 됩니다. 0은 ‘0이라고 적혀 있다’이고, 빈칸은 ‘아무것도 안 적혀 있다’입니다.
실제로 0으로 채워 보면 잔반 평균이 17.69 → 16.80으로 내려갑니다 —
한 톨도 안 남은 날이 하루 생긴 셈이 되지요. Ⅱ-4 에서 세운 규칙이 여기서 값으로 확인됩니다.
자릿수 오타 1개 — 배식인원 최대가 4120입니다. 전교생이 420명인 학교에서
4,120명에게 배식했을 리 없습니다. 412를 치다가 0을 하나 더 친 것이지요.
표기 흔들림 1개 — 메뉴 가짓수가 5가지로 나옵니다.
한식 · 양식 · 중식 · 일식, 우리가 아는 것은 넷인데 하나가 더 있습니다.
'한식 ' — 뒤에 공백이 하나 붙은 값입니다.
눈으로는 똑같아 보이지만 컴퓨터에게는 다른 값입니다.
식별자 열 1개 — ‘날짜’ 열은 20개 값이 전부 서로 다릅니다(100%).
이런 열을 모델에 넣으면 모든 행이 자기 자신과만 닮게 되어 이웃이 사라집니다.
그리고 그것이 사람에 관한 것이라면(이름 · 학번) 그 자리가 바로 개인정보입니다.
⚠️ 오타 한 칸이 표를 어떻게 망가뜨리나
배식인원 열을 다시 보세요. 평균 587.75 · 표준편차 810.38입니다.
학생 588명에게 배식하고, 날마다 810명씩 오르내린다는 뜻이 되지요. 말이 안 됩니다.
4120 한 칸이 만든 결과입니다.
그런데 같은 열의 중앙값은 402.5입니다.
오타를 412로 고쳐도 중앙값은 한 칸도 안 움직입니다(평균은 185.40 움직입니다).
중앙값은 오타 한 칸에 거의 흔들리지 않습니다 —
6차시에서 빈칸을 중앙값으로 메우는 까닭이 바로 이 한 줄에 다 들어 있습니다.
여기서 꼭 짚을 것이 있습니다. 코드는 4120이 이상한 줄 모릅니다.
우리 학교 전교생이 몇 명인지 아는 사람만 압니다.
6차시에서 z 라는 잣대로 이런 값을 자동으로 표시하게 만들지만,
표시된 것을 버릴지 고칠지는 끝까지 사람이 정합니다.
1750cm는 오타지만 205cm는 진짜 있을 수 있는 키니까요.
그래서 이 자료로 모델을 만들 수 있나 — 규격 점검
첫인상이 잘 읽힌다고 쓸 수 있는 것은 아닙니다. 마지막 칸이 그것을 판정합니다.
규격
최소
견본
판정
행 수
70
20
✘ 50행이 모자란다
특성(수치 열)
3
3
✔
이름표 후보(범주 열)
1
3
✔
표가 예뻐 보이는 것과 쓸 수 있는 것은 다릅니다. 읽히는데 모자란다 — 이것이 오늘 배우는 것입니다.
4주치가 20행이니, 한 학기(약 95일)치를 받아 오면 넘습니다.
“자료가 없다”가 아니라 “기간이 모자란다”는 진단이 나온 것이지요.
진단이 이렇게 구체적이면 다음에 할 일도 구체적입니다 —
영양 선생님께 4주치가 아니라 한 학기치를 부탁드리면 됩니다.
💡 이제 우리 팀 것을 넣어 보세요
위 코드 맨 위의 CSV = """ … """ 사이만 갈아 끼우면 됩니다.
엑셀에서 표를 통째로 복사해 그 자리에 붙여 넣고 다시 [▶ 실행]을 누르세요.
나머지 코드는 한 글자도 안 고쳐도 돕니다.
붙여 넣다가 자주 나는 오류 셋 —
① 쉼표를 하나 빠뜨리면 ValueError: 열 수가 안 맞는 줄 … 가
그 자리에서 납니다(한참 뒤에 터지지 않습니다. 그러라고 넣어 둔 검사입니다).
② 수치 열에 글자가 하나라도 섞이면(412명 같은 것) 그 열이 통째로 범주 열이 되어
최소 · 최대 · 평균이 사라집니다. 단위는 값이 아니라 열 이름에 적으세요(배식인원명 말고 배식인원).
③ 열 이름 줄에 넣은 공백은 코드가 알아서 지웁니다.
💻
손으로 ③ — 판정과 ‘몇 행이 되나’를 코드로
위 판정기가 화면에서 하던 일을 이번에는 코드로 적습니다.
직접 적어 보면 규칙이 어디에 들어 있는지가 보입니다 —
특히 빈칸 ④ 한 줄이 이 차시의 윤리를 통째로 담고 있습니다.
실행하면 후보 열 개의 판정이 나옵니다.
간다 4개 · 조건부 1개 · 보류 2개 · 중단 3개입니다.
중단 셋을 보세요. 하나는 합계가 7점이고, 하나는 6점입니다.
점수만 보면 ‘보류’ 이상인데도 전부 멈춰 섰습니다. 빨강 때문입니다.
그다음 두 표가 ‘공개 데이터가 없으면 우리가 만든다’는 길입니다.
아래는 그 표에서 꼭 기억할 세 줄입니다.
방식
설정
행
규격 70행
배울 것
설문
우리 반 30명에게 한 번
30
✘
한 번 걷어서는 못 넘는다
설문
우리 반 30명에게 열흘
300
✔
행을 늘리는 것은 날짜와 사람이다
설문
우리 반 30명에게 열흘 (응답률 60%)
180
✔
응답률은 정직하게 넣는다
측정
한 지점 하루 한 번 열흘
10
✘
측정
세 지점 하루 네 번 열흘
120
✔
지점을 늘리는 것이 가장 빠르다
기록
급식 일지 4주
20
✘
기록
급식 일지 한 학기
95
✔
가장 싸다 — 이미 누가 적어 뒀다
기록
급식 일지 한 해
190
✔
대신 허락과 형식이 관문이다
‘한 해 190일’은 초 · 중등교육법 시행령 제45조가 정한 최소 수업일수에서 왔습니다.
다만 그 조항은 하한을 정한 것이지 고정값이 아니어서, 사정에 따라 줄어들 수 있습니다.
여기서 가장 자주 틀리는 자리를 다시 짚습니다.
“문항 3개짜리 설문을 열흘 걷으면 300행”은 맞습니다. 하지만 그 300행은 문항 때문이 아닙니다.
30명 × 10일 = 300, 문항 수는 이 식에 들어오지도 않습니다.
문항은 행이 아니라 열입니다. 문항을 늘리면 특성이 늘고, 행은 그대로입니다.
이 함정을 5차시에서 숫자로 다시 잽니다 — 문항이 몇 개여야 하는지가 거기서 나옵니다.
이름표 값 — 프로젝트 시간의 절반이 여기로 간다
마지막 표가 오늘 가장 쓸모 있는 한 줄을 줍니다.
사진 한 장을 눈으로 보고 ‘가능/불가’를 정하는 데 8초가 걸린다고 가정하면,
네 명이 나눠서 붙일 때 이렇게 됩니다.
장 수
혼자
4명이 나누면
차시(22분) 몇 개분
100
13.3분
3.3분
0.15
160
21.3분
5.3분
0.24
300
40.0분
10.0분
0.45
500
66.7분
16.7분
0.76
1000
133.3분
33.3분
1.52
3000
400.0분
100.0분
4.55
8초는 우리가 정한 가정이지 조사된 값이 아닙니다. 그래서 아래에 직접 재 보는 활동을 둡니다.
읽는 법은 이렇습니다. 한 사람이 한 차시(22분)에 붙일 수 있는 이름표는 165장입니다.
네 명이면 660장이지요. 6~10차시에 우리가 쓸 견본 데이터가 160장인 것도 여기서 나왔습니다 —
네 명이 나누면 5.3분, 한 차시의 4분의 1도 안 됩니다.
반대쪽을 보세요. 3,000장을 찍어 오면 네 명이 붙여도 100분입니다.
4.5차시가 이름표에만 사라집니다. 우리에게 남은 차시는 전부 합쳐 다섯인데요.
“그럼 더 빨리 붙이면 되지” 하고 8초를 3초로 줄여도 3,000장은 여전히 37.5분입니다.
초가 아니라 장 수를 줄여야 하는 문제입니다.
💡 8초를 우리 팀 숫자로 바꾸세요
타이머를 켜고 20장에 이름표를 붙여 보세요.
걸린 시간을 20으로 나누면 여러분 팀의 초가 나옵니다.
그 값을 코드의 LABEL_SEC 에 넣고 다시 돌리면, 위 표가 우리 팀 표가 됩니다.
사진이 아니라 문장을 분류하는 팀이라면 8초보다 훨씬 오래 걸릴 것입니다.
📖
정리 — 다음 시간까지 팀이 할 일
오늘 산출물은 표 한 장과 숫자 두 개입니다.
다음 시간에 계획서를 쓸 때 그대로 옮겨 적게 되니, 공책에 남겨 두세요.
후보 셋을 네 잣대로 재어 표에 적는다.빨강이 하나면 거기서 멈춥니다. 합계 점수를 아무리 더해도 넘을 수 없습니다.
‘간다’가 하나도 없으면 우리가 만든다.
사람 수 · 걷는 날 수 · 응답률을 정해서 몇 행이 되는지 계산해 적으세요.
70행을 못 넘으면 날짜를 늘리거나 사람을 늘립니다.
이름표가 없는 자료를 골랐으면 시간을 재 본다.
20장을 재어 우리 팀의 초를 구하고, 우리가 모으려는 양에 곱해 보세요.
22분 안에 못 끝나면 양을 줄입니다.
⚠ 집단 열을 하나 정한다. 요일 · 학년 · 촬영 조건 · 수집한 사람 —
집단 열은
모델에 넣지 않고 9차시에서 성능을 쪼개어 볼 때 씁니다.
값이 2~3가지인 것이 좋고, 테스트에서 한 집단에 15개 이상이 있어야 합니다.
이것을 안 정하면 9차시가 통째로 안 돌아갑니다.
못 구한 팀도 괜찮습니다. 아래 견본 데이터로 6~10차시를 끝까지 갈 수 있습니다.
💡 여기까지 못 했으면 — 이렇게 하세요
판정을 못 끝냈으면 후보 하나만 재어도 됩니다. 셋을 채우는 것보다
하나를 제대로 재는 것이 낫습니다. 나머지는 다음 시간 앞머리에 이어서 하세요.
자료를 아직 못 구했으면 오늘 반드시 챙길 것은 딱 하나 —
집단 열을 무엇으로 할지입니다. 견본 데이터로 가더라도 그 감각은 우리 것이어야 합니다.
판정에 ‘간다’가 하나도 없어도 프로젝트는 멈추지 않습니다.
그것은 실패가 아니라 오늘 얻은 결론입니다. 다음 문단의 길로 가세요.
견본 데이터로 가는 길
자기 데이터가 없는 팀을 위해 한 벌이 준비돼 있습니다.
6차시부터 10차시까지 다섯 차시가 모두 이 한 벌을 쓰므로, 중간에 갈아탈 필요가 없습니다.
무엇
견본 데이터
이야기
학교 분리수거장에서 찍은 페트병 사진 160장을 사람이 눈으로 재어 적은 표
열
7개 — 반사도 · 밝기 · 투명도 · 이물질 · 찌그러짐 · 촬영조건 · 재활용
특성
앞의 다섯 (모델에 넣는 열)
이름표
재활용 — 가능 / 불가
집단 열
촬영조건 — 밝음 / 어두움 (9차시에서 쪼개어 봅니다)
심어 둔 흠
빈칸 3칸 · 자릿수 오타 2개 — 6차시에서 찾아내는 것이 실습입니다
⚠ 이 데이터는 지어낸 것입니다. 어느 학교의 실제 기록도, 어느 기관의 공개 자료도 아닙니다.
여기서 나오는 성능 숫자는 “견본 데이터로 해 보면 이렇게 된다”로만 말할 수 있습니다.
견본을 쓰기로 했다면 5차시 계획서의 ‘데이터 출처와 수집’ 칸에
“견본 데이터(페트병 사진 160장)”라고 적고, ‘위험과 플랜 B’ 칸에
“우리 학교 이야기가 아니게 된다”는 대가를 함께 적으세요.
그 대가를 적어 두는 것과 모른 채 가는 것은 11차시 발표에서 크게 갈립니다.
⚠️ 오늘 나온 숫자를 옮겨 적을 때
오늘 화면에 나온 숫자 가운데 바깥 세상의 사실은
창구 목록과 ‘한 해 190일’ 둘뿐입니다.
판정 점수, 8초, 응답률, 급식 20행 — 나머지는 전부 우리가 정한 가정입니다.
발표 자료에 옮길 때 이 구분을 지우면, 가정이 통계인 척하게 됩니다.
“우리가 8초로 잡으면”이라는 말머리를 지우지 마세요.
✅
확인 문제
✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.
1. 데이터를 구하는 세 길을 대고, 각각이 요구하는 대가를 하나씩 쓰세요.
그리고 “공짜인 것은 남의 문제에 맞춰져 있다”는 말이 무슨 뜻인지 설명하세요.
📖 모범 답안
① 직접 모은다(설문 · 측정 · 촬영) — 우리 문제에 꼭 맞지만
시간이 가장 많이 들고 이름표도 우리가 붙여야 합니다.
② 공개 데이터(공공데이터포털 · 기상자료개방포털 등) — 양이 많고 공짜지만
우리 문제에 딱 맞는 것은 거의 없습니다.③ 공개 데이터셋(AI 허브 등) — 이름표가 이미 붙어 있지만
남의 문제를 풀게 됩니다.
“공짜인 것은 남의 문제에 맞춰져 있다”는 것은, 이미 만들어져 있는 자료는
누군가가 자기 목적으로 모았다는 뜻입니다. 기상청은 우리 학교 급식 잔반을 알아보려고
기온을 잰 것이 아니지요. 그래서 공짜로 받을수록 우리 물음과 어긋나고,
우리 물음에 맞출수록 우리 시간이 듭니다. 셋 중 정답은 없고
우리 팀 시간과 맞바꾸는 선택만 있습니다.
2. 공개 데이터를 내려받을 때 반드시 확인해야 할 두 가지는 무엇인가요?
그리고 이름표가 붙어 있지 않은 자료를 골랐다면 팀이 무엇을 해야 하는지 쓰세요.
📖 모범 답안
① 라이선스 — 어떤 조건으로 쓸 수 있는지입니다.
대부분 “출처를 밝히면 자유롭게”이지만, 출처를 적는 일은 예외 없이 해야 합니다.
내려받은 날짜와 주소를 그 자리에서 메모해 두는 것이 좋습니다.
② 개인정보 — 특정한 개인이 드러나는가입니다.
드러나면 빨강, 이름 · 학번 열만 지우면 되면 노랑, 사람과 무관하면 초록입니다.
이름표가 없으면 우리가 붙여야 합니다. 그리고 그 시간을 먼저 계산해야 합니다.
한 개에 8초로 잡으면 한 사람이 한 차시(22분)에 165장, 네 명이면 660장입니다.
우리가 모으려는 양이 그 안에 들어오는지 보고, 안 들어오면 양을 줄입니다.
더 빨리 붙이는 것으로는 풀리지 않습니다 — 8초를 3초로 줄여도 3,000장은 네 명이 37.5분입니다.
3.(오늘 실행한 결과) 손으로 ② 의 첫인상 보고서를 돌려
견본 급식 자료에서 찾은 흠 네 가지를 적고, 그중 ‘배식인원’ 열의
평균 · 중앙값 · 최대 세 숫자를 적으세요.
그리고 그 셋을 나란히 놓았을 때 무엇을 알 수 있는지 쓰세요.
📖 모범 답안
흠 네 가지 — ① 빈칸 2칸(잔반kg 1 · 기온 1),
② 자릿수 오타 1개(배식인원 4120), ③ 표기 흔들림 1개(메뉴 가짓수가 4가지가 아니라
5가지로 나옴 — '한식 ' 의 뒤 공백), ④ 식별자 열 1개(날짜, 20/20이 서로 다름).
배식인원: 평균 587.75 · 중앙값 402.5 · 최대 4120.
세 숫자를 나란히 놓으면 오타 한 칸이 평균을 얼마나 끌고 가는지가 보입니다.
전교생이 420명인 학교인데 평균이 588명입니다. 표준편차도 810.38로 터무니없지요.
그런데 중앙값은 402.5로 멀쩡합니다. 4120을 412로 고쳐도
중앙값은 한 칸도 안 움직이고 평균만 185.40 움직입니다.
중앙값은 이런 오타에 거의 흔들리지 않는다 — 6차시에서 빈칸을
(평균이 아니라) 중앙값으로 메우는 까닭이 여기 있습니다.
4.(오늘 실행한 결과) 판정기의 [직접 만들기] 칸에서
설문 · 30명 · 응답률 100%로 두고, 규격 70행을 처음 넘는 날을 찾으세요.
응답률을 60%로 낮추면 며칠이 됩니까? 그리고 문항 수 슬라이더를 3에서 12까지 밀었을 때
행 수가 얼마나 늘어났는지 적고, 왜 그런지 설명하세요.
“90행의 30%면 27개 아닌가?” 싶었다면 잘 본 것입니다.
화면에는 28개가 뜹니다. 훈련은 90 × 0.7 을 소수점 아래에서 잘라 정하는데,
컴퓨터 안에서 그 값이 63이 아니라 62.99999… 여서 62로 잘리기 때문입니다.
남는 28개가 테스트가 되지요. 코드가 세어 준 값과 머릿속 값이 다르면
코드가 어떻게 셌는지를 먼저 보는 것이 순서입니다.
문항 수를 3에서 12까지 밀어도 행은 하나도 늘지 않습니다.문항은 행이 아니라 열이기 때문입니다. 한 사람이 한 번 응답하면,
문항이 3개든 12개든 그것은 한 줄입니다. 문항은 그 줄의 칸 수를 늘릴 뿐입니다.
이것이 오늘 가장 흔한 착각입니다. “3문항 × 10일 = 30행”처럼 세면
행이 열 배 모자란 채로 계획서를 쓰게 됩니다.
행을 늘리는 것은 사람 수와 걷는 횟수뿐입니다.
5. 어떤 팀이 “개인정보도 점수로 매기자. 심하면 −3점을 주면 되잖아”라고
제안했습니다. 이 제안을 받아들이면 무슨 일이 생기는지, 오늘 본 후보 열 개 가운데
실제로 판정이 뒤집히는 것을 하나 들어 설명하세요.
📖 모범 답안
점수는 다른 점수로 덮을 수 있습니다. 그것이 점수의 성질이지요.
개인정보에 −3점을 주더라도, 공개 · 형식 · 양이 모두 3점이면 9 − 3 = 6점이 되어
‘보류’ 자리에 남습니다. 그리고 시간이 급해지면 ‘보류’는 ‘간다’가 됩니다.
실제로 뒤집히는 것: ‘인스타그램 해시태그 게시물’.
공개 2 · 형식 2 · 양 3 — 합계 7점입니다. 7점이면 ‘간다’ 줄에 섭니다.
지금 규칙(관문)에서는 신호등이 빨강이라 합계를 보지도 않고 중단입니다.
점수제로 바꾸면 이 후보가 그대로 나갑니다.
왜 못 쓰는지도 분명합니다. 점수가 낮아서가 아닙니다 —
올린 사람이 우리에게 준 적이 없기 때문입니다.
공개된 것과 우리가 써도 되는 것은 다릅니다. 이것은 점수로 잴 성질의 것이 아니라
지나가거나 막히거나 둘 중 하나입니다.
6. 어떤 팀이 주제를 먼저 정하지 않고,
기상자료개방포털에서 받은 자료를 먼저 열어 본 다음 거기서 주제를 찾았습니다.
“순서가 거꾸로 아니냐”는 말을 들었다면 이 팀은 뭐라고 답할 수 있을까요?
그리고 이 방식이 위험해지는 경우도 함께 쓰세요.
📖 모범 답안
현명한 경우. 오늘 배운 대로, 프로젝트가 무너지는 가장 흔한 자리는
‘주제는 멋진데 데이터가 없다’입니다. 자료에서 출발하면 그 위험이 처음부터 없습니다.
네 잣대의 ①②③ 가 이미 높은 상태에서 시작하는 셈이지요.
남은 다섯 차시밖에 없는 학교 프로젝트에서는 확실히 손에 든 것으로 시작하는 편이
현실적일 때가 많습니다.
위험해지는 경우. 자료에 맞춰 물음을 만들다 보면
아무도 궁금해하지 않는 물음이 나올 수 있습니다.
“내일 기온을 어제 기온으로 맞힌다” 같은 것 말이지요 — 풀 수는 있지만 풀 까닭이 없습니다.
1차시에서 지표로 문제를 골랐던 이유가 이것입니다.
그래서 두 방향을 만나게 해야 합니다. 자료에서 출발했더라도
“이 답이 나오면 누가 무엇을 다르게 하는가”를 반드시 적어 보세요.
그 물음에 답할 수 없으면 자료가 아무리 좋아도 프로젝트가 되지 않습니다.
🔁 되돌아보기
오늘 우리 주제에 필요한 자료를 네 잣대로 재고,
구할 수 없을 때 우리가 만들면 몇 행이 되는지 계산했습니다.
그리고 첫인상 보고서로 흠 넷을 찾아냈습니다.
공책을 덮기 전에 한 줄만 적으세요 —
“우리 팀이 오늘 포기한 후보 하나와, 포기한 까닭.” 다음 시간에는 계획서와 플랜 B를 씁니다. 오늘의 판정 표가 그 계획서의
‘데이터’ 칸으로 그대로 들어가고, 오늘 포기한 후보가 ‘위험’ 칸으로 들어갑니다.
🔎
더 알아보기
공개된 숫자는 누가 어떤 조건으로 쟀나, 이름표는 누가 붙였나, 번호로 바꾸면 정말 안전한가
현장
그 숫자는 어디서 왔나 — 학교 백엽상과 기상청 관측소
사진은 우리나라 어느 학교 마당의 백엽상입니다. 흰 칠을 한 상자에 비스듬한 비늘창을 달아
햇빛은 막고 바람은 통하게 한 것이지요. 문 안쪽에 둥근 계기판이 하나 달려 있는데,
눈금은 10부터 100까지 적혀 있고 단위는 어디에도 없습니다.
이 바늘을 읽어 표에 ‘17’이라고 적으면, 그 17이 무엇의 17인지는 적은 사람만 압니다.
그리고 이 상자는 건물 벽 바로 앞, 관목 사이로 올라온 기둥 위에 서 있습니다.
기상청이 공개하는 기온과 습도는 이렇게 재지 않습니다. 세계기상기구(WMO)의 관측 지침은 기온과 습도를
트인 곳의 잔디 위, 땅에서 1.25~2m 높이에서, 벽이나 건물의 열을 받지 않는 자리에서 재도록 권합니다.
어느 관측소의 값이든 같은 조건에서 잰 그 지역의 대표값이 되도록 맞춰 둔 것입니다.
그래서 기상자료개방포털의 기온·습도는 ②번 길의 좋은 점(양이 많고 형식이 맞다)을 다 갖췄지만,
우리 급식실 옆의 값은 아닙니다. 반대로 학교 백엽상에서 읽은 값은 우리 자리의 값이지만
표준 조건과 달라서 포털 값과 한 열에 섞으면 안 됩니다.
계획서 ‘데이터 출처’ 칸에 어디서, 어떤 장비로, 어떤 단위로 쟀는지까지 적어야 하는 까닭입니다.
열 이름에 단위를 붙여 두라는 손으로 ②의 조언도 같은 이야기입니다.
사진: 학교 마당의 백엽상(한국) · 출처: Park taeho, Wikimedia Commons (CC BY-SA 4.0)
역사
상자 안에 숨은 사람 — 이름표는 결국 사람이 붙인다
1770년 볼프강 폰 켐펠렌이 선보인 체스 두는 기계 ‘투르크인’은 유럽 곳곳을 돌며 사람들을 이겼습니다.
그 비밀은 기계가 아니라 상자 안에 숨은 체스 고수였지요. 그림은 요제프 라크니츠가 1789년 책에서
그 속을 추측해 그린 단면도입니다.
2005년 아마존은 사람들에게 아주 작은 일을 나눠 맡기는 서비스를 열면서 이름을
메커니컬 터크(Mechanical Turk)라고 붙였습니다. 겉으로는 컴퓨터가 처리하는 것 같지만
그 안에서 일하는 것은 사람이라는 뜻입니다.
이 서비스로 만든 가장 유명한 자료가 ImageNet입니다. 1,400만 장이 넘는 사진마다
‘무엇이 찍혔나’를 세계 여러 나라의 수만 명이 나눠 붙였고, 이 자료가 2012년 딥러닝의 약진을 불러온 대회의 무대가 되었습니다.
오늘 우리가 가정한 8초로 셈하면 1,400만 장은 한 사람이 쉬지 않고 3년 반을 붙여야 하는 양입니다.
이름표 값은 사라지지 않고, 누군가가 치릅니다.
그림: 켐펠렌의 체스 기계 단면도(라크니츠, 1789) · 출처: Joseph Racknitz, Wikimedia Commons (Public domain)
생각할 거리
번호로 바꾸면 초록인가 — 2006년 검색 기록 공개 사건
오늘 ‘노랑’ 칸에 이름 · 학번 열을 번호로 바꾸면 초록이 된다고 적었습니다.
우리 반 설문처럼 칸이 몇 개 없는 표에서는 대개 맞는 말입니다. 그런데 이 규칙이 통하지 않은 유명한 사례가 있습니다.
2006년 8월, 미국의 인터넷 회사 AOL은 연구자들을 돕겠다며 약 65만 명이 석 달 동안 입력한 검색어 약 2,000만 건을 공개했습니다.
이름은 지우고 이용자마다 번호만 붙였지요. 며칠 만에 뉴욕타임스 기자들이 4417749번의 검색어 —
사는 동네 이름, 같은 성을 가진 사람들, 나이에 얽힌 고민 — 를 이어 맞춰 그 사람을 실제로 찾아가 확인했습니다.
AOL은 사과하고 자료를 내렸지만, 이미 여러 곳에 복사된 뒤였습니다.
교훈은 둘입니다. 첫째, 식별자 열만 사람을 드러내는 것이 아닙니다. 한 줄씩은 흔한 값도
한 사람 아래 여러 줄이 모이면 그 사람을 가리킵니다. 둘째, 오늘 본 대로 한 번 내보낸 파일은 지워지지 않습니다.
그래서 자유롭게 쓴 글 · 검색어 · 위치처럼 내용 자체가 사람을 말해 주는 자료는, 번호로 바꿔도 초록이 아니라
빨강에 가깝다고 보고 멈추는 편이 안전합니다.