작은 모델 학습과 평가
학습과 평가를 분리하고 점수가 의미하는 한계를 설명해요.
학습 목표
- 학습과 평가를 분리하고 점수가 의미하는 한계를 설명해요.
scikit-learn으로 회귀·분류 모델을 학습해요. 붓꽃 데이터는 꽃받침 길이·너비와 꽃잎 길이·너비, 네 특징을 가져요. 먼저 데이터를 나누고 학습용으로 fit한 뒤 남겨둔 예제로 평가하세요. 학습 점수가 높아도 새 데이터 성능은 나쁠 수 있으며 이를 과적합이라고 해요. 전처리도 학습 데이터에만 맞춰 평가 정보가 학습으로 새지 않게 하세요.
조금 더 알아보기
이웃 수 k와 트리 깊이는 학습 밖에서 선택하는 하이퍼파라미터이고, 회귀 계수는 학습된 파라미터가 될 수 있어요. 설정은 검증 데이터나 교차검증으로 고르고 테스트 데이터는 최종 평가에 남겨두세요. 테스트 점수를 보며 계속 조정하면 평가가 낙관적으로 치우쳐요. 데이터 분할·기준 모델·점수·오류 사례를 기록하세요. 작은 붓꽃 실험은 첫 프로젝트이며 모든 집단과 문제에 대한 성능 증명은 아니에요.
내 말로 설명해 보기
학습한 데이터에서 100%를 맞힌 모델은 다음에 무엇을 확인해야 할까요?
설명과 비교하기
적절한 미학습 데이터에서 평가하고 오류·데이터 누수를 확인해요. 학습 정확도만으로는 부족해요.
스스로 표시하는 칸이에요. 여기서 채점하지는 않아요.