小さなモデルの学習と評価
学習と評価を分け、スコアの限界を説明します。
学習目標
- 学習と評価を分け、スコアの限界を説明します。
scikit-learnで回帰・分類モデルを学習します。Irisにはがく片の長さと幅、花弁の長さと幅の4特徴があります。適合前にデータを分け、訓練部分で学び、取り置いた例で評価します。訓練スコアが高くても新しいデータで悪いことがあり、過学習と呼びます。前処理も訓練データだけに適合し、評価情報の漏れを防ぎます。
もう少し詳しく
近傍数kや木の深さは適合の外で選ぶハイパーパラメーターで、係数は学習するパラメーターになり得ます。設定は検証用データや交差検証で選び、テスト集合は最終評価に残します。テスト結果に合わせ続けると見積もりが楽観的になります。分割・基準モデル・スコア・誤りを記録しましょう。小さなIris実験は最初の作品で、あらゆる集団や課題への有効性の証明ではありません。
自分の言葉で説明
学習に使ったデータで100%のモデルは、次に何を確かめるべきですか。
説明と比べる
適切な未学習データで評価し、誤りや情報漏れを調べます。訓練の正解率だけでは不十分です。
自分で記録する欄です。ここで採点はしません。