【えむえるぱいぷらいん】
MLパイプライン とは?
最終更新:
💡 機械学習の「ベルトコンベア」で品質と効率を両立
前処理・学習・評価などの機械学習工程を、入力・出力と依存関係で結んだワークフロー。目的に応じてデータ取得やデプロイも含め、自動実行や追跡を行う。
📌 このページのポイント
MLパイプラインって何のために作るの?
具体的にはどんなステップがあるの?
パイプラインがあれば前の結果を完全に再現できる?
ツールによって役割は違うの?
Kubeflow PipelinesはMLワークフローの実行や成果物の追跡に使うよ。scikit-learnのPipelineは前処理などの変換と推定器をつなぐ仕組み。後者を使うだけで、収集から本番配備まで全部が管理されるわけではないんだ。
前処理で気をつけることは?
評価用データの情報を、学習する前処理へ混ぜないことだよ。たとえば正規化に使う値を訓練データから求め、評価データには同じ変換を適用する。scikit-learnのPipelineは、交差検証でこうした情報漏れを避ける助けになるよ。
📖 おまけ:英語の意味
「ML Pipeline」 = 機械学習のパイプライン
💬 MLはMachine Learning(機械学習)の略。Pipelineは工程をつないでデータや成果物を渡す流れを表す言葉だよ。