Sklearnの交差検証の可視化:K-Fold、シャッフル&スプリット、および時系列スプリット

Sklearnの交差検証の可視化

Sklearn K-Fold、Shuffle & Split、およびTime Series Splitのクロスバリデーションのプロセスを可視化し、Pythonを使用して検証結果を表示する

写真:Ryoji Iwata氏撮影、Unsplashより引用

クロスバリデーションとは?

基本的に、クロスバリデーションは学習アルゴリズムを評価するための統計的手法です。分析を実行するために、固定数のフォールド(データのグループ)が設定されます。これらのフォールドは、トレーニングセットとテスト(検証)セットにデータをグループ化し、ラウンドごとに交差します。これにより、各データポイントを検証することができます。

主な目的は、モデルが作成に使用されなかった独立したデータを予測する能力をテストすることです。また、オーバーフィッティングや選択バイアスなどの問題に対処するのにも役立ちます。

この記事のクロスバリデーションの結果の例。画像:著者撮影

この記事では、Scikit Learnライブラリの3つのクロスバリデーションのプロセスを可視化するためにPythonを適用します:

  • K-Foldクロスバリデーション
  • Shuffle & Splitクロスバリデーション
  • Time Series Splitクロスバリデーション

さらに、検証結果もプロットして洞察力のある情報を表現することができます。

さあ、始めましょう

1. K-Foldクロスバリデーション

K-Foldはクロスバリデーションの一般的な方法です。まず、すべてのデータをフォールドに分割します。次に、トレーニングセット(k-1フォールド)から学習モデルを作成し、テストセット(残りのフォールド)を検証に使用します。

通常、K-Foldクロスバリデーションから得られるフォールドはできるだけ均等に分割されます。次に、K-Foldクロスバリデーションのプロセスを見ていきます。

ライブラリのインポートとデータの読み込み

例えば、この記事ではSklearnライブラリからダウンロードできるワインデータセットを使用します。このデータセットは、CC BY 4.0ライセンスの下でのUCI MLワインデータのコピーです。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

人工知能

「トリントの創設者兼CEO、ジェフ・コフマンへのインタビューシリーズ」

ジェフ・コーフマンは、ABC、CBS、CBCニュースで30年のキャリアを持った後、Trintの創設者兼CEOとなりましたジェフは手作業の...

人工知能

「コーネリスネットワークスのソフトウェアエンジニアリング担当副社長、ダグ・フラーラー氏 - インタビューシリーズ」

ソフトウェアエンジニアリングの副社長として、DougはCornelis Networksのソフトウェアスタック全体、Omni-Path Architecture...

人工知能

「マーク・A・レムリー教授による生成AIと法律について」

データサイエンス内で新しい分野が現れ、研究内容が理解しにくい場合は、専門家やパイオニアと話すことが最善です最近、私た...

AIテクノロジー

「LXTのテクノロジーバイスプレジデント、アムル・ヌール・エルディン - インタビューシリーズ」

アムル・ヌール・エルディンは、LXTのテクノロジー担当副社長ですアムルは、自動音声認識(ASR)の文脈での音声/音響処理と機...

人工知能

ファイデムのチーフ・プロダクト・オフィサー、アルパー・テキン-インタビューシリーズ

アルパー・テキンは、FindemというAI人材の獲得と管理プラットフォームの最高製品責任者(CPO)ですFindemのTalent Data Clou...

人工知能

「ナレ・ヴァンダニャン、Ntropyの共同創設者兼CEO- インタビューシリーズ」

Ntropyの共同創設者兼CEOであるナレ・ヴァンダニアンは、開発者が100ミリ秒未満で超人的な精度で金融取引を解析することを可...