CSVデータセット・プロファイラ
CSVをドロップするだけで、列ごとの型・欠損・外れ値・クラスバランスを即座に表示。このデータセット・プロファイラについて
CSVをドロップ(または貼り付け)すると、探索的データ分析の最初の一巡を自動で行います。各列の型を推定し、 欠損値の件数と割合を報告し、ユニーク値を数え、数値列では最小・最大・平均・中央値・標準偏差・ 四分位数を計算して外れ値をIQR規則(Q1 − 1.5×IQR未満、または Q3 + 1.5×IQR超)で検出します。カテゴリ列では頻度分布とクラス不均衡の警告を表示し、 サマリータイルには重複行も出ます。
モデルを学習させる前に、外れ値、 欠損データ、 不均衡データセット をどう扱うか決めるためのチェックリストを1画面にまとめたものです(記事はトルコ語)。区切り文字(カンマ・セミコロン・タブ)は 自動判定され、引用符付きフィールドはRFC 4180に従って解析されます。ファイルはブラウザから出ません。 関連ツール:CSV ↔ JSON変換。