Data & Pipeline ML
Model AI yang kuat lahir dari data yang rapi. Pipeline data memastikan kualitas sebelum training.
Sumber Data
- Data internal (log produk, CRM, analytics)
- Data publik (Kaggle, dataset pemerintah)
- Data sintetis (hasil augmentasi)
Labeling & Ground Truth
Labeling adalah proses memberi “jawaban benar” untuk melatih model.
- Gunakan guideline labeling yang jelas.
- Audit sampel secara berkala.
Train / Validation / Test
- Train: melatih model.
- Validation: tuning hyperparameter.
- Test: evaluasi final tanpa bias.
Checklist Pipeline
- Deduplicate data
- Tangani missing values
- Simpan versioning dataset