flashcard

Konsep Dasar AI & ML

Hubungan AI vs ML ? AI adalah konsep payung mencakup Problem Solving, Knowledge Agents, dan ML sebagai salah satu bagiannya.

Definisi Machine Learning ?

  • Kelleher: Proses automatis yang mengekstrak pattern dari data.
  • Tom Mitchell: Program belajar dari Experience (E) untuk Task (T), dengan Performance (P) yang meningkat seiring E.

Tipe Pembelajaran

3 Tipe Utama Machine Learning ?

  1. Supervised Learning: Modeling relasi data-label → Goal: prediksi. Task: Klasifikasi, Regresi.
  2. Unsupervised Learning: Eksplorasi struktur data tanpa label. Task: Clustering, Market Basket.
  3. Reinforcement Learning: Agent belajar dari Reward/Punishment melalui interaksi dengan environment
  1. Supervised Learning: ::Modeling relasi data-label → Goal: prediksi. Task: Klasifikasi, Regresi.
  1. Unsupervised Learning: ::Eksplorasi struktur data tanpa label. Task: Clustering, Market Basket.
  1. Reinforcement Learning: ::Agent belajar dari Reward/Punishment melalui interaksi dengan environment

Supervised Learning

Elemen Utama Supervised Learning ?

  • I/O Pairs: Data () dan Label ()
  • Training Set: Kumpulan I/O pairs
  • Target Function (): Rumus asli dunia nyata
  • Hypothesis (): Pendekatan mesin ()
  • Inductive Learning: Generalisasi dari khusus → umum

Classification vs Regression ?

  • Classification: Label kategori terbatas (Ya/Tidak, Spam/Not Spam). Output: probabilitas per kelas.
  • Regression: Label nilai kontinu (Harga, Suhu). Output: angka spesifik.

Terminologi Dataset

Komponen Utama Dataset ?

  1. Samples: Baris data/observasi
  2. Features: Kolom/atribut yang diukur
  3. Class Labels: Target yang diprediksi

Algoritma & Model

3 Model Klasifikasi & Pendekatannya ?

  1. Naive Bayes: Probabilitas statistik ()
  2. Decision Tree: Struktur pohon keputusan
  3. Logistic Regression/SVM: Fungsi linear () + weights

Alur Deep Learning ?

  • Image: Input piksel → CNN → Probabilitas kelas
  • Text: Input teks → RNN/Transformer → Sentimen/Label

ML Pipeline

Preprocessing Pipeline ? Sebelum Split:

  1. Raw Data Collection
  2. Missing Data Handling
  3. Initial Feature Extraction

Saat Training:

  1. Feature Scaling
  2. Dimensionality Reduction

Alur Training & Evaluasi ?

  1. Split Data: Training vs Test Dataset
  2. Training: Pilih algoritma & hyperparameter
  3. Cross-Validation: Evaluasi berulang → model kandidat terbaik
  4. Final Evaluation: Test pada Test Dataset
  5. Apply: Gunakan untuk New Dataset

Studi Kasus: Identifikasi Tipe Learning

Task: Segmentasi pasar dengan fitur demografi + label “potensial_klien” ? Unsupervised Learning - Task mencari kesamaan karakteristik (clustering), bukan prediksi label.

Task: Prediksi rating produk dari fitur demografi ? Supervised Learning (Regresi) - Ada label numerik (rating) yang diprediksi.

Task: Prediksi apakah pelanggan potensial klien ? Supervised Learning (Klasifikasi) - Ada label kategori (Ya/Tidak) yang diprediksi.

Task: 1) Tentukan prodi; 2) Estimasi skor rapor ? Multi-task Learning - Task 1: Klasifikasi (diskrit), Task 2: Regresi (kontinu).

Task: Prediksi harga masker dari viralitas Covid ? Regresi - Target harga adalah nilai kontinu.


Design of Experiments

Mengapa Desain Eksperimen diperlukan? ? Semua benar: ML butuh waktu panjang & setiap teknik butuh tuning parameter untuk model terbaik.

Faktor yang TIDAK bisa diatur dalam eksperimen ? Derau (noise) dalam data - Algoritma, fitur, dataset bisa dipilih; noise inherent & tidak terkontrol.

Tujuan desain eksperimen ? Mendapatkan model terbaik secara efisien (optimal + efisien).

Mengapa Cross Validation diperlukan? ? Semua benar: Cegah overfitting, hindari selection bias, kurangi faktor random → evaluasi robust & general.

Pertanyaan Apa itu cross validation?