Istilah AI/ML

Balik ke index.

Konsep dasar model

  • Model — fungsi matematis hasil belajar dari data, dipakai buat prediksi/ generate output baru.
  • Training — proses “ngajarin” model dari data, model nyesuaikan parameter internalnya biar errornya makin kecil.
  • Inference — proses pakai model yang udah jadi buat ngasih output dari input baru (bedanya sama training: nggak ada pembelajaran lagi di sini).
  • Overfitting — model terlalu “menghafal” data training, jadi jelek performanya di data baru. Underfitting — model kebalikannya, terlalu sederhana sampe nggak nangkep pola yang ada.
  • Feature — variabel input yang dipakai model buat belajar/prediksi (misal umur, harga, teks).
  • Label / ground truth — jawaban yang benar buat satu data, dipakai buat ngajarin/ngevaluasi model (supervised learning).
  • Hyperparameter — pengaturan yang di-set manusia sebelum training (bukan dipelajari model sendiri), misal learning rate, jumlah layer.
  • Benchmark / evaluation — cara ngukur seberapa bagus model, biasanya bandingin ke dataset standar atau model lain.

LLM & generative AI (paling sering muncul sekarang)

  • LLM (Large Language Model) — model bahasa raksasa (GPT, Claude, dll) yang dilatih dari banyak teks buat ngerti dan generate bahasa.
  • Prompt engineering — teknik nyusun instruksi (prompt) ke LLM biar hasilnya sesuai yang diinginkan.
  • Context window — batas jumlah teks (token) yang bisa “diingat”/diproses LLM dalam satu percakapan/request.
  • Token — potongan teks terkecil yang diproses model (kira-kira ¾ kata dalam bahasa Inggris). Biaya pemakaian API biasanya dihitung per token.
  • Fine-tuning — melatih ulang model yang udah jadi (pretrained) dengan data spesifik, biar lebih jago di satu domain/tugas tertentu.
  • RAG (Retrieval-Augmented Generation) — teknik nyuntikin informasi eksternal (dari database/dokumen) ke prompt LLM sebelum dia jawab, biar jawabannya lebih akurat/up-to-date daripada cuma ngandelin memori model.
  • Embedding — representasi teks/gambar/dll dalam bentuk vektor angka, dipakai buat ngukur “kemiripan makna” antar data (dasar dari RAG & semantic search).
  • Vector database — database yang dioptimasi buat nyimpen dan nyari embedding berdasarkan kemiripan (Pinecone, Weaviate, pgvector).
  • Hallucination — LLM ngasih jawaban yang keliatan meyakinkan tapi sebenarnya salah/ngarang.
  • Agent / tool use — LLM yang bisa manggil fungsi/tool eksternal (API, kalkulator, search) buat nyelesain tugas, bukan cuma jawab teks doang.
  • System prompt — instruksi “di belakang layar” yang ngatur perilaku dasar LLM sebelum user mulai ngobrol.
  • Temperature — parameter yang ngatur seberapa “random”/kreatif output LLM; makin tinggi makin variatif (dan makin gampang ngaco).

MLOps & produksi

  • MLOps — praktik ngelola siklus hidup model ML di produksi (mirip DevOps tapi buat ML): training, deployment, monitoring, retraining.
  • Model drift / data drift — performa model menurun seiring waktu karena pola data di dunia nyata berubah dari data training.
  • A/B testing — ngebandingin dua versi model/fitur ke user beneran buat liat mana yang lebih bagus performanya.
  • Model registry — tempat nyimpen dan versi-in model yang udah dilatih, biar gampang dilacak model versi berapa yang lagi jalan di produksi.
  • Latency (inference) — seberapa cepat model ngasih output setelah dikasih input — penting banget buat aplikasi real-time.

Flashcards

Apa bedanya training dan inference? :: Training = proses model belajar dari data (parameter berubah); inference = pakai model yang sudah jadi buat prediksi (parameter tetap) Apa itu RAG dan kenapa dipakai? :: Teknik nyuntikin data eksternal ke prompt LLM sebelum dijawab, biar jawaban lebih akurat/up-to-date daripada mengandalkan memori model saja Apa itu embedding? :: Representasi teks/data dalam bentuk vektor angka untuk mengukur kemiripan makna antar data Apa itu hallucination pada LLM? :: LLM memberi jawaban yang terdengar meyakinkan tapi sebenarnya salah atau mengarang Apa itu overfitting? :: Model terlalu menghafal data training sehingga performanya jelek di data baru