Istilah AI/ML
Balik ke index.
Konsep dasar model
- Model — fungsi matematis hasil belajar dari data, dipakai buat prediksi/ generate output baru.
- Training — proses “ngajarin” model dari data, model nyesuaikan parameter internalnya biar errornya makin kecil.
- Inference — proses pakai model yang udah jadi buat ngasih output dari input baru (bedanya sama training: nggak ada pembelajaran lagi di sini).
- Overfitting — model terlalu “menghafal” data training, jadi jelek performanya di data baru. Underfitting — model kebalikannya, terlalu sederhana sampe nggak nangkep pola yang ada.
- Feature — variabel input yang dipakai model buat belajar/prediksi (misal umur, harga, teks).
- Label / ground truth — jawaban yang benar buat satu data, dipakai buat ngajarin/ngevaluasi model (supervised learning).
- Hyperparameter — pengaturan yang di-set manusia sebelum training (bukan dipelajari model sendiri), misal learning rate, jumlah layer.
- Benchmark / evaluation — cara ngukur seberapa bagus model, biasanya bandingin ke dataset standar atau model lain.
LLM & generative AI (paling sering muncul sekarang)
- LLM (Large Language Model) — model bahasa raksasa (GPT, Claude, dll) yang dilatih dari banyak teks buat ngerti dan generate bahasa.
- Prompt engineering — teknik nyusun instruksi (prompt) ke LLM biar hasilnya sesuai yang diinginkan.
- Context window — batas jumlah teks (token) yang bisa “diingat”/diproses LLM dalam satu percakapan/request.
- Token — potongan teks terkecil yang diproses model (kira-kira ¾ kata dalam bahasa Inggris). Biaya pemakaian API biasanya dihitung per token.
- Fine-tuning — melatih ulang model yang udah jadi (pretrained) dengan data spesifik, biar lebih jago di satu domain/tugas tertentu.
- RAG (Retrieval-Augmented Generation) — teknik nyuntikin informasi eksternal (dari database/dokumen) ke prompt LLM sebelum dia jawab, biar jawabannya lebih akurat/up-to-date daripada cuma ngandelin memori model.
- Embedding — representasi teks/gambar/dll dalam bentuk vektor angka, dipakai buat ngukur “kemiripan makna” antar data (dasar dari RAG & semantic search).
- Vector database — database yang dioptimasi buat nyimpen dan nyari embedding berdasarkan kemiripan (Pinecone, Weaviate, pgvector).
- Hallucination — LLM ngasih jawaban yang keliatan meyakinkan tapi sebenarnya salah/ngarang.
- Agent / tool use — LLM yang bisa manggil fungsi/tool eksternal (API, kalkulator, search) buat nyelesain tugas, bukan cuma jawab teks doang.
- System prompt — instruksi “di belakang layar” yang ngatur perilaku dasar LLM sebelum user mulai ngobrol.
- Temperature — parameter yang ngatur seberapa “random”/kreatif output LLM; makin tinggi makin variatif (dan makin gampang ngaco).
MLOps & produksi
- MLOps — praktik ngelola siklus hidup model ML di produksi (mirip DevOps tapi buat ML): training, deployment, monitoring, retraining.
- Model drift / data drift — performa model menurun seiring waktu karena pola data di dunia nyata berubah dari data training.
- A/B testing — ngebandingin dua versi model/fitur ke user beneran buat liat mana yang lebih bagus performanya.
- Model registry — tempat nyimpen dan versi-in model yang udah dilatih, biar gampang dilacak model versi berapa yang lagi jalan di produksi.
- Latency (inference) — seberapa cepat model ngasih output setelah dikasih input — penting banget buat aplikasi real-time.
Flashcards
Apa bedanya training dan inference? :: Training = proses model belajar dari data (parameter berubah); inference = pakai model yang sudah jadi buat prediksi (parameter tetap) Apa itu RAG dan kenapa dipakai? :: Teknik nyuntikin data eksternal ke prompt LLM sebelum dijawab, biar jawaban lebih akurat/up-to-date daripada mengandalkan memori model saja Apa itu embedding? :: Representasi teks/data dalam bentuk vektor angka untuk mengukur kemiripan makna antar data Apa itu hallucination pada LLM? :: LLM memberi jawaban yang terdengar meyakinkan tapi sebenarnya salah atau mengarang Apa itu overfitting? :: Model terlalu menghafal data training sehingga performanya jelek di data baru