Istilah Data

Balik ke index.

Data engineering

  • ETL / ELT — Extract, Transform, Load: proses ambil data dari sumber, diolah/dibersihkan, lalu disimpan ke tempat lain. ELT bedanya cuma urutan: data ditransform setelah di-load (biasanya dipakai kalau data warehouse-nya kuat, transform dikerjain di sana).
  • Data pipeline — rangkaian proses otomatis yang mindahin & ngolah data dari sumber ke tujuan (misal dari database transaksi ke data warehouse).
  • Data warehouse — tempat nyimpen data yang udah terstruktur & siap dianalisis (Snowflake, BigQuery, Redshift) — beda dari database aplikasi yang dioptimasi buat transaksi.
  • Data lake — tempat nyimpen data mentah dalam jumlah besar, format apa aja (terstruktur/nggak), belum tentu langsung siap dianalisis.
  • Batch processing vs streaming — batch = data diolah berkala dalam kelompok besar (misal tiap malam); streaming = data diolah real-time begitu datang (Kafka, Flink).
  • Data pipeline orchestration — ngatur urutan & jadwal proses-proses dalam pipeline (Airflow, Dagster) — mastiin step B baru jalan setelah step A sukses.
  • Idempotent pipeline — pipeline yang kalau dijalankan ulang dengan input yang sama, hasilnya tetap sama (nggak dobel data) — sama konsepnya kayak idempotency di SWE.

Data quality & modeling

  • Data drift — perubahan pola/distribusi data dari waktu ke waktu, bisa bikin model/analisis yang lama jadi nggak relevan lagi.
  • Data lineage — jejak dari mana suatu data berasal dan lewat proses apa aja sampe ke bentuk sekarang — penting buat debugging & audit.
  • Schema — struktur/definisi bentuk data (nama kolom, tipe data). Schema evolution — perubahan struktur itu seiring waktu, dan gimana sistem handle perubahan tanpa nge-break yang lama.
  • Feature engineering — proses bikin/milih variabel (feature) dari data mentah yang paling berguna buat model ML.
  • Data catalog — semacam “daftar isi” buat semua dataset yang ada di organisasi, biar orang bisa nemu data yang relevan.
  • Star schema / dimensional modeling — cara desain tabel di data warehouse biar gampang buat query analitik (tabel fakta + tabel dimensi).

Analytics & metrics

  • KPI (Key Performance Indicator) — metrik utama yang dipakai buat ngukur keberhasilan suatu hal (bukan istilah data doang, tapi sering disebut di konteks dashboard/reporting).
  • North star metric — satu metrik utama yang paling merepresentasikan value produk buat user, dipakai sebagai fokus tim.
  • Cohort analysis — analisis dengan ngelompokkan user berdasarkan karakteristik/waktu yang sama (misal “user yang daftar bulan Januari”), buat liat tren perilaku mereka dari waktu ke waktu.
  • Data-driven decision — keputusan yang diambil berdasarkan data/analisis, bukan cuma asumsi/insting.

Ops

  • Data governance — kebijakan & proses buat mastiin data dikelola dengan benar (siapa yang boleh akses, gimana kualitasnya dijaga, kepatuhan regulasi).
  • Observability (data) — mirip observability di SWE tapi buat data: monitoring apakah pipeline jalan normal, data yang masuk sesuai ekspektasi (nggak kosong/aneh).
  • Data contract — kesepakatan formal antara tim penghasil data dan pengguna data soal format & jaminan kualitas data yang dikirim.

Flashcards

Apa bedanya ETL dan ELT? :: ETL mentransformasi data sebelum di-load; ELT me-load data mentah dulu lalu transformasi dilakukan di tempat tujuan (biasanya data warehouse) Apa bedanya data warehouse dan data lake? :: Data warehouse menyimpan data terstruktur yang siap dianalisis; data lake menyimpan data mentah dalam berbagai format, belum tentu siap dianalisis Apa itu data drift? :: Perubahan pola/distribusi data dari waktu ke waktu yang bisa membuat model/analisis lama jadi tidak relevan Apa itu data lineage dan kenapa penting? :: Jejak asal-usul data dan proses yang dilaluinya; penting untuk debugging dan audit Apa itu feature engineering? :: Proses membuat atau memilih variabel dari data mentah yang paling berguna untuk model ML