“In most organizations, systems and data evolve more organically than data management professionals would like.”
Motivasi DataOps
- Traditional data delivery = lambat (slow), mahal (costly), tidak transparan (opaque).
- Ada permintaan yang meningkat terhadap data yang usable, fresh, responsive.
- Kebutuhan ini didukung oleh self-service BI tools yang memberdayakan pengguna.
- DataOps = menyatukan data production + delivery menjadi satu praktik yang agile.
DataOps Memperluas Agile
- Dibangun di atas prinsip Agile.
- Mengirimkan working data sebagai prioritas utama (analog “working software” di Agile Manifesto).
- Menghargai orang dan kolaborasi di atas proses yang kaku.
- Beradaptasi dengan cepat terhadap perubahan.
- Praktik: data management practices, tim kecil, delivery yang sering, feedback harian, otomasi.
DataOps Memperluas DevOps
- DevOps menyatukan development + operations; DataOps menyatukan data engineering + operations.
- Tenet inti yang diterapkan:
- Think services, not servers → Data as a Service (API, streams, lakes).
- Infrastructure as Code (IaC) → versioned, tested, repeatable.
- Automate everything → perubahan skema, compliance, skalabilitas.
Praktik DataOps
- Menerapkan proses Agile → siklus delivery yang pendek.
- Berintegrasi erat dengan customer (konsumen data internal).
- Mengimplementasikan segalanya dalam kode (IaC + best practices).
- Memelihara beberapa environment (dev, test, prod).
- Mengintegrasikan toolchain lintas domain.
- Menguji segalanya sebelum deployment.
(Lihat kembali roda DAMA-DMBOK2 di 9_DataOps_Data_Architecture_and_Master_Data — semua area fungsi tersebut menjadi konteks bagi praktik DataOps ini.)
Tantangan dan Kapabilitas Kunci
Tantangan
- Kurangnya Application Data Interface (ADI) yang terstandarisasi.
- Perlu mendukung baik snapshots (tables) maupun streams (transactions).
- Interface query yang spesifik-vendor membatasi portabilitas.
- Resource-intensive: storage, compute, networking.
- Perubahan skema yang sering → membutuhkan adaptabilitas.
- Tuntutan governance dan compliance.
Kapabilitas Kunci
- DataOps + Agile data engineering = organisasi data generasi berikutnya (next-gen).
- Kapabilitas kunci: source data inventory, data movement & shaping, logical models of unified data, unified data hub, feedback loops untuk continuous improvement.
- Tujuan: mengirimkan data yang bersih, lengkap, dan terkini (clean, complete, current) → meningkatkan “company IQ”.
DataOps Principles
Pentingnya Prinsip DataOps
- Menghindari jebakan “single vendor, single platform”.
- Ekosistem yang open dan best-of-breed = kesuksesan jangka panjang.
- Memaksimalkan penggunaan ulang (reuse) data berkualitas.
- Fleksibilitas untuk mengganti tools yang berkinerja buruk.
1. Highly Automated
- Skala data enterprise melampaui kemampuan penanganan manual.
- Otomasi mencakup: cataloging, moving, organizing data.
- Terinspirasi dari otomasi DevOps (build, test, release).
- Menjamin repeatability, reliability, speed.
2. Open Ecosystem
- Tidak proprietary, tidak terkunci (locked-in) pada satu vendor.
- Campuran tools FOSS (Free/Open Source Software) + proprietary.
- Saling beroperasi (interoperate) lewat API.
- Fleksibilitas untuk mengadopsi tools yang lebih baik.
3. Best of Breed
- Setiap tool dipilih untuk tujuan (purpose) spesifiknya.
- Powerful dan membebaskan (liberating), tapi kompleks.
- Pemilihan tool membutuhkan testing dan validasi dunia nyata.
- Contoh nyata: kisah kerja Mark Ramsey di GSK yang menggambarkan bagaimana mengombinasikan banyak vendor bisa berhasil mengelola data pada skala besar.
4. Table(s) in / Table(s) out
- Lowest common denominator = tables — tabel menjadi metode integrasi utama.
- Terinspirasi dari Spark RDD & DataFrame.
- Desain service-oriented sangat krusial.
5. Layered Interfaces
Tiga gaya interface inti untuk berkomunikasi dengan data:
- Data access services — SQL-like views.
- Messaging services — pertukaran event/stateful.
- REST services — fleksibilitas berbasis API.
Alur lapisan: Application/User Space ↔ REST/API Services ↔ Messaging Services ↔ Data Access Services ↔ Data Space.

6. Data Lineage & Provenance
- Melacak input, output, dan langkah pemrosesan.
- Memungkinkan reproducibility dalam analitik dan ML.
- Membangun kepercayaan terhadap kualitas data.
- Lineage adalah spektrum, bukan sesuatu yang absolut (bisa lebih detail atau lebih kasar tergantung kebutuhan).
7. Data Integration Approaches
Tiga pendekatan integrasi data:
- Deterministic — misalnya rules, ETL.
- Probabilistic — misalnya model machine learning.
- Humanistic — misalnya feedback manusia.
- Kombinasikan ketiganya untuk mencapai skala.
- Style arsitektur: warehouse, lake, lakehouse, fabric, mesh (lihat 12_DataOps_Data_Architecture_Styles_and_Flow_Patterns untuk detail masing-masing).
8. Aggregated + Federated Storage
- Kedua pendekatan (agregasi terpusat vs. federasi terdistribusi) dibutuhkan dalam enterprise modern.
- Trade-off: performance vs. control.
- Cloud storage (S3, GCS) memungkinkan model hybrid.
9. Batch + Streaming Processing
- Ekosistem yang sehat mendukung kedua mode.
- Batch = pemrosesan skala besar dan periodik.
- Streaming = konsumsi real-time.
- Kafka memvalidasi desain dual-mode ini.
DataOps Component (Komponen Ekosistem DataOps)
Poin Penting
- Ecosystem = kumpulan komponen yang saling beroperasi (interoperable).
- Tujuannya adalah menyeimbangkan keputusan buy vs. build.
- Komponen berevolusi sepanjang 8–10 tahun praktik enterprise.
- Bukan satu tool atau platform tunggal — melainkan kumpulan tools best-of-breed yang saling melengkapi.
- Memprioritaskan merespons perubahan di atas rencana yang kaku.
- Desain inti: interoperability + automation.
- Area kunci: Catalog, Movement, Alignment, Storage, Publishing, Feedback, Governance.
Interoperability
- Merupakan pergeseran dari platform integrasi data monolitik (ETL tunggal).
- Bersifat plug-and-play lintas vendor, open source, dan tools buatan sendiri (homegrown).
- Tiap tool melakukan satu hal secara sangat baik.
- Overlap antar tool diperbolehkan, selama hasilnya bisa di-import/export.
- Metadata exchange menjadi enabler kunci.
- Contoh: dataset profiling bisa dilakukan lintas tool extract, unify, dan catalog.
Metadata Exchange
- Menggunakan format metadata yang terbuka dan interoperable.
- Metadata dipertahankan dan diperkaya di setiap tahap pipeline.
- Contoh: tipe numerik, deskripsi, format ikut diteruskan sepanjang pipeline.
- Memungkinkan mapping, kategorisasi, dan presentasi yang akurat.
Automation
- Etos API-first → setiap aksi UI tersedia lewat API.
- Dua mode: continuous dan batch automation.
- Continuous = me-refresh/memperbarui dataset.
- Batch = spin up/tear down pipeline secara otomatis.
- Memungkinkan responsiveness dan repeatability.
Continuous Automation
Mengotomasi publishing dan refresh dataset; API untuk update dataset/atribut/dashboard; manajemen konflik antara update manual (user) vs. API; melaporkan health, state, dan versi.
Batch Automation
Mengotomasi inisialisasi, eksekusi, shutdown; API untuk mengimpor artifact/metadata/konfigurasi; mengkodifikasi workflow untuk mapping/matching/kategorisasi; memungkinkan testing pipeline secara programatik.
Area Kunci Ekosistem DataOps
| Area | Deskripsi | Contoh Tools | DAMA KA Terkait |
|---|---|---|---|
| Catalog / Registry | Titik awal kritis: “Data apa saja yang kita miliki?” Kombinasi otomasi + panduan manusia; pendekatan terbaik: vendor-neutral, open, interoperable | Apache Atlas, Alation, Waterline | Metadata, Data Quality |
| Movement | Perpindahan data — ETL tradisional hingga tools streaming modern; Python + Airflow jadi baseline umum | Informatica, Talend, Oracle, IBM, Microsoft (tradisional); StreamSets, DataKitchen, KNIME (baru); GCP DataFlow, Azure, AWS, Databricks, Snowflake (cloud) | Data Warehousing & BI, Data Integration & Interoperability |
| Alignment/Unification | Menyelaraskan variasi data enterprise lewat rules, model, dan feedback manusia; active learning + model probabilistik meningkatkan kecocokan; keahlian manusia menangani corner case | — | Metadata, Reference & Master Data, Data Integration & Interoperability |
| Storage | Evolusi dari row store ke platform modern; cloud lebih unggul dalam iterasi cepat dan investasi awal lebih rendah; vendor tradisional (IBM, Oracle, Teradata) mulai tertinggal | AWS Redshift, GCP BigTable/Spanner, Azure SQL, Databricks, Snowflake (cloud); Vertica, Postgres (on-prem) | Data Storage & Operation, Data Security, Document & Content Management |
| Publishing | Mekanisme mempublikasikan data yang bersih dan berkualitas tinggi, dalam format machine + human-readable, dengan rekomendasi dinamis (baris, kolom, relasi) | — | Data Warehousing & BI, Document & Content Management |
| Feedback | Komponen paling berdampak namun paling kurang dihargai; kondisi saat ini: pipeline bersifat unidirectional (searah) tanpa feedback; dibutuhkan feedback loop sistematis dari konsumen kembali ke sumber data | — | — |
| Governance | Didorong oleh regulasi privasi data; fokus pada otomasi kebijakan akses informasi, diselaraskan dengan role pengguna dan penegakan kebijakan; hindari “boiling the ocean” — prioritaskan scope yang praktis | — | Data Security, Metadata, Data Architecture |
Data Supply Chain
Analogi rantai pasok untuk data:
- Ingest → mengimpor dan memuat data mentah.
- Preparation/Cleansing → memastikan kualitas (“garbage in, garbage out”).
- Analysis → modeling, discovery, decision support.
- Egress → output dikonsumsi oleh manusia, mesin, maupun sistem lain.
Peran (Roles) dalam DataOps
Enam peran kunci yang terlibat dalam ekosistem DataOps: Business Users, Data Analysts, Data Scientists, Data Engineers, Developers, dan Operational Engineers.
Arsitektur Ekosistem DataOps (Rangkuman Visual)
Alur menyeluruh: Data Source → Data Integration & Interoperability (Data Streaming, Data Ingestion/ELT) → Data Pipeline (Data Processing/Storage) → Data Governance & Management (Data Quality & Validation, Master Data Management & Reference, Metadata Management & Lineage) → Data Catalog & Security → Data Consumption & Analytics (Data Analytics & Modeling → Dashboarding & Reporting), semuanya dipayungi oleh CI/CD & Automation (Version Control/Git, Automated Data Testing, CI/CD Pipeline) yang memberi feedback ke berbagai tahap, dan Monitoring & Observability yang mengawasi keseluruhan sistem.

Flashcard
flashcards Apa definisi singkat DataOps menurut slide ini? :: DataOps adalah praktik yang menyatukan data production dan delivery menjadi satu praktik yang agile, sebagai jawaban atas traditional data delivery yang lambat, mahal, dan tidak transparan. Sebutkan 3 tenet inti DevOps yang diterapkan DataOps. :: Think services not servers (Data as a Service via API/streams/lakes), Infrastructure as Code (versioned, tested, repeatable), dan Automate everything (schema changes, compliance, scalability). Sebutkan 9 prinsip DataOps yang dibahas (Highly Automated dst). :: Highly Automated, Open Ecosystem, Best of Breed, Table(s) in/Table(s) out, Layered Interfaces, Data Lineage & Provenance, Data Integration Approaches, Aggregated + Federated Storage, Batch + Streaming Processing. Apa maksud prinsip “Table(s) in / Table(s) out” dalam DataOps? :: Prinsip bahwa tabel menjadi lowest common denominator dan metode integrasi utama antar tools dalam ekosistem DataOps, terinspirasi dari konsep Spark RDD dan DataFrame, dengan desain service-oriented yang kritis. Sebutkan 3 gaya Layered Interfaces dalam DataOps. :: Data access services (SQL-like views), Messaging services (event/stateful interchange), dan REST services (API-driven flexibility). Mengapa komponen “Feedback” dianggap paling berdampak namun paling kurang dihargai dalam ekosistem DataOps? :: Karena kondisi pipeline data saat ini umumnya bersifat unidirectional (searah dari sumber ke konsumen) tanpa mekanisme sistematis untuk mengalirkan feedback kembali dari konsumen ke sumber data, padahal feedback loop tersebut sangat berdampak pada peningkatan kualitas data berkelanjutan. Sebutkan 7 area kunci komponen ekosistem DataOps. :: Catalog, Movement, Alignment, Storage, Publishing, Feedback, Governance. Sebutkan 4 tahap dalam Data Supply Chain. :: Ingest (import & load raw data), Preparation/Cleansing (memastikan kualitas, “garbage in garbage out”), Analysis (modeling, discovery, decision support), Egress (output dikonsumsi manusia/mesin/sistem). Sebutkan 6 peran (roles) dalam DataOps. :: Business Users, Data Analysts, Data Scientists, Data Engineers, Developers, Operational Engineers.