waktu membaca : 12 minutes

Saya tidak mempekerjakan seorang LLM. Saya mempekerjakan seorang penononim. Sebelum melakukan RAG pgvector, sebelum melakukan fine-tuning pada ahli CDA/FPA, sebelum menyediakan workspaces klien — seseorang harus membersihkan toilet data. Pegawai ini adalah ahli anonimisasi (MVP0, EPIC 2 dari codebase-gradle). Dan itulah yang menjadikan produk tersebut dapat dipasarkan.

tik

[]

Masalah yang membuat semua orang melarikan diri

Semua startup AI yang memproses data pelatihan menghadapi dinding yang sama :

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

Hasil: atau kamu melakukan RAG pada data kotor (halusinasi PII, tidak kepatuhan GDPR, risiko hukum), atau kamu tidak melakukan apa-apa (tidak ada produk). Cara ketiga — membersihkan secara manual — tidak dapat diskalakan.

Jawaban saya: tidak menghindari masalah. L'**mengotomatisasi**.

== MVP0: Penyamar, Pekerja pertama yang dipekerjakan dalam masa percobaan

MVP0 bukan fitur. Ini adalah**ahli kenyamanan**— seorang pekerja yang mengerjakan pekerjaan kotor yang bodoh dan jahat, dan yang tidak ada yang mau membicarakan dalam pitch decks.

Apa yang dia lakukan :

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

Dia mendeteksi pola-pola yang paling jelas terlebih dahulu (emails)`.*@.*`, token`sk-*`, `ghp_*`, IPs), lalu ia belajar. Masa percobaan, itu adalah itu: kita memvalidasi bahwa ia tidak membiarkan negatif palsu lolos sebelum mengangkatnya tetap.

== Apa yang dibuka oleh MVP ini (dan ini bukan hanya kepatuhan)

Anonimisasi seperti MVP0 bukan tol GDPR sebelum jalan raya. Itu adalah jalan raya itu sendiri. Berikut apa yang dibukanya :

=== Saat ini: Realitas Augmented dalam Prompt

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAG tidak mencari di data kotor — ia mencari di ruang**bersih oleh konstruksi**. Ini mengubah semuanya untuk kualitas jawaban: LLM tidak menghabiskan waktunya untuk mengelak dari PII yang dia kenali tetapi tidak boleh disebutkan.

=== Masa depan : Fine-Tuning pada Data Sehat

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

Fine-tuning pada data mentah adalah potensi bencana hukum. Pada data bersih, ini adalah**metode yang dapat direproduksi**. Setiap klien mengakumulasi datasetnya yang telah dibersihkan, setiap klien dapat melakukan fine-tuning pada pakar bisnisnya atas datanya — tanpa pernah mengekspos data pribadi.

== Mengapa itu dapat dipasarkan?

Bukan « alat kepatuhan GDPR ». Ini adalah**metode yang dapat direproduksi yang mengubah masalah universel menjadi aset**:

1. *Semua perusahaan pelatihan memiliki data kotor* — ini masalahnya
2. *Tidak ada yang memiliki pipeline pembersihan otomatis multi-sumber* — itu adalah pasar
3. *Perulangan: anonymisasi → RAG → fine-tuning bersifat proprietor* — itu adalah hambatan

SaaS Edster (MVP3) tidak akan menjual « workspace Gradle ». Ia akan menjual loop tertutup ini. Dan MVP0 adalah pintu masuk.

== Format SQL sebagai Cara Ketiga dari Konteks

Pengimporan data terstruktur bukan hanya format pertukaran. Skema SQL (DDL) memuat**model entitas-relasi domain**:

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

DDL ini, setelah dianonimkan (baris 4), menjadi sumber konteks untuk LLM. Bukan teks —**model bisnis**. RAG memberikan konten (similaritas vektor), Graphify memberikan relasi (struktur tepat), dan skema SQL memberikan**Desain Berbasis Domain implisit**: bounded contexts, agrégats, value objects. LLM memahami bisnis karena ia membaca skemanya.

== Roadmap: dari MVP0 ke SaaS

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

Setiap MVP bergantung pada yang sebelumnya. Tidak ada yang dapat dikirim tanpa MVP0. Ini adalah alasan mengapa Anonymiseur bukan « P0 » dalam backlog — ia adalah**MVP0**. Ini adalah deliverable komersial pertama, dan semua sisanya bergantung pada keberhasilannya.

== Kesimpulan : pekerjaan tidak terlihat yang membuat segalanya mungkin

Dalam startup konvensional, pembersihan data di-outsource, dilakukan secara manual, atau diabaikan. Dalam arsitektur ini, ini adalah**inti produk**. L'Anonymiseur adalah karyawan pertama karena tanpa dia, tidak ada yang berfungsi :

* Tanpa MVP0 → tidak ada RAG legal (MVP1)
* Tanpa MVP0 → tidak ada fine-tuning tanpa kebocoran data (EPIC 5)
* Tanpa MVP0 → tidak ada SaaS kredibel (MVP3)
* Tanpa MVP0 → tidak ada realitas augmentasi dalam prompt
* Tanpa MVP0 → tidak ada jalur ketiga konteks (SQL DDD)

Dia melakukan pekerjaan kotor. Dia tidak akan pernah disebutkan dalam pitch. Tapi dia yang menjaga pabrik berjalan.

Dan itulah mengapa kami merekrutnya terlebih dahulu.

== Referensi

* Article tentang ontologi spasial dan lingkaran kepercayaan :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[Ontologi Spasial sebagai Mekanisme Penyelarasan]
* Artikel tentang governansi agen Eager/Lazy :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[Mengatur Agent AI dengan AsciiDoc]
* Artikel tentang mekanisme Hot/Warm/Cold :link:../2026/0110_mecanisme_backup_contexte_agent_post.html[Sliding Window dan Gelombang Dingin]
* Artikel tentang perbandingan dari tiga LLM :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

Artikel terkait