waktu membaca : 12 minutes

Saya tidak merekrut sebuah LLM. Saya merekrut seorang penganonim. Sebelum melakukan RAG pgvector, sebelum fine-tuning ahli CDA/FPA, sebelum menyediakan workspace klien — seseorang harus membersihkan toilet data. Pegawai ini adalah ahli anonymisasi (MVP0, EPIC 2 dari codebase-gradle). Dan itulah yang membuat produk dapat dipasarkan.

tik

[]

Masalah yang membuat semua orang lari

Semua startup AI yang memanipulasi data pelatihan menabrak dinding yang sama :

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

Hasil: baik kamu melakukan RAG pada data kotor (halusinasi PII, tidak kepatuhan terhadap GDPR, risiko hukum), atau kamu tidak melakukan apa-apa (tidak ada produk). Cara ketiga — membersihkan secara manual — tidak dapat diskalakan.

Jawaban saya: jangan mengelakari masalah. L'**mengotomatisasi**.

== MVP0: Anonimizer, pertama yang dipekerjakan dalam masa percobaan

MVP0 bukanlah sebuah fitur. Ini adalah**pakar kenyamanan**— seorang pekerja yang mengerjakan pekerjaan kotor, bodoh dan jahat, dan yang tidak ada yang ingin membicarakan di dalam dek pitch.

Yang dilakukan olehnya:

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

Deteksi pola yang paling jelas terlebih dahulu (email`.*@.*`, token`sk-*`, `ghp_*`, IPs), kemudian ia belajar. Masa uji: ini adalah kita memastikan bahwa dia tidak membiarkan negatif palsu lolos sebelum kita mengangkatnya sebagai tetap.

== Apa yang Dibuka oleh MVP Ini (dan ini bukan hanya kepatuhan)

Anonymisasi seperti MVP0 bukan tol RGPD sebelum jalan raya. Ini adalah jalan raya itu sendiri. Berikut ini adalah apa yang dibukanya :

=== Sekarang: Realitas Augmented dalam Prompt

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAG tidak mencari di data kotor — ia mencari di sebuah ruang**bersih oleh konstruksi**. Ini mengubah segalanya untuk kualitas jawaban: LLM tidak menghabiskan waktunya untuk mengelakari PII yang dikenal tetapi tidak boleh disebutkan.

=== Masa depan : Fine-Tuning pada Data Sehat

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

Fine-tuning pada data mentah adalah potensi bencana hukum. Pada data bersih, ini adalah**metode yang dapat direproduksi**. Setiap klien mengakumulasi dataset yang telah dibersihkan miliknya, setiap klien dapat melatih ulang ahli bisnisnya pada data mereka — tanpa pernah mengekspos data pribadi.

== Mengapa Ini Dapat Dipasarkan

Ini bukan « alat kepatuhan GDPR ». Ini adalah**metode yang dapat direproduksi yang mengubah masalah universal menjadi aset**:

1. *Semua perusahaan pelatihan memiliki data kotor* — ini adalah masalah
2. *Tidak ada yang memiliki pipeline pembersihan multi-source otomatis* — itu adalah pasar
3. *Lingkaran: anonimisasi → RAG → fine-tuning adalah proprietari* — itu adalah hambatan

SaaS Edster (MVP3) tidak akan menjual « sebuah workspace Gradle ». Dia akan menjual loop yang tertutup ini. Dan MVP0 adalah pintu masuk.

== Format SQL sebagai Cara Ketiga dari Konteks

Import data terstruktur bukan hanya format pertukaran. Skema SQL (DDL) memuat**model entitas-relasi domain**:

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

DDL ini, setelah dianonimkan (baris 4), menjadi sumber konteks untuk LLM. Bukan teks —**model bisnis**. RAG memberikan konten (kesamaan vektor), Graphify memberikan relasi (struktur tepat), dan skema SQL memberikan le**Domain-Driven Design implisit**bounded contexts, agregat, value objects. LLM memahami bidang karena ia membaca skemanya.

== Peta jalan: dari MVP0 ke SaaS

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

Ini adalah alasan mengapa Anonymiser tidak « P0 » dalam backlog — ia adalah**MVP0**. Ini adalah produk yang pertama yang dapat diperjualbelikan, dan seluruh hal lainnya bergantung pada keberhasilannya.

== Kesimpulan : Pekerjaan Tak Terlihat yang Membuat Semua Hal Mungkin

Dalam startup konvensional, pembersihan data dilakukan secara eksternal, secara manual, atau diabaikan. Dalam arsitektur ini, ini adalah**inti dari produk**. Anonymiseur adalah karyawan pertama karena tanpa dia, tidak ada yang berfungsi :

* Tanpa MVP0 → tidak ada RAG legal (MVP1)
* Tanpa MVP0 → tidak ada fine-tuning tanpa kebocoran data (EPIC 5)
* Tanpa MVP0 → tidak ada SaaS yang kredibel (MVP3)
* Tanpa MVP0 → tidak ada realitas augmentasi dalam prompt
* Tanpa MVP0 → tidak ada jalur konteks ketiga (SQL DDD)

Dia melakukan pekerjaan kotor. Dia tidak akan pernah disebut dalam pitch. Tetapi dia yang menjaga pabrik berjalan.

Dan itulah sebabnya kita merekrutnya terlebih dahulu.

== Referensi

* Article tentang ontologi spasial dan lingkaran kepercayaan :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[Ontologi Spasial sebagai Mekanisme Penyelarasan]
* Artikel tentang tata kelola agen Eager/Lazy :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[Mengatur Agen AI dengan AsciiDoc]
* Artikel tentang mekanisme Hot/Warm/Cold:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[Sliding Window dan Gelombang Dingin]
* Artikel tentang perbandingan tiga LLMs :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

Artikel terkait