Table des matières
Lesezeit : 12 minutes

Ich stelle keinen LLM ein. Ich stelle einen Anonymisierer ein. Bevor ich RAG pgvector mache, bevor ich CDA/FPA-Experten fine-tune, bevor ich Kund*innen-Workspaces bereitstelle — jemand muss die Toiletten der Daten reinigen. Dieser Mitarbeiter ist der Anonymisierungsexperte (MVP0, EPIC 2 von codebase-gradle). Und er ist es, der das Produkt marktfähig macht.

klopf

[]

Das Problem, das alle verjagt

Jede KI-Startup, die Trainingsdaten verarbeitet, stößt auf dieselbe Wand :

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

Ergebnis: Entweder du machst RAG mit schmutzigen Daten (PII-Halluzinationen, Nicht-Einhaltung der DSGVO, rechtliches Risiko), oder du machst gar nichts (kein Produkt). Der dritte Weg — manuelles Aufräumen — ist nicht skalierbar.

Meine Antwort : das Problem nicht umgehen. L'**automatisieren**.

== MVP0 : Der Anonymisierer, Erster eingestellter während der Probezeit

Das MVP0 ist keine Feature. Es ist ein**Experte für Komfort**— ein Mitarbeiter, der die dreckige, dumme und böse Arbeit erledigt, über die niemand in den Pitch-Decks sprechen möchte.

Was er macht :

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

Er erkennt die offensichtlichsten Muster zuerst (E-Mails`.*@.*`, Tokens`sk-*`, `ghp_*`, IPs), dann lernt es. Die Probezeit, das ist es: wir prüfen, dass es keine falsch-negativen Ergebnisse durchlässt, bevor wir es übernehmen.

== Was dieser MVP freischaltet (und es ist nicht nur Compliance)

Die Anonymisierung als MVP0 ist nicht die DSGVO-Maut vor der Autobahn. Sie ist die Autobahn selbst. Das ist, was sie öffnet:

=== Gegenwart: Erweiterte Realität im Prompt

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAG sucht nicht in schmutzigen Daten — es sucht in einem Raum**korrekt durch Konstruktion**. Das ändert alles für die Qualität der Antworten: Das LLM verbringt nicht seine Zeit damit, PII zu umgehen, die es erkennt, aber die es nicht erwähnen darf.

=== Zukunft: Fine-Tuning auf gesunden Daten

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

Das Fine-Tuning mit Rohdaten ist eine potenzielle Rechtskatastrophe. Auf sauberem Datenmaterial ist es ein**Wiederholbare Methode**. Jeder Kunde sammelt seine bereinigten Datasets, jeder Kunde kann seine Fach-Experten auf seinen Daten fein abstimmen — ohne jemals personenbezogene Daten preiszugeben.

== Warum ist das marktfähig?

Es ist kein „DSGVO-Compliance-Tool“. Es ist eine**wiederholbare Methode, die ein universelles Problem in einen Vermögenswert umwandelt**:

1. *Jedes Ausbildungsunternehmen hat schmutzige Daten* — das ist das Problem
2. *Keine hat eine automatisierte mehrquellige Reinigungs-Pipeline* — das ist der Markt
3. *Der Durchlauf: Anonymisierung → RAG → Feintuning ist proprietär* — Das ist die Barriere

Der SaaS Edster (MVP3) wird keinen „Gradle-Workspace“ verkaufen. Er wird diese geschlossene Schleife verkaufen. Und das MVP0 ist der Einstieg.

== Das SQL-Format als dritter Weg des Kontextes

Der Import strukturierter Daten ist nicht nur ein Austauschformat. Das SQL-Schema (DDL) trägt das**Entitäts-Beziehungsmodell des Bereichs** :

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

Dieses DDL, einmal anonymisiert (Zeile 4), wird zu einer Kontextquelle für das LLM. Kein Text — du**Geschäftsmodell**. RAG liefert den Inhalt (vektorbasierte Ähnlichkeit), Graphify liefert die Beziehungen (exakte Struktur), und das SQL-Schema liefert das**implizites Domain-Driven Design**: bounded contexts, Aggregates, Wertobjekte. Das LLM versteht das Geschäftsfeld, weil es sein Schema liest.

== Die Roadmap: von MVP0 bis SaaS

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

Jeder MVP hängt vom vorherigen ab. Keiner kann ohne den MVP0 ausgeliefert werden. Aus diesem Grund ist der Anonymisierer im Backlog nicht « P0 » — er ist**MVP0**. Das ist das erste kommerzielle Lieferobjekt, und alles andere hängt von seinem Erfolg ab.

== Fazit: die unsichtbare Arbeit, die alles ermöglicht

In einem herkömmlichen Startup ist die Datenbereinigung ausgelagert, manuell oder ignoriert. In dieser Architektur ist es das**Kern des Produkts**. Der Anonymiseur ist der erste Mitarbeiter, denn ohne ihn funktioniert nichts:

* Ohne MVP0 → kein rechtmäßiges RAG (MVP1)
* Ohne MVP0 → kein Fine-Tuning ohne Datenleck (EPIC 5)
* Ohne MVP0 → kein glaubwürdiges SaaS (MVP3)
* Ohne MVP0 → keine erweiterte Realität im Prompt
* Ohne MVP0 → kein dritter Kontextweg (SQL DDD)

Er macht die schmutzige Arbeit. Er wird nie in den Pitches genannt. Aber er ist es, der die Fabrik am Laufen hält.

Deshalb wird er/sie als erstes eingestellt.

== Referenzen

* Artikel über die räumliche Ontologie und Vertrauenskreise :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[Die räumliche Ontologie als Ausrichtungsmechanismus]
* Artikel zur Governance des Agents Eager/Lazy:link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[Verwalten eines KI-Agenten mit AsciiDoc]
* Artikel über den Mechanismus Hot/Warm/Cold:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[Sliding Window und Kaltwelle]
* Artikel über den Vergleich der drei LLMs :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

Verwandte Artikel