Unser erster Angestellter : Der Datensatz-Anonymisierer — MVP0 in der Probezeit
Publié le 01 May 2026
Table des matières
Lesezeit : 12 minutes
Ich stelle keinen LLM ein. Ich stelle einen Anonymisierer ein. Bevor ich RAG pgvector mache, bevor ich CDA/FPA-Experten fine-tune, bevor ich Kund*innen-Workspaces bereitstelle — jemand muss die Toiletten der Daten reinigen. Dieser Mitarbeiter ist der Anonymisierungsexperte (MVP0, EPIC 2 von codebase-gradle). Und er ist es, der das Produkt marktfähig macht.
- klopf
-
[]
Das Problem, das alle verjagt
Jede KI-Startup, die Trainingsdaten verarbeitet, stößt auf dieselbe Wand :
----
----
Données brutes client (SPG, cours, évaluations)
├→ Noms de stagiaires en clair dans les PDF
├→ Emails dans les métadonnées JSON
├→ IP de connexion dans les logs pgvector
├→ Identifiants dans les nœuds Graphify
└→ Références OF pilote dans les schémas SQL
----
Ergebnis: Entweder du machst RAG mit schmutzigen Daten (PII-Halluzinationen, Nicht-Einhaltung der DSGVO, rechtliches Risiko), oder du machst gar nichts (kein Produkt). Der dritte Weg — manuelles Aufräumen — ist nicht skalierbar.
Meine Antwort : das Problem nicht umgehen. L'**automatisieren**.
== MVP0 : Der Anonymisierer, Erster eingestellter während der Probezeit
Das MVP0 ist keine Feature. Es ist ein**Experte für Komfort**— ein Mitarbeiter, der die dreckige, dumme und böse Arbeit erledigt, über die niemand in den Pitch-Decks sprechen möchte.
Was er macht :
[source]
----
ENTRÉE : Données brutes multi-sources
├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
├→ JSON (catalogue formations) → emails, téléphones
├→ YAML (config workspace) → tokens OAuth2
├→ SQL (schémas DDL) → IP, adresses
├→ pgvector (métadonnées embeddings) → identifiants
├→ ONNX (outputs classification) → noms propres
└→ Graphify (graph.json) → nœuds avec PII
SORTIE : Datasets propres, format standardisé
├→ [ANONYMIZED] remplace les PII détectées
├→ Classification RGPD (niveau 0→4)
├→ Rapport d'audit (quoi a été nettoyé)
└→ Dataset prêt pour RAG ET fine-tuning
----
Er erkennt die offensichtlichsten Muster zuerst (E-Mails`.*@.*`, Tokens`sk-*`, `ghp_*`, IPs), dann lernt es. Die Probezeit, das ist es: wir prüfen, dass es keine falsch-negativen Ergebnisse durchlässt, bevor wir es übernehmen.
== Was dieser MVP freischaltet (und es ist nicht nur Compliance)
Die Anonymisierung als MVP0 ist nicht die DSGVO-Maut vor der Autobahn. Sie ist die Autobahn selbst. Das ist, was sie öffnet:
=== Gegenwart: Erweiterte Realität im Prompt
[source]
----
DONNÉES BRUTES CLIENT
↓
Anonymiseur MVP0 → datasets propres
↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----
RAG sucht nicht in schmutzigen Daten — es sucht in einem Raum**korrekt durch Konstruktion**. Das ändert alles für die Qualität der Antworten: Das LLM verbringt nicht seine Zeit damit, PII zu umgehen, die es erkennt, aber die es nicht erwähnen darf.
=== Zukunft: Fine-Tuning auf gesunden Daten
[source]
----
MVP0 → datasets propres accumulés (session après session)
↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----
Das Fine-Tuning mit Rohdaten ist eine potenzielle Rechtskatastrophe. Auf sauberem Datenmaterial ist es ein**Wiederholbare Methode**. Jeder Kunde sammelt seine bereinigten Datasets, jeder Kunde kann seine Fach-Experten auf seinen Daten fein abstimmen — ohne jemals personenbezogene Daten preiszugeben.
== Warum ist das marktfähig?
Es ist kein „DSGVO-Compliance-Tool“. Es ist eine**wiederholbare Methode, die ein universelles Problem in einen Vermögenswert umwandelt**:
1. *Jedes Ausbildungsunternehmen hat schmutzige Daten* — das ist das Problem
2. *Keine hat eine automatisierte mehrquellige Reinigungs-Pipeline* — das ist der Markt
3. *Der Durchlauf: Anonymisierung → RAG → Feintuning ist proprietär* — Das ist die Barriere
Der SaaS Edster (MVP3) wird keinen „Gradle-Workspace“ verkaufen. Er wird diese geschlossene Schleife verkaufen. Und das MVP0 ist der Einstieg.
== Das SQL-Format als dritter Weg des Kontextes
Der Import strukturierter Daten ist nicht nur ein Austauschformat. Das SQL-Schema (DDL) trägt das**Entitäts-Beziehungsmodell des Bereichs** :
[source]
----
CREATE TABLE formation (
id UUID PRIMARY KEY,
titre VARCHAR NOT NULL,
referentiel RNCP REFERENCES rncp(id),
organisme OF REFERENCES of_pilote(id) -- ← va être anonymisé
);
----
Dieses DDL, einmal anonymisiert (Zeile 4), wird zu einer Kontextquelle für das LLM. Kein Text — du**Geschäftsmodell**. RAG liefert den Inhalt (vektorbasierte Ähnlichkeit), Graphify liefert die Beziehungen (exakte Struktur), und das SQL-Schema liefert das**implizites Domain-Driven Design**: bounded contexts, Aggregates, Wertobjekte. Das LLM versteht das Geschäftsfeld, weil es sein Schema liest.
== Die Roadmap: von MVP0 bis SaaS
[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
Sortie : datasets propres, reproductible
MVP1 — RAG pgvector (dépend de MVP0)
Realité augmentée en prompt sur données nettoyées
MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
Vecteur composite de contexte (règles + similarité + relations exactes)
MVP3 — SaaS Edster (dépend de MVP0-2)
Provisionnement workspace client complet
----
Jeder MVP hängt vom vorherigen ab. Keiner kann ohne den MVP0 ausgeliefert werden. Aus diesem Grund ist der Anonymisierer im Backlog nicht « P0 » — er ist**MVP0**. Das ist das erste kommerzielle Lieferobjekt, und alles andere hängt von seinem Erfolg ab.
== Fazit: die unsichtbare Arbeit, die alles ermöglicht
In einem herkömmlichen Startup ist die Datenbereinigung ausgelagert, manuell oder ignoriert. In dieser Architektur ist es das**Kern des Produkts**. Der Anonymiseur ist der erste Mitarbeiter, denn ohne ihn funktioniert nichts:
* Ohne MVP0 → kein rechtmäßiges RAG (MVP1)
* Ohne MVP0 → kein Fine-Tuning ohne Datenleck (EPIC 5)
* Ohne MVP0 → kein glaubwürdiges SaaS (MVP3)
* Ohne MVP0 → keine erweiterte Realität im Prompt
* Ohne MVP0 → kein dritter Kontextweg (SQL DDD)
Er macht die schmutzige Arbeit. Er wird nie in den Pitches genannt. Aber er ist es, der die Fabrik am Laufen hält.
Deshalb wird er/sie als erstes eingestellt.
== Referenzen
* Artikel über die räumliche Ontologie und Vertrauenskreise :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[Die räumliche Ontologie als Ausrichtungsmechanismus]
* Artikel zur Governance des Agents Eager/Lazy:link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[Verwalten eines KI-Agenten mit AsciiDoc]
* Artikel über den Mechanismus Hot/Warm/Cold:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[Sliding Window und Kaltwelle]
* Artikel über den Vergleich der drei LLMs :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----