읽는 시간 : 12 minutes

저는 LLM을 고용하지 않습니다. 저는 익명화자를 고용합니다. RAG pgvector를 수행하기 전, CDA/FPA 전문가를 fine-tuning하기 전, 클라이언트 워크스페이스를 프로비저닝하기 전 — 누군가는 데이터의 화장실을 청소해야 합니다. 그 직원은 익명화 전문가(MVP0, codebase-gradle의 EPIC 2)입니다. 그리고 그가 제품을 시장가능하게 만듭니다.

틱

[]

모두를 도망치게 하는 문제

훈련 데이터를 다루는 모든 인공지능 스타트업은 같은 벽에 부딪힙니다:

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

결과: 더러운 데이터에서 RAG를 수행한다(개인정보(PII) 환각, GDPR 비준수, 법적 위험)와 그렇지 않으면 아무것도 하지 않는다(제품 없음). 세 번째 방식 — 수작업으로 정리하기 — 는 확장할 수 없다.

내 답변: 문제를 피하지 마라. L'**자동화하다**.

== MVP0 : 익명화자, 시험 기간 중 첫 번째 채용

MVP0는 기능이 아닙니다. 그것은**편의 전문가**— 더럽고 멍청하고 사악한 일을 하는 직원, 그리고 누구도 피치 덱에서 이야기하고 싶어하지 않는 사람.

그가 하는 것:

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

가장 명백한 패턴부터 먼저 감지합니다 (이메일`.*@.*`, 토큰`sk-*`, `ghp_*`, IPs), 그는 배운다. 시험 기간은 이것이죠: 우리는 그가 거짓 음성을 놓치지 않도록 확인한 뒤 그를 정규직으로 채용한다.

== 이 MVP가 열어젖히는 것(그리고 이것이 단지 규정이 아님)

MVP0 형태의 익명화는 고속도로 앞의 GDPR 통행세가 아니다. 그것은 고속도로 자체이다. 다음은 그것이 열어주는 것:

=== 현재 : 프롬프트에서의 증강 현실

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAG은 오염된 데이터에서 검색하지 않고 — 공간에서 검색합니다**구축에 따라 깨끗한**. 이것이 답변 품질의 판도를 바꾼다: LLM은 인식하지만 언급해서는 안 되는 PII를 우회하는 데 시간을 보내지 않는다.

=== 미래 : 건강한 데이터에 대한 파인튜닝

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

원시 데이터에서의 파인튜닝은 잠재적인 법적 재앙이다. 깨끗한 데이터에서는 이것이**재현 가능한 방법**. 각 클라이언트는 정제된 데이터셋을 축적하고, 각 클라이언트는 개인 데이터를 노출시키지 않고 자신의 비즈니스 전문가를 자신의 데이터에 대해 미세 조정할 수 있습니다.

== 왜 그게 시장성이 있나요?

이건 “GDPR 준수 도구”가 아니에요. 이건**보편적인 문제를 자산으로 바꾸는 재현 가능한 방법** :

1. *모든 교육 기업에는 더러운 데이터가 있습니다* — 이것이 문제입니다
2. *아무것도 자동화된 다중 소스 정제 파이프라인이 없습니다* — 이것이 시장입니다
3. *루프: 익명화 → RAG → 파인튜닝은 전용입니다* — 이것이 장벽이다

SaaS Edster (MVP3)는 « Gradle 워크스페이스 »를 판매하지 않을 것입니다. 그는 이 닫힌 루프를 판매할 것입니다. 그리고 MVP0는 진입점입니다.

== SQL 형식은 컨텍스트의 세 번째 방법

구조화된 데이터의 가져오기는 단순히 교환 형식이 아닙니다. SQL 스키마(DDL)는 이를 가지고 있다**도메인 엔티티-관계 모델** :

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

이 DDL은 한 번 익명 처리된(4번 라인 이후) 후, LLM의 컨텍스트 소스가 됩니다. 텍스트가 아니라 —**비즈니스 모델**. RAG는 내용(유사도 벡터)를 제공합니다, Graphify는 관계(정확한 구조)를 제공합니다, 그리고 SQL 스키마는**암시적 Domain-Driven Design**: bounded contexts, agrégats, value objects. LLM은 자신이 읽은 스키마를 통해 해당 도메인을 이해한다.

== 로드맵: MVP0부터 SaaS까지

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

각 MVP는 이전 MVP에 의존합니다. MVP0 없이는 어떠한 MVP도 제공할 수 없습니다. 이것이 백로그에서 익명화자가 « P0 »가 아닌 이유입니다 — 그것은**MVP0**. 이것은 첫 번째 상업적 산출물이자, 나머지는 그것의 성공에 달려 있다.

== 결론: 모든 것을 가능하게 하는 보이지 않는 일

일반적인 스타트업에서는 데이터 정리가 외주화되거나, 수작업으로 수행되거나, 간과됩니다. 이 아키텍처에서는 이것이**제품의 핵심**. 익명 처리자는 첫 번째 직원입니다. 그가 없이는 아무것도 작동하지 않기 때문에:

* MVP0 없이는 합법적인 RAG이 없습니다 (MVP1)
* MVP0 없이는 → 데이터 유출 없이 미세 조정 불가능 (EPIC 5)
* MVP0 없이 → 신뢰할 수 있는 SaaS가 없음 (MVP3)
* MVP0 없이 → 프롬프트에서의 증강 현실 없음
* MVP0가 없음 → 컨텍스트의 세 번째 방법이 없습니다 (SQL DDD)

그는 더러운 일을 한다. 그는 피치에서 결코 언급되지 않을 것이다. 하지만 그는 공장을 움직이게 하는 사람이다.

그리고 이것이 그가 먼저 고용되는 이유다.

== 참고문헌

* 공간 온톨로지와 신뢰의 원에 대한 기사 :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[공간 온톨로지, 정렬 메커니즘으로서]
* Eager/Lazy 에이전트 거버넌스에 관한 기사 :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[AsciiDoc을 이용해 AI 에이전트를 운영하다]
* 핫/웜/콜드 메커니즘에 관한 기사:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[슬라이딩 윈도우와 차가운 파도]
* 세 개의 LLM 비교에 관한 기사 :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

관련 기사