Table des matières
読書時間 : 12 minutes

私はLLMを雇いません。匿名化者を雇います。pgvectorを使ったRAGの前に、CDA/FPAの専門家をファインチューニングする前に、クライアントのワークスペースをプロビジョニングする前に — だれかがデータのトイレを掃除しなければなりません。その従業員こそが匿名化の専門家(MVP0、EPIC 2、コードベース Gradle)です。そして彼が製品を市場向きにします。

トック

[]

誰もが逃げ出す問題

トレーニングデータを扱うあらゆるAIスタートアップは、同じ壁にぶつかる:

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

結果:汚れたデータに対してRAGを行う(PIIの幻覚、GDPR違反、法的リスク)か、何もせず(製品なし)かのいずれかです。第三の方法—手作業でクリーンアップする—はスケーラブルではありません。

私の答え:問題を回避しない。L'**自動化する**。

== MVP0:匿名化者、試用期間中に最初に採用された人

MVP0 は機能ではありません。それは**便利の専門家**— 一人の従業員が、汚い愚かで嫌な仕事をしており、誰もピッチデッキで話したがらない。

彼がやること:

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

最初に最も明白なパターンを検出します(emails`.*@.*`, トークン`sk-*`, `ghp_*`, IPs), それから彼は学ぶ。試用期間とはそういうことです : 偽陰性を見逃さないことを確認してから、正規に採用します。

== この MVP が解き放つもの(そしてそれは単なるコンプライアンスではない)

MVP0としての匿名化は、高速道路の前にあるGDPRの通行料ではなく、高速道路そのものです。それが高速道路そのものです。これがそれが開くもの:

=== 現在:プロンプトにおける拡張現実

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAGは汚れたデータの中で探さない―それは空間の中で探す**構築によってきれい**. これは回答の品質に大きな影響を与える:LLMは認識しているが言及すべきでないPIIを回避するために時間を費やすわけではない。

=== 将来 : 健全なデータへのファインチューニング

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

未加工のデータでのファインチューニングは法的災害となる可能性があります。クリーンなデータでは、それは**再現可能な方法**. 各クライアントは、クリーニングされたデータセットを蓄積し、各クライアントは自分のデータでビジネス専門家をファインチューニングできます —  — 絶対に個人データを露出することはありません。

== なぜそれが市場性があるのか

これは « GDPR コンプライアンス ツール » ではありません。これは一**普遍的な問題を資産に変える再現可能な方法**:

1. *すべてのトレーニング企業には汚いデータがあります* — それが問題です
2. *自動化されたマルチソースクリーニングパイプラインを持っているものはない* — それが市場です
3. ループ:匿名化 → RAG → ファインチューニングは独占的です — それが障壁です

Edster SaaS (MVP3)は「Gradle ワークスペース」を販売しません。それはこの閉じたループを販売します。そしてMVP0は入口です。

== コンテキストにおける第三の道としてのSQL形式

構造化データのインポートは単なる交換フォーマットではなく、SQLスキーマ(DDL)は**ドメイン エンティティ-リレーションシップ モデル** :

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

このDDLは、匿名化された後(行4)、LLMのコンテキストソースになります。テキストではない — これは**ビジネスモデル**. RAGはコンテンツ(ベクトル類似性)を提供し、Graphifyは関係(正確な構造)を提供し、SQLスキーマは**暗黙的ドメイン駆動設計**: bounded contexts, agrégats, value objects. LLMはスキーマを読むことでビジネスを理解する。

== ロードマップ:MVP0からSaaSへ

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

各MVPは前のものに依存しています。MVP0なしではどのMVPも配信できません。これが、バックログにおける「Anonymiseur」が「P0」ではない理由です — それは**MVP0**. これは最初の商業的な納品物であり、それ以外のすべてはその成功にかかっている。

== 結論:すべてを可能にする見えない仕事

一般的なスタートアップでは、データのクリーニングは外部委託、手動、または無視されます。このアーキテクチャでは、それは**製品の中心**. 匿名化者は最初に雇用される従業員です。なぜなら、彼がいなければ何も機能しないからです :

* MVP0 がなければ → 法的な RAG なし (MVP1)
* MVP0なしで → データ漏洩なしではファインチューニングは行われない (EPIC 5)
* MVP0 なし→信頼できる SaaS なし(MVP3)
* MVP0 がなければ → プロンプトに拡張現実なし
* MVP0いないと→コンテキストにおける第三の道がない(SQL DDD)

彼は汚い仕事をする。ピッチで名前を挙げられることは決してない。しかし、工場を回しているのは彼だ。

それが理由で、最初に彼/彼女を雇う。

== 参考文献

* 空間オントロジーと信頼の円に関する記事:link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[空間オントロジーとしての整合メカニズム]
* エージャー/ラジーなエージェントのガバナンスに関する記事 :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[AsciiDocを使ってAIエージェントを管理する]
* Hot/Warm/Cold メカニズムに関する記事:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[スライドウィンドウと寒波]
* 三つのLLMの比較に関する記事:link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

関連記事