私たちの最初の採用:データセット匿名化ツール — MVP0 試用期間中
公開日: 01 May 2026
Table des matières
読書時間 : 12 minutes
私はLLMを雇いません。匿名化者を雇います。pgvectorを使ったRAGの前に、CDA/FPAの専門家をファインチューニングする前に、クライアントのワークスペースをプロビジョニングする前に — だれかがデータのトイレを掃除しなければなりません。その従業員こそが匿名化の専門家(MVP0、EPIC 2、コードベース Gradle)です。そして彼が製品を市場向きにします。
- トック
-
[]
誰もが逃げ出す問題
トレーニングデータを扱うあらゆるAIスタートアップは、同じ壁にぶつかる:
----
----
Données brutes client (SPG, cours, évaluations)
├→ Noms de stagiaires en clair dans les PDF
├→ Emails dans les métadonnées JSON
├→ IP de connexion dans les logs pgvector
├→ Identifiants dans les nœuds Graphify
└→ Références OF pilote dans les schémas SQL
----
結果:汚れたデータに対してRAGを行う(PIIの幻覚、GDPR違反、法的リスク)か、何もせず(製品なし)かのいずれかです。第三の方法—手作業でクリーンアップする—はスケーラブルではありません。
私の答え:問題を回避しない。L'**自動化する**。
== MVP0:匿名化者、試用期間中に最初に採用された人
MVP0 は機能ではありません。それは**便利の専門家**— 一人の従業員が、汚い愚かで嫌な仕事をしており、誰もピッチデッキで話したがらない。
彼がやること:
[source]
----
ENTRÉE : Données brutes multi-sources
├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
├→ JSON (catalogue formations) → emails, téléphones
├→ YAML (config workspace) → tokens OAuth2
├→ SQL (schémas DDL) → IP, adresses
├→ pgvector (métadonnées embeddings) → identifiants
├→ ONNX (outputs classification) → noms propres
└→ Graphify (graph.json) → nœuds avec PII
SORTIE : Datasets propres, format standardisé
├→ [ANONYMIZED] remplace les PII détectées
├→ Classification RGPD (niveau 0→4)
├→ Rapport d'audit (quoi a été nettoyé)
└→ Dataset prêt pour RAG ET fine-tuning
----
最初に最も明白なパターンを検出します(emails`.*@.*`, トークン`sk-*`, `ghp_*`, IPs), それから彼は学ぶ。試用期間とはそういうことです : 偽陰性を見逃さないことを確認してから、正規に採用します。
== この MVP が解き放つもの(そしてそれは単なるコンプライアンスではない)
MVP0としての匿名化は、高速道路の前にあるGDPRの通行料ではなく、高速道路そのものです。それが高速道路そのものです。これがそれが開くもの:
=== 現在:プロンプトにおける拡張現実
[source]
----
DONNÉES BRUTES CLIENT
↓
Anonymiseur MVP0 → datasets propres
↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----
RAGは汚れたデータの中で探さない―それは空間の中で探す**構築によってきれい**. これは回答の品質に大きな影響を与える:LLMは認識しているが言及すべきでないPIIを回避するために時間を費やすわけではない。
=== 将来 : 健全なデータへのファインチューニング
[source]
----
MVP0 → datasets propres accumulés (session après session)
↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----
未加工のデータでのファインチューニングは法的災害となる可能性があります。クリーンなデータでは、それは**再現可能な方法**. 各クライアントは、クリーニングされたデータセットを蓄積し、各クライアントは自分のデータでビジネス専門家をファインチューニングできます — — 絶対に個人データを露出することはありません。
== なぜそれが市場性があるのか
これは « GDPR コンプライアンス ツール » ではありません。これは一**普遍的な問題を資産に変える再現可能な方法**:
1. *すべてのトレーニング企業には汚いデータがあります* — それが問題です
2. *自動化されたマルチソースクリーニングパイプラインを持っているものはない* — それが市場です
3. ループ:匿名化 → RAG → ファインチューニングは独占的です — それが障壁です
Edster SaaS (MVP3)は「Gradle ワークスペース」を販売しません。それはこの閉じたループを販売します。そしてMVP0は入口です。
== コンテキストにおける第三の道としてのSQL形式
構造化データのインポートは単なる交換フォーマットではなく、SQLスキーマ(DDL)は**ドメイン エンティティ-リレーションシップ モデル** :
[source]
----
CREATE TABLE formation (
id UUID PRIMARY KEY,
titre VARCHAR NOT NULL,
referentiel RNCP REFERENCES rncp(id),
organisme OF REFERENCES of_pilote(id) -- ← va être anonymisé
);
----
このDDLは、匿名化された後(行4)、LLMのコンテキストソースになります。テキストではない — これは**ビジネスモデル**. RAGはコンテンツ(ベクトル類似性)を提供し、Graphifyは関係(正確な構造)を提供し、SQLスキーマは**暗黙的ドメイン駆動設計**: bounded contexts, agrégats, value objects. LLMはスキーマを読むことでビジネスを理解する。
== ロードマップ:MVP0からSaaSへ
[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
Sortie : datasets propres, reproductible
MVP1 — RAG pgvector (dépend de MVP0)
Realité augmentée en prompt sur données nettoyées
MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
Vecteur composite de contexte (règles + similarité + relations exactes)
MVP3 — SaaS Edster (dépend de MVP0-2)
Provisionnement workspace client complet
----
各MVPは前のものに依存しています。MVP0なしではどのMVPも配信できません。これが、バックログにおける「Anonymiseur」が「P0」ではない理由です — それは**MVP0**. これは最初の商業的な納品物であり、それ以外のすべてはその成功にかかっている。
== 結論:すべてを可能にする見えない仕事
一般的なスタートアップでは、データのクリーニングは外部委託、手動、または無視されます。このアーキテクチャでは、それは**製品の中心**. 匿名化者は最初に雇用される従業員です。なぜなら、彼がいなければ何も機能しないからです :
* MVP0 がなければ → 法的な RAG なし (MVP1)
* MVP0なしで → データ漏洩なしではファインチューニングは行われない (EPIC 5)
* MVP0 なし→信頼できる SaaS なし(MVP3)
* MVP0 がなければ → プロンプトに拡張現実なし
* MVP0いないと→コンテキストにおける第三の道がない(SQL DDD)
彼は汚い仕事をする。ピッチで名前を挙げられることは決してない。しかし、工場を回しているのは彼だ。
それが理由で、最初に彼/彼女を雇う。
== 参考文献
* 空間オントロジーと信頼の円に関する記事:link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[空間オントロジーとしての整合メカニズム]
* エージャー/ラジーなエージェントのガバナンスに関する記事 :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[AsciiDocを使ってAIエージェントを管理する]
* Hot/Warm/Cold メカニズムに関する記事:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[スライドウィンドウと寒波]
* 三つのLLMの比較に関する記事:link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----
関連記事
HyperFrames-Gradle : AsciiDocをMP4動画に変換
31 May 2026
31 May 2026
プラグイン独立+コンシューマー ルート アーキテクチャ:なぜ私のGradleビルドが重複するのか
14 May 2026
14 May 2026