私たちの最初の採用 : データセット匿名化ツール — MVP0、試用期間中
公開日: 01 May 2026
Table des matières
読了時間 : 12 minutes
私はLLMを雇わない。私は匿名化の専門家を雇う。pgvectorを使ったRAGを行う前に、CDA/FPAの専門家をファインチューニングする前に、クライアントのワークスペースをプロビジョンする前に — 誰かがデータのトイレを掃除しなければならない。この従業員こそが、匿名化のエキスパート(codebase-gradleのMVP0、EPIC 2)だ。そして彼こそが製品を市場に適合させる人だ。
- チック
-
(empty)
みんなが逃げ出す問題
�訓練データを扱うAIスタートアップはすべて同じ壁にぶつかる:
----
----
Données brutes client (SPG, cours, évaluations)
├→ Noms de stagiaires en clair dans les PDF
├→ Emails dans les métadonnées JSON
├→ IP de connexion dans les logs pgvector
├→ Identifiants dans les nœuds Graphify
└→ Références OF pilote dans les schémas SQL
----
結果 : 汚いデータで RAG を行う(PII の幻覚、GDPR 違反、法的リスク)か、何もせず(製品なし)かのいずれかです。第三の道 — 手動でクリーニングする — はスケーラブルではありません。
私の答え : 問題を回避しない。L'**自動化する**。
== MVP0 : 匿名化ツール, 試用期間中に最初に雇用された
MVP0は機能ではありません。それは**利便性の専門家**— ピッチデッキでは誰も語りたがらない、汚くて愚かで残酷な仕事をする従業員。
それが行うこと:
[source]
----
ENTRÉE : Données brutes multi-sources
├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
├→ JSON (catalogue formations) → emails, téléphones
├→ YAML (config workspace) → tokens OAuth2
├→ SQL (schémas DDL) → IP, adresses
├→ pgvector (métadonnées embeddings) → identifiants
├→ ONNX (outputs classification) → noms propres
└→ Graphify (graph.json) → nœuds avec PII
SORTIE : Datasets propres, format standardisé
├→ [ANONYMIZED] remplace les PII détectées
├→ Classification RGPD (niveau 0→4)
├→ Rapport d'audit (quoi a été nettoyé)
└→ Dataset prêt pour RAG ET fine-tuning
----
最初に最も明白なパターンを検出します (emails`.*@.*`, トークン`sk-*`, `ghp_*`, IPs), それから彼は学ぶ。試用期間、それがそれです:偽陰性を見逃さないことを確認してから、彼を正式に採用します。
== このMVPが解き放つもの ( そしてそれは単なるコンプライアンスではない )
MVP0としての匿名化は、高速道路に入る前のGDPRの通行料ではない。それが高速道路そのものだ。それが開くものは次のとおりだ:
=== 現在 : プロンプトにおける拡張現実
[source]
----
DONNÉES BRUTES CLIENT
↓
Anonymiseur MVP0 → datasets propres
↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----
RAGは汚れたデータを検索しません — それはスペースを検索します**構成上きれい**. これは回答の品質を大きく変える:LLMは認識しているが言及してはならないPIIを回避することに時間を費やさない。
=== 未来 : ファインチューニング on 健康なデータ
[source]
----
MVP0 → datasets propres accumulés (session après session)
↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----
ファインチューニングは生データでの潜在的な法的災害です。クリーンなデータでは、それは**再現可能な方法**. 各クライアントはクリーニング済みのデータセットを蓄積し、各クライアントは自分のビジネス専門家を自分のデータでファインチューニングできます — — 個人データを決して公開することはありません。
== なぜそれが販売可能なのか
これはGDPRコンプライアンスツールではありません。これは**普遍的な問題を資産に変える再現可能な方法**:
1. *すべてのトレーニング企業は汚れたデータを持っている* — それが問題だ
2. *誰も自動化されたマルチソースクリーニングパイプラインを持っていない* — これは市場です
3. *匿名化 → RAG → ファインチューニングのループは独自である* — それが障壁だ
Edster SaaS (MVP3)は« Gradleワークスペース »を販売しません。それはこの閉じたループを販売します。そしてMVP0は入口です。
== SQL形式はコンテキストの第三の方法
構造化データのインポートは単なる交換形式ではない。SQL スキーマ (DDL) は持ちます**ドメインのエンティティ-リレーションモデル**:
[source]
----
CREATE TABLE formation (
id UUID PRIMARY KEY,
titre VARCHAR NOT NULL,
referentiel RNCP REFERENCES rncp(id),
organisme OF REFERENCES of_pilote(id) -- ← va être anonymisé
);
----
このDDLは、匿名化された後(行4)、LLMのコンテキストソースとなります。テキストではなく — du**ビジネスモデル**. RAGはベクトル類似性によるコンテンツを提供し、Graphifyは正確な構造による関係を提供し、SQLスキーマは**暗黙の Domain-Driven Design**: bounded contexts, agrégats, value objects. LLMはスキーマを読むことでドメインを理解します。
== ロードマップ:MVP0からSaaSまで
[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
Sortie : datasets propres, reproductible
MVP1 — RAG pgvector (dépend de MVP0)
Realité augmentée en prompt sur données nettoyées
MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
Vecteur composite de contexte (règles + similarité + relations exactes)
MVP3 — SaaS Edster (dépend de MVP0-2)
Provisionnement workspace client complet
----
各MVPは前のMVPに依存しています。MVP0がなければ、どのMVPもリリースできません。これがバックログにおいて「Anonymiseur」が「P0」ではない理由です — それは**MVP0**. これは最初の商業的な納品物であり、その他すべてはそれが成功することを条件としている。
== 結論:目に見えない仕事がすべてを可能にする
一般的なスタートアップでは、データのクレンジングはアウトソーシング、手動、または無視されます。このアーキテクチャでは、それは**製品の中心**. 匿名化者は最初に雇用される従業員です。なぜなら彼/彼女がいなければ、何も機能しないからです:
* MVP0 なし → 法的な RAG なし (MVP1)
* MVP0 がなければ → データ漏洩のないファインチューニングもできない (EPIC 5)
* MVP0 なし → 信頼できる SaaS なし (MVP3)
* MVP0がなければ → プロンプトに拡張現実がない
* MVP0 なし → コンテキストの第三の方法なし (SQL DDD)
彼は汚い仕事をしている。彼は決してピッチでは言及されない。だが、彼こそが工場を回している。
それが彼/彼女を最初に雇う理由です。
== 参考文献
* 空間オントロジーと信頼の輪に関する記事:link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[空間オントロジーをアラインメントメカニズムとして]
* Eager/Lazyエージェントのガバナンスについての記事:link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[AsciiDocでAIエージェントを管理する]
* Hot/Warm/Cold メカニズムの記事:link:../2026/0110_mecanisme_backup_contexte_agent_post.html[スライドウィンドウと寒波]
* 3つのLLMの比較に関する記事 :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro、Kimi K2.6、GLM-5.1]
----
関連記事
HyperFrames-Gradle : AsciiDocをMP4動画に変換
31 May 2026
31 May 2026
プラグイン独立+コンシューマー ルート アーキテクチャ:なぜ私のGradleビルドが重複するのか
14 May 2026
14 May 2026