اولین استخدام ما: ناشناسساز دیتاست — MVP0 در دورهٔ آزمایش
منتشر شده در 01 May 2026
Table des matières
زمان خوانش : 12 minutes
من یک LLM استخدام نمیکنم. من یک ناشناس‑سازی‑گر استخدام میکنم. قبل از اینکه RAG pgvector را انجام دهم، قبل از fine‑tune کردن متخصصان CDA/FPA، قبل از فراهم کردن workspaces برای مشتریان — کسی باید توالتهای دادهها را پاکسازی کند. این کارمند، متخصص ناشناسسازی است (MVP0، EPIC 2 از کدپایهٔ Gradle). و اوست که محصول را قابلفروش میسازد.
- تاک
-
[]
مشکلی که همه را فرار میکند
هر استارتاپ هوش مصنوعی که دادههای آموزشی را پردازش میکند، به همان دیوار میرسد:
----
----
Données brutes client (SPG, cours, évaluations)
├→ Noms de stagiaires en clair dans les PDF
├→ Emails dans les métadonnées JSON
├→ IP de connexion dans les logs pgvector
├→ Identifiants dans les nœuds Graphify
└→ Références OF pilote dans les schémas SQL
----
نتیجه: یا میتوانید RAG روی دادههای نجس (هلاوسینتهای PII، نقض GDPR، خطر حقوقی) انجام دهید، یا کاری نکنید (بدون محصول). راه سوم — پاکسازی دستی — مقیاسپذیر نیست.
پاسخ من : مشکل را دور نزنید. ل'**اتوماتیکسازی**.
== MVP0 : ناشناسساز، اولین کارمند در دورهی آزمایش
MVP0 ویژگی نیست. این یک**متخصص راحتی**— کارمندی که کار قذارت، احمقانه و خبیث را انجام میدهد و کسی نمیخواهد در pitch decks صحبت کند.
آنچه که میکند:
[source]
----
ENTRÉE : Données brutes multi-sources
├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
├→ JSON (catalogue formations) → emails, téléphones
├→ YAML (config workspace) → tokens OAuth2
├→ SQL (schémas DDL) → IP, adresses
├→ pgvector (métadonnées embeddings) → identifiants
├→ ONNX (outputs classification) → noms propres
└→ Graphify (graph.json) → nœuds avec PII
SORTIE : Datasets propres, format standardisé
├→ [ANONYMIZED] remplace les PII détectées
├→ Classification RGPD (niveau 0→4)
├→ Rapport d'audit (quoi a été nettoyé)
└→ Dataset prêt pour RAG ET fine-tuning
----
او ابتدا الگوهای واضحترین را تشخیص میدهد (emails`.*@.*`، توکنها`sk-*`, `ghp_*`, IPs), سپس او یاد میگیرد. دوره آزمایشی، این است: ما تأیید میکنیم که منفیهای کاذب را عبور ندهد قبل از اینکه او را استخدام دائمی کنیم.
== چه کاری این MVP را باز میکند (و این فقط همسویی نیست)
ناشناسسازی بهعنوان MVP0، هزینeh گذر GDPR پیش از بزرگراه نیست. این خود بزرگراه است. اینجا است که چه چیزی را باز میکند:
=== حاضر: واقعیت افزوده در پرامپت
[source]
----
DONNÉES BRUTES CLIENT
↓
Anonymiseur MVP0 → datasets propres
↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----
RAG در دادههای آلوده جستجو نمیکند — در یک فضا جستجو میکند**پاک بهطرز ساخت**. این تغییر تمام چیزی را برای کیفیت پاسخها تغییر میدهد: LLM زمان خود را هدر نمیدهد تا سعی کند PIIهایی که میشناسد اما نباید آنها را ذکر کند دور بزند.
=== آینده : تنظیم دقیق روی دادههای سالم
[source]
----
MVP0 → datasets propres accumulés (session après session)
↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----
بهصورت fine-tuning روی دادههای خام یک katastrofa حقوقی بالقوه است. بر دادههای تمیز، این یک**روش قابل بازتولید**. هر مشتری دیتاستهای تمیز شده خود را جمع میکند، هر مشتری میتواند متخصصین حرفهای خود را بر پایهٔ دادههای خود تنظیم دقیق کند — به هیچ وجه دادهای شخصی را فاش نکند
== چرا این قابل فروش است؟
این « ابزاری برای اطمینان از پایآمدی GDPR » نیست. این یک**روش قابل تکرار که یک مشکل جهانی را به دارایی تبدیل میکند**[No output]
1. *هر شرکت آموزشی دادههای نامنظّمی دارد* — این مسئله است
2. *هیچکدام پایپلاینی خودکار پاکسازی چندمنبعی ندارند* — این بازار است
3. *P حلقه: ناشناسسازی → RAG → تنظیم دقیق مالکانه* — این ممانعت است
SaaS Edster (MVP3) « workspace Gradle » را نخواهد فروخت. این حلقه بسته را خواهد فروخت. و MVP0 ورودی است.
== فرمت SQL به عنوان راه سوم زمینه
وارد کردن دادههای ساختاریافته صرفاً یک قالب تبادل نیست. طرح SQL (DDL) حامل**مدل موجودیت-رابطه حوزه**:
[source]
----
CREATE TABLE formation (
id UUID PRIMARY KEY,
titre VARCHAR NOT NULL,
referentiel RNCP REFERENCES rncp(id),
organisme OF REFERENCES of_pilote(id) -- ← va être anonymisé
);
----
این DDL، پس از انونیمایز شدن (خط 4)، یک منبع زمینه برای LLM میشود. نه متن — از**مدل کسبوکار**. RAG محتوا (شباهت برداری) میدهد، Graphify روابط (ساختار دقیق) میدهد و طرح SQL**Domain-Driven Design ضمنی**: bounded contexts, تجمعات, value objects. LLM چون scheme‑ش را میخواند، métier را میفهمد.
== Roadmap : از MVP0 تا SaaS
[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
Sortie : datasets propres, reproductible
MVP1 — RAG pgvector (dépend de MVP0)
Realité augmentée en prompt sur données nettoyées
MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
Vecteur composite de contexte (règles + similarité + relations exactes)
MVP3 — SaaS Edster (dépend de MVP0-2)
Provisionnement workspace client complet
----
هر MVP به پیشین آن وابسته است. هیچیک بدون MVP0 قابل ارائه نیست. این دلیل است که آنونیمایزر در بک لاگ « P0 » نیست — او است**MVP0**. این اولین تحویل تجاری است و بقیه به موفقیت آن مشروط است.
== نتیجه : کار نامرئی که همه چیز را ممکن میسازد
در یک استارتاپ کلاسیک، تمیز کردن دادهها outsourcing شده، دستی است یا نادیده گرفته میشود. در این معماری، این**قلب محصول**. انونیمایزر اولین کارمند است زیرا بهدونش هیچ rzecz کار نمیکند :
* بدون MVP0 → RAG قانونی نیست (MVP1)
* بدون MVP0 → بدون fine-tuning بدون نشت داده (EPIC 5)
* بدون MVP0 → هیچ SaaS معتبری نیست (MVP3)
* بدون MVP0 → هیچ واقعیت افزایش یافته در prompt
* بدون MVP0 → هیچ راه سوم از زمینه (SQL DDD)
او کار قذر را انجام میدهد. هیچگاه در پیشنهادها نامش برده نخواهد شد. اما اوست که کارخانه را در حال حرکت نگه دارد.
و همین دلیل است که او را اولاً استخدام میکنیم.
== مراجع
* مقاله دربارهٔОнوتولوژی فضایی و دایرههای اعتماد :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[’ontologie فضایی به عنوان مکانیزم ترازی]
* مقاله دربارهٔ حوكومهٔ عامل Eager/Lazy :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[مدیریت یک عامل هوش مصنوعی با استفاده از AsciiDoc]
* مقاله درباره مکانیزم Hot/Warm/Cold :link:../2026/0110_mecanisme_backup_contexte_agent_post.html[Sliding Window و موج خنک]
* مقاله درباره مقایسه سه LLM :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----