zaman motale’e: 12 minutes

من یک LLM استفاده نمی‌کنم. من یک ناشناس‌ساز استخدام می‌کنم. قبل از اجرای RAG pgvector، قبل از fine-tuning متخصصان CDA/FPA، قبل از تهیه workspaces برای مشتریان — کسی باید توالت‌های داده‌ها را تمیز کند. این کارمند، متخصص ناشناس‌سازی (MVP0، EPIC 2 از codebase-gradle) است. و اوست که محصول را قابل فروش می‌سازد.

تیک

[]

مشکلی که همه را فرار می‌دهد

هر استارتاپ هوش مصنوعی که داده‌های آموزش را پردازش می‌کند، با همان دیوار روبرو می‌شود:

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

نتیجهٔ: یا روی داده‌های نجس RAG انجام می‌دهید (هلوسین‌های PII، عدم انطباق با GDPR، خطر حقوقی)، یا هیچ کاری نمی‌کنید (بدون محصول). راه سوم — تمیز کردن به صورت دستی — مقیاس‌پذیر نیست.

پاسخ من: مشکل را دور نکنید. L'**اتوماسیون کردن**.

== MVP0 : ناشناس‌ساز، نخستین کارمند استخدام شده در دورهٔ آزمایش

ام وی‌پی-zero یک ویژگی نیست. این یک**متخصص راحتی**— یک کارمند که کار قذارت، احمقانه و بدانه را انجام می‌دهد، و ninguém نمی‌خواهد در pitch decks دربارهٔ او صحبت کند.

کار او:

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

او ابتدا الگوهای واضح‌ترین را تشخیص می‌دهد (ایمیل‌ها`.*@.*`، توکن`sk-*`, `ghp_*`, IPs), سپس او یاد می‌گیرد. دوره آزمایشی، به این معناست: اطمینان حاصل می‌کنیم که او منفی‌های کاذب را رد نکند، پیش از اینکه او را استخدام دائمی کنیم.

== چیزی که این MVP باز می‌کند (و این فقط انطباق نیست)

ناشناس‌سازی به‌عنوان MVP0 نه هزینهٔ عبور RGPD قبل از'autoroute است؛ خود'autoroute است. این است که آن باز می‌کند:

=== حال : واقعیت افزوده در پرامپت

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAG در داده‌های کثیف جستجو نمی‌کند — بلکه در یک فضای جستجو می‌کند.**تمیز به‌طرز ساخت**. این موضوع کیفیت پاسخ‌ها را به‌طور کامل تغییر می‌دهد: مدل زبانی بزرگ (LLM) زمان خود را صرف دور زدن PII-هایی که شناخته می‌شود اما نباید آن‌ها را نام بردارد.

=== مستقبل : تنظیم دقیق روی داده‌های سالم

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

تنظیم دقیق روی داده‌های خام یک disastro حقوقی بالقوه است. روی داده‌های تمیز، این یک**روش قابل بازتولید**. هر مشتری دیتاست‌های تمیز شده خود را جما می‌کند، هر مشتری می‌تواند متخصصین کاری خود را بر روی داده‌های خود تنظیم دقیق (fine‑tune) کند — هیچوقت داده شخصی را فاش نخواهد کرد.

== چرا این قابل فروش است؟

این « یک ابزار سازگاری GDPR » نیست. این یک**روش قابل بازتولید که یک مشکل جهانی را به دارایی تبدیل می‌کند**</think>

1. *هر شرکت آموزشی داده‌های ناپاک دارد* — این مشکل است
2. *هیچ‌کدام پایپلاین خودکار پاک‌سازی چند منبعی ندارند* — این بازار است
3. *حلقه: anonymisation → RAG → fine-tuning مالک است* — این موانع است

SaaS Edster (MVP3) « workspace Gradle » را نخواهد فروخت. این حلقه بسته را خواهد فروخت. و MVP0 ورودی است.

== فرمت SQL به‌عنوان سومین راه/context

وارد کردن داده‌های ساختاریافته صرفاً یک فرمت تبادل نیست. اسکیو ال (DDL) بر عهده دارد**مدل موجودیت-رابطه‌ی حوزه**:

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

این DDL، پس از ناشناس‌سازی (خط 4)، یک منبع زمینه برای LLM می‌شود. متن نیست — از**مدل کسب‌وکار**. RAG محتوای (شباهت وکتور) را می‌دهد، Graphify روابط (ساختار دقیق) را می‌دهد، و طرح SQL را می‌دهد**طراحی مبتنی بر دامنه ضمنی**: bounded contexts, تجمع‌ها، اشیاء مقدار. LLM شغل را می‑فهمد چون طرح آن را می‌خواند.

== نقشه‌ی : از MVP0 تا SaaS

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

هر MVP به پیشین خود وابسته است. هیچ یک بدون MVP0 قابل تحویل نیست. همین دلیل است که «Anonymiseur» در بک‌لگ « P0 » نیست — است**MVP0**. این اولین تحویل‌پذیر تجاری است و سایر موارد به موفقیت آن وابسته هستند.

== نتیجه: کار نامرئی که همه چیز را ممکن می‌سازد

در یک استارت‌آپ سنتی، پاکسازی داده‌ها به‌صورت outsourcing، دستی یا نادیده گرفته می‌شود. در این معماری، این است که**قلب محصول**. ناشناس‌سازی اولین کارمند است، زیرا بدون او چیزی کار نمی‌کند :

* بدون MVP0 → هیچ RAG قانونی (MVP1)
* بدون MVP0 → بدون تنظیم دقیق بدون نشت داده‌ها (EPIC 5)
* بدون MVP0 → هیچ SaaS معتبر (MVP3)
* بدون MVP0 → واقعیت افزوده‌ای در پرامپت نیست
* بدون MVP0 → هیچ راه سوم از context (SQL DDD)

او کار قذر را انجام می‌دهد. او هرگز در پچ‌ها نام‌برده نخواهد شد. اما اوست که کارخانه را می‌چرخاند.

به همین دلیل است که او را اول استفاده می‌کنیم.

== مراجع

* مقاله دربارهٔ هنتولوژی فضایی و دایره‌های اعتماد :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[اوانتولوژی فضایی به‌عنوان مکانیزم هماهنگی]
* مقاله در مورد حوكمانی عامل Eager/Lazy :link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[مدیریت یک عامل هوش مصنوعی با AsciiDoc]
* مقاله درباره مکانیزم Hot/Warm/Cold :link:../2026/0110_mecanisme_backup_contexte_agent_post.html[پنجره لغزنده و موج سرد]
* مقاله درباره مقایسه سه LLMs :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

مقالات مرتبط