وقت القراءة: 12 minutes

أنا لا أوظف نموذج لغوي كبير. أوظف متخصصًا في إخفاء الهوية. قبل تنفيذ RAG pgvector، قبل ضبط دقيق لخبراء CDA/FPA، قبل توفير مساحات عمل للعملاء — يجب على شخص ما تنظيف حمام البيانات. هذا الموظف هو خبير إخفاء الهوية (MVP0, EPIC 2 من codebase-gradle). وهو من يجعل المنتج قابلاً للتسويق.

طَق

[]

المشكلة التي تجعل الجميع يفرون

أي شركة ناشئة للذكاء الاصطناعي التي تتعامل مع بيانات التدريب تصطدم بنفس الحائط :

----
----
Données brutes client (SPG, cours, évaluations)
  ├→ Noms de stagiaires en clair dans les PDF
  ├→ Emails dans les métadonnées JSON
  ├→ IP de connexion dans les logs pgvector
  ├→ Identifiants dans les nœuds Graphify
  └→ Références OF pilote dans les schémas SQL
----

النتيجة: إما أن تقوم بـ RAG على بيانات غير نظيفة (هلوسات PII، عدم امتثال لـ GDPR، مخاطر قانونية)، أو لا تفعل شيئًا (لا يوجد منتج). الطريق الثالثة — التنظيف يدويًا — ليست قابلة للتوسع.

جوابي : لا تتجنب المشكلة. ال**أتمتة**.

== MVP0 : المجهول الهوية، أول موظف تم توظيفه خلال فترة الاختبار

الـ MVP0 ليست ميزة. إنها**خبير في الراحة**— موظف يقوم بالعمل القذر والغبي والشرير، ولا أحد يرغب في التحدث عنه في pitch decks

ما يفعله :

[source]
----
ENTRÉE : Données brutes multi-sources
  ├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
  ├→ JSON (catalogue formations) → emails, téléphones
  ├→ YAML (config workspace) → tokens OAuth2
  ├→ SQL (schémas DDL) → IP, adresses
  ├→ pgvector (métadonnées embeddings) → identifiants
  ├→ ONNX (outputs classification) → noms propres
  └→ Graphify (graph.json) → nœuds avec PII

SORTIE : Datasets propres, format standardisé
  ├→ [ANONYMIZED] remplace les PII détectées
  ├→ Classification RGPD (niveau 0→4)
  ├→ Rapport d'audit (quoi a été nettoyé)
  └→ Dataset prêt pour RAG ET fine-tuning
----

إنه يكتشف الأنماط الأكثر وضوحًا أولاً (البريد الإلكتروني)`.*@.*`, الرموز`sk-*`, `ghp_*`, IPs)، ثم يتعلم. فترة التجربة، هذا هو الأمر: نتأكد من أنه لا يسمح بمرور سلبيات كاذبة قبل تعيينه نهائيًا.

== ما يطلقه هذا MVP (ليس مجرد امتثال)

التّخفيّ كـ MVP0 ليس هو رسوم الـ GDPR قبل الطريق السريع. هو الطريق السريع نفسه. هذا ما يفتحه :

=== الحاضر: واقع معزز في المُحفّز

[source]
----
DONNÉES BRUTES CLIENT
    ↓
Anonymiseur MVP0 → datasets propres
    ↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
    ↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----

RAG لا يبحث في البيانات القذرة — إنه يبحث في مساحة**نظيف بالتصميم**. وهذا يغير كل شيء بالنسبة لجودة الإجابات : لا يقضي النموذج اللغوي الكبير وقته في الالتفاف حول بيانات تعريف شخصية (PII) يدركها لكنه لا يجب أن يذكرها.

=== المستقبل : ضبط دقيق على البيانات الصحية

[source]
----
MVP0 → datasets propres accumulés (session après session)
    ↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
    ↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----

الضبط الدقيق على البيانات الخام هو كارثة قانونية محتملة. على البيانات النظيفة، هو**طريقة قابلة للتكرار**. كل عميل يجمع مجموعات البيانات المنظّفة الخاصة به، كل عميل يمكنه تعديل خبرائه المتخصصين بدقة على بياناته — دون أن يكشف أبدًا عن بيانات شخصية.

== لماذا هذا قابل للتسويق

ليس « أداة امتثال لـ RGPD ». إنها**طريقة قابلة للتكرار تحوّل مشكلة عالمية إلى أصل**:

1. *كل شركة تدريب لديها بيانات قذرة* — هذه هي المشكلة
2. *لا أحد يمتلك خط أنابيب تلقائي للتنظيف متعدد المصادر* — هذا هو السوق
3. *الحلقة: إخفاء الهوية → RAG → ضبط دقيق مملوكة* — إنه الحاجز

لن يبيع برنامج Edster كخدمة (MVP3) « مساحة عمل Gradle ». بل سيبيع هذه الحلقة المغلقة. و MVP0 هو نقطة الدخول.

== تنسيق SQL كطريقة ثالثة للسياق

استيراد البيانات المنظمة لا يقتصر على أن يكون مجرد تنسيق لتبادل. مخطط SQL (DDL) يحمل**نموذج العلاقة بين الكيانات للمجال**:

[source]
----
CREATE TABLE formation (
  id UUID PRIMARY KEY,
  titre VARCHAR NOT NULL,
  referentiel RNCP REFERENCES rncp(id),
  organisme OF REFERENCES of_pilote(id)  -- ← va être anonymisé
);
----

هذا DDL، بمجرد إخفاء هويته (السطر 4)، يصبح مصدرًا للسياق للنموذج اللغوي الكبير. ليس نصًا — من**نموذج أعمال**. يعطي RAG المحتوى (التشابه المتجهي)، ويعطي Graphify العلاقات (البنية الدقيقة)، ويعطي مخطط SQL**التصميم الموجه للنطاق الضمني**: bounded contexts, agrégats, value objects. الـ LLM يفهم المجال لأنه يقرأ مخططه.

== خريطة الطريق : من MVP0 إلى SaaS

[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
  Sortie : datasets propres, reproductible

MVP1 — RAG pgvector (dépend de MVP0)
  Realité augmentée en prompt sur données nettoyées

MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
  Vecteur composite de contexte (règles + similarité + relations exactes)

MVP3 — SaaS Edster (dépend de MVP0-2)
  Provisionnement workspace client complet
----

كل MVP يعتمد على السابق. لا يمكن تسليم أي MVP بدون MVP0. هذا هو السبب الذي يجعل المُجهِّل ليس « P0 » في backlog — إنه**MVP0**. أول مخرج تجاري، وكل شيء آخر معتمد على نجاحه

== الاستنتاج : العمل غير المرئي الذي يجعل كل شيء ممكناً

في شركة ناشئة تقليدية، يتم التعاقد مع تنظيف البيانات، أو يكون يدويًّا، أو يُتجاهَل. في هذه البنية، الأمر هو أن**قلب المنتج**. المُخَفي هو أول موظف لأن بدونه لا شيء يعمل :

* بدون MVP0 → لا يوجد RAG قانوني (MVP1)
* بدون MVP0 → لا تعديل دقيق بدون تسرب بيانات (ملحمة 5)
* بدون MVP0 → لا يوجد SaaS موثوق به (MVP3)
* بدون MVP0 → لا يوجد واقع معزز في المطالبة
* بدون MVP0 → لا توجد طريق ثالثة للسياق (SQL DDD)

هو يقوم بالأعمال القذرة. لن يُذكر أبدًا في العروض التقديمية. لكنه هو من يدير المصنع.

وهذا هو السبب الذي يوظفونه أولاً.

== المراجع

* مقالة حول علم الوجود المكاني ودوائر الثقة :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[الأ'ontologie المكانية كآلية للمحاذاة]
* مقالة حول حوكمة الوكيل Eager/Lazy:link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[حكم وكيل ذكاء اصطناعي باستخدام AsciiDoc]
* مقالة حول آلية Hot/Warm/Coldlink:../2026/0110_mecanisme_backup_contexte_agent_post.html[نافذة منزلقة وموجة باردة]
* مقالة حول مقارنة الثلاثة LLMs :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----

Articles connexes