أول موظف لدينا: مزيل هوية مجموعات البيانات — MVP0 في فترة تجريبية
Publié le 01 May 2026
Table des matières
وقت القراءة: 12 minutes
أنا لا أوظف نموذج لغوي كبير. أوظف متخصصًا في إخفاء الهوية. قبل تنفيذ RAG pgvector، قبل ضبط دقيق لخبراء CDA/FPA، قبل توفير مساحات عمل للعملاء — يجب على شخص ما تنظيف حمام البيانات. هذا الموظف هو خبير إخفاء الهوية (MVP0, EPIC 2 من codebase-gradle). وهو من يجعل المنتج قابلاً للتسويق.
- طَق
-
[]
المشكلة التي تجعل الجميع يفرون
أي شركة ناشئة للذكاء الاصطناعي التي تتعامل مع بيانات التدريب تصطدم بنفس الحائط :
----
----
Données brutes client (SPG, cours, évaluations)
├→ Noms de stagiaires en clair dans les PDF
├→ Emails dans les métadonnées JSON
├→ IP de connexion dans les logs pgvector
├→ Identifiants dans les nœuds Graphify
└→ Références OF pilote dans les schémas SQL
----
النتيجة: إما أن تقوم بـ RAG على بيانات غير نظيفة (هلوسات PII، عدم امتثال لـ GDPR، مخاطر قانونية)، أو لا تفعل شيئًا (لا يوجد منتج). الطريق الثالثة — التنظيف يدويًا — ليست قابلة للتوسع.
جوابي : لا تتجنب المشكلة. ال**أتمتة**.
== MVP0 : المجهول الهوية، أول موظف تم توظيفه خلال فترة الاختبار
الـ MVP0 ليست ميزة. إنها**خبير في الراحة**— موظف يقوم بالعمل القذر والغبي والشرير، ولا أحد يرغب في التحدث عنه في pitch decks
ما يفعله :
[source]
----
ENTRÉE : Données brutes multi-sources
├→ AsciiDoc (SPG_A2SP.adoc) → noms, dates, OF pilote
├→ JSON (catalogue formations) → emails, téléphones
├→ YAML (config workspace) → tokens OAuth2
├→ SQL (schémas DDL) → IP, adresses
├→ pgvector (métadonnées embeddings) → identifiants
├→ ONNX (outputs classification) → noms propres
└→ Graphify (graph.json) → nœuds avec PII
SORTIE : Datasets propres, format standardisé
├→ [ANONYMIZED] remplace les PII détectées
├→ Classification RGPD (niveau 0→4)
├→ Rapport d'audit (quoi a été nettoyé)
└→ Dataset prêt pour RAG ET fine-tuning
----
إنه يكتشف الأنماط الأكثر وضوحًا أولاً (البريد الإلكتروني)`.*@.*`, الرموز`sk-*`, `ghp_*`, IPs)، ثم يتعلم. فترة التجربة، هذا هو الأمر: نتأكد من أنه لا يسمح بمرور سلبيات كاذبة قبل تعيينه نهائيًا.
== ما يطلقه هذا MVP (ليس مجرد امتثال)
التّخفيّ كـ MVP0 ليس هو رسوم الـ GDPR قبل الطريق السريع. هو الطريق السريع نفسه. هذا ما يفتحه :
=== الحاضر: واقع معزز في المُحفّز
[source]
----
DONNÉES BRUTES CLIENT
↓
Anonymiseur MVP0 → datasets propres
↓
RAG pgvector (MVP1) → top-K documents similaires (filtrés, anonymisés)
↓
LLM (deepseek-v4-pro) → réponse augmentée, zéro PII
----
RAG لا يبحث في البيانات القذرة — إنه يبحث في مساحة**نظيف بالتصميم**. وهذا يغير كل شيء بالنسبة لجودة الإجابات : لا يقضي النموذج اللغوي الكبير وقته في الالتفاف حول بيانات تعريف شخصية (PII) يدركها لكنه لا يجب أن يذكرها.
=== المستقبل : ضبط دقيق على البيانات الصحية
[source]
----
MVP0 → datasets propres accumulés (session après session)
↓
Fine-tuning expert métier (CDA, FPA) sur données zéro PII
↓
Modèle fine-tuné exposé via Ollama (sans fuite de données)
----
الضبط الدقيق على البيانات الخام هو كارثة قانونية محتملة. على البيانات النظيفة، هو**طريقة قابلة للتكرار**. كل عميل يجمع مجموعات البيانات المنظّفة الخاصة به، كل عميل يمكنه تعديل خبرائه المتخصصين بدقة على بياناته — دون أن يكشف أبدًا عن بيانات شخصية.
== لماذا هذا قابل للتسويق
ليس « أداة امتثال لـ RGPD ». إنها**طريقة قابلة للتكرار تحوّل مشكلة عالمية إلى أصل**:
1. *كل شركة تدريب لديها بيانات قذرة* — هذه هي المشكلة
2. *لا أحد يمتلك خط أنابيب تلقائي للتنظيف متعدد المصادر* — هذا هو السوق
3. *الحلقة: إخفاء الهوية → RAG → ضبط دقيق مملوكة* — إنه الحاجز
لن يبيع برنامج Edster كخدمة (MVP3) « مساحة عمل Gradle ». بل سيبيع هذه الحلقة المغلقة. و MVP0 هو نقطة الدخول.
== تنسيق SQL كطريقة ثالثة للسياق
استيراد البيانات المنظمة لا يقتصر على أن يكون مجرد تنسيق لتبادل. مخطط SQL (DDL) يحمل**نموذج العلاقة بين الكيانات للمجال**:
[source]
----
CREATE TABLE formation (
id UUID PRIMARY KEY,
titre VARCHAR NOT NULL,
referentiel RNCP REFERENCES rncp(id),
organisme OF REFERENCES of_pilote(id) -- ← va être anonymisé
);
----
هذا DDL، بمجرد إخفاء هويته (السطر 4)، يصبح مصدرًا للسياق للنموذج اللغوي الكبير. ليس نصًا — من**نموذج أعمال**. يعطي RAG المحتوى (التشابه المتجهي)، ويعطي Graphify العلاقات (البنية الدقيقة)، ويعطي مخطط SQL**التصميم الموجه للنطاق الضمني**: bounded contexts, agrégats, value objects. الـ LLM يفهم المجال لأنه يقرأ مخططه.
== خريطة الطريق : من MVP0 إلى SaaS
[source]
----
MVP0 — Anonymiseur (ce que cet article décrit)
Sortie : datasets propres, reproductible
MVP1 — RAG pgvector (dépend de MVP0)
Realité augmentée en prompt sur données nettoyées
MVP2 — Graphify + ONNX + SQL DDD (dépend de MVP1)
Vecteur composite de contexte (règles + similarité + relations exactes)
MVP3 — SaaS Edster (dépend de MVP0-2)
Provisionnement workspace client complet
----
كل MVP يعتمد على السابق. لا يمكن تسليم أي MVP بدون MVP0. هذا هو السبب الذي يجعل المُجهِّل ليس « P0 » في backlog — إنه**MVP0**. أول مخرج تجاري، وكل شيء آخر معتمد على نجاحه
== الاستنتاج : العمل غير المرئي الذي يجعل كل شيء ممكناً
في شركة ناشئة تقليدية، يتم التعاقد مع تنظيف البيانات، أو يكون يدويًّا، أو يُتجاهَل. في هذه البنية، الأمر هو أن**قلب المنتج**. المُخَفي هو أول موظف لأن بدونه لا شيء يعمل :
* بدون MVP0 → لا يوجد RAG قانوني (MVP1)
* بدون MVP0 → لا تعديل دقيق بدون تسرب بيانات (ملحمة 5)
* بدون MVP0 → لا يوجد SaaS موثوق به (MVP3)
* بدون MVP0 → لا يوجد واقع معزز في المطالبة
* بدون MVP0 → لا توجد طريق ثالثة للسياق (SQL DDD)
هو يقوم بالأعمال القذرة. لن يُذكر أبدًا في العروض التقديمية. لكنه هو من يدير المصنع.
وهذا هو السبب الذي يوظفونه أولاً.
== المراجع
* مقالة حول علم الوجود المكاني ودوائر الثقة :link:../2026/0114_gouvernance_cercles_confiance_ontologie_spatiale_alignement_llm_post.html[الأ'ontologie المكانية كآلية للمحاذاة]
* مقالة حول حوكمة الوكيل Eager/Lazy:link:../2026/0108_gouvernance_agent_opencode_eager_lazy_post.html[حكم وكيل ذكاء اصطناعي باستخدام AsciiDoc]
* مقالة حول آلية Hot/Warm/Coldlink:../2026/0110_mecanisme_backup_contexte_agent_post.html[نافذة منزلقة وموجة باردة]
* مقالة حول مقارنة الثلاثة LLMs :link:../2026/0112_comparaison_kimi_glm_deepseek_long_contexte_plugin_gradle_opencode_post.html[DeepSeek-V4-Pro, Kimi K2.6, GLM-5.1]
----