تصمم UnlockLive IT وتسلّم أنظمة توليد معزَّز بالاسترجاع جاهزة للإنتاج — من النوع الذي يصمد أمام مستخدمين حقيقيين وأسئلة حقيقية وبيانات مؤسسية حقيقية وفوضوية. نبني مسارات استرجاع هجينة (BM25 + تضمينات كثيفة + إعادة ترتيب)، وبحثاً مراعياً للصلاحيات عبر بياناتكم في Notion وSharePoint وConfluence وS3 وSalesforce، وتوليد إجابات بمتطلبات استشهاد صارمة وتقييمات آلية عند كل تغيير. الحزمة الافتراضية: Python/FastAPI + Qdrant أو pgvector + Cohere Rerank + Claude أو GPT-5، تُنشر على AWS أو Modal أو داخل المنشأة بالكامل لأحمال العمل الخاضعة للتنظيم. راجعوا دراسة حالة Local LLM لدينا للاطلاع على مثال عملي لـ RAG في بيئة معزولة عن الشبكة.
ما الذي نبنيه
البحث في قواعد المعرفة المؤسسية:بحث وإجابة على Notion وConfluence وGoogle Drive وSharePoint وSlack وZendesk وJira وويكي الشركة الداخلية، مع استرجاع يراعي الصلاحيات (لا يرى المستخدم إلا نتائج من المستندات المسموح له بقراءتها).
مساعدو دعم موجهون للعملاء:RAG على مركز المساعدة ووثائق المنتج وملاحظات الإصدار وسجل التذاكر. إجابات متدفقة مع استشهادات مضمّنة، ومقاييس التحويل بعيداً عن الدعم البشري، وتسليم سلس إلى موظف بشري عند انخفاض مستوى الثقة.
الأسئلة والأجوبة الخاصة بمجالات محتوى خاضع للتنظيم:العقود القانونية، والأدبيات الطبية، والإرشادات السريرية، والإفصاحات المالية، وأكواد البناء، مع متطلبات صارمة للاستشهاد ومسارات تدقيق كاملة لمراجعة الامتثال.
مساعدو تمكين المبيعات والعروض:RAG فوق ملاحظات الفوز والخسارة، والعروض السابقة، وعروض التسعير، وملفات العميل المثالي (ICP)، وبطاقات المنافسين — لتوليد مسودات أولى لردود طلبات العروض (RFP) وتحضير الاكتشاف في ثوانٍ.
RAG مدرك للشيفرة على مستودعاتكم:تقطيع واعٍ بالشجرة النحوية (AST) لقاعدة الشيفرة إضافة إلى README وADR وسياق التذاكر، لمساعدي المطورين الداخليين ومساعدي التأهيل.
تحديد حالة الاستخدام (أسبوع واحد): حدّد من يسأل، وما الذي يحاول إنجازه، وما شكل الإجابة المقبولة، وأنماط الفشل التي قد تضر بالثقة. نرفض بدء مشاريع RAG دون مقياس نجاح صريح، وهو عادةً دقة الإجابات على مجموعة تقييم موسومة.
استيعاب البيانات وتنظيفها (1-3 أسابيع): موصّلات إلى الأنظمة المصدر (Confluence وNotion وS3 وSharePoint وSalesforce وZendesk)، وتحليل المستندات، وإزالة التكرار، واستخراج قوائم التحكم بالوصول (ACL)، وإثراء البيانات الوصفية. معظم مشكلات الاسترجاع هي في الواقع مشكلات استيعاب.
خط أساس الاسترجاع ومجموعة التقييم (1-2 أسبوع): إعداد يدوي لمجموعة تقييم من 100-300 سؤال تغطي الذيل الطويل للاستعلامات الحقيقية. وبناء خط استرجاع أساسي. وتقييمه. وتوثيق مواضع إخفاقه.
التحسين المتكرر للاسترجاع (2-4 أسابيع): بحث هجين، وإعادة ترتيب (reranking)، وإعادة صياغة الاستعلام، واسترجاع سياقي، واسترجاع المستند الأصلي (parent-document)، ومرشحات البيانات الوصفية. ويُقاس كل تكرار على مجموعة التقييم، لا على الانطباع.
التوليد وحواجز الحماية (1-2 أسبوع): هندسة التعليمات لنموذج الإجابة، ومتطلبات الاستشهاد، ومعالجة الرفض للأسئلة خارج النطاق، والحماية من اختراق النموذج وحقن التعليمات، ومصنِّفات المخرجات.
النشر في الإنتاج والمراقبة (1-2 أسبوع): نقاط نهاية API، والتخزين المؤقت، وتحديد المعدل، وعزل كل مستأجر، ومراقبة شاملة (LangFuse / Helicone)، ولوحات معلومات مرتبطة بمقياس عملك: معدل التحويل بعيداً عن الدعم البشري، أو زمن الوصول إلى الإجابة، أو ساعات المحللين الموفَّرة.
الأسئلة الشائعة
ما هو RAG ولماذا أحتاج إلى نسخة مخصصة؟
التوليد المعزَّز بالاسترجاع هو النمط الذي يُزوَّد فيه LLM بمستندات ذات صلة من قاعدة معرفتكم ويُطلب منه الإجابة باستخدام تلك المستندات فقط. تصلح النسخ الجاهزة من نوع «ارفع ملفات PDF إلى ChatGPT» للعروض التوضيحية لكنها تنهار في الإنتاج لأن بيانات المؤسسات الحقيقية تتضمن التحكم بالوصول، وصيغاً فوضوية، واحتياجات تقطيع مخصصة، ومتطلبات استشهاد، ومعايير جودة تستلزم التحسين المتكرر. RAG المخصص هو ما تبنونه عندما يكون لخطأ الإجابة تكلفة فعلية على الأعمال.
كم تبلغ تكلفة بناء نظام RAG للإنتاج؟
يتراوح RAG مركّز بمصدر واحد (قاعدة معرفة واحدة، وواجهة مستخدم واحدة، وبالإنجليزية فقط) عادةً بين 30,000 و80,000 دولار. ويتراوح RAG مؤسسي متعدد المصادر مع استرجاع مراعٍ للصلاحيات وموصلات إلى 5+ أنظمة بين 80,000 و200,000 دولار. ويبدأ RAG للقطاعات الخاضعة للتنظيم مع مسارات تدقيق ونشر داخل المنشأة وتقييمات صارمة من 150,000 دولار. تُحتسب تكاليف الاستدلال والتضمين بشكل منفصل وتعتمد على حجم المستندات ومعدل الاستعلامات.
Pinecone أم Weaviate أم Qdrant أم pgvector؟
pgvector هو خيارنا الافتراضي إذا كان لديكم PostgreSQL أصلاً — فلأقل من نحو 10 ملايين متجه ومعدل استعلامات معتدل، هو سريع بما يكفي ويزيل مكوناً متحركاً. وQdrant هو خيارنا الافتراضي لعمليات النشر المستضافة ذاتياً أو المعزولة عن الشبكة. وPinecone أو Turbopuffer هما خياراتنا الافتراضية للخدمات المُدارة واسعة النطاق جداً حيث تريدون صفر عمليات تشغيلية. وWeaviate خيار جيد عندما تريدون بحثاً هجيناً جاهزاً ولديكم الاستعداد التشغيلي. نختار بعد القياس المقارن على بياناتكم.
كيف تتعاملون مع الهلوسة والدقة؟
ثلاث طبقات. (1) جودة الاسترجاع — تُقاس مقابل مجموعة تقييم موسومة عند كل تغيير، مع إعادة الترتيب والبحث الهجين والاسترجاع السياقي لرفع الاستدعاء. (2) حواجز حماية التوليد — مطالبات تشترط الاستشهاد بالمقاطع المسترجعة، ورفض الأسئلة خارج النطاق، ومساراً بتدخل بشري للإجابات منخفضة الثقة. (3) المراقبة في الإنتاج — مراجعة بشرية لعينات من المحادثات، وفحوصات آلية للدقة الواقعية، وتنبيه فوري عند تراجعات أنماط الفشل. لكل نظام نسلّمه أنماط فشل مقبولة موثّقة.
هل يمكن لـ RAG احترام صلاحيات المستخدمين؟
نعم. نستخرج قوائم التحكم بالوصول (ACLs) من الأنظمة المصدرية وقت الاستيعاب، ونخزنها كبيانات وصفية قابلة للتصفية في قاعدة بيانات المتجهات، ونطبق مرشحات لكل مستخدم وقت الاستعلام. وفي البيئات عالية الثقة نجري أيضاً تحققاً من الصلاحيات بعد الاسترجاع مقابل النظام المصدر كفحص دفاع متعدد الطبقات. الاسترجاع المراعي للصلاحيات غير قابل للتفاوض في أي نشر يمس المستندات الداخلية.
هل يمكننا نشر هذا داخل المنشأة أو في VPC الخاصة بنا؟
نعم. ننشر بانتظام بالكامل داخل حسابات AWS / Azure / GCP الخاصة بالعملاء، وفي أحمال العمل الخاضعة للتنظيم ننشر بالكامل داخل المنشأة ومعزولاً عن الشبكة باستخدام نماذج مفتوحة المصدر (Llama 3.3 وQwen وMistral) تُقدَّم عبر vLLM أو TGI، مع Qdrant للاسترجاع. راجعوا دراسة حالة Local LLM لدينا للاطلاع على مثال عملي.
ما الفرق بين RAG والضبط الدقيق؟
يسترجع RAG حقائق حديثة وقت الاستعلام، وهو الإجابة الصحيحة لقواعد المعرفة المتغيرة ومتطلبات الاستشهاد والمحتوى الخاضع للتحكم بالوصول. أما الضبط الدقيق فيُدمج الأنماط والأسلوب في النموذج، وهو الإجابة الصحيحة لتعليم النموذج صيغة أو مصطلحات أو شخصية خاصة بمجال معين. وهما متكاملان — فكثير من أنظمة الإنتاج تستخدم الاثنين. نساعدكم على اختيار الأداة المناسبة في مرحلة الاستكشاف.
أخبرونا عن الأسئلة التي تريدون الإجابة عنها وعن البيانات التي تريدون الإجابة منها. سنرد خلال يوم عمل واحد. احجزوا مكالمة استراتيجية مجانية مع فريقنا في تورنتو.
احصل على تقدير صريح لمشروعك
رد في اليوم نفسه خلال ساعات العمل في أمريكا الشمالية. دون أي التزام.