دراسة حالة · عميل مؤسسي (سرّي) في قطاع خاضع للتنظيم

نشر LLM خاص على الجهاز لمؤسسة حساسة للخصوصية (Ollama + llama.cpp)

كيف استبدلنا فاتورة OpenAI البالغة 4.2 ألف دولار شهرياً بسير عمل LLM يعمل بالكامل على الجهاز باستخدام Ollama وllama.cpp وطبقة تنسيق بـ FastAPI — مع إبقاء 100% من بيانات العملاء على حاسوب المستخدم المحمول وتقديم استجابات في أقل من ثانية.

  • القطاعالمؤسسات / الرعاية الصحية
  • السنة2025
  • البلدكندا
  • المدة3 أشهر
Private, On-Device LLM Deployment for a Privacy-Sensitive Enterprise (Ollama + llama.cpp) hero screenshot

النتائج في لمحة

  • 100%استدلال على الجهاز نفسه — لا تغادر أي بيانات عملاء الحاسوب المحمول
  • $4.2K/moإلغاء الإنفاق على OpenAI، واستبداله بتكلفة استدلال هامشية قدرها 0 دولار
  • <800msزمن استجابة p95 لأول رمز (token) على M2 MacBook لنموذج الدردشة
  • الأولاجتاز التسليم المراجعة الأمنية للعميل

التحدي

كان عميل مؤسسي في قطاع خاضع للتنظيم يستخدم LLM مستضافاً عبر أدواته الداخلية، لكن فريق المراجعة الأمنية لديه كان يشير كل ربع سنة إلى العائق نفسه: نصوص تحدد هوية العملاء كانت تُرسل إلى نقطة نهاية سحابية أمريكية. أوقف الفريق القانوني التوسع الأوسع، وتجاوزت فاتورة OpenAI 4,200 دولار شهرياً مع جزء صغير فقط من قاعدة المستخدمين المخططة، وطُرح على فريق المنتج السؤال المستحيل: «هل يمكننا الاحتفاظ بكل قدرات الذكاء الاصطناعي هذه دون أن تغادر أي بيانات حاسوب المستخدم المحمول؟»

لم يكونوا بحاجة إلى مشروع بحثي. كانوا بحاجة إلى سير عمل قابل للتسليم يستطيع موظف داخلي تثبيته في فترة بعد ظهر واحدة، ويعمل بالكامل على أجهزة MacBook بمعالجات M وأجهزة Windows ThinkPad الموجودة لديهم، ويؤدي بما يكفي من الكفاءة بحيث لا يستاء أحد من ترقية الخصوصية.

حلّنا

صممنا وسلّمنا حزمة LLM تعمل بالكامل على الجهاز: Ollama كبيئة تشغيل للنموذج، وllama.cpp تحت الغطاء للاستدلال المكمَّم على GPU/CPU، وطبقة تنسيق صغيرة بـ FastAPI لاستخدام الأدوات والاسترجاع، وواجهة سطح مكتب بـ Next.js مغلّفة عبر غلاف Tauri خفيف. كل بايت من السياق يبقى على الجهاز. لا استدلال عن بُعد ولا استدعاء قياس عن بُعد ولا وسيط.

اختبرنا سبعة نماذج مفتوحة الأوزان (Llama 3.1 8B وQwen 2.5 7B/14B وPhi-3 وMistral ونسختان مضبوطتان لمجالات محددة) على التعليمات الفعلية للعميل، وسلّمنا موجّه نماذج لكل مهمة: نموذج صغير وسريع للتصنيف والدردشة، ونموذج استدلال أكبر عند الطلب. ويعمل RAG على فهرس ChromaDB محلي مبني من مستندات المستخدم نفسه، مع حساب كل التضمينات على الجهاز.

والنتيجة سير عمل أسرع بشكل ملموس من النسخة السحابية في التعليمة المتوسطة (دون رحلة شبكية)، ويجتاز المراجعة الأمنية للعميل من التقديم الأول، ويتوسع إلى كل حاسوب محمول في الشركة بتكلفة استدلال صفرية لكل مقعد.

  • بيئة تشغيل Ollama مع موجّه نماذج لكل مهمة (صغير للدردشة، وكبير للاستدلال)
  • استدلال مكمَّم عبر llama.cpp مضبوط لمعالجات Apple Silicon ومعالجات Intel/AMD الحديثة
  • RAG محلي على ملفات المستخدم نفسه باستخدام ChromaDB وتضمينات على الجهاز
  • طبقة تنسيق FastAPI مع واجهة HTTP API مستقرة لواجهة سطح المكتب بـ Next.js / Tauri
  • قائمة سماح شبكية قابلة للتحقق — لا يغادر أي حركة مرور LLM الجهاز
  • أداة تقييم مدمجة بحيث يُقيَّم كل تحديث للنموذج قبل الطرح
  • مثبّتات موقّعة وموثّقة لأنظمة macOS (M1/M2/M3) وWindows
  • لوحة خصوصية داخل التطبيق تعرض بالضبط ما يستطيع النموذج قراءته
  • قناة اختيارية لتحديث النموذج تحترم الوكيل المؤسسي وسياسة الشبكة

كيف بنيناه

  1. 01

    الاستكشاف: تدقيق الأوامر وخط الأساس للأجهزة

    جمعنا مجموعة ممثلة من نحو 400 تعليمة حقيقية من سجلات OpenAI الحالية (بعد تنقيتها)، ثم قارنّا النماذج المفتوحة الأوزان المرشحة على مزيج الأجهزة الفعلي لدى العميل، وهو أجهزة MacBook من طراز M1 وM2 وM3 إضافة إلى جهاز ThinkPad يعمل بنظام Windows كمرجع، وقسنا عدد الرموز في الثانية، وزمن الاستجابة للرمز الأول عند المئين 95، والجودة مقابل خط GPT-4 المرجعي باستخدام معيار تقييم يملكه العميل.

  2. 02

    البنية المعمارية: موجّه النماذج + RAG محلي

    اخترنا Ollama كبيئة تشغيل (دورة حياة نظيفة، وإدارة إصدارات النماذج، وتكميم يراعي GPU)، ثم بنينا طبقة تنسيق خفيفة بـ FastAPI توجّه كل مهمة إلى النموذج المناسب، وتتولى الاسترجاع من فهرس ChromaDB محلي، وتوفّر واجهة HTTP API مستقرة يستدعيها تطبيق سطح المكتب. ويعمل النظام بأكمله كثلاث عمليات محلية يديرها تطبيق سطح المكتب.

  3. 03

    البناء: تجربة سطح المكتب، واستيعاب RAG، والتقييمات

    جرت الهندسة في سباقات (sprints) مدتها أسبوعان مع نظام تقييم حقيقي؛ إذ قُيّم كل تغيير على مجموعة مطالبات محجوبة، فظهرت تراجعات الجودة فورًا. وأضفنا تدفق إدخال بنقرة واحدة لمستندات المستخدم الخاصة، وقناة لتحديث النموذج تحترم سياسة الشبكة لدى المستخدم، ولوحة خصوصية تعرض بدقة ما يمكن للنموذج الوصول إليه.

  4. 04

    المراجعة الأمنية، والتغليف، والطرح

    جمّعنا الحزمة في مثبّت موقّع (موثّق على macOS، وموقّع على Windows)، وكتبنا نموذج تهديدات قصيرًا يستطيع فريق الأمن قراءته في 20 دقيقة، وأطلقنا نسخة تجريبية لـ 25 مستخدمًا قبل الإطلاق على مستوى الشركة. اجتازت المراجعة الأمنية من أول تقديم، وكانت الميزة الحاسمة قائمة سماح للشبكة قابلة للتحقق تثبت أن أي حركة LLM لا تغادر الجهاز أبدًا.

حزمة التقنيات

  • Ollama
  • llama.cpp
  • Llama 3.1
  • Qwen 2.5
  • LangChain
  • Python
  • FastAPI
  • Next.js
  • SQLite
  • ChromaDB
  • تطوير وكلاء الذكاء الاصطناعي
  • تطوير الذكاء الاصطناعي والتعلم الآلي
  • Python وFastAPI
  • الأمن السيبراني
“ظننا أن الذكاء الاصطناعي الخاص يعني منتجاً أسوأ. إن ما بناه UnlockLive أسرع من النسخة السحابية في معظم ما يقوم به فريقنا، واستغرقت مراجعتنا الأمنية 20 دقيقة بدلاً من ثلاثة أشهر.”
مدير المنتج · عميل مؤسسي (الاسم سري)

الأسئلة الشائعة

هل يمكن لنموذج LLM محلي أن يحل محل GPT-4 فعلًا في سير العمل الإنتاجي؟

في معظم مهام المؤسسات، مثل التصنيف والتلخيص وRAG على مستندات المستخدم نفسه والاستخراج المنظم، نعم: نموذج مفتوح الأوزان جيد الاختيار في نطاق 7B إلى 14B يضاهي GPT-3.5 أو يتفوق عليه، ويقترب من GPT-4 بفارق 10 إلى 15% في الجودة. السر في التقييم الصادق: نقيّم النماذج المرشحة دائماً على تعليمات العميل الحقيقية لا على معايير عامة.

ما النماذج مفتوحة الأوزان التي توصون بها للنشر على الجهاز في 2025؟

نعتمد افتراضياً Llama 3.1 8B للمحادثة العامة وQwen 2.5 14B للمهام التي تتطلب استدلالاً كثيفاً، مع Phi-3 mini للتصنيف فائق السرعة. ويعتمد الاختيار النهائي على أجهزة المستخدم (تتعامل أجهزة Mac من طراز M2/M3 مع 14B بسهولة، بينما تعمل الحواسيب المحمولة الأقدم من Intel بصورة أفضل مع 7B المكمَّم) وعلى مزيج أحمال العمل.

هل Ollama جاهز للإنتاج في قطاع خاضع للتنظيم؟

ترخيص Ollama نفسه متساهل، وله دورة حياة مستقرة للنماذج، وتكميم يراعي وحدة GPU، وواجهة HTTP API نظيفة. نقرنه بطبقة تنسيق رقيقة مبنية على FastAPI نملكها، ومثبّت موقّع وموثّق (signed/notarized)، وقائمة سماح شبكية قابلة للتحقق، وقد اجتازت هذه التركيبة عدة مراجعات أمنية للمؤسسات من التقديم الأول.

كيف تحافظون على جودة النموذج مرتفعة عندما لا يمكنكم تحديث النماذج مع كل استدعاء API؟

نسلّم مع النشر أداة تقييم خاصة بكل مستأجر. يُقيَّم كل ترقية للنموذج مقابل مجموعة موجّهات محجوبة يملكها العميل، ولا تُعتمد إلا إذا حققت معيار الجودة. وتُطرح تحديثات النماذج عبر قناة canary يتحكم بها المستخدم.

كم تبلغ تكلفة نشر LLM خاص مقابل الاستمرار في استخدام OpenAI / Anthropic؟

نقطة التعادل المعتادة تكون بين 6 و9 أشهر. البناء تكلفة هندسية لمرة واحدة (من 8 إلى 14 أسبوعًا لسير عمل مركّز)، ثم تنخفض تكلفة الاستدلال لكل مستخدم إلى الصفر. تتفوق واجهات API المستضافة في الاستخدام المتقطع منخفض الحجم؛ ويتفوق التشغيل على الجهاز في أدوات المؤسسات اليومية النشطة.

هل تريد نتيجة كهذه؟

تحدّث إلى الفريق نفسه الذي بنى نشر LLM خاص على الجهاز لمؤسسة حساسة للخصوصية (Ollama + llama.cpp). سنحدد نطاق مشروعك، ونقدّم لك عرضًا بسعر ثابت، ونُريك أقرب مثال من أعمالنا.

احجز مكالمة استراتيجية