Le défi
Une entreprise cliente d’un secteur réglementé utilisait un LLM hébergé via ses outils internes, mais chaque trimestre son équipe de revue de sécurité signalait le même point bloquant : du texte permettant d’identifier des clients était envoyé vers un point de terminaison cloud américain. Le service juridique avait suspendu le déploiement élargi, la facture OpenAI avait dépassé 4 200 $/mois avec seulement une fraction de la base d’utilisateurs prévue, et l’équipe produit s’était vu poser la question impossible : « peut-on conserver toute cette capacité d’IA sans qu’aucune donnée ne quitte l’ordinateur portable de l’utilisateur ? »
Ils n’avaient pas besoin d’un projet de recherche. Ils avaient besoin d’un workflow livrable qu’un employé interne pouvait installer en un après-midi, qui fonctionnait entièrement sur leurs MacBook série M et ThinkPad Windows existants, et dont les performances étaient assez bonnes pour que personne ne regrette l’amélioration de la confidentialité.
Notre solution
Nous avons conçu et livré une pile LLM entièrement sur l’appareil : Ollama comme moteur d’exécution des modèles, llama.cpp en coulisses pour l’inférence quantifiée GPU/CPU, une petite couche d’orchestration FastAPI pour l’utilisation d’outils et la récupération, et une interface de bureau Next.js livrée via une fine enveloppe Tauri. Chaque octet de contexte reste sur l’appareil. Pas d’inférence distante, pas de rappel de télémétrie, pas de proxy.
Nous avons évalué sept modèles à poids ouverts (Llama 3.1 8B, Qwen 2.5 7B/14B, Phi-3, Mistral et deux variantes spécialisées par domaine) sur les prompts réels du client et livré un routeur de modèles par tâche : un petit modèle rapide pour la classification et le chat, un modèle de raisonnement plus grand à la demande. Le RAG s’exécute sur un index ChromaDB local construit à partir des propres documents de l’utilisateur, chaque embedding étant calculé sur l’appareil.
Le résultat est un workflow mesurablement plus rapide que la version cloud sur le prompt médian (sans aller-retour réseau), qui réussit la revue de sécurité du client dès la première soumission et qui s’étend à chaque ordinateur portable de l’entreprise pour un coût d’inférence nul par poste.
- Moteur Ollama avec routeur de modèles par tâche (petit pour le chat, grand pour le raisonnement)
- Inférence quantifiée via llama.cpp optimisée pour Apple Silicon et les CPU Intel/AMD modernes
- RAG local sur les propres fichiers de l’utilisateur avec ChromaDB et des embeddings sur l’appareil
- Couche d’orchestration FastAPI avec API HTTP stable pour l’interface de bureau Next.js / Tauri
- Liste d’autorisation réseau vérifiable — aucun trafic LLM ne quitte jamais l’appareil
- Banc d’évaluation intégré : chaque mise à niveau de modèle est notée avant le déploiement
- Installateurs signés et notarisés pour macOS (M1/M2/M3) et Windows
- Panneau de confidentialité dans l’application montrant exactement ce que le modèle peut lire
- Canal optionnel de mise à jour des modèles respectant le proxy d’entreprise et la politique réseau