Custom RAG & Enterprise Search Development — illustrative product visual produced by UnlockLive IT
Réponse rapide

UnlockLive IT conçoit et livre des des systèmes de génération augmentée par récupération de production — du genre qui tiennent face à de vrais utilisateurs posant de vraies questions sur des données d'entreprise réelles et désordonnées. Nous construisons des pipelines de récupération hybrides (BM25 + embeddings denses + reranking), une recherche respectueuse des permissions sur vos données Notion, SharePoint, Confluence, S3 et Salesforce, et une génération de réponses avec exigences strictes de citation et évaluations automatisées à chaque modification. Stack par défaut : Python/FastAPI + Qdrant ou pgvector + Cohere Rerank + Claude ou GPT-5, déployé sur AWS, Modal ou entièrement on-premise pour les charges de travail réglementées. Consultez notre étude de cas LLM local pour un exemple concret de RAG isolé (air-gapped).

Ce que nous construisons

Recherche dans les bases de connaissances d'entreprise:Recherche et réponse sur les Notion, Confluence, Google Drive, SharePoint, Slack, Zendesk, Jira et wikis internes de votre entreprise, avec une récupération respectueuse des permissions (un utilisateur ne voit que les résultats issus de documents qu'il est autorisé à lire).
Copilotes de support destinés aux clients:RAG sur votre centre d'aide, votre documentation produit, vos notes de version et l'historique des tickets. Réponses en streaming avec citations en ligne, indicateurs de déflexion et transfert propre vers un agent humain lorsque la confiance baisse.
Questions-réponses spécialisées sur contenu réglementé:Contrats juridiques, littérature médicale, recommandations cliniques, communications financières, codes du bâtiment, avec des exigences strictes de citation et des pistes d'audit complètes pour la revue de conformité.
Copilotes d'aide à la vente et de rédaction de propositions:RAG sur les notes de gains/pertes, les propositions passées, les grilles tarifaires, les profils de client idéal et les fiches concurrentielles, pour générer en quelques secondes des premières versions de réponses aux appels d’offres et des préparations de découverte.
RAG sensible au code sur vos dépôts:Découpage en chunks tenant compte de l'AST pour votre base de code, ainsi que le contexte des README, ADR et tickets, pour des copilotes développeurs internes et des assistants d'intégration.
RAG multimodal (PDF, images, tableaux, vidéo):Analyse de PDF tenant compte de la mise en page (Unstructured, LlamaParse, Reducto), extraction de tableaux, modèles de vision pour les graphiques et les captures d’écran, et indexation des transcriptions vidéo.

Notre stack technologique RAG

Analyse de documents: Unstructured, LlamaParse, Reducto, Docling, Azure Document Intelligence, AWS Textract
Stratégies de chunking: Découpage sémantique, late chunking, sensible à la mise en page, enrichi par le contexte (modèle de récupération contextuelle d'Anthropic)
Modèles d'embedding: OpenAI text-embedding-3-large, Voyage voyage-3, Cohere Embed v3, BGE, Nomic, Jina v3, BM25 hybride
Bases de données vectorielles: Pinecone, Weaviate, Qdrant, Chroma, pgvector, MongoDB Atlas Vector Search, Turbopuffer
Recherche hybride: BM25 + dense + fusion de rangs réciproques, expansion de requêtes, HyDE, multi-requêtes, récupération de documents parents
Rerankers: Cohere Rerank 3, Voyage rerank-2, BGE reranker, Jina reranker, ColBERT v2 pour une recherche de haute précision
Génération: OpenAI (famille GPT-5), Anthropic Claude (Sonnet 4.5, Opus), Gemini, open source via Together / Groq / vLLM
Récupération sensible aux permissions: Filtres ACL par document dans la base vectorielle, contrôles de permissions après récupération, accès aux sources via OAuth
Évaluations et qualité: Ragas, TruLens, LangSmith, LangFuse, Promptfoo, Phoenix : notation automatisée de la qualité de la recherche et des réponses
Observabilité: LangFuse, Helicone, Sentry, OpenTelemetry : trace complète du prompt et de la récupération pour chaque requête
Déploiement: AWS, Modal, Vercel, Cloudflare Workers, sur site (air-gapped), Kubernetes

Notre processus de développement RAG

  1. Définition du cas d'usage (1 semaine): Définissez QUI pose la question, CE QU'IL cherche à accomplir, à quoi ressemble une réponse acceptable et quels modes d'échec nuiraient à la confiance. Nous refusons de démarrer des projets RAG sans indicateur de réussite explicite, généralement la précision des réponses sur un jeu d'évaluation étiqueté.
  2. Ingestion et nettoyage des données (1-3 semaines): Connecteurs vers les systèmes sources (Confluence, Notion, S3, SharePoint, Salesforce, Zendesk), analyse de documents, déduplication, extraction des ACL et enrichissement des métadonnées. La plupart des problèmes de récupération sont en réalité des problèmes d'ingestion.
  3. Référence de récupération et jeu d'évaluation (1-2 semaines): Constituez à la main un jeu d'évaluation de 100 à 300 questions couvrant la longue traîne des vraies requêtes. Construisez un pipeline de récupération de référence. Évaluez-le. Documentez où il échoue.
  4. Itérer sur la récupération (2-4 semaines): Recherche hybride, reranking, réécriture de requêtes, récupération contextuelle, récupération de documents parents, filtres de métadonnées. Chaque itération est mesurée sur le jeu d'évaluation, pas au feeling.
  5. Génération et garde-fous (1-2 semaines): Ingénierie de prompts pour le modèle de réponse, exigences de citation, gestion des refus pour les questions hors périmètre, défense contre le jailbreak et l'injection de prompt, classifieurs de sortie.
  6. Déploiement en production et supervision (1-2 semaines): Endpoints d'API, mise en cache, limitation de débit, isolation par tenant, observabilité complète (LangFuse / Helicone) et tableaux de bord liés à votre indicateur métier : taux de déflexion, temps de réponse ou heures d'analyste économisées.

Questions fréquentes

Qu'est-ce que le RAG et pourquoi ai-je besoin d'une version sur mesure ?

La génération augmentée par récupération est le schéma où un LLM reçoit des documents pertinents issus de votre base de connaissances et doit répondre en s'appuyant uniquement sur ces documents. Les versions prêtes à l'emploi du type « envoyer des PDF à ChatGPT » conviennent pour des démos mais échouent en production, car les vraies données d'entreprise comportent du contrôle d'accès, des formats désordonnés, des besoins de découpage spécifiques, des exigences de citation et des seuils de qualité qui exigent de l'itération. Le RAG sur mesure, c'est ce que l'on construit lorsqu'une mauvaise réponse a un vrai coût pour l'entreprise.

Combien coûte la construction d'un système RAG de production ?

Un RAG ciblé à source unique (une base de connaissances, une surface utilisateur, anglais uniquement) coûte généralement de 30 000 $ à 80 000 $. Un RAG d'entreprise multisource avec récupération respectueuse des permissions et connecteurs vers plus de 5 systèmes coûte de 80 000 $ à 200 000 $. Un RAG pour secteur réglementé avec pistes d'audit, déploiement on-premise et évaluations rigoureuses démarre à 150 000 $. Les coûts d'inférence et d'embedding sont distincts et dépendent du volume de documents et du taux de requêtes.

Pinecone, Weaviate, Qdrant ou pgvector ?

pgvector est notre choix par défaut si vous avez déjà PostgreSQL — pour moins d'environ 10 M de vecteurs et un QPS modéré, il est suffisamment rapide et supprime un élément mobile. Qdrant est notre choix par défaut pour les déploiements auto-hébergés ou isolés (air-gapped). Pinecone ou Turbopuffer sont nos choix par défaut pour les services managés à très grande échelle où vous voulez zéro ops. Weaviate est un bon choix lorsque vous voulez la recherche hybride prête à l'emploi et que vous avez déjà l'appétence opérationnelle. Nous choisissons après des benchmarks sur vos données.

Comment gérez-vous les hallucinations et la précision ?

Trois couches. (1) Qualité de la récupération — mesurée sur un jeu d'évaluation étiqueté à chaque modification, avec reranking, recherche hybride et récupération contextuelle pour améliorer le rappel. (2) Garde-fous de génération — prompts exigeant la citation des passages récupérés, refus des questions hors périmètre et parcours human-in-the-loop pour les réponses à faible confiance. (3) Supervision en production — revue humaine par échantillonnage des conversations, contrôles automatisés de factualité et alertes immédiates sur les régressions de modes de défaillance. Chaque système que nous livrons documente ses modes de défaillance acceptables.

Le RAG peut-il respecter les permissions des utilisateurs ?

Oui. Nous extrayons les ACL des systèmes sources à l'ingestion, les stockons comme métadonnées filtrables dans la base vectorielle et appliquons des filtres par utilisateur au moment de la requête. Pour les environnements à haute confiance, nous effectuons aussi une vérification des permissions après récupération auprès du système source, en défense en profondeur. La récupération respectueuse des permissions est non négociable pour tout déploiement touchant des documents internes.

Pouvons-nous déployer cela on-premise ou dans notre propre VPC ?

Oui. Nous déployons régulièrement entièrement dans les comptes AWS / Azure / GCP de nos clients et, pour les charges de travail réglementées, nous déployons entièrement on-premise et en environnement isolé (air-gapped) avec des modèles open source (Llama 3.3, Qwen, Mistral) servis sur vLLM ou TGI, plus Qdrant pour la récupération. Consultez notre étude de cas LLM local pour un exemple concret.

En quoi le RAG diffère-t-il du fine-tuning ?

Le RAG récupère des faits à jour au moment de la requête et constitue la bonne réponse pour des bases de connaissances évolutives, des exigences de citation et des contenus à accès contrôlé. Le fine-tuning intègre des schémas et un style dans le modèle et constitue la bonne réponse pour lui apprendre un format, une terminologie ou une personnalité propres à un domaine. Ils sont complémentaires — de nombreux systèmes de production font les deux. Nous aidons à choisir le bon outil pendant la phase de découverte.

Une autre question ? Réservez un appel stratégique gratuit.

Prêt à livrer un RAG qui répond vraiment correctement ?

Parlez-nous des questions auxquelles vous voulez des réponses et des données dont elles doivent provenir. Nous répondrons sous un jour ouvrable. Réservez un appel stratégique gratuit avec notre équipe de Toronto.

Obtenez une estimation honnête pour votre projet

Réponse le jour même pendant les heures de bureau nord-américaines. Sans engagement.

Réservez un appel stratégique gratuit

Contact pour un service