Pour les DSI, les RSSI et les dirigeants d'entreprises sous contrainte de confidentialité
Un modèle d'IA ouvert chez vous : faire tourner un LLM sur vos serveurs
Pas de clé chez un fournisseur, pas de donnée qui sorte, pas de facture à l'usage. Une IA locale, on premise : un modèle ouvert sur une machine à vous, dimensionnée et mesurée avant toute promesse, sous l'œil de votre DSI comme le reste du réseau.
Leebr Data Consulting est un cabinet de conseil indépendant basé à Levallois-Perret. Il installe et exploite des modèles de langage ouverts (open weights), une IA locale, on premise, sur l'infrastructure de l'entreprise, choisit le matériel sur mesure, et construit les assistants et agents qui tournent dessus. Le cabinet propose des correctifs au moteur d'inférence llama.cpp.
Mis à jour le 24 septembre 2026
Vous vous reconnaissez ?
- Vos données ne peuvent pas quitter l'entreprise : secret industriel, données de santé, données de clients, contrat qui l'interdit.
- Vous utilisez un fournisseur d'IA et vous ne savez pas ce que deviendraient vos usages si ses prix, ses règles ou son accès changeaient du jour au lendemain.
- Vous avez des usages ordinaires (résumer, trier, extraire, répondre) et la facture à l'usage augmente chaque mois.
- On vous a dit qu'il fallait un cluster de cartes graphiques. Vous aimeriez savoir ce qu'il faut vraiment.
Ce que vous obtenez
Une machine dimensionnée à vos usages
Le choix du modèle et du matériel se fait sur vos cas et vos volumes, mesurés, pas sur une fiche technique. Un poste avec 64 Go de mémoire et une carte graphique modeste fait tourner un modèle de 35 milliards de paramètres : c'est notre banc.
Un service d'IA interne
Un serveur d'inférence sur votre réseau, avec une API compatible avec les outils du marché, des accès nommés, des journaux, des sauvegardes : administré comme vos autres serveurs.
Les assistants qui vont dessus
Assistant sur documents, agent relié à vos outils, traitement de courriels ou de factures : construits pour ce modèle, mesurés sur ce modèle.
La conformité regardée en face
Ce que l'AI Act demande quand le modèle tourne chez vous (provenance des contenus, rôle de fournisseur ou de déployeur) est traité au cadrage, pas découvert après.
Comment ça se passe
- 1
Vos usages et vos contraintes
Quels traitements, quels volumes, quelle confidentialité, quelle latence acceptable. On sépare ce qui relève d'un modèle ouvert chez vous de ce qui justifierait, à part, un modèle de frontière.
- 2
Une mesure sur votre matériel, ou sur notre banc
Avant tout engagement, le modèle candidat est mesuré sur vos cas : qualité des réponses, vitesse, mémoire. Le cadrage fixe le matériel, le modèle, un critère de succès et le coût complet, en une à deux semaines. Le cadrage lui-même est facturé, au forfait annoncé avant de commencer : c'est du travail, pas une démonstration commerciale.
- 3
Installer, brancher, transmettre
Le serveur, les assistants, la supervision, livrés par étapes ; à la fin, votre équipe exploite seule le service, documentation et procédures à l'appui, avec notre support si vous le souhaitez, jamais par obligation.
Ce qui est différent chez nous
Nous faisons tourner nos propres modèles ouverts
Loom, notre agent local open source, tourne sur un modèle ouvert avec son harnais et ses outils, et documente ses mesures publiquement.
Nous travaillons dans le moteur
Une correction écrite dans le back-end Vulkan de llama.cpp, mesurée sur notre banc : un point de contrôle passé de 3,3 secondes à 25 millisecondes, détail et pull request plus bas. Nous connaissons le moteur de l'intérieur.
Le local pour l'ordinaire, la frontière pour l'exception
Nous ne vendons pas le tout-local. Les usages courants tournent chez vous ; les cas qui justifient un modèle de frontière sont nommés, limités, et passent par un fournisseur en Europe, par exemple Claude via Bedrock. Le fournisseur reste interchangeable : rien ne vous y attache.
Rien de plus que votre réseau
Un modèle chez vous n'a pas de clé à voler, pas de facture à gonfler, rien qui sorte, et rien qui ne soit déjà sous l'œil de votre DSI, avec les mêmes règles, journaux et sauvegardes que le reste.
Des travaux que vous pouvez examiner
Loom : un agent local et son harnais
Un agent open source sur modèle ouvert, avec ses outils et sa boucle d'exécution. Les choix de harnais sont documentés et comparés sur un banc local.
Voir le projet et ses mesuresNotre première proposition de correctif à llama.cpp
Trois semaines de sondes, six lignes de correctif dans le back-end Vulkan, un point de contrôle de 3,3 s à 25 ms sur notre banc. Notre première pull request chez llama.cpp, ouverte et en revue, porte un correctif complémentaire ; le correctif Vulkan attend son tour, le dépôt limitant un nouveau contributeur à une PR à la fois.
Lire la noteQuestions fréquentes
Qu'est-ce qu'un LLM local, ou modèle ouvert chez soi ?
Un modèle de langage dont les poids sont publiés (Llama, Qwen, Mistral, gpt-oss et d'autres), installé sur une machine de l'entreprise et interrogé sur votre réseau. Aucune requête ne part chez un fournisseur, et le coût est celui de la machine, pas de l'usage.
Quelle machine faut-il pour faire tourner un LLM en local dans une entreprise ?
Pour un banc ou un usage individuel, un poste avec 64 Go de mémoire et une carte graphique modeste fait tourner un modèle ouvert de 35 milliards de paramètres. Pour un service partagé en production, un serveur avec une ou plusieurs cartes graphiques dimensionnées au cadrage, ou un cloud privé en Europe. Nous mesurons la vitesse en tokens par seconde sur vos cas avant de promettre, et ce chiffre figure dans le cadrage.
Un modèle ouvert est-il aussi bon qu'un modèle de frontière comme Claude ou GPT ?
Pour résumer, trier, extraire, répondre à partir de documents, souvent oui, et la différence ne se voit pas. Pour les tâches longues, le code difficile et les enchaînements de nombreux outils, non : ces cas se comptent et passent par un modèle de frontière, sur un périmètre limité.
Qui est responsable de la conformité quand le modèle tourne chez nous ?
Le contrôle technique passe de l'éditeur du modèle à votre organisation. Depuis août 2026, l'article 50 de l'AI Act impose des obligations de transparence (contenus générés détectables) même avec un modèle ouvert : l'installer ne fait pas automatiquement de vous un fournisseur, ce qui compte est la destination des sorties. Le cadrage traite ces questions avec vos juristes.
Combien ça coûte par rapport à un fournisseur ?
Un investissement matériel (ou un serveur loué en Europe) et une exploitation, contre une facture à l'usage. Le point de bascule dépend de vos volumes : le cadrage le calcule sur vos chiffres, et nous disons franchement quand le fournisseur reste moins cher.
Pour aller plus loin
Des données qui ne doivent pas sortir, et l'envie d'utiliser l'IA quand même ?
Décrivez vos usages et vos contraintes. On vous dit ce qu'il faut comme machine, ce qui tournera bien dessus, et ce qui non.
Décrire votre situation