Étude de cas
IA privéeDéploiement d’une plateforme d’inférence IA privée
Contexte
Une maison d’édition de logiciels, engagée dans l’open source. Les développeurs y utilisaient les agents de codage tous les jours. Mais deux freins bloquaient tout élargissement : les données et les usages passaient chez un prestataire étranger, et l’abonnement montait avec chaque utilisateur le tout dans un contexte de restrictions d’usage. Étendre l’IA à toute l’entreprise dans ces conditions ? Compliqué, et de plus en plus cher.
Le défi
Donner à tout le monde les mêmes capacités, sans abonnement externe. Concrètement : une plateforme d’IA privée, un proxy LLM central pour distribuer les clés et suivre les usages, et des modèles hébergés en France, sur du matériel dédié.
Souveraineté
Prompts, données, usages : dépendre d'un acteur étranger pour toute son entreprise est un risque stratégique. Blocages régionaux de modèles, risques de conformité et fuites d'informations le démontrent
Coût
L’abonnement grimpe à chaque nouvel utilisateur, qu’il consomme ou non. Un coût de licences, pas un coût d’usage.
Adoption
Généraliser sans casser les habitudes. Les développeurs gardent leurs agents et leurs IDE ; les autres équipes découvrent l’IA.
L’approche
01 · L’entrée unique
Un proxy LLM, point d’entrée unique
Plutôt que d’éparpiller les clés API, LiteLLM centralise tout. Les IDE et les agents l’appellent : les développeurs gardent leurs habitudes, les requêtes tournent sur les modèles privés. Clés, quotas par équipe et par utilisateur, traçabilité de chaque appel le proxy s’en occupe. Ajouter un modèle open weight ou retirer l’ancien tient en une ligne de configuration : les nouveautés vont vite, les outils ne bougent pas. Les utilisateurs non techniques, eux, passent surtout par les intégrations IA des outils internes, et par Open WebUI pour le chat : une URL à ouvrir, rien à installer.
02 · Le routage
Deux modèles pour deux usages
Qwen3.6 Dense 27B pour l’aide au code : excellents résultats, mais gourmand en ressources. Qwen3.6 MoE 35B-A3B pour les usages généralistes : bons résultats, beaucoup plus léger à l’échelle. Les deux modèles tournent en versions compressées NVFP4.
03 · Le socle bare metal
Des machines physiques dédiées et hébergées en France
Les modèles tournent sur des machines dédiées opérées par l’entreprise, dans un datacenter français. Le parc GPU mélange plusieurs générations de cartes NVIDIA.
Les résultats
Adoption rapide
L’entreprise a rapidement intégrer l’IA au quotidien. IDE et agents pour les développeurs, intégrations dans les outils internes et OpenWebUI pour les autres.
Coût à l'usage
Le coût suit l’usage réel. Chaque équipe voit le nomre de tokens qu’elle consomme ; on ne paie plus de licences dormantes.
Souveraineté complète
Modèles, prompts et données restent au sein de l'entreprise. Pas de risques de fuites business, de secrets, etc
Plateforme autonome
La plateforme vit sans moi. Architecture, exploitation, gestion des clés : tout est documenté, l’équipe est autonome.
Les modèles bougent vite
Ajouter un modèle open weight ou retirer l’ancien tient en une ligne de configuration du proxy ; les outils des équipes ne bougent pas.
Réversibilité
Tout repose sur le standard des endpoints OpenAI : les outils appellent une API connue. Changer de modèle, de fournisseur d'inférence ou d’hébergeur est simple et ne nécessite, pas une migration.
La stack
Accès
- LiteLLM
- Open WebUI
Modèles
- Qwen3.6 Dense
- Qwen3.6 MoE
Orchestration
- Kubernetes
- Ansible
- Ubuntu
Infra
- Bare metal
- GPU NVIDIA