Guillaume Assier

Étude de cas

IA privée

Déploiement d’une plateforme d’inférence IA privée

Contexte

Une maison d’édition de logiciels, engagée dans l’open source. Les développeurs y utilisaient les agents de codage tous les jours. Mais deux freins bloquaient tout élargissement : les données et les usages passaient chez un prestataire étranger, et l’abonnement montait avec chaque utilisateur le tout dans un contexte de restrictions d’usage. Étendre l’IA à toute l’entreprise dans ces conditions ? Compliqué, et de plus en plus cher.

Le défi

Donner à tout le monde les mêmes capacités, sans abonnement externe. Concrètement : une plateforme d’IA privée, un proxy LLM central pour distribuer les clés et suivre les usages, et des modèles hébergés en France, sur du matériel dédié.

  • Souveraineté

    Prompts, données, usages : dépendre d'un acteur étranger pour toute son entreprise est un risque stratégique. Blocages régionaux de modèles, risques de conformité et fuites d'informations le démontrent

  • Coût

    L’abonnement grimpe à chaque nouvel utilisateur, qu’il consomme ou non. Un coût de licences, pas un coût d’usage.

  • Adoption

    Généraliser sans casser les habitudes. Les développeurs gardent leurs agents et leurs IDE ; les autres équipes découvrent l’IA.

L’approche

01 · L’entrée unique

Un proxy LLM, point d’entrée unique

Plutôt que d’éparpiller les clés API, LiteLLM centralise tout. Les IDE et les agents l’appellent : les développeurs gardent leurs habitudes, les requêtes tournent sur les modèles privés. Clés, quotas par équipe et par utilisateur, traçabilité de chaque appel le proxy s’en occupe. Ajouter un modèle open weight ou retirer l’ancien tient en une ligne de configuration : les nouveautés vont vite, les outils ne bougent pas. Les utilisateurs non techniques, eux, passent surtout par les intégrations IA des outils internes, et par Open WebUI pour le chat : une URL à ouvrir, rien à installer.

02 · Le routage

Deux modèles pour deux usages

Qwen3.6 Dense 27B pour l’aide au code : excellents résultats, mais gourmand en ressources. Qwen3.6 MoE 35B-A3B pour les usages généralistes : bons résultats, beaucoup plus léger à l’échelle. Les deux modèles tournent en versions compressées NVFP4.

03 · Le socle bare metal

Des machines physiques dédiées et hébergées en France

Les modèles tournent sur des machines dédiées opérées par l’entreprise, dans un datacenter français. Le parc GPU mélange plusieurs générations de cartes NVIDIA.

Les résultats

  1. Adoption rapide

    L’entreprise a rapidement intégrer l’IA au quotidien. IDE et agents pour les développeurs, intégrations dans les outils internes et OpenWebUI pour les autres.

  2. Coût à l'usage

    Le coût suit l’usage réel. Chaque équipe voit le nomre de tokens qu’elle consomme ; on ne paie plus de licences dormantes.

  3. Souveraineté complète

    Modèles, prompts et données restent au sein de l'entreprise. Pas de risques de fuites business, de secrets, etc

  4. Plateforme autonome

    La plateforme vit sans moi. Architecture, exploitation, gestion des clés : tout est documenté, l’équipe est autonome.

  5. Les modèles bougent vite

    Ajouter un modèle open weight ou retirer l’ancien tient en une ligne de configuration du proxy ; les outils des équipes ne bougent pas.

  6. Réversibilité

    Tout repose sur le standard des endpoints OpenAI : les outils appellent une API connue. Changer de modèle, de fournisseur d'inférence ou d’hébergeur est simple et ne nécessite, pas une migration.

La stack

Accès

  • LiteLLM
  • Open WebUI

Modèles

  • Qwen3.6 Dense
  • Qwen3.6 MoE

Orchestration

  • Kubernetes
  • Ansible
  • Ubuntu

Infra

  • Bare metal
  • GPU NVIDIA