Aller au contenu
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

Infrastructure LLM Privée — plateformes GPU auto-hébergées, gérées et partagées construites et exploitées par LLL Inc. LLL Inc. - Infrastructure LLM Privée

Pourquoi une Plateforme LLM Privée

La plupart des usages de l’IA aujourd’hui passent par une API publique : une invite quitte votre réseau, se rend sur les serveurs d’un fournisseur, et une réponse revient. C’est le bon compromis pour beaucoup de tâches. Ce compromis cesse d’être le bon dès que le contenu de l’invite est quelque chose que vous préférez garder au sein de votre propre infrastructure — documents internes, données clients, code source, tout ce qui relève d’une obligation de confidentialité que vous ne pouvez pas confier à un tiers.

Une plateforme LLM privée est l’alternative : un grand modèle de langage fonctionnant sur du matériel que vous contrôlez, ou que LLL exploite en votre nom, plutôt qu’un service public partagé.

LLL construit et exploite une infrastructure LLM privée dans le cadre de son propre environnement interne — le même environnement que nous utilisons pour présenter la plateforme à des clients potentiels avant qu’ils ne s’engagent dans leur propre construction. Il s’agit d’une extension d’une infrastructure que nous exploitons déjà, et non d’un nouveau domaine d’activité que nous décrivons pour la première fois sur le papier.


Trois Façons de l’Exploiter

Il n’existe pas une forme de déploiement « correcte » unique. Chacune des trois a un niveau d’utilisation où elle est l’option la moins chère — aucune ne l’emporte à toutes les échelles.

FormeSignification
Auto-hébergée (dans vos locaux)Le matériel GPU est installé dans votre propre bâtiment. L’équipement est votre actif immobilisé dès le premier jour.
Hébergement GéréLLL héberge et exploite le matériel en votre nom — alimentation, refroidissement, onduleur, connectivité et supervision inclus dans un forfait mensuel.
Infrastructure PartagéeAucun achat de matériel. Vous louez de la capacité GPU/VRAM, facturée à l’unité, sur une infrastructure déjà exploitée par LLL.

L’auto-hébergement tend à être le moins cher pour un usage soutenu, lourd et prévisible, à condition que votre bâtiment puisse supporter la charge électrique et de refroidissement (voir « Réalité du Marché des Équipements », ci-dessous). L’hébergement géré supprime la charge liée aux installations sans supprimer la propriété du matériel. L’infrastructure partagée supprime les deux, au prix d’un tarif à l’unité plutôt que de la possession de la capacité sous-jacente. Déterminer laquelle des trois est réellement rentable pour une charge de travail donnée est exactement la question à laquelle un PoC de 30 jours est conçu pour répondre — ce n’est pas quelque chose que nous recommandons par défaut avant d’avoir vu vos chiffres.


Ce Qui Est Inclus dans une Construction Complète

Une construction complète pour un cas d’usage unique est structurée autour de quatre éléments :

  • Construction de l’environnement : approvisionnement et configuration de la pile d’inférence sur la forme de déploiement choisie
  • RAG (Retrieval-Augmented Generation) : connexion du modèle à vos propres documents et base de connaissances, afin que les réponses s’appuient sur votre contenu plutôt que sur l’entraînement général du modèle
  • Intégration avec les systèmes existants : connexion de la plateforme aux outils déjà utilisés par votre équipe, plutôt que la livraison d’une fenêtre de discussion autonome que personne n’ouvre
  • Formation : mise à niveau de votre équipe sur l’utilisation, et le cas échéant, l’exploitation de la plateforme

Configuration de Modèle Recommandée

Les chiffres de poids ci-dessous sont en FP8 — voir la note sur la quantification sous le tableau.

ClasseFormatPoids (FP8)Positionnement
Classe 32BDense~32 GoSeuil pratique minimal pour un usage professionnel
Classe 70BDense~70 GoPar défaut et recommandé — une seule machine, dimensionnée pour approcher un équivalent ChatGPT à l’échelle de l’entreprise
122B-A10BMoE (10B actifs)~125 GoPour un usage simultané plus élevé
Classe 400BMoE (17B actifs)~400 GoHaut de la gamme que nous déployons actuellement
35B-A3BMoE (3B actifs)~35 GoRôle de triage/garde-fou uniquement — ni dimensionné ni positionné comme modèle de réponse

Seuil minimal de quantification : FP8. Nos configurations standard ne descendent pas en dessous de FP8 (par exemple, quantification 4-bit/INT4). Dans nos tests, une quantification plus poussée dégrade de manière mesurable la précision sur les tâches professionnelles en japonais, ce n’est donc pas quelque chose que nous livrons par défaut, quelles que soient les économies de coûts qu’elle pourrait offrir sur le papier.


Investissement

Les prix ci-dessous sont en USD et reflètent ce que nous facturons directement aux clients — pas des chiffres de coût interne.

PrestationPrixNotes
PoC de 30 jours$6,000 ($3,000 pour les équipes de 50 personnes ou moins)Valide la faisabilité sur votre propre charge de travail avant tout engagement matériel. Entièrement crédité sur la construction complète si vous poursuivez — voir PoC LLM Privé de 30 Jours
Construction complète (cas d’usage unique)$8,000–$22,000, selon l’échelleConstruction de l’environnement, RAG, intégration avec les systèmes existants et formation (voir ci-dessus)
Maintenance et exploitation continues$300–$1,300/moisSelon le nombre de GPU
Hébergement géré$300–$1,600/moisSelon la consommation électrique. Alimentation, refroidissement, onduleur, connectivité et supervision inclus
Infrastructure partagéeÀ partir de $300/mois par unité de VRAM de 24 GoAucun achat de matériel

Réalité du Marché des Équipements

Les prix des GPU et de la mémoire serveur augmentent fortement, et selon les signaux actuels du marché, les deux devraient rester tendus jusqu’en 2027 — une évolution portée par la demande liée à l’IA plutôt que par une pénurie temporaire. Nous ne publions pas de prix fixe pour l’équipement sur cette page : les prix du matériel évoluent actuellement assez vite pour qu’un chiffre précis publié aujourd’hui soit déjà dépassé au moment où vous le lisez, et il varierait de toute façon selon la région et le canal d’approvisionnement.

Pour donner un ordre de grandeur : une configuration à un ou quelques GPU — suffisante pour faire fonctionner le modèle de seuil 32B décrit ci-dessus — se situe à un ordre de grandeur nettement différent d’une construction complète à 8 GPU dimensionnée pour la classe 70B par défaut, laquelle se situe dans la fourchette basse des six chiffres, en USD, en tant que construction complète. Une configuration multi-nœuds dimensionnée pour le palier de classe 400B représente encore un cran au-dessus. Chaque palier fait basculer l’investissement en équipement dans une fourchette nettement plus élevée — c’est en partie pourquoi le PoC de 30 Jours existe : établir de quel palier votre charge de travail a réellement besoin avant d’en chiffrer un quelconque.

La mémoire est le deuxième poste de coût le plus important après les GPU eux-mêmes — un système construit autour de 768 Go de VRAM nécessite généralement plus de 1 To de mémoire système pour le soutenir, ce qui explique en partie pourquoi le prix de la mémoire a évolué presque aussi vite que celui des GPU. Pour connaître les prix actuels de l’équipement selon votre région d’approvisionnement et votre configuration réelles, contactez-nous plutôt que de vous fier à un chiffre potentiellement déjà dépassé.


Ce Que Nous Disons Honnêtement Dès le Départ

L’alimentation, le refroidissement, l’onduleur, l’alimentation de secours, la supervision et le contrôle du bruit varient énormément d’un bâtiment à l’autre, nous ne les chiffrons donc pas à un montant fixe dans une proposition — ils sont chiffrés individuellement après une visite sur site.

À titre de repère général : le refroidissement par air est praticable jusqu’à environ 20 kW par baie ; au-delà, le refroidissement liquide ou des modifications des installations deviennent généralement nécessaires. Même des changements qui paraissent mineurs sur le papier — l’ajout de capacité de distribution électrique, par exemple — ont entraîné des coûts réels et non négligeables sur certains sites. Nous préférons vous dire qu’un poste budgétaire lié aux installations existe et nécessite une visite sur site plutôt que de vous donner un chiffre que nous ne pourrions pas assumer.


Où Vont Réellement Vos Données

« Privé » décrit l’endroit où s’exécute l’inférence, pas l’architecture de votre réseau. Avec un déploiement auto-hébergé ou géré, l’invite et la réponse générée sont traitées sur des serveurs situés au sein de votre propre infrastructure — elles ne sont pas envoyées à un service d’IA public à usage général. Il s’agit d’une affirmation sur le lieu où s’effectue le calcul.

Ce n’est pas une affirmation sur le périmètre de votre réseau. Les VPN, les pare-feux, le contrôle d’accès, et tout ce qui concerne la sécurisation de cette infrastructure au niveau réseau, relèvent d’une décision de conception distincte, sur laquelle nous pouvons vous conseiller mais qui n’est pas incluse par défaut dans ce service.


Propriété du Modèle, des Données et des Résultats de Réglage

Les projets d’infrastructure soulèvent les mêmes questions de propriété que les projets applicatifs, étendues à ce qui est spécifique à une plateforme LLM : non seulement le code environnant, mais aussi les artefacts de modèle réglés, l’index de recherche et les résultats d’évaluation.

  • Les artefacts de réglage et de RAG vous appartiennent : tout poids affiné, toute configuration de prompt/recherche et tout jeu de données d’évaluation produits durant une construction sont remis en tant que livrables — ils ne sont pas conservés uniquement sur une infrastructure contrôlée par LLL, ce qui en ferait une dépendance plutôt qu’un actif.
  • Aucun verrouillage de modèle : les constructions sont conçues autour d’une interface d’inférence standard compatible OpenAI (voir ci-dessous), de sorte que le modèle sous-jacent peut être remplacé — un autre modèle à poids ouverts, un autre fournisseur de GPU, un autre arrangement d’hébergement — sans réécrire votre couche d’intégration.
  • Aucun verrouillage de fournisseur : la même pile d’inférence standard est utilisée pour les déploiements auto-hébergés, gérés et partagés. Passer ultérieurement d’une forme de déploiement à une autre ne nécessite pas de réarchitecturer la façon dont vos applications communiquent avec le modèle.
  • Vos données restent sous votre contrôle : les documents et les invites utilisés pour l’évaluation et le RAG restent sous votre contrôle en permanence — conformément à la remarque sur la localité des données ci-dessus.

C’est le même principe anti-verrouillage que LLL applique à chaque mission : une conception indépendante du modèle, une pile d’inférence standard, et une construction que vous pouvez faire migrer vers un autre fournisseur si vous le choisissez, plutôt qu’une construction qui dépend de la présence continue de LLL pour continuer à fonctionner.


Choisir la Bonne Forme de Déploiement

QuestionOriente vers
Avez-vous besoin que le matériel soit un actif immobilisé que vous possédez — pour des raisons d’audit, de politique de sécurité ou de comptabilité ?Auto-hébergé
Souhaitez-vous obtenir la capacité sans prendre en charge le travail d’installations (alimentation, refroidissement, onduleur, supervision) ?Hébergement géré
L’usage est-il léger, imprévisible, ou encore en phase de validation ?Infrastructure partagée
L’usage est-il lourd et soutenu, et votre installation peut-elle supporter cette charge ?L’auto-hébergement l’emporte souvent à cette échelle

Aucune de ces réponses n’est universelle — ce sont des points de départ. La bonne réponse pour une charge de travail spécifique, ainsi que la bonne taille de modèle, est ce que le PoC de 30 jours ci-dessous est conçu pour déterminer à partir de vos propres chiffres plutôt que d’une règle empirique.


Pour Commencer

S’engager sur un budget d’équipement à six chiffres, ou un contrat géré ou partagé pluriannuel, avant de savoir si un LLM privé atteint réellement votre seuil de précision et de latence, est un risque réel — un risque qu’une preuve de concept existe précisément pour éliminer.

Le PoC LLM Privé de 30 Jours s’exécute sur une infrastructure déjà exploitée par LLL, teste la précision et la latence sur vos propres documents et charge de travail (pas un benchmark générique), et se conclut par un rapport écrit : quelle forme de déploiement convient, quel palier de modèle convient, et une estimation de coût pour la construction complète. Si vous poursuivez, les frais de PoC sont intégralement crédités sur cette construction.


FAQ

Q : Devons-nous acheter du matériel pour savoir si cela fonctionne pour nous ? R : Non. Le PoC de 30 jours s’exécute sur une infrastructure déjà construite et exploitée par LLL en interne. Le rapport qui en résulte vous indique quoi acheter — ou louer, ou nous confier en hébergement — si vous décidez de poursuivre.

Q : 70B est-il toujours la bonne taille de modèle ? R : C’est notre point de départ par défaut et recommandé, dimensionné pour approcher un équivalent ChatGPT à l’échelle de l’entreprise sur une seule machine. Les charges de travail ayant des exigences de précision plus faibles peuvent fonctionner sur le seuil 32B ; les charges de travail à usage simultané élevé peuvent nécessiter les paliers MoE 122B-A10B ou classe 400B. Le rapport de PoC recommande un palier précis avec justification, et non un choix par défaut.

Q : Pouvons-nous quantifier en dessous de FP8 pour économiser sur le matériel ? R : Vous le pouvez, mais nous ne le recommandons pas par défaut. Nos tests montrent une baisse mesurable de précision sur les tâches professionnelles en japonais en dessous de FP8, nos configurations standard maintiennent donc cette limite même si cela réduirait la facture matérielle.

Q : Sommes-nous enfermés avec LLL, ou avec un modèle ou un fournisseur de GPU spécifique, une fois cette solution construite ? R : Non, par conception. La couche d’inférence est une interface standard compatible OpenAI, de sorte que le modèle et l’arrangement d’hébergement sous-jacent peuvent changer sans réécrire votre intégration — voir Propriété du Modèle, des Données et des Résultats de Réglage, ci-dessus.

Q : Qu’est-ce qui n’est pas inclus dans les prix de cette page ? R : Le travail spécifique au site — alimentation, refroidissement, onduleur, secours, supervision et contrôle du bruit — qui varie trop d’un bâtiment à l’autre pour être chiffré sans visite sur site. Voir « Ce Que Nous Disons Honnêtement Dès le Départ », ci-dessus, pour les chiffres de référence que nous pouvons partager avant cette visite.


Ressources Associées


Démarrer la Conversation

Prêt à savoir si une plateforme LLM privée convient à votre charge de travail ?

Planifier une Consultation


LLL Inc. - Infrastructure LLM Privée depuis la Malaisie Auto-hébergée • Gérée • Partagée — Aucun Verrouillage