Zum Inhalt springen
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

Private LLM-Infrastruktur — selbst gehostete, verwaltete und gemeinsam genutzte GPU-Plattformen, gebaut und betrieben von LLL Inc. LLL Inc. - Private LLM-Infrastruktur

Warum eine private LLM-Plattform

Der Großteil der heutigen KI-Nutzung läuft über eine öffentliche API: Ein Prompt verlässt Ihr Netzwerk, geht an die Server eines Anbieters, und eine Antwort kommt zurück. Das ist für viele Aufgaben der richtige Kompromiss. Er hört auf, der richtige Kompromiss zu sein, sobald das Material im Prompt etwas ist, das Sie lieber innerhalb Ihrer eigenen Infrastruktur behalten würden — interne Dokumente, Kundendaten, Quellcode, alles, was einer Vertraulichkeitspflicht unterliegt, die Sie nicht an Dritte weitergeben können.

Eine private LLM-Plattform ist die Alternative: ein großes Sprachmodell, das auf Hardware läuft, die Sie kontrollieren, oder die LLL in Ihrem Auftrag betreibt, anstatt auf einem gemeinsam genutzten öffentlichen Dienst.

LLL baut und betreibt private LLM-Infrastruktur als Teil unserer eigenen internen Umgebung — derselben Umgebung, die wir nutzen, um potenziellen Kunden die Plattform vorzuführen, bevor sie sich für einen eigenen Aufbau entscheiden. Dies ist eine Erweiterung einer Infrastruktur, die wir bereits betreiben, kein neuer Tätigkeitsbereich, den wir zum ersten Mal auf dem Papier beschreiben.


Drei Wege, sie zu betreiben

Es gibt nicht die eine „richtige” Bereitstellungsform. Jede der drei hat ein Nutzungsniveau, bei dem sie die günstigste Option ist — keine gewinnt auf jeder Skala.

FormBedeutung
Selbst gehostet (in Ihren eigenen Räumlichkeiten)GPU-Hardware wird in Ihrem eigenen Gebäude installiert. Die Ausrüstung ist ab dem ersten Tag Ihr Anlagevermögen.
Managed HostingLLL beherbergt und betreibt die Hardware in Ihrem Auftrag — Strom, Kühlung, USV, Konnektivität und Überwachung sind in einer monatlichen Gebühr enthalten.
Shared InfrastructureKein Hardwarekauf. Sie mieten GPU-/VRAM-Kapazität, abgerechnet pro Einheit, auf Infrastruktur, die LLL bereits betreibt.

Selbst gehostete Lösungen sind tendenziell bei anhaltender, hoher, vorhersehbarer Nutzung am günstigsten, vorausgesetzt, Ihr Gebäude kann die elektrische Last und die Kühllast bewältigen (siehe „Marktrealität bei der Ausrüstung” weiter unten). Managed Hosting beseitigt die Belastung durch die Gebäudeinfrastruktur, ohne das Eigentum an der Hardware aufzugeben. Shared Infrastructure beseitigt beides, auf Kosten eines Preises pro Einheit statt des Eigentums an der zugrunde liegenden Kapazität. Welche der drei Optionen für eine bestimmte Arbeitslast tatsächlich wirtschaftlich sinnvoll ist, ist genau die Frage, die ein 30-tägiger PoC beantworten soll — nicht etwas, das wir standardmäßig empfehlen, bevor wir Ihre Zahlen gesehen haben.


Was in einem vollständigen Aufbau enthalten ist

Ein vollständiger Aufbau für einen einzelnen Anwendungsfall ist um vier Elemente herum konzipiert:

  • Umgebungsaufbau: Bereitstellung und Konfiguration des Inferenz-Stacks in der gewählten Bereitstellungsform
  • RAG (Retrieval-Augmented Generation): Verbindung des Modells mit Ihren eigenen Dokumenten und Ihrer Wissensdatenbank, sodass Antworten auf Ihrem Material basieren und nicht auf dem allgemeinen Training des Modells
  • Integration mit bestehenden Systemen: Einbindung der Plattform in die Tools, die Ihr Team bereits nutzt, statt ein eigenständiges Chatfenster zu liefern, das niemand öffnet
  • Schulung: Ihr Team auf den aktuellen Stand bringen, wie die Plattform genutzt und, wo relevant, betrieben wird

Empfohlene Modellkonfiguration

Die Gewichtsangaben unten sind FP8 — siehe den Quantisierungshinweis unter der Tabelle.

KlasseFormatGewichte (FP8)Positionierung
Klasse 32BDense~32GBPraktische Untergrenze für den Geschäftseinsatz
Klasse 70BDense~70GBStandard und empfohlen — eine Maschine, dimensioniert, um ein unternehmensweites ChatGPT-Äquivalent anzunähern
122B-A10BMoE (10B aktiv)~125GBFür höhere gleichzeitige Nutzung
Klasse 400BMoE (17B aktiv)~400GBObergrenze des Bereichs, den wir derzeit bereitstellen
35B-A3BMoE (3B aktiv)~35GBNur für Triage-/Guardrail-Funktion — nicht als Antwortmodell dimensioniert oder positioniert

Quantisierungsuntergrenze: FP8. Unsere Standardkonfigurationen gehen nicht unter FP8 (zum Beispiel 4-Bit-/INT4-Quantisierung). In unseren Tests verschlechtert eine weitere Quantisierung die Genauigkeit bei japanischsprachigen Geschäftsaufgaben messbar, daher liefern wir dies nicht als Standardempfehlung, unabhängig von den Kosteneinsparungen, die es auf dem Papier bieten könnte.


Investition

Die folgenden Preise sind in USD und spiegeln wider, was wir Kunden direkt anbieten — keine internen Kostenzahlen.

LeistungPreisAnmerkungen
30-tägiger PoC$6.000 ($3.000 für Teams mit 50 oder weniger Mitarbeitenden)Validiert die Machbarkeit für Ihre eigene Arbeitslast vor jeder Hardware-Verpflichtung. Wird bei Fortsetzung vollständig auf den vollständigen Aufbau angerechnet — siehe 30-Tage-PoC für private LLMs
Vollständiger Aufbau (einzelner Anwendungsfall)$8.000–$22.000, skalenabhängigUmgebungsaufbau, RAG, Integration mit bestehenden Systemen und Schulung (siehe oben)
Laufende Wartung & Betrieb$300–$1.300/MonatGestaffelt nach GPU-Anzahl
Managed Hosting$300–$1.600/MonatGestaffelt nach Leistungsaufnahme. Strom, Kühlung, USV, Konnektivität und Überwachung inklusive
Shared InfrastructureAb $300/Monat pro 24GB-VRAM-EinheitKein Hardwarekauf

Marktrealität bei der Ausrüstung

Die Preise für GPUs und Server-Arbeitsspeicher sind stark gestiegen, und nach aktuellen Marktsignalen wird erwartet, dass beide bis 2027 knapp bleiben — getrieben durch KI-bezogene Nachfrage und nicht durch einen vorübergehenden Engpass. Wir veröffentlichen auf dieser Seite keinen festen Ausrüstungspreis: Die Hardwarepreise bewegen sich derzeit schnell genug, dass eine heute veröffentlichte konkrete Zahl zum Zeitpunkt Ihrer Lektüre bereits veraltet wäre, und sie würde ohnehin je nach Region und Beschaffungskanal variieren.

Als groben Anhaltspunkt für die Größenordnung: Ein Ein- oder Wenig-GPU-Setup — ausreichend, um das oben beschriebene 32B-Untergrenzenmodell auszuführen — liegt in einer deutlich anderen Größenordnung als ein vollständiger 8-GPU-Aufbau, dimensioniert für den 70B-Klasse-Standard, der als vollständiger Aufbau im unteren sechsstelligen Bereich, in USD, liegt. Eine Multi-Node-Konfiguration, dimensioniert für die 400B-Klasse-Stufe, ist noch einmal ein deutlicher Schritt nach oben. Jede Stufe hebt die Ausrüstungsinvestition in eine deutlich höhere Kategorie an — das ist mit ein Grund, warum der 30-Tage-PoC existiert: um festzustellen, welche Stufe Ihre Arbeitslast tatsächlich benötigt, bevor eine davon bepreist wird.

Arbeitsspeicher ist der zweitgrößte Kostenpunkt nach den GPUs selbst — ein System, das um 768GB VRAM herum aufgebaut ist, benötigt typischerweise mehr als 1TB Systemspeicher zur Unterstützung, was mit ein Grund ist, warum sich die Speicherpreise fast so schnell bewegt haben wie die GPU-Preise. Für aktuelle Ausrüstungspreise für Ihre tatsächliche Beschaffungsregion und Konfiguration nehmen Sie Kontakt auf, statt sich auf eine möglicherweise bereits veraltete Zahl zu verlassen.


Was wir von Anfang an ehrlich sagen

Strom, Kühlung, USV, Notstromversorgung, Überwachung und Lärmschutz variieren enorm von Gebäude zu Gebäude, daher geben wir dafür in einem Angebot keine feste Zahl an — sie werden nach einem Vor-Ort-Besuch individuell bepreist.

Als allgemeiner Richtwert: Luftkühlung ist bis etwa 20kW pro Rack praktikabel; darüber hinaus werden in der Regel Flüssigkühlung oder bauliche Änderungen erforderlich. Selbst Änderungen, die auf dem Papier gering erscheinen — etwa die Erweiterung der Stromverteilungskapazität — haben an manchen Standorten zu realen, nicht unerheblichen Kosten geführt. Wir sagen Ihnen lieber, dass eine Position für Gebäudeinfrastruktur existiert und ein Vor-Ort-Besuch erforderlich ist, als Ihnen eine Zahl zu nennen, hinter der wir nicht stehen können.


Wohin Ihre Daten tatsächlich gehen

„Privat” beschreibt, wo die Inferenz läuft, nicht Ihre Netzwerkarchitektur. Bei einer selbst gehosteten oder verwalteten Bereitstellung werden der Prompt und die generierte Antwort auf Servern innerhalb Ihrer eigenen Infrastruktur verarbeitet — sie werden nicht an einen öffentlichen KI-Dienst für allgemeine Zwecke gesendet. Das ist eine Aussage darüber, wo die Berechnung stattfindet.

Es ist keine Aussage über Ihren Netzwerkperimeter. VPNs, Firewalls, Zugriffskontrolle und alles andere darüber, wie diese Infrastruktur auf Netzwerkebene abgesichert wird, ist eine separate Designentscheidung, zu der wir beraten können, die aber standardmäßig nicht in diesen Service eingebunden ist.


Eigentum an Modell, Daten und Tuning-Ergebnissen

Infrastrukturprojekte werfen die gleichen Eigentumsfragen auf wie Anwendungsprojekte, erweitert um das, was für eine LLM-Plattform spezifisch ist: nicht nur den umgebenden Code, sondern auch die feinabgestimmten Modellartefakte, den Retrieval-Index und die Evaluationsergebnisse.

  • Tuning- und RAG-Artefakte gehören Ihnen: Alle während eines Aufbaus erzeugten fein abgestimmten Gewichte, Prompt-/Retrieval-Konfigurationen und Evaluationsdatensätze werden als Liefergegenstände übergeben — nicht nur auf einer Infrastruktur belassen, die allein LLL kontrolliert, was sie zu einer Abhängigkeit statt zu einem Vermögenswert machen würde.
  • Kein Modell-Lock-in: Aufbauten sind um eine standardisierte, OpenAI-kompatible Inferenzschnittstelle (siehe unten) herum konzipiert, sodass das zugrunde liegende Modell ausgetauscht werden kann — ein anderes Open-Weight-Modell, ein anderer GPU-Anbieter, eine andere Hosting-Vereinbarung —, ohne Ihre Integrationsebene neu zu schreiben.
  • Kein Anbieter-Lock-in: Derselbe standardisierte Inferenz-Stack wird bei selbst gehosteten, verwalteten und gemeinsam genutzten Bereitstellungen verwendet. Ein späterer Wechsel von einer Bereitstellungsform zu einer anderen erfordert keine Neuarchitektur der Kommunikation Ihrer Anwendungen mit dem Modell.
  • Ihre Daten bleiben unter Ihrer Kontrolle: Dokumente und Prompts, die für Evaluation und RAG verwendet werden, bleiben durchgehend unter Ihrer Kontrolle — im Einklang mit dem Hinweis zur Datenlokalität oben.

Dies ist dasselbe Anti-Lock-in-Prinzip, das LLL bei jedem Engagement anwendet: modellagnostisches Design, ein standardisierter Inferenz-Stack und ein Aufbau, den Sie jederzeit zu einem anderen Anbieter migrieren können, statt einer, die davon abhängt, dass LLL weiterhin involviert bleibt, damit sie funktioniert.


Die richtige Bereitstellungsform wählen

FrageDeutet hin auf
Benötigen Sie die Hardware als Anlagevermögen, das Sie besitzen — aus Audit-, Sicherheits- oder Buchhaltungsgründen?Selbst gehostet
Möchten Sie die Fähigkeit, ohne die Gebäudeinfrastrukturarbeit zu übernehmen (Strom, Kühlung, USV, Überwachung)?Managed Hosting
Ist die Nutzung leicht, unvorhersehbar oder noch im Nachweisstadium?Shared Infrastructure
Ist die Nutzung schwer und anhaltend, und kann Ihre Einrichtung die Last bewältigen?Selbst gehostet gewinnt bei dieser Skala oft

Keine davon ist eine universelle Antwort — sie sind Ausgangspunkte. Die richtige Antwort für eine bestimmte Arbeitslast, zusammen mit der richtigen Modellgröße, ist das, was der 30-tägige PoC unten anhand Ihrer eigenen Zahlen bestimmen soll, nicht anhand einer Faustregel.


Erste Schritte

Ein sechsstelliges Ausrüstungsbudget oder einen mehrjährigen Managed- oder Shared-Vertrag einzugehen, bevor bekannt ist, ob ein privates LLM tatsächlich Ihre Genauigkeits- und Latenzanforderungen erfüllt, ist ein reales Risiko — eines, das ein Proof of Concept eigens dafür beseitigt.

Der 30-Tage-PoC für private LLMs läuft auf Infrastruktur, die LLL bereits betreibt, testet Genauigkeit und Latenz anhand Ihrer eigenen Dokumente und Arbeitslast (nicht eines generischen Benchmarks) und endet mit einem schriftlichen Bericht: welche Bereitstellungsform passt, welche Modellstufe passt und eine Kostenschätzung für den vollständigen Aufbau. Wenn Sie fortfahren, wird die PoC-Gebühr vollständig auf diesen Aufbau angerechnet.


Häufig gestellte Fragen

F: Müssen wir Hardware kaufen, um herauszufinden, ob dies für uns funktioniert? A: Nein. Der 30-tägige PoC läuft auf Infrastruktur, die LLL bereits intern aufbaut und betreibt. Der daraus resultierende Bericht sagt Ihnen, was Sie kaufen — oder mieten oder von uns hosten lassen — sollten, falls Sie sich für die Fortsetzung entscheiden.

F: Ist 70B immer die richtige Modellgröße? A: Es ist unser Standard- und empfohlener Ausgangspunkt, dimensioniert, um ein unternehmensweites ChatGPT-Äquivalent auf einer Maschine anzunähern. Arbeitslasten mit geringeren Genauigkeitsanforderungen können auf der 32B-Untergrenze laufen; Arbeitslasten mit hoher gleichzeitiger Nutzung benötigen möglicherweise die 122B-A10B- oder 400B-Klasse-MoE-Stufen. Der PoC-Bericht empfiehlt eine konkrete Stufe mit Begründung, nicht standardmäßig.

F: Können wir unter FP8 quantisieren, um bei der Hardware zu sparen? A: Sie können, aber wir empfehlen es nicht als Standard. Unsere Tests zeigen einen messbaren Genauigkeitsabfall bei japanischsprachigen Geschäftsaufgaben unterhalb von FP8, daher halten unsere Standardkonfigurationen diese Grenze ein, auch wenn dies die Hardwarerechnung senken würde.

F: Sind wir an LLL oder an ein bestimmtes Modell oder einen GPU-Anbieter gebunden, sobald dies aufgebaut ist? A: Nein, per Design. Die Inferenzebene ist eine standardisierte, OpenAI-kompatible Schnittstelle, sodass das Modell und die dahinterliegende Hosting-Vereinbarung geändert werden können, ohne Ihre Integration neu zu schreiben — siehe „Eigentum an Modell, Daten und Tuning-Ergebnissen” oben.

F: Was ist in den Preisen auf dieser Seite nicht enthalten? A: Standortspezifische Arbeiten — Strom, Kühlung, USV, Notstromversorgung, Überwachung und Lärmschutz —, die zu stark von Gebäude zu Gebäude variieren, um ohne einen Vor-Ort-Besuch bepreist zu werden. Siehe „Was wir von Anfang an ehrlich sagen” oben für die Referenzzahlen, die wir vor diesem Besuch mitteilen können.


Verwandte Ressourcen


Beginnen Sie das Gespräch

Bereit herauszufinden, ob eine private LLM-Plattform zu Ihrer Arbeitslast passt?

Beratungstermin vereinbaren


LLL Inc. - Private LLM-Infrastruktur aus Malaysia Selbst gehostet • Verwaltet • Gemeinsam genutzt — Kein Lock-in