LLL Inc. - Private LLM-Infrastruktur
Warum eine private LLM-Plattform
Der Großteil der heutigen KI-Nutzung läuft über eine öffentliche API: Ein Prompt verlässt Ihr Netzwerk, geht an die Server eines Anbieters, und eine Antwort kommt zurück. Das ist für viele Aufgaben der richtige Kompromiss. Er hört auf, der richtige Kompromiss zu sein, sobald das Material im Prompt etwas ist, das Sie lieber innerhalb Ihrer eigenen Infrastruktur behalten würden — interne Dokumente, Kundendaten, Quellcode, alles, was einer Vertraulichkeitspflicht unterliegt, die Sie nicht an Dritte weitergeben können.
Eine private LLM-Plattform ist die Alternative: ein großes Sprachmodell, das auf Hardware läuft, die Sie kontrollieren, oder die LLL in Ihrem Auftrag betreibt, anstatt auf einem gemeinsam genutzten öffentlichen Dienst.
LLL baut und betreibt private LLM-Infrastruktur als Teil unserer eigenen internen Umgebung — derselben Umgebung, die wir nutzen, um potenziellen Kunden die Plattform vorzuführen, bevor sie sich für einen eigenen Aufbau entscheiden. Dies ist eine Erweiterung einer Infrastruktur, die wir bereits betreiben, kein neuer Tätigkeitsbereich, den wir zum ersten Mal auf dem Papier beschreiben.
Drei Wege, sie zu betreiben
Es gibt nicht die eine „richtige” Bereitstellungsform. Jede der drei hat ein Nutzungsniveau, bei dem sie die günstigste Option ist — keine gewinnt auf jeder Skala.
| Form | Bedeutung |
|---|---|
| Selbst gehostet (in Ihren eigenen Räumlichkeiten) | GPU-Hardware wird in Ihrem eigenen Gebäude installiert. Die Ausrüstung ist ab dem ersten Tag Ihr Anlagevermögen. |
| Managed Hosting | LLL beherbergt und betreibt die Hardware in Ihrem Auftrag — Strom, Kühlung, USV, Konnektivität und Überwachung sind in einer monatlichen Gebühr enthalten. |
| Shared Infrastructure | Kein Hardwarekauf. Sie mieten GPU-/VRAM-Kapazität, abgerechnet pro Einheit, auf Infrastruktur, die LLL bereits betreibt. |
Selbst gehostete Lösungen sind tendenziell bei anhaltender, hoher, vorhersehbarer Nutzung am günstigsten, vorausgesetzt, Ihr Gebäude kann die elektrische Last und die Kühllast bewältigen (siehe „Marktrealität bei der Ausrüstung” weiter unten). Managed Hosting beseitigt die Belastung durch die Gebäudeinfrastruktur, ohne das Eigentum an der Hardware aufzugeben. Shared Infrastructure beseitigt beides, auf Kosten eines Preises pro Einheit statt des Eigentums an der zugrunde liegenden Kapazität. Welche der drei Optionen für eine bestimmte Arbeitslast tatsächlich wirtschaftlich sinnvoll ist, ist genau die Frage, die ein 30-tägiger PoC beantworten soll — nicht etwas, das wir standardmäßig empfehlen, bevor wir Ihre Zahlen gesehen haben.
Was in einem vollständigen Aufbau enthalten ist
Ein vollständiger Aufbau für einen einzelnen Anwendungsfall ist um vier Elemente herum konzipiert:
- Umgebungsaufbau: Bereitstellung und Konfiguration des Inferenz-Stacks in der gewählten Bereitstellungsform
- RAG (Retrieval-Augmented Generation): Verbindung des Modells mit Ihren eigenen Dokumenten und Ihrer Wissensdatenbank, sodass Antworten auf Ihrem Material basieren und nicht auf dem allgemeinen Training des Modells
- Integration mit bestehenden Systemen: Einbindung der Plattform in die Tools, die Ihr Team bereits nutzt, statt ein eigenständiges Chatfenster zu liefern, das niemand öffnet
- Schulung: Ihr Team auf den aktuellen Stand bringen, wie die Plattform genutzt und, wo relevant, betrieben wird
Empfohlene Modellkonfiguration
Die Gewichtsangaben unten sind FP8 — siehe den Quantisierungshinweis unter der Tabelle.
| Klasse | Format | Gewichte (FP8) | Positionierung |
|---|---|---|---|
| Klasse 32B | Dense | ~32GB | Praktische Untergrenze für den Geschäftseinsatz |
| Klasse 70B | Dense | ~70GB | Standard und empfohlen — eine Maschine, dimensioniert, um ein unternehmensweites ChatGPT-Äquivalent anzunähern |
| 122B-A10B | MoE (10B aktiv) | ~125GB | Für höhere gleichzeitige Nutzung |
| Klasse 400B | MoE (17B aktiv) | ~400GB | Obergrenze des Bereichs, den wir derzeit bereitstellen |
| 35B-A3B | MoE (3B aktiv) | ~35GB | Nur für Triage-/Guardrail-Funktion — nicht als Antwortmodell dimensioniert oder positioniert |
Quantisierungsuntergrenze: FP8. Unsere Standardkonfigurationen gehen nicht unter FP8 (zum Beispiel 4-Bit-/INT4-Quantisierung). In unseren Tests verschlechtert eine weitere Quantisierung die Genauigkeit bei japanischsprachigen Geschäftsaufgaben messbar, daher liefern wir dies nicht als Standardempfehlung, unabhängig von den Kosteneinsparungen, die es auf dem Papier bieten könnte.
Investition
Die folgenden Preise sind in USD und spiegeln wider, was wir Kunden direkt anbieten — keine internen Kostenzahlen.
| Leistung | Preis | Anmerkungen |
|---|---|---|
| 30-tägiger PoC | $6.000 ($3.000 für Teams mit 50 oder weniger Mitarbeitenden) | Validiert die Machbarkeit für Ihre eigene Arbeitslast vor jeder Hardware-Verpflichtung. Wird bei Fortsetzung vollständig auf den vollständigen Aufbau angerechnet — siehe 30-Tage-PoC für private LLMs |
| Vollständiger Aufbau (einzelner Anwendungsfall) | $8.000–$22.000, skalenabhängig | Umgebungsaufbau, RAG, Integration mit bestehenden Systemen und Schulung (siehe oben) |
| Laufende Wartung & Betrieb | $300–$1.300/Monat | Gestaffelt nach GPU-Anzahl |
| Managed Hosting | $300–$1.600/Monat | Gestaffelt nach Leistungsaufnahme. Strom, Kühlung, USV, Konnektivität und Überwachung inklusive |
| Shared Infrastructure | Ab $300/Monat pro 24GB-VRAM-Einheit | Kein Hardwarekauf |
Marktrealität bei der Ausrüstung
Die Preise für GPUs und Server-Arbeitsspeicher sind stark gestiegen, und nach aktuellen Marktsignalen wird erwartet, dass beide bis 2027 knapp bleiben — getrieben durch KI-bezogene Nachfrage und nicht durch einen vorübergehenden Engpass. Wir veröffentlichen auf dieser Seite keinen festen Ausrüstungspreis: Die Hardwarepreise bewegen sich derzeit schnell genug, dass eine heute veröffentlichte konkrete Zahl zum Zeitpunkt Ihrer Lektüre bereits veraltet wäre, und sie würde ohnehin je nach Region und Beschaffungskanal variieren.
Als groben Anhaltspunkt für die Größenordnung: Ein Ein- oder Wenig-GPU-Setup — ausreichend, um das oben beschriebene 32B-Untergrenzenmodell auszuführen — liegt in einer deutlich anderen Größenordnung als ein vollständiger 8-GPU-Aufbau, dimensioniert für den 70B-Klasse-Standard, der als vollständiger Aufbau im unteren sechsstelligen Bereich, in USD, liegt. Eine Multi-Node-Konfiguration, dimensioniert für die 400B-Klasse-Stufe, ist noch einmal ein deutlicher Schritt nach oben. Jede Stufe hebt die Ausrüstungsinvestition in eine deutlich höhere Kategorie an — das ist mit ein Grund, warum der 30-Tage-PoC existiert: um festzustellen, welche Stufe Ihre Arbeitslast tatsächlich benötigt, bevor eine davon bepreist wird.
Arbeitsspeicher ist der zweitgrößte Kostenpunkt nach den GPUs selbst — ein System, das um 768GB VRAM herum aufgebaut ist, benötigt typischerweise mehr als 1TB Systemspeicher zur Unterstützung, was mit ein Grund ist, warum sich die Speicherpreise fast so schnell bewegt haben wie die GPU-Preise. Für aktuelle Ausrüstungspreise für Ihre tatsächliche Beschaffungsregion und Konfiguration nehmen Sie Kontakt auf, statt sich auf eine möglicherweise bereits veraltete Zahl zu verlassen.
Was wir von Anfang an ehrlich sagen
Strom, Kühlung, USV, Notstromversorgung, Überwachung und Lärmschutz variieren enorm von Gebäude zu Gebäude, daher geben wir dafür in einem Angebot keine feste Zahl an — sie werden nach einem Vor-Ort-Besuch individuell bepreist.
Als allgemeiner Richtwert: Luftkühlung ist bis etwa 20kW pro Rack praktikabel; darüber hinaus werden in der Regel Flüssigkühlung oder bauliche Änderungen erforderlich. Selbst Änderungen, die auf dem Papier gering erscheinen — etwa die Erweiterung der Stromverteilungskapazität — haben an manchen Standorten zu realen, nicht unerheblichen Kosten geführt. Wir sagen Ihnen lieber, dass eine Position für Gebäudeinfrastruktur existiert und ein Vor-Ort-Besuch erforderlich ist, als Ihnen eine Zahl zu nennen, hinter der wir nicht stehen können.
Wohin Ihre Daten tatsächlich gehen
„Privat” beschreibt, wo die Inferenz läuft, nicht Ihre Netzwerkarchitektur. Bei einer selbst gehosteten oder verwalteten Bereitstellung werden der Prompt und die generierte Antwort auf Servern innerhalb Ihrer eigenen Infrastruktur verarbeitet — sie werden nicht an einen öffentlichen KI-Dienst für allgemeine Zwecke gesendet. Das ist eine Aussage darüber, wo die Berechnung stattfindet.
Es ist keine Aussage über Ihren Netzwerkperimeter. VPNs, Firewalls, Zugriffskontrolle und alles andere darüber, wie diese Infrastruktur auf Netzwerkebene abgesichert wird, ist eine separate Designentscheidung, zu der wir beraten können, die aber standardmäßig nicht in diesen Service eingebunden ist.
Eigentum an Modell, Daten und Tuning-Ergebnissen
Infrastrukturprojekte werfen die gleichen Eigentumsfragen auf wie Anwendungsprojekte, erweitert um das, was für eine LLM-Plattform spezifisch ist: nicht nur den umgebenden Code, sondern auch die feinabgestimmten Modellartefakte, den Retrieval-Index und die Evaluationsergebnisse.
- Tuning- und RAG-Artefakte gehören Ihnen: Alle während eines Aufbaus erzeugten fein abgestimmten Gewichte, Prompt-/Retrieval-Konfigurationen und Evaluationsdatensätze werden als Liefergegenstände übergeben — nicht nur auf einer Infrastruktur belassen, die allein LLL kontrolliert, was sie zu einer Abhängigkeit statt zu einem Vermögenswert machen würde.
- Kein Modell-Lock-in: Aufbauten sind um eine standardisierte, OpenAI-kompatible Inferenzschnittstelle (siehe unten) herum konzipiert, sodass das zugrunde liegende Modell ausgetauscht werden kann — ein anderes Open-Weight-Modell, ein anderer GPU-Anbieter, eine andere Hosting-Vereinbarung —, ohne Ihre Integrationsebene neu zu schreiben.
- Kein Anbieter-Lock-in: Derselbe standardisierte Inferenz-Stack wird bei selbst gehosteten, verwalteten und gemeinsam genutzten Bereitstellungen verwendet. Ein späterer Wechsel von einer Bereitstellungsform zu einer anderen erfordert keine Neuarchitektur der Kommunikation Ihrer Anwendungen mit dem Modell.
- Ihre Daten bleiben unter Ihrer Kontrolle: Dokumente und Prompts, die für Evaluation und RAG verwendet werden, bleiben durchgehend unter Ihrer Kontrolle — im Einklang mit dem Hinweis zur Datenlokalität oben.
Dies ist dasselbe Anti-Lock-in-Prinzip, das LLL bei jedem Engagement anwendet: modellagnostisches Design, ein standardisierter Inferenz-Stack und ein Aufbau, den Sie jederzeit zu einem anderen Anbieter migrieren können, statt einer, die davon abhängt, dass LLL weiterhin involviert bleibt, damit sie funktioniert.
Die richtige Bereitstellungsform wählen
| Frage | Deutet hin auf |
|---|---|
| Benötigen Sie die Hardware als Anlagevermögen, das Sie besitzen — aus Audit-, Sicherheits- oder Buchhaltungsgründen? | Selbst gehostet |
| Möchten Sie die Fähigkeit, ohne die Gebäudeinfrastrukturarbeit zu übernehmen (Strom, Kühlung, USV, Überwachung)? | Managed Hosting |
| Ist die Nutzung leicht, unvorhersehbar oder noch im Nachweisstadium? | Shared Infrastructure |
| Ist die Nutzung schwer und anhaltend, und kann Ihre Einrichtung die Last bewältigen? | Selbst gehostet gewinnt bei dieser Skala oft |
Keine davon ist eine universelle Antwort — sie sind Ausgangspunkte. Die richtige Antwort für eine bestimmte Arbeitslast, zusammen mit der richtigen Modellgröße, ist das, was der 30-tägige PoC unten anhand Ihrer eigenen Zahlen bestimmen soll, nicht anhand einer Faustregel.
Erste Schritte
Ein sechsstelliges Ausrüstungsbudget oder einen mehrjährigen Managed- oder Shared-Vertrag einzugehen, bevor bekannt ist, ob ein privates LLM tatsächlich Ihre Genauigkeits- und Latenzanforderungen erfüllt, ist ein reales Risiko — eines, das ein Proof of Concept eigens dafür beseitigt.
Der 30-Tage-PoC für private LLMs läuft auf Infrastruktur, die LLL bereits betreibt, testet Genauigkeit und Latenz anhand Ihrer eigenen Dokumente und Arbeitslast (nicht eines generischen Benchmarks) und endet mit einem schriftlichen Bericht: welche Bereitstellungsform passt, welche Modellstufe passt und eine Kostenschätzung für den vollständigen Aufbau. Wenn Sie fortfahren, wird die PoC-Gebühr vollständig auf diesen Aufbau angerechnet.
Häufig gestellte Fragen
F: Müssen wir Hardware kaufen, um herauszufinden, ob dies für uns funktioniert? A: Nein. Der 30-tägige PoC läuft auf Infrastruktur, die LLL bereits intern aufbaut und betreibt. Der daraus resultierende Bericht sagt Ihnen, was Sie kaufen — oder mieten oder von uns hosten lassen — sollten, falls Sie sich für die Fortsetzung entscheiden.
F: Ist 70B immer die richtige Modellgröße? A: Es ist unser Standard- und empfohlener Ausgangspunkt, dimensioniert, um ein unternehmensweites ChatGPT-Äquivalent auf einer Maschine anzunähern. Arbeitslasten mit geringeren Genauigkeitsanforderungen können auf der 32B-Untergrenze laufen; Arbeitslasten mit hoher gleichzeitiger Nutzung benötigen möglicherweise die 122B-A10B- oder 400B-Klasse-MoE-Stufen. Der PoC-Bericht empfiehlt eine konkrete Stufe mit Begründung, nicht standardmäßig.
F: Können wir unter FP8 quantisieren, um bei der Hardware zu sparen? A: Sie können, aber wir empfehlen es nicht als Standard. Unsere Tests zeigen einen messbaren Genauigkeitsabfall bei japanischsprachigen Geschäftsaufgaben unterhalb von FP8, daher halten unsere Standardkonfigurationen diese Grenze ein, auch wenn dies die Hardwarerechnung senken würde.
F: Sind wir an LLL oder an ein bestimmtes Modell oder einen GPU-Anbieter gebunden, sobald dies aufgebaut ist? A: Nein, per Design. Die Inferenzebene ist eine standardisierte, OpenAI-kompatible Schnittstelle, sodass das Modell und die dahinterliegende Hosting-Vereinbarung geändert werden können, ohne Ihre Integration neu zu schreiben — siehe „Eigentum an Modell, Daten und Tuning-Ergebnissen” oben.
F: Was ist in den Preisen auf dieser Seite nicht enthalten? A: Standortspezifische Arbeiten — Strom, Kühlung, USV, Notstromversorgung, Überwachung und Lärmschutz —, die zu stark von Gebäude zu Gebäude variieren, um ohne einen Vor-Ort-Besuch bepreist zu werden. Siehe „Was wir von Anfang an ehrlich sagen” oben für die Referenzzahlen, die wir vor diesem Besuch mitteilen können.
Verwandte Ressourcen
- 30-Tage-PoC für private LLMs — der Weg zum Festpreis-Einstieg
- KI-gestützte Entwicklungsdienste — KI-Arbeit auf Anwendungsebene, die auf dieser Infrastruktur aufsetzen kann
- KI-Integration — Hinzufügen einer KI-Funktion zu einem bestehenden Produkt
Beginnen Sie das Gespräch
Bereit herauszufinden, ob eine private LLM-Plattform zu Ihrer Arbeitslast passt?
LLL Inc. - Private LLM-Infrastruktur aus Malaysia Selbst gehostet • Verwaltet • Gemeinsam genutzt — Kein Lock-in