LLL Inc. - Infrastruttura LLM Privata
Perché una Piattaforma LLM Privata
Gran parte dell’adozione dell’AI oggi passa attraverso un’API pubblica: un prompt lascia la tua rete, va ai server di un fornitore, e torna una risposta. Per molti lavori è il compromesso giusto. Smette di esserlo nel momento in cui il materiale inserito nel prompt è qualcosa che preferiresti tenere all’interno della tua infrastruttura — documenti interni, dati dei clienti, codice sorgente, qualsiasi cosa soggetta a un obbligo di riservatezza che non puoi consegnare a terzi.
Una piattaforma LLM privata è l’alternativa: un modello linguistico di grandi dimensioni in esecuzione su hardware che controlli, o che LLL gestisce per tuo conto, invece di un servizio pubblico condiviso.
LLL costruisce e gestisce infrastruttura LLM privata come parte del proprio ambiente interno — lo stesso ambiente che usiamo per mostrare la piattaforma a potenziali clienti prima che si impegnino in una costruzione propria. Questa è un’estensione di un’infrastruttura che già gestiamo, non una nuova area di attività che stiamo descrivendo per la prima volta sulla carta.
Tre Modi per Gestirla
Non esiste un’unica forma di distribuzione “corretta”. Ognuna delle tre ha un livello di utilizzo in cui è l’opzione più economica — nessuna vince a ogni scala.
| Forma | Cosa significa |
|---|---|
| Self-hosted (nella tua sede) | L’hardware GPU è installato nel tuo edificio. L’attrezzatura è un tuo bene capitale fin dal primo giorno. |
| Hosting Gestito | LLL ospita e gestisce l’hardware per tuo conto — alimentazione, raffreddamento, UPS, connettività e monitoraggio inclusi in una tariffa mensile. |
| Infrastruttura Condivisa | Nessun acquisto di hardware. Noleggi capacità GPU/VRAM, misurata per unità, su un’infrastruttura già gestita da LLL. |
Il self-hosted tende a essere il più economico con un utilizzo continuo, intenso e prevedibile, a condizione che il tuo edificio possa sostenere il carico elettrico e di raffreddamento (vedi “Realtà del Mercato delle Attrezzature”, sotto). L’hosting gestito rimuove l’onere delle strutture senza rimuovere la proprietà dell’hardware. L’infrastruttura condivisa rimuove entrambi, al costo di pagare una tariffa per unità invece di possedere la capacità sottostante. Quale delle tre sia effettivamente conveniente per un determinato carico di lavoro è esattamente la domanda a cui un PoC di 30 giorni è progettato per rispondere — non qualcosa che raccomandiamo di default prima di vedere i tuoi numeri.
Cosa È Incluso in una Costruzione Completa
Una costruzione completa per un singolo caso d’uso è strutturata attorno a quattro elementi:
- Costruzione dell’ambiente: provisioning e configurazione dello stack di inferenza sulla forma di distribuzione scelta
- RAG (Retrieval-Augmented Generation): collegamento del modello ai tuoi documenti e alla tua base di conoscenza, in modo che le risposte si basino sul tuo materiale piuttosto che sull’addestramento generale del modello
- Integrazione con i sistemi esistenti: collegamento della piattaforma agli strumenti già usati dal tuo team, invece di consegnare una finestra di chat autonoma che nessuno apre
- Formazione: portare il tuo team al passo su come usare, e dove rilevante gestire, la piattaforma
Configurazione del Modello Raccomandata
I valori di peso qui sotto sono in FP8 — vedi la nota sulla quantizzazione sotto la tabella.
| Classe | Formato | Pesi (FP8) | Posizionamento |
|---|---|---|---|
| Classe 32B | Dense | ~32GB | Soglia pratica minima per l’uso aziendale |
| Classe 70B | Dense | ~70GB | Predefinita e raccomandata — una macchina, dimensionata per approssimare un equivalente ChatGPT a livello aziendale |
| 122B-A10B | MoE (10B attivi) | ~125GB | Per un utilizzo simultaneo più elevato |
| Classe 400B | MoE (17B attivi) | ~400GB | Vertice della gamma che distribuiamo attualmente |
| 35B-A3B | MoE (3B attivi) | ~35GB | Solo ruolo di triage/guardrail — non dimensionato né posizionato come modello di risposta |
Soglia minima di quantizzazione: FP8. Le nostre configurazioni standard non scendono sotto FP8 (ad esempio, quantizzazione 4-bit/INT4). Nei nostri test, quantizzare ulteriormente degrada in modo misurabile la precisione sui task aziendali in lingua giapponese, quindi non è qualcosa che forniamo come raccomandazione predefinita, indipendentemente dai risparmi sui costi che potrebbe offrire sulla carta.
Investimento
I prezzi qui sotto sono in USD e riflettono ciò che quotiamo direttamente ai clienti — non cifre di costo interno.
| Incarico | Prezzo | Note |
|---|---|---|
| PoC di 30 giorni | $6.000 ($3.000 per team di 50 persone o meno) | Convalida la fattibilità rispetto al tuo carico di lavoro prima di qualsiasi impegno hardware. Interamente accreditato sulla costruzione completa se continui — vedi PoC LLM Privato di 30 Giorni |
| Costruzione completa (caso d’uso singolo) | $8.000–$22.000, in base alla scala | Costruzione dell’ambiente, RAG, integrazione con i sistemi esistenti e formazione (vedi sopra) |
| Manutenzione e gestione continue | $300–$1.300/mese | A livelli in base al numero di GPU |
| Hosting gestito | $300–$1.600/mese | A livelli in base al consumo energetico. Alimentazione, raffreddamento, UPS, connettività e monitoraggio inclusi |
| Infrastruttura condivisa | A partire da $300/mese per unità di VRAM da 24GB | Nessun acquisto di hardware |
Realtà del Mercato delle Attrezzature
I prezzi di GPU e memoria server sono saliti bruscamente, e secondo i segnali di mercato attuali entrambi dovrebbero restare tesi fino al 2027 — spinti dalla domanda legata all’AI e non da una carenza temporanea. Non pubblichiamo un prezzo fisso dell’attrezzatura in questa pagina: i prezzi dell’hardware si muovono attualmente abbastanza velocemente che una cifra specifica pubblicata oggi sarebbe già datata nel momento in cui la leggi, e comunque varierebbe per regione e canale di approvvigionamento.
Come indicazione approssimativa di scala: una configurazione a una o poche GPU — sufficiente per eseguire il modello soglia 32B descritto sopra — si colloca a un ordine di grandezza nettamente diverso rispetto a una costruzione completa a 8 GPU dimensionata per il predefinito classe 70B, che si colloca nella fascia bassa delle sei cifre, in USD, come costruzione completa. Una configurazione multi-nodo dimensionata per il livello classe 400B è un ulteriore salto verso l’alto. Ogni livello sposta l’investimento in attrezzatura in una fascia sensibilmente più alta — questo è in parte il motivo per cui esiste il PoC di 30 Giorni: stabilire di quale livello il tuo carico di lavoro ha effettivamente bisogno prima di quotarne uno qualsiasi.
La memoria è la seconda voce di costo più grande dopo le GPU stesse — un sistema costruito attorno a 768GB di VRAM richiede tipicamente più di 1TB di memoria di sistema per supportarlo, il che è in parte il motivo per cui il prezzo della memoria si è mosso quasi altrettanto velocemente di quello delle GPU. Per prezzi attuali dell’attrezzatura relativi alla tua regione e configurazione reali di approvvigionamento, contattaci invece di affidarti a una cifra che potrebbe già essere superata.
Ciò di Cui Siamo Onesti Fin dall’Inizio
Alimentazione, raffreddamento, UPS, alimentazione di backup, monitoraggio e controllo del rumore variano enormemente da un edificio all’altro, quindi non li quotiamo come cifra fissa in una proposta — vengono quotati individualmente dopo un sopralluogo.
Come punto di riferimento generale: il raffreddamento ad aria è praticabile fino a circa 20kW per rack; oltre questo, il raffreddamento a liquido o modifiche alle strutture diventano generalmente necessari. Persino cambiamenti che sembrano minori sulla carta — aggiungere capacità di distribuzione elettrica, ad esempio — hanno comportato costi reali e non trascurabili in alcuni siti. Preferiamo dirti che esiste una voce di budget per le strutture e che serve un sopralluogo, piuttosto che darti una cifra che non potremmo sostenere.
Dove Vanno Realmente i Tuoi Dati
“Privato” descrive dove viene eseguita l’inferenza, non l’architettura della tua rete. Con una distribuzione self-hosted o gestita, il prompt e la risposta generata vengono elaborati su server all’interno della tua infrastruttura — non vengono inviati a un servizio AI pubblico generico. Questa è un’affermazione su dove avviene il calcolo.
Non è un’affermazione sul perimetro della tua rete. VPN, firewall, controllo degli accessi, e tutto il resto su come quell’infrastruttura viene messa in sicurezza a livello di rete è una decisione di progettazione separata, su cui possiamo consigliarti ma che non è inclusa di default in questo servizio.
Proprietà di Modello, Dati e Risultati del Tuning
I progetti di infrastruttura sollevano le stesse questioni di proprietà dei progetti applicativi, estese a ciò che è specifico di una piattaforma LLM: non solo il codice circostante, ma gli artefatti del modello ottimizzato, l’indice di retrieval e i risultati di valutazione.
- Gli artefatti di tuning e RAG sono tuoi: qualsiasi peso affinato, configurazione di prompt/retrieval e dataset di valutazione prodotti durante una costruzione vengono consegnati come deliverable — non trattenuti solo su un’infrastruttura controllata esclusivamente da LLL, il che li renderebbe una dipendenza invece che un asset.
- Nessun lock-in di modello: le costruzioni sono progettate attorno a un’interfaccia di inferenza standard, compatibile con OpenAI (vedi sotto), quindi il modello sottostante può essere sostituito — un diverso modello a pesi aperti, un diverso fornitore di GPU, un diverso accordo di hosting — senza riscrivere il tuo livello di integrazione.
- Nessun lock-in di fornitore: lo stesso stack di inferenza standard viene usato nelle distribuzioni self-hosted, gestite e condivise. Passare in seguito da una forma di distribuzione a un’altra non richiede di riprogettare come le tue applicazioni comunicano con il modello.
- I tuoi dati restano sotto il tuo controllo: documenti e prompt usati per la valutazione e il RAG restano sotto il tuo controllo in ogni momento — coerentemente con la nota sulla localizzazione dei dati sopra.
Questo è lo stesso principio anti-lock-in che LLL applica in ogni incarico: design agnostico rispetto al modello, uno stack di inferenza standard, e una costruzione che puoi spostare verso un altro fornitore se un giorno lo scegli, non una che dipende dal coinvolgimento continuo di LLL per continuare a funzionare.
Scegliere la Forma di Distribuzione Giusta
| Domanda | Indica verso |
|---|---|
| Hai bisogno che l’hardware sia un bene capitale che possiedi — per motivi di audit, policy di sicurezza o contabilità? | Self-hosted |
| Vuoi la capacità senza assumerti il lavoro sulle strutture (alimentazione, raffreddamento, UPS, monitoraggio)? | Hosting gestito |
| L’utilizzo è leggero, imprevedibile, o ancora da dimostrare? | Infrastruttura condivisa |
| L’utilizzo è intenso e continuo, e la tua struttura può sostenere quel carico? | Il self-hosted spesso vince a quella scala |
Nessuna di queste è una risposta universale — sono punti di partenza. La risposta giusta per un carico di lavoro specifico, insieme alla dimensione di modello giusta, è ciò che il PoC di 30 giorni qui sotto è progettato per determinare con i tuoi numeri, non con una regola empirica.
Come Iniziare
Impegnarsi in un budget per attrezzature a sei cifre, o un contratto gestito o condiviso pluriennale, prima di sapere se un LLM privato soddisfa effettivamente la tua soglia di precisione e latenza, è un rischio reale — un rischio che una proof of concept esiste specificamente per eliminare.
Il PoC LLM Privato di 30 Giorni viene eseguito su un’infrastruttura già gestita da LLL, testa precisione e latenza rispetto ai tuoi documenti e carico di lavoro (non un benchmark generico), e si conclude con un report scritto: quale forma di distribuzione si adatta, quale livello di modello si adatta, e una stima dei costi per la costruzione completa. Se continui, la tariffa del PoC viene interamente accreditata su quella costruzione.
Domande Frequenti
D: Dobbiamo acquistare hardware per sapere se questo funziona per noi? R: No. Il PoC di 30 giorni viene eseguito su un’infrastruttura già costruita e gestita da LLL internamente. Il report risultante ti dice cosa acquistare — o noleggiare, o farci gestire in hosting — se decidi di continuare.
D: 70B è sempre la dimensione di modello giusta? R: È il nostro punto di partenza predefinito e raccomandato, dimensionato per approssimare un equivalente ChatGPT a livello aziendale su una macchina. Carichi di lavoro con requisiti di precisione inferiori possono funzionare sulla soglia 32B; carichi di lavoro con uso simultaneo intenso potrebbero richiedere i livelli MoE 122B-A10B o classe 400B. Il report del PoC raccomanda un livello specifico con motivazione, non un default.
D: Possiamo quantizzare sotto FP8 per risparmiare sull’hardware? R: Puoi, ma non lo raccomandiamo come default. I nostri test mostrano un calo misurabile di precisione sui task aziendali in lingua giapponese sotto FP8, quindi le nostre configurazioni standard mantengono quel limite anche quando abbasserebbe la fattura hardware.
D: Siamo vincolati a LLL, o a un modello o fornitore di GPU specifico, una volta costruito questo? R: No, per progettazione. Il livello di inferenza è un’interfaccia standard compatibile con OpenAI, quindi il modello e l’accordo di hosting sottostante possono cambiare senza riscrivere la tua integrazione — vedi Proprietà di Modello, Dati e Risultati del Tuning, sopra.
D: Cosa non è incluso nei prezzi di questa pagina? R: Il lavoro specifico del sito — alimentazione, raffreddamento, UPS, backup, monitoraggio e controllo del rumore — che varia troppo da edificio a edificio per essere quotato senza un sopralluogo. Vedi “Ciò di Cui Siamo Onesti Fin dall’Inizio”, sopra, per le cifre di riferimento che possiamo condividere prima di quel sopralluogo.
Risorse Correlate
- PoC LLM Privato di 30 Giorni — il modo a prezzo fisso per iniziare
- Servizi di Sviluppo Basato su IA — lavoro AI a livello applicativo che può appoggiarsi a questa infrastruttura
- AI Integration — aggiungere una funzionalità AI a un prodotto esistente
Avvia la Conversazione
Pronto a scoprire se una piattaforma LLM privata si adatta al tuo carico di lavoro?
LLL Inc. - Infrastruttura LLM Privata dalla Malesia Self-Hosted • Gestita • Condivisa — Nessun Lock-In