Vai al contenuto
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

PoC LLM Privato · 30 giorni, prezzo fisso

Dimostra che un LLM privato funziona sui tuoi dati, in 30 giorni — prima di impegnarti sull'hardware.

Precisione e latenza misurate sui tuoi documenti e sul tuo carico di lavoro, non su un benchmark generico. Ottieni una raccomandazione scritta su forma di distribuzione, dimensione del modello e costo della costruzione completa — prima di spendere per un server GPU.

Avvia un PoC LLM Privato Prima una chiamata iniziale gratuita · NDA prima di qualsiasi scambio di dati · Risposta entro 1 giorno lavorativo

Situazioni comuni

«Vogliamo un LLM privato. Non vogliamo spendere per un server GPU solo per scoprire se funziona davvero.»

Un PoC LLM Privato è pensato per il momento prima di impegnarsi su hardware o un contratto di hosting — quando la domanda aperta è ancora "questo soddisfa la nostra soglia di precisione", e vuoi una risposta sui tuoi dati, non la demo di un fornitore.

Situazione 01

Una costruzione completa a 8 GPU arriva a sei cifre, in USD. È un impegno notevole prima ancora che qualcuno abbia misurato la precisione sui tuoi documenti.

Vedi la realtà del mercato delle attrezzature sulla pagina di servizio dell'infrastruttura — questo PoC esiste per evitarti di spendere quella cifra per primo.
Situazione 02

L'IT ha già provato a fare self-hosting di un modello aperto. O non ha raggiunto la precisione a cui le persone sono abituate, o ha richiesto più VRAM del previsto.

Dimensione del modello e quantizzazione sono esattamente ciò che il PoC testa sul tuo carico di lavoro reale.
Situazione 03

Self-hosted, gestito, o condiviso — tre modi per gestire questo, e nessuno internamente sa dire con sicurezza quale sia il più economico per il tuo pattern di utilizzo.

Nessuna delle tre vince a ogni scala. Il report del PoC indica quale, per te.

Before → After

Cosa cambia in 30 giorni.

Il deliverable è una decisione su cui puoi agire, non una presentazione su cosa un LLM privato potrebbe teoricamente fare.

Giorno 0 · Prima
  • Nessun hardware, e nessun numero di precisione misurato sui tuoi documenti.
  • Tre forme di distribuzione solo sulla carta — self-hosted, gestita, condivisa — senza base per sceglierne una.
  • Un mercato GPU che si muove abbastanza velocemente da rendere il preventivo dello scorso trimestre già superato.
  • Nessuna stima di quanto costerebbe davvero una costruzione completa per il tuo caso d'uso specifico.
Giorno 30 · Dopo
  • Un report scritto: fattibile, condizionatamente fattibile, o non fattibile — specifico per il tuo carico di lavoro.
  • Precisione e latenza misurate sui tuoi documenti e sulle tue domande.
  • Un livello di modello e una forma di distribuzione raccomandati, con la motivazione di ciascuno.
  • Una stima dei costi per la costruzione completa, e la tariffa del PoC accreditata su di essa se continui.

Perché questo PoC, prima di un preventivo hardware

Il punto è una decisione difendibile, non una demo.

Un PoC LLM privato è pensato per rispondere onestamente a una domanda: questo soddisfa la tua soglia di precisione e latenza, sul tuo materiale, a un costo che ha senso per il tuo utilizzo.

01 · Nessun hardware richiesto

Testato su un'infrastruttura che già gestiamo

Il PoC gira sull'ambiente interno proprio di LLL. Non ti viene chiesto di allestire un server GPU per sapere se la risposta è sì.

02 · I tuoi dati, non un benchmark

Precisione misurata sui tuoi documenti

Il set di valutazione è costruito a partire dal tuo materiale e dalle tue domande — non un benchmark pubblico generico che potrebbe non riflettere il tuo dominio o il tuo uso della lingua.

03 · Una raccomandazione, non una vendita

Forma di distribuzione e dimensione del modello, con motivazione

Il report indica un livello di modello e una forma di distribuzione specifici e ne spiega il motivo — incluso dirlo se un LLM privato non è la scelta giusta per ciò che hai testato.

Come funziona · 4 fasi settimanali

Trenta giorni dal kickoff alla raccomandazione scritta.

NDA e DPA vengono firmati prima che uno qualsiasi dei tuoi documenti o dati venga usato nella valutazione.

Settimana 1

Kickoff & definizione del carico di lavoro

Definizione del caso d'uso, dei documenti e delle domande su cui verrà testato il modello, e cosa significa "fattibile" per i tuoi requisiti di precisione e latenza — per iscritto, prima dell'inizio dei test.

PM + ingegnere + cliente · 60 minuti

Settimana 2

Preselezione di modello & forma di distribuzione

In base al carico di lavoro definito, preselezione di un livello di modello (partendo dal predefinito classe 70B) e provisioning sul nostro ambiente operativo per i test.

Nessun acquisto di hardware in questa fase

Settimana 3

Costruzione & test

Collegamento del modello preselezionato al tuo materiale (RAG dove rilevante) ed esecuzione di test di precisione sul tuo set di valutazione, oltre a latenza e throughput sotto un carico rappresentativo.

Risultati misurati, non stimati

Settimana 4

Report & raccomandazione

Report di validazione scritto: fattibile, condizionatamente fattibile, o non fattibile. Livello di modello e forma di distribuzione raccomandati, più una stima dei costi per la costruzione completa.

Tariffa accreditata sulla costruzione completa se continui

Cosa elimina davvero il PoC

L'impegno che non stai ancora prendendo.

Queste sono le tre cose che un PoC LLM privato è progettato per eliminare prima che tu firmi qualcosa di più grande.

0Hardware acquistato per il PoC

I test girano su un'infrastruttura già gestita da LLL. Ti impegni sull'hardware solo dopo che il report ti ha detto quale forma e dimensione si adattano davvero.

FP8Soglia minima di quantizzazione, testata così com'è

La stessa soglia che usiamo in ogni costruzione raccomandata — i nostri test mostrano un calo misurabile di precisione sui task aziendali in lingua giapponese al di sotto, quindi non testiamo né forniamo qualcosa di più basso per default.

3Forme di distribuzione confrontate

Self-hosted, gestita e condivisa — ognuna ha una scala in cui è la più economica. Il report indica quale per il tuo carico di lavoro, non per default.

Su cosa puoi contare

Cinque regole che governano ogni PoC LLM Privato.

Regole operative, non obiettivi ambiziosi — le stesse in ogni incarico.

  • NDA prima dei dati

    NDA e DPA vengono firmati prima che uno qualsiasi dei tuoi documenti, dati o domande venga usato per la valutazione — inclusa la chiamata iniziale gratuita.

  • Testato sul tuo materiale

    La precisione viene verificata sui tuoi documenti e domande, non su un benchmark pubblico generico che potrebbe non riflettere il tuo dominio o il tuo uso della lingua.

  • Soglia minima di quantizzazione FP8

    Non testiamo né raccomandiamo al di sotto di FP8 per risposte rivolte al business. Se un caso d'uso genuinamente non ne ha bisogno, il report lo dice — non è un upselling.

  • Credito integrale sulla costruzione

    Se prosegui verso una costruzione completa, la tariffa del PoC di $6.000 (o $3.000) viene detratta integralmente da quella fattura. Nessun buono, nessuna scadenza.

  • No-go onesto

    Se il carico di lavoro non si adatta a un LLM privato — la precisione non ci arriva, l'economia non funziona, un'API pubblica è genuinamente più adatta — il report lo dice invece di raccomandare comunque una costruzione.

FAQ

Cinque domande prima di iniziare.

Il tuo caso specifico non è qui? Aggiungilo nel campo messaggio del modulo qui sotto. Rispondiamo entro un giorno lavorativo.

Su quale hardware gira davvero il PoC?
Il PoC viene eseguito su un'infrastruttura già costruita e gestita da LLL internamente. Non ti viene chiesto di acquistare un server per sapere se un LLM privato si adatta al tuo caso d'uso — il report finale ti dice cosa acquistare, noleggiare, o farci gestire in hosting, se decidi di continuare.
Quale dimensione di modello testerete?
Partiamo dal predefinito raccomandato, un modello dense classe 70B (circa 70GB in FP8), dimensionato per approssimare un equivalente ChatGPT a livello aziendale su una macchina. Se il tuo carico di lavoro richiede meno (la soglia 32B) o più (122B-A10B o MoE classe 400B per uso simultaneo intenso), il report lo indica con motivazione, non come upselling predefinito.
Perché FP8 e non una quantizzazione più piccola?
Le nostre configurazioni standard mantengono FP8 come soglia minima. Quantizzare ulteriormente (ad esempio a 4-bit) degrada in modo misurabile la precisione sui task aziendali in lingua giapponese nei nostri test, quindi non lo forniamo come raccomandazione predefinita anche se abbasserebbe la fattura hardware.
La tariffa viene davvero scontata dalla costruzione completa?
Sì. I $6.000 completi (o $3.000 per team di 50 persone o meno) vengono detratti dal costo della costruzione completa se continui. Nessun buono, nessuna scadenza — viene scontato dalla fattura successiva.
«Privato» significa che nulla lascia la nostra rete?
Significa che l'inferenza — il prompt e la risposta generata — viene elaborata su server all'interno della tua infrastruttura invece di essere inviata a un servizio AI pubblico generico. Non è un'affermazione sul perimetro della tua rete, sulle VPN o sui controlli di accesso, che restano una decisione di progettazione separata da dove gira il modello stesso.

Avvia un PoC LLM Privato

Raccontaci il tuo carico di lavoro. Ricevi una valutazione iniziale gratuita.

Rispondiamo entro 1 giorno lavorativo con una prima valutazione gratuita sulla fattibilità, prima che tu ti impegni sui $6.000 (o $3.000).

  • NDA firmato prima di qualsiasi discussione tecnica — inclusa la valutazione gratuita.
  • Nessun acquisto di hardware richiesto per eseguire il PoC stesso.
  • Se un LLM privato non è la scelta giusta, te lo diremo nel report.
  • $6K ($3K ≤50 persone)
  • 30 giorni
  • 0 hardware richiesto
  • Credito sulla costruzione completa

Richiedi una valutazione iniziale gratuita

Campi obbligatori contrassegnati con *

Inviando, accetti la nostra informativa sulla privacy.