Pular para o conteúdo
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

PoC de LLM Privado · 30 dias, preço fixo

Prove que um LLM privado funciona com seus dados, em 30 dias — antes de você se comprometer com hardware.

Precisão e latência medidas com seus próprios documentos e carga de trabalho, não um benchmark genérico. Você recebe uma recomendação escrita sobre forma de implantação, tamanho de modelo e custo da construção completa — antes de gastar em um servidor GPU.

Iniciar um PoC de LLM Privado Primeiro, chamada inicial gratuita · NDA antes de qualquer troca de dados · Resposta em 1 dia útil

Situações comuns

"Queremos um LLM privado. Não queremos gastar com um servidor GPU para descobrir se realmente funciona."

Um PoC de LLM Privado é para o momento antes de um compromisso com hardware ou contrato de hospedagem — quando a questão em aberto ainda é "isso atende ao nosso padrão de precisão", e você quer uma resposta com seus próprios dados, não a demonstração de um fornecedor.

Situação 01

Uma construção completa de 8 GPUs chega a seis dígitos, em USD. É muito para se comprometer antes que alguém tenha medido a precisão com seus próprios documentos.

Veja a realidade do mercado de equipamentos na página de serviço de infraestrutura — este PoC existe para que você não precise gastar isso primeiro.
Situação 02

O TI já tentou auto-hospedar um modelo aberto. Ou ficou aquém da precisão à qual as pessoas estão acostumadas, ou precisou de mais VRAM do que o esperado.

Tamanho de modelo e quantização são exatamente o que o PoC testa com sua carga de trabalho real.
Situação 03

Auto-hospedado, gerenciado, ou compartilhado — três formas de operar isso, e ninguém internamente consegue dizer com confiança qual é a mais barata para seu padrão de uso.

Nenhuma das três vence em todas as escalas. O relatório do PoC diz qual, para você.

Antes → Depois

O que muda em 30 dias.

O entregável é uma decisão sobre a qual você pode agir, não uma apresentação sobre o que um LLM privado poderia teoricamente fazer.

Dia 0 · Antes
  • Nenhum hardware, e nenhum número de precisão medido com seus próprios documentos.
  • Três formas de implantação no papel — auto-hospedada, gerenciada, compartilhada — sem base para escolher uma.
  • Um mercado de GPU se movendo rápido o suficiente para que a cotação do trimestre passado já possa estar desatualizada.
  • Nenhuma estimativa de quanto uma construção completa realmente custaria para seu caso de uso específico.
Dia 30 · Depois
  • Um relatório escrito: viável, condicionalmente viável, ou não viável — especificamente para sua carga de trabalho.
  • Precisão e latência medidas com seus próprios documentos e perguntas.
  • Um nível de modelo e forma de implantação recomendados, com a justificativa de cada um.
  • Uma estimativa de custo para a construção completa, e a taxa do PoC creditada nela se você continuar.

Por que este PoC, antes de uma cotação de hardware

O ponto é uma decisão que você pode defender, não uma demonstração.

Um PoC de LLM privado é feito para responder honestamente a uma pergunta: isso atende ao seu padrão de precisão e latência, com seu próprio material, a um custo que faz sentido para o seu uso.

01 · Nenhum hardware necessário

Testado em infraestrutura que já operamos

O PoC roda no ambiente interno próprio da LLL. Você não precisa provisionar um servidor GPU para saber se a resposta é sim.

02 · Seus dados, não um benchmark

Precisão medida com seus próprios documentos

O conjunto de avaliação é construído a partir do seu material e das suas perguntas — não um benchmark público genérico que pode não refletir seu domínio ou uso da língua.

03 · Uma recomendação, não um discurso de vendas

Forma de implantação e tamanho de modelo, com justificativa

O relatório nomeia um nível de modelo e forma de implantação específicos e explica o porquê — inclusive dizendo isso caso um LLM privado não seja o encaixe certo para o que você testou.

Como funciona · 4 fases semanais

Trinta dias do kickoff até a recomendação escrita.

NDA e DPA são assinados antes de qualquer um dos seus documentos ou dados serem usados na avaliação.

Semana 1

Kickoff & definição da carga de trabalho

Definição do caso de uso, dos documentos e perguntas contra os quais o modelo será testado, e o que "viável" significa para seus requisitos de precisão e latência — por escrito, antes de os testes começarem.

PM + engenheiro + cliente · 60 minutos

Semana 2

Pré-seleção de modelo & forma de implantação

Com base na carga de trabalho definida, pré-seleção de um nível de modelo (partindo do padrão classe 70B) e provisionamento no nosso próprio ambiente operacional para testes.

Nenhuma compra de hardware nesta etapa

Semana 3

Construção & teste

Conexão do modelo pré-selecionado ao seu material (RAG quando relevante) e execução de testes de precisão com seu próprio conjunto de avaliação, além de latência e throughput sob uma carga representativa.

Resultados medidos, não estimados

Semana 4

Relatório & recomendação

Relatório de validação escrito: viável, condicionalmente viável, ou não viável. Nível de modelo e forma de implantação recomendados, mais uma estimativa de custo para a construção completa.

Taxa creditada na construção completa se você continuar

O que o PoC realmente elimina

O compromisso que você ainda não está assumindo.

Estas são as três coisas que um PoC de LLM privado foi projetado para eliminar antes de você assinar algo maior.

0Hardware comprado para o PoC

Os testes rodam em infraestrutura que a LLL já opera. Você só se compromete com hardware depois que o relatório diz qual forma e tamanho realmente se encaixam.

FP8Piso de quantização, testado como está

O mesmo piso que usamos em toda construção recomendada — nossos testes mostram uma queda mensurável de precisão em tarefas empresariais em japonês abaixo dele, então não testamos nem entregamos algo mais baixo por padrão.

3Formas de implantação comparadas

Auto-hospedada, gerenciada e compartilhada — cada uma tem uma escala em que é a mais barata. O relatório diz qual delas para sua carga de trabalho, não por padrão.

No que você pode confiar

Cinco regras que regem todo PoC de LLM Privado.

Regras operacionais, não metas ambiciosas — as mesmas em toda contratação.

  • NDA antes dos dados

    NDA e DPA são assinados antes de qualquer um dos seus documentos, dados ou perguntas serem usados para avaliação — inclusive durante a chamada inicial gratuita.

  • Testado com seu próprio material

    A precisão é verificada com seus documentos e perguntas, não um benchmark público genérico que pode não refletir seu domínio ou uso da língua.

  • Piso de quantização FP8

    Não testamos nem recomendamos abaixo de FP8 para respostas voltadas ao negócio. Se um caso de uso genuinamente não precisar disso, o relatório diz — não é uma venda adicional.

  • Crédito integral na construção

    Se você continuar para uma construção completa, a taxa do PoC de $6.000 (ou $3.000) é deduzida integralmente dessa fatura. Sem vale, sem expiração.

  • Recusa honesta

    Se a carga de trabalho não se encaixar em um LLM privado — a precisão fica aquém, a economia não funciona, uma API pública é genuinamente mais adequada —, o relatório diz isso em vez de recomendar uma construção de qualquer forma.

Perguntas Frequentes

Cinco perguntas antes de você começar.

Seu caso específico não está aqui? Adicione-o no campo de mensagem do formulário abaixo. Respondemos em um dia útil.

Em qual hardware o PoC realmente roda?
O PoC roda em infraestrutura que a LLL já constrói e opera internamente. Você não precisa comprar um servidor para saber se um LLM privado se encaixa no seu caso de uso — o relatório final diz o que comprar, alugar, ou nos contratar para hospedar, caso você decida continuar.
Qual tamanho de modelo vocês vão testar?
Começamos pelo padrão recomendado, um modelo dense classe 70B (cerca de 70GB em FP8), dimensionado para aproximar um equivalente ao ChatGPT em escala de toda a empresa em uma máquina. Se sua carga de trabalho precisar de menos (o piso 32B) ou mais (122B-A10B ou MoE classe 400B para uso concorrente pesado), o relatório dirá isso com justificativa, não como venda adicional padrão.
Por que FP8 e não uma quantização menor?
Nossas configurações padrão mantêm FP8 como piso. Quantizar além disso (por exemplo, para 4 bits) degrada mensuravelmente a precisão em tarefas empresariais em japonês em nossos testes, então não entregamos isso como recomendação padrão, mesmo que reduzisse a conta de hardware.
A taxa realmente é descontada da construção completa?
Sim. Os $6.000 completos (ou $3.000 para equipes de 50 pessoas ou menos) são deduzidos do custo da construção completa se você continuar. Sem vale, sem expiração — vem descontado da próxima fatura.
"Privado" significa que nada sai da nossa rede?
Significa que a inferência — o prompt e a resposta gerada — é processada em servidores dentro da sua própria infraestrutura em vez de ser enviada a um serviço de IA público de uso geral. Não é uma afirmação sobre o perímetro da sua rede, VPNs ou controles de acesso, que permanecem uma decisão de design separada de onde o próprio modelo roda.

Iniciar um PoC de LLM Privado

Conte-nos sobre sua carga de trabalho. Receba uma avaliação inicial gratuita.

Respondemos em 1 dia útil com uma primeira leitura gratuita sobre viabilidade, antes de você se comprometer com os $6.000 (ou $3.000).

  • NDA assinado antes de qualquer discussão técnica — inclusive a avaliação gratuita.
  • Nenhuma compra de hardware necessária para rodar o PoC em si.
  • Se um LLM privado não for o encaixe certo, diremos isso no relatório.
  • $6K ($3K ≤50 pessoas)
  • 30 dias
  • 0 hardware necessário
  • Crédito na construção completa

Solicitar uma avaliação inicial gratuita

Campos obrigatórios marcados com *

Ao enviar, você concorda com nosso aviso de privacidade.