Pular para o conteúdo
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

Infraestrutura de LLM Privado — plataformas GPU auto-hospedadas, gerenciadas e compartilhadas construídas e operadas pela LLL Inc. LLL Inc. - Infraestrutura de LLM Privado

Por Que uma Plataforma de LLM Privado

A maior parte da adoção de IA hoje passa por uma API pública: um prompt sai da sua rede, vai para os servidores de um fornecedor, e uma resposta retorna. Essa é a troca certa para muitos trabalhos. Ela deixa de ser a troca certa a partir do momento em que o material inserido no prompt é algo que você preferiria manter dentro da sua própria infraestrutura — documentos internos, dados de clientes, código-fonte, qualquer coisa sob uma obrigação de confidencialidade que você não pode entregar a terceiros.

Uma plataforma de LLM privado é a alternativa: um modelo de linguagem grande rodando em hardware que você controla, ou que a LLL opera em seu nome, em vez de um serviço público compartilhado.

A LLL constrói e opera infraestrutura de LLM privado como parte do nosso próprio ambiente interno — o mesmo ambiente que usamos para demonstrar a plataforma a clientes em potencial antes que eles se comprometam com uma construção própria. Isso é uma extensão de uma infraestrutura que já operamos, não uma nova área de atuação que estamos descrevendo no papel pela primeira vez.


Três Formas de Operar

Não existe uma única forma de implantação “correta”. Cada uma das três tem um nível de uso em que é a opção mais barata — nenhuma vence em todas as escalas.

FormaO que significa
Auto-hospedada (em suas instalações)O hardware de GPU é instalado no seu próprio prédio. O equipamento é seu ativo imobilizado desde o primeiro dia.
Hospedagem GerenciadaA LLL abriga e opera o hardware em seu nome — energia, refrigeração, nobreak, conectividade e monitoramento incluídos em uma mensalidade.
Infraestrutura CompartilhadaNenhuma compra de hardware. Você aluga capacidade de GPU/VRAM, medida por unidade, em infraestrutura que a LLL já opera.

A opção auto-hospedada tende a ser a mais barata em uso sustentado, pesado e previsível, desde que seu prédio consiga suportar a carga elétrica e de refrigeração (veja “Realidade do Mercado de Equipamentos”, abaixo). A hospedagem gerenciada remove o ônus das instalações sem remover a propriedade do hardware. A infraestrutura compartilhada remove ambos, ao custo de pagar uma taxa por unidade em vez de possuir a capacidade subjacente. Qual das três realmente compensa para uma determinada carga de trabalho é exatamente a pergunta que um PoC de 30 dias foi projetado para responder — não algo que recomendamos por padrão antes de ver seus números.


O Que Está Incluído em uma Construção Completa

Uma construção completa para um único caso de uso é estruturada em torno de quatro elementos:

  • Construção do ambiente: provisionamento e configuração da pilha de inferência na forma de implantação escolhida
  • RAG (Retrieval-Augmented Generation): conexão do modelo aos seus próprios documentos e base de conhecimento, para que as respostas se baseiem no seu material em vez do treinamento geral do modelo
  • Integração com sistemas existentes: conectar a plataforma às ferramentas que sua equipe já usa, em vez de entregar uma janela de chat independente que ninguém abre
  • Treinamento: capacitar sua equipe sobre como usar e, quando relevante, operar a plataforma

Configuração de Modelo Recomendada

Os valores de peso abaixo são em FP8 — veja a nota sobre quantização abaixo da tabela.

ClasseFormatoPesos (FP8)Posicionamento
Classe 32BDense~32GBPiso prático para uso empresarial
Classe 70BDense~70GBPadrão e recomendado — uma máquina, dimensionada para aproximar um equivalente ao ChatGPT em escala de toda a empresa
122B-A10BMoE (10B ativos)~125GBPara uso concorrente mais alto
Classe 400BMoE (17B ativos)~400GBTopo da faixa que implantamos atualmente
35B-A3BMoE (3B ativos)~35GBFunção apenas de triagem/guarda — não dimensionado nem posicionado como modelo de resposta

Piso de quantização: FP8. Nossas configurações padrão não vão abaixo de FP8 (por exemplo, quantização de 4 bits/INT4). Em nossos testes, quantizar além disso degrada mensuravelmente a precisão em tarefas empresariais em japonês, portanto não é algo que entregamos como recomendação padrão, independentemente da economia de custo que possa oferecer no papel.


Investimento

Os preços abaixo estão em USD e refletem o que cotamos diretamente aos clientes — não valores internos de custo.

ContrataçãoPreçoNotas
PoC de 30 dias$6.000 ($3.000 para equipes de 50 pessoas ou menos)Valida a viabilidade em relação à sua própria carga de trabalho antes de qualquer compromisso com hardware. Totalmente creditado na construção completa se você continuar — veja PoC de LLM Privado de 30 Dias
Construção completa (caso de uso único)$8.000–$22.000, dependendo da escalaConstrução do ambiente, RAG, integração com sistemas existentes e treinamento (veja acima)
Manutenção e operação contínuas$300–$1.300/mêsEscalonado por número de GPUs
Hospedagem gerenciada$300–$1.600/mêsEscalonado por consumo de energia. Energia, refrigeração, nobreak, conectividade e monitoramento incluídos
Infraestrutura compartilhadaA partir de $300/mês por unidade de 24GB de VRAMNenhuma compra de hardware

Realidade do Mercado de Equipamentos

Os preços de GPUs e memória de servidor têm subido acentuadamente, e, segundo os sinais de mercado atuais, espera-se que ambos permaneçam apertados até 2027 — impulsionados pela demanda relacionada a IA, não por uma escassez temporária. Não publicamos um preço fixo de equipamento nesta página: os preços de hardware estão se movendo rápido o suficiente agora para que um número específico publicado hoje já esteja desatualizado quando você o ler, e variaria por região e canal de aquisição de qualquer forma.

Como uma noção aproximada de escala: uma configuração de um ou poucos GPUs — suficiente para rodar o modelo de piso 32B descrito acima — está em uma ordem de grandeza bem diferente de uma construção completa de 8 GPUs dimensionada para o padrão classe 70B, que fica na casa dos seis dígitos baixos, em USD, como uma construção completa. Uma configuração multi-node dimensionada para o nível classe 400B é mais um salto além disso. Cada nível eleva o investimento em equipamento para uma faixa consideravelmente mais alta — o que é parte do motivo pelo qual o PoC de 30 Dias existe: estabelecer de qual nível sua carga de trabalho realmente precisa antes de precificar qualquer um deles.

A memória é o segundo maior item de custo depois das próprias GPUs — um sistema construído em torno de 768GB de VRAM tipicamente precisa de mais de 1TB de memória de sistema para suportá-lo, o que é parte do motivo pelo qual o preço da memória tem subido quase tão rápido quanto o preço das GPUs. Para preços atuais de equipamento para sua região e configuração reais de aquisição, entre em contato em vez de confiar em um número que já pode estar desatualizado.


O Que Somos Honestos Desde o Início

Energia, refrigeração, nobreak, energia de backup, monitoramento e controle de ruído variam enormemente de um prédio para outro, portanto não cotamos isso como um número fixo em uma proposta — eles são precificados individualmente após uma visita ao local.

Como ponto de referência geral: o resfriamento a ar é viável até aproximadamente 20kW por rack; além disso, o resfriamento líquido ou mudanças nas instalações geralmente se tornam necessários. Até mudanças que parecem pequenas no papel — adicionar capacidade de distribuição elétrica, por exemplo — resultaram em custo real e não trivial em alguns locais. Preferimos dizer que existe uma linha de orçamento para instalações e que ela precisa de uma visita ao local, em vez de fornecer um número que não poderíamos sustentar.


Para Onde Seus Dados Realmente Vão

“Privado” descreve onde a inferência é executada, não a arquitetura da sua rede. Com uma implantação auto-hospedada ou gerenciada, o prompt e a resposta gerada são processados em servidores dentro da sua própria infraestrutura — eles não são enviados a um serviço de IA público de uso geral. Essa é uma afirmação sobre onde a computação acontece.

Não é uma afirmação sobre o perímetro da sua rede. VPNs, firewalls, controle de acesso, e tudo mais sobre como essa infraestrutura é protegida na camada de rede é uma decisão de design separada, sobre a qual podemos aconselhar, mas que não está incluída por padrão neste serviço.


Propriedade de Modelo, Dados e Resultados de Ajuste

Projetos de infraestrutura levantam as mesmas questões de propriedade que projetos de aplicação, estendidas ao que é específico de uma plataforma de LLM: não apenas o código ao redor, mas os artefatos de modelo ajustados, o índice de recuperação e os resultados de avaliação.

  • Artefatos de ajuste e RAG são seus: quaisquer pesos ajustados, configuração de prompt/recuperação e conjuntos de dados de avaliação produzidos durante uma construção são entregues como produtos — não retidos apenas em infraestrutura controlada exclusivamente pela LLL, o que os tornaria uma dependência em vez de um ativo.
  • Sem aprisionamento a modelo: as construções são projetadas em torno de uma interface de inferência padrão, compatível com OpenAI (veja abaixo), de modo que o modelo subjacente pode ser trocado — um modelo de pesos abertos diferente, um fornecedor de GPU diferente, um arranjo de hospedagem diferente — sem reescrever sua camada de integração.
  • Sem aprisionamento a fornecedor: a mesma pilha de inferência padrão é usada em implantações auto-hospedadas, gerenciadas e compartilhadas. Mudar de uma forma de implantação para outra mais tarde não exige reprojetar como suas aplicações conversam com o modelo.
  • Seus dados permanecem sob seu controle: documentos e prompts usados para avaliação e RAG permanecem sob seu controle o tempo todo — consistente com a observação sobre localidade de dados acima.

Esse é o mesmo princípio anti-aprisionamento que a LLL aplica em todos os projetos: design agnóstico de modelo, uma pilha de inferência padrão, e uma construção que você pode migrar para outro fornecedor se um dia escolher fazê-lo, não uma que depende de a LLL continuar envolvida para continuar funcionando.


Escolhendo a Forma de Implantação Certa

PerguntaAponta para
Você precisa que o hardware seja um ativo imobilizado que você possui — por razões de auditoria, política de segurança ou contabilidade?Auto-hospedada
Você quer a capacidade sem assumir o trabalho de instalações (energia, refrigeração, nobreak, monitoramento)?Hospedagem gerenciada
O uso é leve, imprevisível, ou ainda está sendo comprovado?Infraestrutura compartilhada
O uso é pesado e sustentado, e sua instalação consegue suportar a carga?A opção auto-hospedada geralmente vence nessa escala

Nenhuma dessas é uma resposta universal — são pontos de partida. A resposta certa para uma carga de trabalho específica, junto com o tamanho de modelo certo, é o que o PoC de 30 dias abaixo foi projetado para determinar com seus próprios números, não com uma regra geral.


Como Começar

Comprometer-se com um orçamento de equipamento de seis dígitos, ou um contrato gerenciado ou compartilhado plurianual, antes de saber se um LLM privado realmente atende ao seu padrão de precisão e latência, é um risco real — um risco que uma prova de conceito existe especificamente para eliminar.

O PoC de LLM Privado de 30 Dias roda em infraestrutura que a LLL já opera, testa precisão e latência em relação aos seus próprios documentos e carga de trabalho (não um benchmark genérico), e termina com um relatório escrito: qual forma de implantação se encaixa, qual nível de modelo se encaixa, e uma estimativa de custo para a construção completa. Se você continuar, a taxa do PoC é totalmente creditada nessa construção.


Perguntas Frequentes

P: Precisamos comprar hardware para saber se isso funciona para nós? R: Não. O PoC de 30 dias roda em infraestrutura que a LLL já constrói e opera internamente. O relatório resultante diz o que comprar — ou alugar, ou nos contratar para hospedar — caso você decida continuar.

P: O 70B é sempre o tamanho de modelo certo? R: É o nosso ponto de partida padrão e recomendado, dimensionado para aproximar um equivalente ao ChatGPT em escala de toda a empresa em uma máquina. Cargas de trabalho com requisitos de precisão menores podem rodar no piso 32B; cargas de trabalho com uso concorrente pesado podem precisar dos níveis MoE 122B-A10B ou classe 400B. O relatório do PoC recomenda um nível específico com justificativa, não um padrão.

P: Podemos quantizar abaixo de FP8 para economizar em hardware? R: Você pode, mas não recomendamos isso como padrão. Nossos testes mostram uma queda mensurável de precisão em tarefas empresariais em japonês abaixo de FP8, então nossas configurações padrão mantêm essa linha mesmo quando isso reduziria a conta de hardware.

P: Ficamos presos à LLL, ou a um modelo ou fornecedor de GPU específico, depois que isso é construído? R: Não, por design. A camada de inferência é uma interface padrão compatível com OpenAI, então o modelo e o arranjo de hospedagem por trás dele podem mudar sem reescrever sua integração — veja Propriedade de Modelo, Dados e Resultados de Ajuste, acima.

P: O que não está incluído nos preços desta página? R: Trabalho específico do local — energia, refrigeração, nobreak, backup, monitoramento e controle de ruído — que varia demais de prédio para prédio para ser precificado sem uma visita ao local. Veja “O Que Somos Honestos Desde o Início”, acima, para os números de referência que podemos compartilhar antes dessa visita.


Recursos Relacionados


Inicie a Conversa

Pronto para descobrir se uma plataforma de LLM privado se encaixa na sua carga de trabalho?

Agende uma Consultoria


LLL Inc. - Infraestrutura de LLM Privado da Malásia Auto-Hospedada • Gerenciada • Compartilhada — Sem Aprisionamento