跳至内容
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

私有LLM基础设施 — LLL Inc. 构建并运营的自托管、托管式与共享GPU平台 LLL Inc. - 私有LLM基础设施

为什么需要私有LLM平台

如今,大多数AI应用都通过公开API运行:提示词离开您的网络,发送到提供商的服务器,然后返回响应。对许多工作场景而言,这是合理的权衡。但当提示词中包含的内容——内部文档、客户数据、源代码,或任何您无法交给第三方的保密义务信息——是您希望保留在自有基础设施内部的东西时,这种权衡就不再合理。

私有LLM平台正是替代方案:大语言模型运行在您自己掌控的硬件上,或由LLL代您运营,而非依赖共享的公开服务。

LLL在自有内部环境中构建并运营私有LLM基础设施——这正是我们在客户承诺自建之前,用来向潜在客户演示平台的同一套环境。这不是我们首次在纸面上描述的新业务领域,而是我们已在运营的基础设施的延伸。


三种运营形态

不存在唯一”正确”的部署形式。三种形态各自在某个使用规模下最具成本优势——没有一种形态在所有规模下都占优。

形态说明
自托管(部署在您的场地)GPU硬件安装在您自己的建筑物内。设备从第一天起就是您的资本资产。
托管式主机LLL代您安置并运营硬件——电力、制冷、UPS、网络连接和监控均包含在月费中。
共享基础设施完全无需购买硬件。您在LLL已运营的基础设施上按单位计费租用GPU/VRAM容量。

自托管往往在持续、高负载、可预测的使用场景下最具成本优势——前提是您的建筑物能够承受相应的电力和制冷负荷(参见下文「设备市场现状」)。托管式主机在保留硬件所有权的同时消除了设施负担。共享基础设施则两者皆免,但需按单位支付费用,而非拥有底层容量。三者中哪一种真正适合特定工作负载,正是30天PoC旨在解答的问题——在看到您的实际数据之前,我们不会默认推荐某一种。


完整构建包含的内容

针对单一用例的完整构建围绕四个要素展开:

  • 环境搭建:在所选部署形态上配置和设置推理堆栈
  • RAG(检索增强生成):将模型连接到您自己的文档和知识库,使回答基于您的资料,而非模型的通用训练知识
  • 与现有系统集成:将平台接入团队已在使用的工具,而非交付一个无人打开的独立聊天窗口
  • 培训:帮助团队掌握平台的使用方法,以及在相关情况下的运维方法

推荐模型配置

下表中的权重数值为FP8精度——量化说明见表格下方。

级别格式权重(FP8)定位
32B级Dense约32GB业务使用的实用下限
70B级Dense约70GB默认推荐 — 单台机器,规模相当于全公司通用的ChatGPT等效方案
122B-A10BMoE(激活10B)约125GB适用于更高并发使用
400B级MoE(激活17B)约400GB当前部署范围内的最高级别
35B-A3BMoE(激活3B)约35GB仅用于分诊/护栏角色 — 并非按回答模型的规模和定位设计

量化下限:FP8。 我们的标准配置不会低于FP8(例如4bit/INT4量化)。测试表明,进一步量化会显著降低日语商业任务的准确率,因此即便可能在纸面上降低硬件成本,我们也不会将其作为默认推荐提供。


投资费用

以下价格均为美元(USD),是我们直接向客户报价的金额——而非内部成本数字。

合作方式价格备注
30天PoC$6,000(50人以下团队为$3,000)在任何硬件投入之前,针对您自己的工作负载验证可行性。若继续推进,费用全额抵扣完整构建——详见30天私有LLM PoC
完整构建(单一用例)$8,000–$22,000,视规模而定环境搭建、RAG、与现有系统集成及培训(见上文)
持续维护与运营每月$300–$1,300按GPU数量分级
托管式主机每月$300–$1,600按功耗分级。包含电力、制冷、UPS、网络连接和监控
共享基础设施每24GB VRAM单位每月起价$300无需购买硬件

设备市场现状

GPU和服务器内存的价格一直在急剧上涨,从当前市场信号看,预计这种紧张态势将持续到2027年——这是由AI相关需求驱动的,而非暂时性短缺。我们不在本页公布固定的设备价格:目前硬件价格变动速度极快,今天公布的具体数字到您阅读时很可能已经过时,而且无论如何都会因地区和采购渠道而异。

作为规模的大致参考:单GPU或少量GPU配置——足以运行上述32B下限模型——与为70B级默认方案配置的完整8-GPU构建相比,属于明显不同数量级的投入;后者作为完整构建,价格处于美元六位数区间的较低端(low six figures)。为400B级层级配置的多节点方案还会再上一个台阶。每提升一个层级,设备投入都会跃升至明显更高的价位区间——这正是30天PoC存在的部分原因:在为任何层级定价之前,先确定您的工作负载实际需要哪个层级。

内存是仅次于GPU本身的第二大成本项——围绕768GB VRAM构建的系统通常需要超过1TB的系统内存来支撑,这也是内存价格几乎与GPU价格同步上涨的原因之一。若需针对您实际采购地区和配置的当前设备报价,请与我们联系,而非依赖可能已经过时的数字。


我们事先坦诚说明的事项

电力、制冷、UPS、备用电源、监控和降噪需求因建筑物而异,差异极大,因此我们不会在提案中将其列为固定金额——这些费用会在现场勘察后单独报价。

作为一般参考:风冷通常可支持每机柜约20kW以内的负载;超过这一水平,通常就需要液冷或设施层面的改造。即便是纸面上看似微小的变更——例如增加配电容量——在部分场地也曾产生实际且不容小觑的成本。相比给出无法兑现的数字,我们更愿意坦诚告知:存在这样一项设施预算,且需要现场勘察。


您的数据实际去向何处

「私有」描述的是推理运行的位置,而非您的网络架构。在自托管或托管式部署中,提示词和生成的响应在您自有基础设施内的服务器上处理——不会发送到公开的通用AI服务。这是关于计算发生位置的说明。

这并非关于您网络边界的声明。VPN、防火墙、访问控制,以及在网络层面如何保护该基础设施的其他一切,都是独立的设计决策——我们可以就此提供建议,但默认不包含在本服务范围内。


模型、数据与调优成果的所有权

基础设施项目会引出与应用项目相同的所有权问题,并延伸至LLM平台特有的内容:不仅是周边代码,还包括调优后的模型产物、检索索引和评估结果。

  • 调优与RAG产物归您所有:构建过程中生成的任何微调权重、提示词/检索配置和评估数据集,都将作为交付物移交——而不会仅保留在LLL控制的基础设施上,那样会使其成为一种依赖,而非资产。
  • 无模型锁定:构建围绕标准的、兼容OpenAI的推理接口(见下文)设计,因此可以更换底层模型——不同的开放权重模型、不同的GPU供应商、不同的托管安排——而无需重写您的集成层。
  • 无供应商锁定:同一套标准推理堆栈适用于自托管、托管式和共享部署。日后从一种部署形态切换到另一种,无需重新架构应用与模型的通信方式。
  • 您的数据始终由您掌控:用于评估和RAG的文档与提示词始终处于您的管控之下——与上文数据本地化的说明一致。

这正是LLL在每个项目中都贯彻的反锁定原则:模型无关的设计、标准的推理堆栈,以及一个您随时可以迁移到其他供应商的构建——而非一个必须依赖LLL持续参与才能运行的方案。


如何选择合适的部署形态

问题指向
出于审计、安全政策或财务原因,您是否需要硬件作为自有的资本资产?自托管
您是否希望获得该能力,但不承担设施工作(电力、制冷、UPS、监控)?托管式主机
使用量是否较轻、不稳定,或仍处于验证阶段?共享基础设施
使用量是否重且持续,您的设施能否支撑这一负载?在此规模下,自托管通常更具优势

以上都不是普适的答案——它们只是起点。针对特定工作负载的正确答案,以及合适的模型规模,正是下文的30天PoC旨在依据您自己的数据而非经验法则来确定的。


开始行动

在了解私有LLM是否真正满足您的准确率和延迟标准之前,就投入六位数的设备预算,或签订多年期的托管/共享合约,是一项真实的风险——而概念验证的存在,正是为了消除这项风险。

30天私有LLM PoC 在LLL已运营的基础设施上进行,针对您自己的文档和工作负载(而非通用基准测试)测试准确率和延迟,最终提供一份书面报告:哪种部署形态适合、哪种模型级别适合,以及完整构建的成本估算。若您继续推进,PoC费用将全额抵扣该构建费用。


常见问题

问:我们必须购买硬件才能知道这是否适合我们吗? 答:不需要。30天PoC在LLL已在内部构建并运营的基础设施上进行。报告会告诉您——如果决定继续——应该购买什么,或租用什么,或委托我们托管什么。

问:70B是否始终是正确的模型规模? 答:这是我们的默认推荐起点,规模相当于单台机器上全公司通用的ChatGPT等效方案。准确率要求较低的工作负载可运行在32B下限;并发使用量大的工作负载可能需要122B-A10B或400B级MoE层级。PoC报告会给出有理由支撑的具体层级建议,而非默认推荐。

问:为了节省硬件成本,我们可以量化到FP8以下吗? 答:可以,但我们不建议将其作为默认选项。我们的测试表明,低于FP8会显著降低日语商业任务的准确率,因此即便可能降低硬件费用,我们的标准配置仍坚持这条底线。

问:构建完成后,我们是否会被锁定在LLL,或特定的模型/GPU供应商上? 答:不会,这是设计使然。推理层是标准的、兼容OpenAI的接口,因此底层的模型和托管安排都可以更改,而无需重写您的集成——详见上文「模型、数据与调优成果的所有权」。

问:本页价格不包含哪些内容? 答:特定场地的工作——电力、制冷、UPS、备用电源、监控和降噪——因建筑物而异,差异过大,无法在未经现场勘察的情况下定价。现场勘察前我们可以分享的参考数字,详见上文「我们事先坦诚说明的事项」。


相关资源


开始对话

想知道私有LLM平台是否适合您的工作负载吗?

预约咨询


LLL Inc. - 来自马来西亚的私有LLM基础设施 自托管 · 托管式 · 共享 — 无锁定