跳至内容
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

私有LLM PoC · 30天,固定价格

30天内,用您自己的数据证明私有LLM可行——在您投入硬件之前。

针对您自己的文档和工作负载测量准确率与延迟,而非通用基准测试。在您为GPU服务器投入费用之前,您将获得关于部署形态、模型规模和完整构建成本的书面建议。

启动私有LLM PoC 先进行免费初步通话 · 数据交接前签署NDA · 1个工作日内回复

常见情形

「我们想要私有LLM。但我们不想花钱买GPU服务器去验证它是否真的可行。」

私有LLM PoC适用于您承诺投入硬件或托管合约之前的阶段——当「是否满足我们的准确率标准」仍是悬而未决的问题,而您需要的是基于自己数据的答案,而非供应商的演示。

情形 01

完整的8-GPU构建方案投入将达到美元六位数。在没有人对您自己的文档测量过准确率之前,这是一笔巨大的承诺。

请参阅基础设施服务页面上关于设备市场现状的说明——这项PoC的存在,正是为了让您无需先支出这笔费用。
情形 02

IT部门已经尝试自托管一个开源模型。结果要么准确率达不到大家习惯的水平,要么所需的VRAM超出预期。

模型规模和量化正是PoC针对您真实工作负载测试的内容。
情形 03

自托管、托管式或共享——三种运营方式,但公司内部没有人能自信地判断哪一种对您的使用模式最省钱。

三者中没有一种在所有规模下都占优。PoC报告会告诉您,对您而言哪一种最合适。

Before → After

30天内会发生什么变化。

交付物是一个可以据以行动的决定,而不是一份关于私有LLM理论上能做什么的幻灯片。

第0天 · 之前
  • 没有硬件,也没有针对您自己文档测量的准确率数据。
  • 三种部署形态仅停留在纸面上——自托管、托管式、共享——没有依据可以选择其一。
  • GPU市场变化速度极快,上季度的报价可能已经过时。
  • 没有针对您具体用例的完整构建实际成本估算。
第30天 · 之后
  • 一份书面报告:可行、有条件可行或不可行——针对您的工作负载具体判定。
  • 基于您自己的文档和问题测量的准确率与延迟。
  • 一个推荐的模型层级和部署形态,并附有各自的理由。
  • 完整构建的成本估算,若继续推进,PoC费用将抵扣其中。

为什么在硬件报价之前先做这项PoC

重点是一个您能站得住脚的决定,而不是一场演示。

私有LLM PoC旨在诚实地回答一个问题:在您自己的资料上,以适合您使用规模的成本,是否满足您的准确率和延迟标准。

01 · 无需硬件

在我们已运营的基础设施上测试

PoC在LLL自有的内部环境中运行。您无需自行配置GPU服务器就能知道答案是否可行。

02 · 您的数据,而非基准测试

基于您自己的文档测量准确率

评估集基于您的资料和问题构建——而非可能无法反映您所在领域或语言习惯的通用公开基准测试。

03 · 建议,而非推销

部署形态与模型规模,附带理由

报告会给出具体的模型层级和部署形态,并说明原因——如果私有LLM并不适合您测试的场景,也会如实说明。

运作方式 · 按周划分的4个阶段

从启动到书面建议,共30天。

在您的任何文档或数据被用于评估之前,我们会先签署NDA和DPA。

第1周

启动与工作负载定义

在测试开始前,以书面形式确定用例、将用于测试模型的文档和问题,以及您的准确率与延迟要求中「可行」的定义。

先签署NDA/DPA

第2周

筛选模型与部署形态

基于已定义的工作负载,筛选出候选模型层级(从70B级默认方案开始),并在我们的运营环境中配置用于测试。

此阶段无需购买硬件

第3周

构建与测试

将筛选出的模型连接到您的资料(如适用则加入RAG),并针对您自己的评估集运行准确率测试,同时测量代表性负载下的延迟和吞吐量。

结果为实测,非估算

第4周

报告与建议

书面验证报告:可行、有条件可行或不可行。附带推荐的模型层级和部署形态,以及完整构建的成本估算。

若继续推进,费用抵扣完整构建

PoC实际消除了什么

您尚不需要作出的承诺。

以下三项,正是私有LLM PoC旨在于您签署任何更大合约之前消除的内容。

0为PoC购买的硬件

测试在LLL已运营的基础设施上进行。只有当报告告诉您哪种形态和规模真正适合之后,您才需要对硬件作出承诺。

FP8量化下限,按原样测试

与我们在每个推荐构建中使用的下限相同——我们的测试表明,低于此下限会显著降低日语商业任务的准确率,因此我们默认不会测试或提供更低的量化。

3对比的部署形态

自托管、托管式和共享——每种形态都有其最具成本优势的规模区间。报告会告诉您,对您的工作负载而言哪一种最合适,而非默认设定。

您可以依赖的事项

贯穿每一次私有LLM PoC的五项规则。

这些是运营规则,而非努力目标——在每个项目中都一致适用。

  • 先NDA,后数据

    在您的任何文档、数据或问题被用于评估之前,我们会先签署NDA和DPA——包括免费初步通话期间。

  • 基于您自己的资料测试

    准确率的核验基于您的文档和问题,而非可能无法反映您所在领域或语言习惯的通用公开基准测试。

  • FP8量化下限

    对于面向业务的回答,我们不会测试或推荐低于FP8的量化。如果某个用例确实不需要它,报告会如实说明——这不是一种追加销售。

  • 全额抵扣构建费用

    如果您继续推进完整构建,$6,000(或$3,000)的PoC费用会从该发票中全额扣除。没有代金券,没有有效期。

  • 诚实的NO-GO

    如果工作负载不适合私有LLM——准确率不达标、经济性不成立,或公开API确实更合适——报告会如实说明,而不会为了推荐而推荐构建。

常见问题

开始之前的五个问题。

没有找到您的具体情形?请在下方表单的留言栏中补充说明。我们会在一个工作日内回复。

PoC 实际在什么硬件上运行?
PoC 在 LLL 已在内部构建并运营的基础设施上运行。您无需购买服务器就能知道私有LLM是否适合您的用例——最终的报告会告诉您,如果决定继续,应该购买、租用或委托我们托管什么。
你们会测试哪种模型规模?
我们从推荐的默认方案开始——一个70B级的Dense模型(FP8精度下约70GB),规模相当于单台机器上全公司通用的ChatGPT等效方案。如果您的工作负载需求更低(32B下限)或更高(122B-A10B或用于高并发场景的400B级MoE),报告会给出有理由支撑的说明,而非默认推销。
为什么是FP8,而不是更小的量化?
我们的标准配置将FP8作为下限。进一步量化(例如4bit)在我们的测试中会显著降低日语商业任务的准确率,因此即便这样做能降低硬件费用,我们也不会将其作为默认推荐提供。
费用真的会从完整构建中抵扣吗?
是的。如果您继续推进,全额$6,000(或50人以下团队的$3,000)将从完整构建的费用中扣除。没有代金券,没有有效期——直接从下一张发票中扣除。
「私有」是否意味着任何内容都不会离开我们的网络?
这意味着推理——提示词和生成的回答——在您自有基础设施内的服务器上处理,而非发送到公开的通用AI服务。这并非关于您网络边界、VPN或访问控制的声明,这些仍是独立于模型运行位置的设计决策。

启动私有LLM PoC

告诉我们您的工作负载。获取免费初步评估。

在您承诺投入$6,000(或$3,000)之前,我们将在1个工作日内回复,提供关于可行性的免费初步评估。

  • 在任何技术讨论之前签署NDA——包括免费评估。
  • 运行PoC本身无需购买硬件。
  • 如果私有LLM并不适合,我们会在报告中如实说明。
  • $6K(50人以下为$3K)
  • 30天
  • 0硬件即可开始
  • 抵扣完整构建费用

申请免费初步评估

必填字段标有 *

提交即表示您同意我们的隐私声明