跳至內容
THE GUILD
0%
SERVICES PRODUCTS CAREERS ABOUT BLOG FAQ CONTACT

私有LLM PoC · 30天,固定價格

30天內,用您自己的資料證明私有LLM可行——在您投資硬件之前。

針對您自己的文件和工作負載測量準確率與延遲,而非通用基準測試。在您為GPU伺服器投入費用之前,您將獲得關於部署形態、模型規模和完整建置成本的書面建議。

啟動私有LLM PoC 先進行免費初步通話 · 資料交接前簽署NDA · 1個工作天內回覆

常見情況

「我們想要私有LLM。但我們不想花錢買GPU伺服器去驗證它是否真的可行。」

私有LLM PoC適用於您承諾投資硬件或代管合約之前的階段——當「是否符合我們的準確率標準」仍是懸而未決的問題,而您需要的是基於自己資料的答案,而非供應商的展示。

情況 01

完整的8-GPU建置方案投資將達到美元六位數。在沒有人針對您自己的文件測量過準確率之前,這是一筆重大的承諾。

請參閱基礎設施服務頁面上關於設備市場現況的說明——這項PoC的存在,正是為了讓您無需先支出這筆費用。
情況 02

IT部門已經嘗試地端部署一個開源模型。結果不是準確率達不到大家習慣的水準,就是所需的VRAM超出預期。

模型規模和量化正是PoC針對您真實工作負載測試的內容。
情況 03

地端部署、代管或共享——三種營運方式,但公司內部沒有人能自信地判斷哪一種對您的使用模式最省錢。

三者中沒有一種在所有規模下都占優。PoC報告會告訴您,對您而言哪一種最合適。

Before → After

30天內會發生什麼變化。

交付物是一個可以據以行動的決定,而不是一份關於私有LLM理論上能做什麼的簡報。

第0天 · 之前
  • 沒有硬件,也沒有針對您自己文件測量的準確率數據。
  • 三種部署形態僅停留在紙面上——地端部署、代管、共享——沒有依據可以選擇其一。
  • GPU市場變化速度極快,上季度的報價可能已經過時。
  • 沒有針對您具體使用情境的完整建置實際成本估算。
第30天 · 之後
  • 一份書面報告:可行、有條件可行或不可行——針對您的工作負載具體判定。
  • 基於您自己的文件和問題測量的準確率與延遲。
  • 一個建議的模型層級和部署形態,並附有各自的理由。
  • 完整建置的成本估算,若繼續推進,PoC費用將折抵其中。

為什麼在硬件報價之前先做這項PoC

重點是一個您能站得住腳的決定,而不是一場展示。

私有LLM PoC旨在誠實地回答一個問題:在您自己的資料上,以適合您使用規模的成本,是否符合您的準確率和延遲標準。

01 · 無需硬件

在我們已營運的基礎設施上測試

PoC在LLL自有的內部環境中運行。您無需自行準備GPU伺服器就能知道答案是否可行。

02 · 您的資料,而非基準測試

基於您自己的文件測量準確率

評估集基於您的資料和問題建置——而非可能無法反映您所在領域或語言習慣的通用公開基準測試。

03 · 建議,而非推銷

部署形態與模型規模,附帶理由

報告會給出具體的模型層級和部署形態,並說明原因——如果私有LLM並不適合您測試的情境,也會如實說明。

運作方式 · 按週劃分的4個階段

從啟動到書面建議,共30天。

在您的任何文件或資料被用於評估之前,我們會先簽署NDA和DPA。

第1週

啟動與工作負載定義

在測試開始前,以書面形式確定使用情境、將用於測試模型的文件和問題,以及您的準確率與延遲要求中「可行」的定義。

先簽署NDA/DPA

第2週

篩選模型與部署形態

基於已定義的工作負載,篩選出候選模型層級(從70B級預設方案開始),並在我們的營運環境中配置用於測試。

此階段無需購買硬件

第3週

建置與測試

將篩選出的模型連接到您的資料(如適用則加入RAG),並針對您自己的評估集執行準確率測試,同時測量代表性負載下的延遲和吞吐量。

結果為實測,非估算

第4週

報告與建議

書面驗證報告:可行、有條件可行或不可行。附帶建議的模型層級和部署形態,以及完整建置的成本估算。

若繼續推進,費用折抵完整建置

PoC實際消除了什麼

您尚不需要做出的承諾。

以下三項,正是私有LLM PoC旨在於您簽署任何更大合約之前消除的內容。

0為PoC購買的硬件

測試在LLL已營運的基礎設施上進行。只有當報告告訴您哪種形態和規模真正適合之後,您才需要對硬件做出承諾。

FP8量化下限,按原樣測試

與我們在每個建議建置中使用的下限相同——我們的測試顯示,低於此下限會明顯降低日語商業任務的準確率,因此我們預設不會測試或提供更低的量化。

3比較的部署形態

地端部署、代管和共享——每種形態都有其最具成本優勢的規模區間。報告會告訴您,對您的工作負載而言哪一種最合適,而非預設方案。

您可以依賴的事項

貫穿每一次私有LLM PoC的五項規則。

這些是營運規則,而非努力目標——在每個專案中都一致適用。

  • 先NDA,後資料

    在您的任何文件、資料或問題被用於評估之前,我們會先簽署NDA和DPA——包括免費初步通話期間。

  • 基於您自己的資料測試

    準確率的核實基於您的文件和問題,而非可能無法反映您所在領域或語言習慣的通用公開基準測試。

  • FP8量化下限

    對於面向業務的回答,我們不會測試或建議低於FP8的量化。如果某個使用情境確實不需要它,報告會如實說明——這不是一種追加銷售。

  • 全額折抵建置費用

    如果您繼續推進完整建置,$6,000(或$3,000)的PoC費用會從該發票中全額扣除。沒有抵用券,沒有到期日。

  • 誠實的NO-GO

    如果工作負載不適合私有LLM——準確率不達標、經濟效益不成立,或公開API確實更合適——報告會如實說明,而不會為了建議而建議建置。

常見問題

開始之前的五個問題。

沒有找到您的具體情況?請在下方表單的留言欄中補充說明。我們會在一個工作天內回覆。

PoC 實際在什麼硬件上運行?
PoC 在 LLL 已於內部建置並營運的基礎設施上運行。您無需購買伺服器就能知道私有LLM是否適合您的使用情境——最後的報告會告訴您,如果決定繼續,應該購買、租用或委託我們代管什麼。
你們會測試哪種模型規模?
我們從建議的預設方案開始——一個70B級的Dense模型(FP8精度下約70GB),規模相當於單台機器上全公司通用的ChatGPT等效方案。如果您的工作負載需求更低(32B下限)或更高(122B-A10B或用於高併發情境的400B級MoE),報告會給出有理由支撐的說明,而非預設推銷。
為什麼是FP8,而不是更小的量化?
我們的標準配置將FP8作為下限。進一步量化(例如4bit)在我們的測試中會明顯降低日語商業任務的準確率,因此即便這樣做能降低硬件費用,我們也不會將其作為預設建議提供。
費用真的會從完整建置中折抵嗎?
是的。如果您繼續推進,全額$6,000(或50人以下團隊的$3,000)將從完整建置的費用中扣除。沒有抵用券,沒有到期日——直接從下一張發票中扣除。
「私有」是否代表任何內容都不會離開我們的網絡?
這代表推論——提示詞和生成的回答——是在您自有基礎設施內的伺服器上處理,而非傳送到公開的通用AI服務。這並非關於您網絡邊界、VPN或存取控制的聲明,這些仍是獨立於模型運行位置的設計決策。

啟動私有LLM PoC

告訴我們您的工作負載。取得免費初步評估。

在您承諾投入$6,000(或$3,000)之前,我們將在1個工作天內回覆,提供關於可行性的免費初步評估。

  • 在任何技術討論之前簽署NDA——包括免費評估。
  • 執行PoC本身無需購買硬件。
  • 如果私有LLM並不適合,我們會在報告中如實說明。
  • $6K(50人以下為$3K)
  • 30天
  • 0硬件即可開始
  • 折抵完整建置費用

申請免費初步評估

必填欄位標有 *

提交即表示您同意我們的私隱聲明