LLL Inc. - 私有LLM基礎設施
為什麼需要私有LLM平台
如今,大多數AI應用都是透過公開API運作:提示詞離開您的網絡,傳送到供應商的伺服器,再取得回應。對許多工作情境而言,這是合理的取捨。但當提示詞中包含的內容——內部文件、客戶資料、原始碼,或任何無法交給第三方的保密義務資訊——是您希望留在自有基礎設施內部的東西時,這種取捨就不再合理。
私有LLM平台正是替代方案:大型語言模型運行在您自己掌控的硬件上,或由LLL代您營運,而非依賴共享的公開服務。
LLL在自有的內部環境中建置並營運私有LLM基礎設施——這正是我們在客戶承諾自行建置之前,用來向潛在客戶展示平台的同一套環境。這不是我們首次在紙上談兵的新業務領域,而是我們已在營運的基礎設施的延伸。
三種營運形態
並不存在唯一「正確」的部署形式。三種形態各自在某個使用規模下最具成本優勢——沒有一種形態在所有規模下都占優。
| 形態 | 說明 |
|---|---|
| 地端部署(自有場地) | GPU硬件安裝在您自己的建築物內。設備從第一天起就是您的資本資產。 |
| 代管服務 | LLL代您安置並營運硬件——電力、散熱、UPS、網絡連線和監控皆包含在月費中。 |
| 共享基礎設施 | 完全無需購買硬件。您在LLL已營運的基礎設施上以單位計費租用GPU/VRAM容量。 |
地端部署通常在持續、高負載、可預測的使用情境下最具成本優勢——前提是您的建築物能夠承受相應的電力與散熱負載(參見下文「設備市場現況」)。代管服務在保留硬件所有權的同時,免除了設施方面的負擔。共享基礎設施則兩者皆免,但需按單位付費,而非擁有底層容量。三者中哪一種真正適合特定工作負載,正是30天PoC旨在解答的問題——在看到您的實際數據之前,我們不會預設推薦其中一種。
完整建置包含的內容
針對單一使用情境的完整建置圍繞四個要素展開:
- 環境建置:在所選部署形態上配置並設定推論堆疊
- RAG(檢索增強生成):將模型連接到您自己的文件和知識庫,使回答基於您的資料,而非模型的通用訓練知識
- 與現有系統整合:將平台接入團隊已在使用的工具,而非交付一個無人開啟的獨立聊天視窗
- 教育訓練:協助團隊掌握平台的使用方式,以及在相關情況下的維運方式
建議模型配置
下表中的權重數值為FP8精度——量化說明請見表格下方。
| 級別 | 格式 | 權重(FP8) | 定位 |
|---|---|---|---|
| 32B級 | Dense | 約32GB | 商業使用的實用下限 |
| 70B級 | Dense | 約70GB | 預設建議 — 單台機器,規模相當於全公司通用的ChatGPT等效方案 |
| 122B-A10B | MoE(啟用10B) | 約125GB | 適用於更高併發使用 |
| 400B級 | MoE(啟用17B) | 約400GB | 目前部署範圍內的最高級別 |
| 35B-A3B | MoE(啟用3B) | 約35GB | 僅用於分流/護欄角色 — 並非按回答模型的規模與定位設計 |
量化下限:FP8。 我們的標準配置不會低於FP8(例如4bit/INT4量化)。測試顯示,進一步量化會明顯降低日語商業任務的準確率,因此即便可能在紙面上降低硬件成本,我們也不會將其作為預設建議提供。
投資費用
以下價格皆為美元(USD),是我們直接向客戶報價的金額——而非內部成本數字。
| 合作方式 | 價格 | 備註 |
|---|---|---|
| 30天PoC | $6,000(50人以下團隊為$3,000) | 在任何硬件投資之前,針對您自己的工作負載驗證可行性。若繼續推進,費用全額折抵完整建置——詳見30天私有LLM PoC |
| 完整建置(單一使用情境) | $8,000–$22,000,視規模而定 | 環境建置、RAG、與現有系統整合及教育訓練(見上文) |
| 持續維護與維運 | 每月$300–$1,300 | 依GPU數量分級 |
| 代管服務 | 每月$300–$1,600 | 依功耗分級。包含電力、散熱、UPS、網絡連線和監控 |
| 共享基礎設施 | 每24GB VRAM單位每月起價$300 | 無需購買硬件 |
設備市場現況
GPU與伺服器記憶體的價格持續劇烈上漲,就目前的市場訊號來看,這種緊縮態勢預計會持續到2027年——這是由AI相關需求驅動的,而非暫時性短缺。我們不在本頁公布固定的設備價格:目前硬件價格變動速度極快,今天公布的具體數字到您閱讀時很可能已經過時,且無論如何都會因地區與採購管道而異。
作為規模的大致參考:單一GPU或少量GPU配置——足以運行上述32B下限模型——與為70B級預設方案配置的完整8-GPU建置相比,屬於明顯不同數量級的投資;後者作為完整建置,價格落在美元六位數區間的較低端(low six figures)。為400B級層級配置的多節點方案又會再上一個台階。每提升一個層級,設備投資都會躍升至明顯更高的價位區間——這正是30天PoC存在的部分原因:在為任何層級定價之前,先確定您的工作負載實際需要哪個層級。
記憶體是僅次於GPU本身的第二大成本項目——圍繞768GB VRAM建置的系統通常需要超過1TB的系統記憶體來支援,這也是記憶體價格幾乎與GPU價格同步上漲的原因之一。若需針對您實際採購地區與配置的目前設備報價,請與我們聯繫,而非依賴可能已經過時的數字。
我們事先坦誠說明的事項
電力、散熱、UPS、備用電源、監控和降噪需求因建築物而異,差異極大,因此我們不會在提案中將其列為固定金額——這些費用會在現場勘查後個別報價。
作為一般參考:氣冷通常可支援每機櫃約20kW以內的負載;超過這個水準,通常就需要液冷或設施層面的改造。即便是紙面上看似微小的變更——例如增加配電容量——在部分場地也曾產生實際且不容小覷的成本。相較於給出無法兌現的數字,我們更願意坦誠告知:存在這樣一項設施預算,且需要現場勘查。
您的資料實際流向何處
「私有」描述的是推論運行的位置,而非您的網絡架構。在地端部署或代管部署中,提示詞和生成的回應會在您自有基礎設施內的伺服器上處理——不會傳送到公開的通用AI服務。這是關於運算發生位置的說明。
這並非關於您網絡邊界的聲明。VPN、防火牆、存取控制,以及在網絡層面如何保護該基礎設施的其他一切,都是獨立的設計決策——我們可以就此提供建議,但預設不包含在本服務範圍內。
模型、資料與調校成果的所有權
基礎設施專案會引出與應用程式專案相同的所有權問題,並延伸至LLM平台特有的內容:不僅是周邊程式碼,還包括調校後的模型產物、檢索索引和評估結果。
- 調校與RAG產物歸您所有:建置過程中產生的任何微調權重、提示詞/檢索設定和評估資料集,都會作為交付物移交——不會僅保留在LLL控制的基礎設施上,那樣會使其成為一種依賴,而非資產。
- 無模型鎖定:建置圍繞標準的、兼容OpenAI的推論介面(見下文)設計,因此可以更換底層模型——不同的開放權重模型、不同的GPU供應商、不同的代管安排——而無需重寫您的整合層。
- 無供應商鎖定:同一套標準推論堆疊適用於地端、代管和共享部署。日後從一種部署形態切換到另一種,無需重新架構應用程式與模型的溝通方式。
- 您的資料始終由您掌控:用於評估和RAG的文件與提示詞始終處於您的管控之下——與上文資料在地化的說明一致。
這正是LLL在每個專案中都貫徹的反鎖定原則:與模型無關的設計、標準的推論堆疊,以及一個您隨時可以遷移到其他供應商的建置——而非一個必須依賴LLL持續參與才能運行的方案。
如何選擇合適的部署形態
| 問題 | 指向 |
|---|---|
| 基於稽核、安全政策或會計原因,您是否需要硬件作為自有的資本資產? | 地端部署 |
| 您是否希望獲得該能力,但不承擔設施工作(電力、散熱、UPS、監控)? | 代管服務 |
| 使用量是否較輕、不穩定,或仍處於驗證階段? | 共享基礎設施 |
| 使用量是否重且持續,您的設施能否支撐這個負載? | 在這個規模下,地端部署通常更具優勢 |
以上皆非放諸四海皆準的答案——它們只是起點。針對特定工作負載的正確答案,以及合適的模型規模,正是下文的30天PoC旨在依據您自己的數據、而非經驗法則來確定的。
開始行動
在了解私有LLM是否真正符合您的準確率與延遲標準之前,就投入六位數的設備預算,或簽訂多年期的代管/共享合約,是一項真實的風險——概念驗證的存在,正是為了消除這項風險。
30天私有LLM PoC 在LLL已營運的基礎設施上進行,針對您自己的文件和工作負載(而非通用基準測試)測試準確率和延遲,最後提供一份書面報告:哪種部署形態合適、哪種模型層級合適,以及完整建置的成本估算。若您繼續推進,PoC費用將全額折抵該建置費用。
常見問題
問:我們必須購買硬件才能知道這是否適合我們嗎? 答:不需要。30天PoC在LLL已於內部建置並營運的基礎設施上進行。報告會告訴您——如果決定繼續——應該購買什麼,或租用什麼,或委託我們代管什麼。
問:70B是否始終是正確的模型規模? 答:這是我們的預設建議起點,規模相當於單台機器上全公司通用的ChatGPT等效方案。準確率要求較低的工作負載可運行在32B下限;併發使用量大的工作負載可能需要122B-A10B或400B級MoE層級。PoC報告會給出有理由支撐的具體層級建議,而非預設方案。
問:為了節省硬件成本,我們可以量化到FP8以下嗎? 答:可以,但我們不建議將其作為預設選項。我們的測試顯示,低於FP8會明顯降低日語商業任務的準確率,因此即便可能降低硬件費用,我們的標準配置仍堅持這條底線。
問:建置完成後,我們是否會被鎖定在LLL,或特定的模型/GPU供應商上? 答:不會,這是設計使然。推論層是標準的、兼容OpenAI的介面,因此底層的模型和代管安排都可以變更,而無需重寫您的整合——詳見上文「模型、資料與調校成果的所有權」。
問:本頁價格不包含哪些內容? 答:特定場地的工作——電力、散熱、UPS、備用電源、監控和降噪——因建築物而異,差異過大,無法在未經現場勘查的情況下報價。現場勘查前我們可以分享的參考數字,詳見上文「我們事先坦誠說明的事項」。
相關資源
- 30天私有LLM PoC — 固定價格的啟動方式
- AI驅動開發服務 — 可建置在此基礎設施之上的應用層AI開發
- AI 整合 — 為現有產品新增AI功能
開始對話
想知道私有LLM平台是否適合您的工作負載嗎?
LLL Inc. - 來自馬來西亞的私有LLM基礎設施 地端部署 · 代管 · 共享 — 無鎖定