LLL Inc. - Infrastruktur LLM Peribadi
Mengapa Platform LLM Peribadi
Kebanyakan penggunaan AI hari ini berjalan melalui API awam: gesaan meninggalkan rangkaian anda, pergi ke pelayan pembekal, dan respons kembali. Itu adalah pertukaran yang tepat untuk banyak kerja. Ia berhenti menjadi pertukaran yang tepat sebaik sahaja bahan yang dimasukkan ke dalam gesaan adalah sesuatu yang anda lebih suka simpan dalam infrastruktur anda sendiri — dokumen dalaman, data pelanggan, kod sumber, apa sahaja di bawah obligasi kerahsiaan yang tidak boleh anda serahkan kepada pihak ketiga.
Platform LLM peribadi adalah alternatifnya: model bahasa besar yang berjalan pada perkakasan yang anda kawal, atau yang dioperasikan oleh LLL bagi pihak anda, dan bukannya perkhidmatan awam yang dikongsi.
LLL membina dan mengoperasikan infrastruktur LLM peribadi sebagai sebahagian daripada persekitaran dalaman kami sendiri — persekitaran yang sama yang kami gunakan untuk mendemonstrasikan platform ini kepada bakal pelanggan sebelum mereka komited kepada pembinaan mereka sendiri. Ini adalah lanjutan infrastruktur yang sudah kami operasikan, bukan bidang amalan baharu yang baru kami huraikan di atas kertas buat kali pertama.
Tiga Cara untuk Menjalankannya
Tiada satu bentuk penggunaan yang “betul”. Setiap satu daripada tiga bentuk mempunyai tahap penggunaan di mana ia adalah pilihan paling murah — tiada satu pun yang menang pada setiap skala.
| Bentuk | Maksudnya |
|---|---|
| Sendiri-hos (di premis anda) | Perkakasan GPU dipasang di bangunan anda sendiri. Peralatan adalah aset modal anda sejak hari pertama. |
| Hosting Terurus | LLL menempatkan dan mengoperasikan perkakasan bagi pihak anda — kuasa, penyejukan, UPS, sambungan, dan pemantauan termasuk dalam yuran bulanan. |
| Infrastruktur Kongsi | Tiada pembelian perkakasan sama sekali. Anda menyewa kapasiti GPU/VRAM, diukur mengikut unit, pada infrastruktur yang telah dioperasikan LLL. |
Sendiri-hos cenderung menjadi paling murah pada penggunaan yang berterusan, berat, dan boleh diramal, dengan syarat bangunan anda dapat menampung beban elektrik dan penyejukan (lihat “Realiti Pasaran Peralatan”, di bawah). Hosting terurus menghapuskan beban kemudahan tanpa menghapuskan pemilikan perkakasan. Infrastruktur kongsi menghapuskan kedua-duanya, dengan kos membayar kadar setiap unit dan bukannya memiliki kapasiti asas. Yang mana satu daripada ketiga-tiga ini benar-benar berbaloi untuk beban kerja tertentu adalah persoalan yang direka khas untuk dijawab oleh PoC 30 hari — bukan sesuatu yang kami syorkan secara lalai sebelum melihat angka anda.
Apa yang Disertakan dalam Pembinaan Penuh
Pembinaan penuh untuk satu kes penggunaan disusun berdasarkan empat elemen:
- Pembinaan persekitaran: menyediakan dan mengkonfigurasi tindanan inferens pada bentuk penggunaan yang dipilih
- RAG (Retrieval-Augmented Generation): menyambungkan model kepada dokumen dan pangkalan pengetahuan anda sendiri, supaya jawapan berasaskan bahan anda dan bukannya latihan umum model
- Integrasi dengan sistem sedia ada: menyambungkan platform kepada alat yang sudah digunakan pasukan anda, dan bukannya menghantar tetingkap sembang berasingan yang tiada sesiapa buka
- Latihan: membantu pasukan anda memahami cara menggunakan, dan jika berkaitan, mengoperasikan platform
Konfigurasi Model yang Disyorkan
Angka berat di bawah adalah FP8 — lihat nota kuantisasi di bawah jadual.
| Kelas | Format | Berat (FP8) | Kedudukan |
|---|---|---|---|
| Kelas 32B | Dense | ~32GB | Tahap minimum praktikal untuk penggunaan perniagaan |
| Kelas 70B | Dense | ~70GB | Lalai dan disyorkan — satu mesin, disesuaikan untuk menyamai ChatGPT setara seluruh syarikat |
| 122B-A10B | MoE (10B aktif) | ~125GB | Untuk penggunaan serentak yang lebih tinggi |
| Kelas 400B | MoE (17B aktif) | ~400GB | Tahap tertinggi yang kami gunakan pada masa ini |
| 35B-A3B | MoE (3B aktif) | ~35GB | Peranan triaj/pengawal sahaja — bukan disesuaikan atau diposisikan sebagai model menjawab |
Tahap minimum kuantisasi: FP8. Konfigurasi standard kami tidak turun bawah FP8 (contohnya, kuantisasi 4-bit/INT4). Dalam ujian kami, kuantisasi lebih lanjut menjejaskan ketepatan secara signifikan pada tugasan perniagaan bahasa Jepun, jadi ia bukan sesuatu yang kami hantar sebagai cadangan lalai walaupun ia mungkin menawarkan penjimatan kos di atas kertas.
Pelaburan
Harga di bawah adalah dalam USD dan mencerminkan apa yang kami sebut harga terus kepada pelanggan — bukan angka kos dalaman.
| Penglibatan | Harga | Nota |
|---|---|---|
| PoC 30 hari | $6,000 ($3,000 untuk pasukan 50 orang atau kurang) | Mengesahkan kebolehlaksanaan terhadap beban kerja anda sendiri sebelum sebarang komitmen perkakasan. Dikreditkan sepenuhnya ke arah pembinaan penuh jika anda teruskan — lihat PoC LLM Peribadi 30 Hari |
| Pembinaan penuh (satu kes penggunaan) | $8,000–$22,000, bergantung skala | Pembinaan persekitaran, RAG, integrasi dengan sistem sedia ada, dan latihan (lihat di atas) |
| Penyelenggaraan & operasi berterusan | $300–$1,300/bulan | Bertingkat mengikut bilangan GPU |
| Hosting terurus | $300–$1,600/bulan | Bertingkat mengikut penggunaan kuasa. Kuasa, penyejukan, UPS, sambungan, dan pemantauan termasuk |
| Infrastruktur kongsi | Dari $300/bulan setiap unit VRAM 24GB | Tiada pembelian perkakasan |
Realiti Pasaran Peralatan
Harga GPU dan memori pelayan telah meningkat dengan mendadak, dan berdasarkan isyarat pasaran semasa, kedua-duanya dijangka kekal ketat sehingga 2027 — didorong oleh permintaan berkaitan AI dan bukannya kekurangan sementara. Kami tidak menerbitkan harga peralatan tetap pada halaman ini: harga perkakasan bergerak cukup pantas pada masa ini sehingga angka khusus yang diterbitkan hari ini mungkin sudah lapuk pada masa anda membacanya, dan ia akan berbeza mengikut wilayah dan saluran perolehan dalam apa jua keadaan.
Sebagai gambaran kasar skala: persediaan satu GPU atau beberapa GPU — cukup untuk menjalankan model tahap minimum 32B yang dinyatakan di atas — berada pada magnitud yang jauh berbeza berbanding pembinaan penuh 8-GPU yang disesuaikan untuk lalai kelas 70B, yang berada pada angka enam digit rendah, dalam USD, sebagai pembinaan lengkap. Konfigurasi berbilang nod yang disesuaikan untuk tahap kelas 400B adalah satu lagi lonjakan ke atas. Setiap tahap menggerakkan pelaburan peralatan ke kategori yang jauh lebih tinggi, dan ini sebahagian daripada sebab PoC 30 Hari wujud: untuk menentukan tahap yang sebenarnya diperlukan oleh beban kerja anda sebelum menetapkan harga mana-mana daripadanya.
Memori adalah item kos terbesar kedua selepas GPU itu sendiri — sistem yang dibina di sekitar 768GB VRAM biasanya memerlukan lebih daripada 1TB memori sistem untuk menyokongnya, dan ini sebahagian daripada sebab harga memori telah bergerak hampir sepantas harga GPU. Untuk harga peralatan semasa terhadap wilayah dan konfigurasi perolehan sebenar anda, hubungi kami dan bukannya bergantung pada angka yang mungkin sudah lapuk.
Apa yang Kami Jujur Sampaikan Terlebih Dahulu
Kuasa, penyejukan, UPS, kuasa sandaran, pemantauan, dan kawalan bunyi berbeza secara meluas antara satu bangunan dengan yang lain, jadi kami tidak menyebut harga tetap untuknya dalam cadangan — ia diberi harga selepas lawatan tapak, secara individu.
Sebagai titik rujukan umum: penyejukan udara boleh berfungsi sehingga kira-kira 20kW setiap rak; melebihi itu, penyejukan cecair atau perubahan kemudahan biasanya menjadi perlu. Malah perubahan yang kelihatan kecil di atas kertas — contohnya, menambah kapasiti pengagihan elektrik — telah menyebabkan kos sebenar yang tidak remeh di sesetengah tapak. Kami lebih suka memberitahu anda bahawa item belanjawan kemudahan wujud dan memerlukan lawatan tapak daripada memberikan anda angka yang tidak dapat kami pertahankan.
Ke Mana Data Anda Sebenarnya Pergi
“Peribadi” menerangkan lokasi inferens dijalankan, bukan seni bina rangkaian anda. Dengan penggunaan sendiri-hos atau terurus, gesaan dan respons yang dijana diproses pada pelayan dalam infrastruktur anda sendiri — ia tidak dihantar ke perkhidmatan AI awam untuk tujuan umum. Itu adalah kenyataan tentang di mana pengiraan berlaku.
Ia bukan tuntutan tentang perimeter rangkaian anda. VPN, tembok api, kawalan akses, dan segala-galanya tentang bagaimana infrastruktur itu diamankan pada lapisan rangkaian adalah keputusan reka bentuk berasingan, yang boleh kami nasihatkan tetapi tidak digabungkan ke dalam perkhidmatan ini secara lalai.
Pemilikan Model, Data, dan Hasil Penalaan
Projek infrastruktur menimbulkan persoalan pemilikan yang sama seperti projek aplikasi, diperluaskan kepada apa yang khusus untuk platform LLM: bukan sahaja kod sekeliling, tetapi juga artifak model yang ditala, indeks capaian semula, dan hasil penilaian.
- Artifak penalaan dan RAG adalah milik anda: sebarang berat yang ditala halus, konfigurasi gesaan/capaian semula, dan set data penilaian yang dihasilkan semasa pembinaan diserahkan sebagai hasil kerja — tidak disimpan hanya pada infrastruktur yang dikawal oleh LLL sahaja, yang akan menjadikannya kebergantungan dan bukannya aset.
- Tiada kunci model: pembinaan direka berasaskan antara muka inferens standard yang serasi OpenAI (lihat di bawah), jadi model asas boleh ditukar ganti — model berat terbuka yang lain, pembekal GPU yang lain, susunan hosting yang lain — tanpa menulis semula lapisan integrasi anda.
- Tiada kunci pembekal: tindanan inferens standard yang sama digunakan merentasi penggunaan sendiri-hos, terurus, dan kongsi. Beralih daripada satu bentuk penggunaan kepada yang lain kemudiannya tidak memerlukan seni bina semula cara aplikasi anda berkomunikasi dengan model.
- Data anda kekal dikawal oleh anda: dokumen dan gesaan yang digunakan untuk penilaian dan RAG kekal di bawah kawalan anda sepanjang masa — selaras dengan nota lokaliti data di atas.
Ini adalah prinsip anti-kunci yang sama yang LLL gunakan pada setiap penglibatan: reka bentuk tidak bergantung model, tindanan inferens standard, dan pembinaan yang boleh anda pindahkan kepada pembekal lain jika anda memilih, bukannya yang bergantung pada penglibatan berterusan LLL untuk terus berjalan.
Memilih Bentuk Penggunaan yang Betul
| Soalan | Menunjuk kepada |
|---|---|
| Adakah anda memerlukan perkakasan sebagai aset modal yang anda miliki — untuk audit, dasar keselamatan, atau sebab perakaunan? | Sendiri-hos |
| Adakah anda mahukan keupayaan tanpa mengambil kerja kemudahan (kuasa, penyejukan, UPS, pemantauan)? | Hosting terurus |
| Adakah penggunaan ringan, tidak boleh diramal, atau masih dibuktikan? | Infrastruktur kongsi |
| Adakah penggunaan berat dan berterusan, dan bolehkah kemudahan anda menampung beban itu? | Sendiri-hos sering menang pada skala itu |
Tiada satu pun daripada ini adalah jawapan universal — ia adalah titik permulaan. Jawapan yang betul untuk beban kerja tertentu, bersama dengan saiz model yang betul, adalah apa yang direka khas oleh PoC 30 hari di bawah untuk ditentukan dengan angka anda sendiri dan bukannya peraturan am.
Bermula
Melakukan komitmen belanjawan peralatan enam digit, atau kontrak terurus atau kongsi berbilang tahun, sebelum mengetahui sama ada LLM peribadi benar-benar memenuhi tahap ketepatan dan kependaman anda adalah risiko sebenar — risiko yang wujud khas untuk dihapuskan oleh bukti konsep.
PoC LLM Peribadi 30 Hari berjalan pada infrastruktur yang telah dioperasikan LLL, menguji ketepatan dan kependaman terhadap dokumen dan beban kerja anda sendiri (bukan penanda aras generik), dan berakhir dengan laporan bertulis: bentuk penggunaan mana yang sesuai, tahap model mana yang sesuai, dan anggaran kos untuk pembinaan penuh. Jika anda teruskan, yuran PoC dikreditkan sepenuhnya ke arah pembinaan itu.
Soalan Lazim
S: Adakah kami perlu membeli perkakasan untuk mengetahui sama ada ini sesuai untuk kami? J: Tidak. PoC 30 hari berjalan pada infrastruktur yang telah dibina dan dioperasikan LLL secara dalaman. Laporan yang dihasilkan memberitahu anda apa yang perlu dibeli — atau disewa, atau diserahkan kepada kami untuk hosting — jika anda memutuskan untuk meneruskan.
S: Adakah 70B sentiasa saiz model yang betul? J: Ia adalah titik permulaan lalai dan disyorkan kami, disesuaikan untuk menyamai ChatGPT setara seluruh syarikat pada satu mesin. Beban kerja dengan keperluan ketepatan yang lebih rendah boleh berjalan pada tahap minimum 32B; beban kerja dengan penggunaan serentak yang berat mungkin memerlukan tahap MoE 122B-A10B atau kelas 400B. Laporan PoC mengesyorkan tahap tertentu dengan sebab, bukan lalai.
S: Bolehkah kami mengkuantisasi bawah FP8 untuk menjimatkan perkakasan? J: Anda boleh, tetapi kami tidak mengesyorkannya sebagai lalai. Ujian kami menunjukkan penurunan ketepatan yang signifikan pada tugasan perniagaan bahasa Jepun di bawah FP8, jadi konfigurasi standard kami mengekalkan garisan itu walaupun ia akan menurunkan bil perkakasan.
S: Adakah kami terkunci kepada LLL, atau kepada model atau pembekal GPU tertentu, sebaik sahaja ini dibina? J: Tidak, secara reka bentuk. Lapisan inferens adalah antara muka standard yang serasi OpenAI, jadi model dan susunan hosting di bawahnya boleh berubah tanpa menulis semula integrasi anda — lihat Pemilikan Model, Data, dan Hasil Penalaan, di atas.
S: Apa yang tidak termasuk dalam harga pada halaman ini? J: Kerja khusus kemudahan — kuasa, penyejukan, UPS, sandaran, pemantauan, dan kawalan bunyi — yang berbeza terlalu banyak mengikut bangunan untuk diberi harga tanpa lawatan tapak. Lihat “Apa yang Kami Jujur Sampaikan Terlebih Dahulu”, di atas, untuk angka rujukan yang boleh kami kongsikan sebelum lawatan itu.
Sumber Berkaitan
- PoC LLM Peribadi 30 Hari — cara bermula dengan harga tetap
- Perkhidmatan Pembangunan Berkuasa AI — kerja AI lapisan aplikasi yang boleh diletakkan di atas infrastruktur ini
- Integrasi AI — menambah ciri AI kepada produk sedia ada
Mulakan Perbualan
Bersedia untuk mengetahui sama ada platform LLM peribadi sesuai dengan beban kerja anda?
LLL Inc. - Infrastruktur LLM Peribadi dari Malaysia Sendiri-hos • Terurus • Kongsi — Tiada Kunci