DGX Spark vs Cloud vs Langganan LLM — Benchmark Ekonomi yang Membunuh Mimpi Perangkat Keras Lokal
Diterbitkan 06 May 2026
- Konteks: Sebuah pasar yang bergeser
- Panel Opsi
- Inferensi Sederhana : Kematian perangkat keras lokal
- Penyetelan Halus : Cloud Tidak Dapat Dikalahkan
- Alasan Satu-satunya yang benar: Kedaulatan Data
- Ringkasan : Matriks Keputusan
- Kasus Khusus: Abonnement Pro Terhadap Model China
- Dan Huawei?
- Kesimpulan : Kelebihan Kedekatan
NVIDIA menjual DGX Spark sebagai "superkomputer AI desktop" seharga $4 699. Ollama menawarkan model cloud-nya seharga $20 per bulan. Seorang H100 disewa seharga $1,38 per jam di Vast.ai. Dan model-model open-source asal China — DeepSeek, Qwen, GLM — tersedia di mana-mana, secara gratis, tanpa harus membeli kartu. Maka, Spark ini, untuk apa sebenarnya? Saya telah melakukan perhitungan.
- tok
-
[]
Konteks: Sebuah pasar yang bergeser
Pada Mei 2026, lanskap AI telah berubah secara drastis dibandingkan dengan pengumuman DGX Spark di CES 2025. Tiga faktor telah konvergen untuk membuat hardware lokal semakin sulit untuk dijustifikasi :
-
Keruntuhan harga cloud GPUSebuah H100 disewa antara $1,38 dan $3 per jam, dibandingkan dengan $5-8 per jam 18 bulan lalu
-
Ledakan model-model open-source CinaDeepSeek-V4, Qwen-3, GLM-5 adalah kompetitif dengan model-model Barat, tersedia secara gratis
-
Kenaikan platform inferensi terkelola: Ollama, Groq, Together AI menawarkan API dengan tarif agresif, dengan level gratis yang melimpah
DGX Spark, yang diumumkan pada $2 999 lalu naik menjadi $4 699, tiba di dunia yang tidak lagi membutuhkannya.
Panel Opsi
Berikut solusi yang tersedia pada Mei 2026 untuk menjalankan LLMs, dari yang paling ringan hingga yang paling berat:
Pilihan |
Biaya |
VRAM / Kapasitas |
model yang dapat diakses |
Kendala utama |
Ollama Gratis |
$0/bulan |
awan ringan |
Semua model publik |
Penggunaan terbatas, 1 model secara bersamaan |
Claude Pro |
$20/bulan (~$240/tahun) |
N/A (API tertutup) |
Hanya Claude 4.x |
Model unik, bukan open-source |
Ollama Pro |
$20/bulan (~$200/tahun) |
medium awan |
Semua model publik |
3 model simultan max |
Ollama Max |
$100/bulan (~$1 200/tahun) |
awan berat |
Semua model publik |
10 model simultan |
GPU Cloud (H100) |
$1.38-3/h |
80 Go HBM |
Semua model, fine-tuning |
Penagihan per jam, setup diperlukan |
DGX Spark |
$4 699 (pembelian) |
128 Go unifié |
Tous modèles <128 Go |
Lambat (~10x lebih lambat daripada H100), tetap |
Mac Studio M3 Ultra |
~$5 000+ |
192 Go unifié |
Tous modèles <192 Go |
Bukan CUDA, ekosistem MLX |
|
Harga GPU cloud yang dikutip adalah dari Vast.ai dan RunPod pada Mei 2026 — dari spot/on-demand, bukan yang terdaftar (reserved). Harga hyperscaler (AWS, GCP, Azure) tetap 2-3x lebih tinggi. |
Apa Yang Saya Eksklusikan (Dan Mengapa)
Saya sengaja mengecualikan opsi-ops berikut dari benchmark ini :
-
API OpenAI / Anthropic / Google: topik di sini adalah untuk menjalankan model open-source yang dapat dipilih, di-fine-tune, dan tidak bergantung pada vendor tunggal
-
Huawei Ascend / Atlas : Huawei ne commercialise pas d’équivalent desktop au DGX Spark. La gamme Ascend (910C, 910D) et Atlas (300I Duo, 350) est orientée datacenter — cartes PCIe, serveurs rack — pas des boîtiers compacts prêts à brancher. La puce Ascend 910C embarque 128 Go HBM mais c’est une puce serveur, pas un système autonome. L’Atlas 300I Duo offre 96 Go pour ~$1 400 mais nécessite une machine hôte
Inferensi Sederhana : Kematian perangkat keras lokal
Mari kita mulai dengan kasus penggunaan paling umum: ngobrol dengan LLM, melakukan code review, menghasilkan teks. Tidak ada fine-tuning, tidak ada batch processing, hanya inferensi interaktif.
Perhitungan
Suatu DGX Spark berharga $4 699. Bagi dengan biaya tahunan setiap langganan:
@startuml skinparam backgroundColor #FEFEFE skinparam defaultTextAlignment center title Titik impas — DGX Spark ($4 699) vs Langganan rectangle "DGX Spark $4 699" as spark #FFCDD2 rectangle "Ollama Pro $200/tahun" as opro #C8E6C9 rectangle "Claude Pro $240/tahun" as cpro #C8E6C9 rectangle "Ollama Max\n$1 200/tahun" as omax #FFF9C4 rectangle "Cloud H100 $3/jam × 10jam/minggu" as cloud #BBDEFB spark --> opro : 23.5 années ⏳ spark --> cpro : 19.6 années ⏳ spark --> omax : 3.9 années spark --> cloud : 3.0 années (à 10h/semaine, intermittent) note bottom of spark Sans compter l'électricité (~$150/an) Sans compter l'obsolescence hardware Sans compter qu'il est 10x plus lent end note @enduml
Putusan ini mengerikan. Untuk inferensi:
-
Ollama ProAnda sebaiknya23 tahunUntuk mengamortisasikan DGX Spark. Spark akan menjadi usang selama 20 tahun.
-
Ollama Max:4 tahun— asalkan menggunakan Spark 24/7, yang tidak dilakukan oleh siapa pun
-
Claude Pro: masalah yang sama,20 tahununtuk single-model tertutup
_ Janjian 'superkomputer AI desktop' bertemu dengan realitas akuntansi dasar: $4 699 / $20 per bulan = tidak pernah menguntungkan untuk penggunaan individu. _
Meski dengan penggunaan intensif
Mari kita ambil skenario terburuk untuk cloud: Anda menjalankan H100 selama 8 jam per hari, 5 hari per minggu, 52 minggu per tahun.
-
8 × 5 × 52 = 2 080 jam/tahun
-
2 080 × $2/h (harga rata-rata spot H100) =$4 160/tahun
Spark ($4 699) menguntungkan dalam13 bulan. kecuali bahwa :
-
H100 adalah~10x lebih cepatque GB10 Spark. Anda melakukan dalam 1 jam apa yang Spark lakukan dalam 10 jam. Untuk volume kerja yang sama, H100 membiayai Anda $416/tahun, bukan $4 160.
-
Le H100 a 80 Go HBM à 3.35 To/s de bande passante. Le Spark a 128 Go LPDDR5X à 273 Go/s. Pour les gros modèles, la bande passante compte plus que la capacité.
|
Membandingkan 1 jam H100 dengan 1 jam Spark tidak bermakna. H100 menyelesaikan pekerjaan 10x lebih cepat. Sehingga biaya cloud sebenarnya untuk workload tertentu sekitar 10x lebih rendah dibanding perhitungan naif yang didasarkan pada jam. |
Penyetelan Halus : Cloud Tidak Dapat Dikalahkan
Argumen klasik para pendukung Spark : « ya tetapi untuk fine-tuning, ini berbeda ».
Tidak, itu tidak.
biaya nyata dari sebuah fine-tune
Penyesuaian halus LoRA/QLoRA di Unsloth untuk model 7B :
-
~2-3h pada H100 =$5 hingga $9
-
Hal yang sama pada Spark =20-30 jam(10x lebih lambat), memblokir mesin
Dengan $4 699 Spark, Anda dapat membiayai :
-
~500 hingga ~900 fine-tunesdalam cloud H100
-
Ou ~23 tahund’Ollama Pro
-
Ou sekitar 4 tahund’Ollama Max
Dan untuk model yang lebih besar (70B+):
-
Le Spark avec ses 128 Go peut charger un 70B en Q4 — mais le fine-tune sera extrêmement lent
-
Un H100 avec 80 Go peut fine-tuner un 70B en QLoRA 4-bit en quelques heures
-
Untuk fine-tuning penuh, diperlukan multi-GPU tentu saja — Spark tidak lagi dalam kompetisi.
Aktor spesialis
Pada tahun 2026, platform seperti Unsloth, Modal, Replicate, dan Together AI menawarkan fine-tuning serverless :
-
Tidak ada manajemen GPU
-
Tidak ada konfigurasi lingkungan
-
Pembayaran per menit
-
Optimasi terintegrasi (perhatian flash, kuantisasi otomatis)
@startuml skinparam backgroundColor #FEFEFE skinparam defaultTextAlignment center title <size:20>Biaya dari Fine-Tune LoRA 7B — Perbandingan</size> note as N |= Option |= Coût par fine-tune |= Fine-tunes possibles avec $4 699 | | **Replicate** | $3-5 | ~1 000 | | **Modal (serverless)** | $2-4 | ~1 500 | | **Unsloth + Vast.ai H100** | $5-9 | ~500-900 | | **Together AI** | $4-8 | ~600-1 000 | | **DGX Spark** | « gratuit » mais 20-30h | ∞ (en théorie) | end note note bottom Le Spark est « gratuit » par fine-tune seulement si votre temps vaut $0/h et que vous n'avez pas besoin de la machine pour autre chose pendant 30h end note @enduml
Alasan Satu-satunya yang benar: Kedaulatan Data
Setelah menghilangkan inferensi, fine-tuning, dan rasio kualitas/harga — apa yang tersisa untuk Spark ?
Kerahasiaan mutlak
Bukan privasi « saya tidak ingin prompt saya dibaca oleh karyawan OpenAI ». Itu, ini adalah masalah palsu pada tahun 2026: Ollama, Groq, dan sebagian besar penyedia yang terhormat memiliki kebijakan zero log dan zero retention.
Kerahasiaan yang sebenarnya, itulah :
-
Air-gap regulatif: pertahanan, diplomasi, kesehatan — data tidak dapat secara fisika keluar dari bangunan
-
data hak milik kritis: kode sumber dari produk yang tidak dipublikasikan, rahasia industri, algoritma perdagangan
-
Ketahanan jaringan: AI harus terus beroperasi meski internet jatuh
|
Tapi jujur saja: berapa persentase pembeli DGX Spark yang benar-benar berada dalam hal ini? 1%? Sisa itu adalah hal yang « nice to have » yang diubah menjadi pengeluaran sebesar $4 699. |
Perhitungan Sejati Kekerasiaan
Untuk penggunaan individu :
-
Ollama Pro($20/bulan) + model sumber terbuka Cina = solusi pragmatis
-
Jika sebuah prompt bocor di Ollama, ia tenggelam dalam jutaan permintaan harian. Ini adalah tetesan air di laut.
-
Risiko nyata bukanlah bocornya sebuah prompt — ini adalah pelatihan tanpa persetujuan pada data Anda. Dan itu, penyedia yang serius melarangnya secara kontrak.
_ Ketakutan akan « mengdistil promptnya dalam LLM » adalah tingkat penyebaran informasi pribadi yang sangat encer sehingga lebih merupakan kecemasan daripada ancaman nyata. Dalam skala industri, ini berbeda. Tapi dalam skala individu, ini hanya kebisingan. _
Ringkasan : Matriks Keputusan
@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultTextAlignment center
title Solusi AI mana yang harus dipilih pada tahun 2026 ?
start
:Quel est votre besoin principal ?;
switch (Besoin)
case (Inférence interactive occasionnelle)
:**Ollama Free**\n$0/mois, tous modèles open-source;
stop
case (Inférence quotidienne, code review, dev)
:**Ollama Pro** ($20/mois)\nAccès à tous les modèles open-source\nDeepSeek, Qwen, GLM, Llama, Mistral;
stop
case (Agents IA, multi-modèles, usage intensif)
:Contexte > 30K tokens ?;
if (Oui) then
:**Ollama Max** ($100/mois)\n10 modèles simultanés\nContexte long sans dégradation;
stop
else (Non)
:**Cloud GPU H100 spot** ($1.38–3/h)\n+ Unsloth/Modal pour fine-tuning\nPerformance brute maximale;
stop
endif
case (Fine-tuning régulier)
:**Vast.ai H100 + Unsloth** ($5–9/fine-tune)\nou **Together AI / Modal** (serverless)\n500+ fine-tunes pour le prix d’un Spark;
stop
case (Air-gap obligatoire)
:Données classifiées ?;
if (Oui) then
:**DGX Spark** ou **Mac Studio M3 Ultra**\nSeul cas où le hardware local est justifié\n(pas économiquement — politiquement);
stop
else (Non)
:Retour au cloud : pas de besoin d’air-gap;
stop
endif
endswitch
@enduml
kriteria |
Ollama Gratis |
Ollama Pro |
Cloud GPU H100 |
DGX Spark |
Inferensi |
✅ terbatas |
✅ Nyaman |
✅ kelebihan |
⚠️ Lambat |
penyesuaian halus |
❌ |
❌ |
tidak terkalahkan |
⚠️ Mungkin namun lambat |
Biaya tahunan |
$0 |
$200 |
Variabel (~$416-2 080*) |
$4 699 muka |
kerahasiaan |
⚠️ Cloud US |
⚠️ Awan AS |
⚠️ Cloud AS (variabel) |
✅ Total |
Pemeliharaan |
Tidak ada |
Tidak ada |
Pengaturan unik |
Listrik, pembaruan |
keterusangan |
tidak ada |
tidak ada |
tidak ada |
3-5 tahun |
ekosistem perangkat lunak |
Semua model terbuka |
Semua model terbuka |
Semua model terbuka |
CUDA (lebih lambat) |
Veridict |
sesekali |
disarankan |
Pros/pencarian |
Hanya air-gap |
*Variabel tergantung volume pekerjaan; dengan kecepatan H100 ~10x > Spark, biaya efektif untuk workload tertentu rendah.
Kasus Khusus: Abonnement Pro Terhadap Model China
Satu poin layak disoroti : kombinasiOllama Pro sewa $20/bulan + model Cina open-sourcepaling mungkin itu adalah nilai terbaik untuk uang dalam sejarah AI untuk konsumen.
mengapa model cina mengubah segalanya
-
DeepSeek-V4-Pro: 1.6T params, CSA+HCA, 1M konteks, kompetitif dengan Claude 4 dan GPT-5 untuk kode
-
Qwen-3: 235B, 256K konteks, sangat baik dalam bahasa Prancis dan penalaran
-
GLM-5.1: 744B, MLA+DSA, 200K konteks, disesain untuk agen
Semua tersedia di Ollama. Semua bersumber terbuka (lisensi permissif). Semua dapat digunakan tanpa batas melalui langganan $20/bulan.
|
Dengan Ollama Pro, Anda memiliki akses ke ~5 model "frontier" open-source dengan harga hanya satu model tertutup (Claude Pro). Nilainya sangat tidak seimbang hingga hampir tidak masuk akal. |
Apa artinya untuk hardware
Jika nilai terbaik (kualitas/harga) berupa langganan cloud seharga $20 per bulan, hardware lokal menjadi pilihan untuk kenyamanan atau prinsip — bukan pilihan ekonomi.
DGX Spark berharga $4.699 adalah setara dengan:
-
235 bulan Ollama Pro
-
23 permainan AAA hari peluncuran
-
4 MacBook Air M4
-
Satu tahun sewa untuk apartemen T2 di Lyon
Untuk perhitungan. Lambat.
Dan Huawei?
Karena pertanyaan itu telah diajukan kepada saya selama penelitian saya: tidak, Huawei tidak menjual setara dengan DGX Spark.
Yang ada :
-
Naik 910C : 128 Go HBM, 800 TFLOPS FP16 — mais c’est une puce serveur, pas un desktop
-
Atlas 300I Duo : 96 Go LPDDR4X, carte PCIe à ~$1 400 — nécessite un hôte
-
Atlas 350 : 112 Go HBM, 1.56 PFLOPS FP4 — accélérateur datacenter, pas un boîtier compact
Huawei reste focalisé sur le marché des serveurs et des centres de données. Pour un boîtier compact « prêt à brancher » avec 120+ Go de VRAM, le DGX Spark (128 Go unifié) et le Mac Studio M3 Ultra (192 Go unifié) sont les seules options en 2026. Et pour l’instant, aucun constructeur chinois n’a annoncé de produit équivalent dans ce format.
Kesimpulan : Kelebihan Kedekatan
DGX Spark bukan produk yang buruk. Ini adalah investasi yang buruk untuk 99% pembeli potensial.
@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultTextAlignment center
title Peta lanskap AI 2026 — Siapa yang mendominasi?
left to right direction
package "Penggunaan Pribadi / UMKM" #C8E6C9 {
rectangle "🏆 Ollama Pro
$20/bulan" as pro
rectangle "Ollama Free\n$0/bulan" as free
rectangle "spot GPU di cloud\n$1-3/h" as spot
}
package "Penggunaan intensif / Pro" #FFF9C4 {
rectangle "🏆 Ollama Max
$100/bulan" as max
rectangle "🏆 GPU Cloud khusus
$2-4/jam" as dedicated
rectangle "Mode / Together AI
Tanpa server" as serverless
}
package "Air-Gap Wajib" #FFCDD2 {
rectangle "DGX Spark
$4 699" as spark
rectangle "Mac Studio M3U
~$5 000" as mac
}
note bottom of spark
1% des cas d'usage — défense,
santé réglementée, secrets
industriels critiques
end note
@enduml
_ Membeli DGX Spark pada tahun 2026 adalah seperti membeli server email pada tahun 2010: secara teknis memungkinkan, secara filosofis memuaskan, secara ekonomis tidak masuk akal untuk individu. _
Perhitungannya sederhana, dan ia tidak berbohong :
-
$0untuk ngobrol dengan DeepSeek di Ollama Free
-
$200/tahununtuk bekerja secara serius dengan Ollama Pro
-
$5-9untuk fine-tune sesekali di GPU cloud
-
$4.699untuk… pengalaman memiliki kasing NVIDIA di meja mereka?
Pasar telah memutuskan. Langganan cloud dan model open-source China telah menang dalam pertarungan harga. Perangkat keras lokal bertahan dalam niche regulasi, bukan di kantor pengembang.
_ DGX Spark bukanlah alat yang menguntungkan. Ini adalah sebuah statement. « Saya ingin AI saya berada di rumah saya, bukan di cloud orang lain. » Ini patut dihargai. Namun pada tahun 2026, ketika Ollama memberi Anda DeepSeek-V4-Pro di cloud untuk $20/bulan, ini terutama sebuah statement yang sangat mahal. _
Artikel ini merupakan hasil percakapan dengan agen AI saya tentang relevansi ekonomi DGX Spark, bersamaan dengan pemantauan pasar mengenai harga cloud GPU (Vast.ai, RunPod), tabel harga Ollama/Claude, serta ekosistem model open-source asal China. Harga yang disebut adalah harga bulan Mei 2026 — kemungkinan besar harga akan terus menurun saat Anda membaca baris-baris ini.