Lesezeit: 14 minutes

NVIDIA verkauft den DGX Spark als „Desktop-KI-Supercomputer“ für 4 699 $. Ollama bietet seine Cloud-Modelle für 20 $/Monat an. Ein H100 wird bei Vast.ai für 1,38 $/Stunde gemietet. Und die chinesischen Open‑Source‑Modelle — DeepSeek, Qwen, GLM — sind überall verfügbar, kostenlos, ohne dass man eine Karte kaufen muss. Wofür genau dient also dieser Spark? Ich habe die Zahlen durchgerechnet.

klopf

[]

Der Kontext: Ein Markt, der sich gewendet hat

Im Mai 2026 hat sich die KI-Landschaft im Vergleich zur Ankündigung des DGX Spark auf der CES 2025 grundlegend verändert. Drei Kräfte haben zusammengewirkt, um die Rechtfertigung lokaler Hardware zunehmend schwieriger zu machen :

  • Der Preisverfall der GPU-CloudEine H100 wird für zwischen 1,38 $ und 3 $/h vermietet, gegenüber 5–8 $/h vor 18 Monaten.

  • Die Explosion der chinesischen Open-Source-Modelle: DeepSeek-V4, Qwen-3, GLM-5 sind wettbewerbsfähig mit den westlichen Modellen, kostenlos verfügbar

  • Der Aufstieg der Managed-Inference-PlattformenOllama, Groq und Together AI bieten API zu aggressiven Preisen an, mit großzügigen kostenlosen Tarifen.

Der DGX Spark, angekündigt zu $2 999 und dann auf $4 699 erhöht, kommt in eine Welt, die ihn nicht mehr braucht.

Das Optionen-Panel

Hier sind die im Mai 2026 verfügbaren Lösungen zum Ausführen von LLMs, von der leichtesten bis zur schwersten :

Option

Kosten

VRAM / Kapazität

Zugängliche Modelle

Hauptbeschränkung

Ollama kostenlos

$0/Monat

leichte Cloud

Alle öffentlichen Modelle

Eingeschränkte Nutzung, 1 Modell gleichzeitig

Claude Pro

$20/Monat (~$240/Jahr)

N/A (API geschlossen)

Nur Claude 4.x

Einzigartiges Modell, kein Open-Source

Ollama Pro

$20/Monat (~$200/Jahr)

Cloud medium

Alle öffentlichen Modelle

max. 3 gleichzeitige Modelle

Ollama Max

$100/Monat (~$1 200/Jahr)

schwere Wolke

Alle öffentlichen Modelle

10 gleichzeitige Modelle

Cloud-GPU (H100)

$1.38-3/h

80 Go HBM

Alle Modelle, fine-tuning

Stundenabrechnung, Setup erforderlich

DGX Spark

$4 699 (Kauf)

128 Go unifié

Tous modèles <128 Go

Langsam (~10x weniger als ein H100), fest

Mac Studio M3 Ultra

~$5 000+

192 Go unifié

Tous modèles <192 Go

Nicht CUDA, MLX-Ökosystem

Die genannten GPU-Cloud-Preise sind die von Vast.ai und RunPod im Mai 2026 — Spot/On-Demand, nicht reserviert. Die Preise der Hyperscaler (AWS, GCP, Azure) bleiben 2-3x höher.

Was ich ausgeschlossen habe (und warum)

Ich habe die folgenden Optionen absichtlich von diesem Benchmark ausgeschlossen:

  • API von OpenAI / Anthropic / Google: Das Thema hier ist, open-source Modelle auszuführen, die man auswählen, fine-tunen und nicht von einem einzigen Anbieter abhängig sein kann.

  • Huawei Ascend / Atlas : Huawei ne commercialise pas d’équivalent desktop au DGX Spark. La gamme Ascend (910C, 910D) et Atlas (300I Duo, 350) est orientée datacenter — cartes PCIe, serveurs rack — pas des boîtiers compacts prêts à brancher. La puce Ascend 910C embarque 128 Go HBM mais c’est une puce serveur, pas un système autonome. L’Atlas 300I Duo offre 96 Go pour ~$1 400 mais nécessite une machine hôte

Einfache Inferenz: Der Tod der lokalen Hardware

Beginnen wir mit dem häufigsten Anwendungsfall: Chatten mit einem LLM, ein Code‑Review machen, Text generieren. Kein Fine‑Tuning, kein Batch‑Verarbeitung, lediglich interaktive Inferenz.

Die Berechnung

Ein DGX Spark zu $4 699. Wir teilen durch die jährlichen Kosten jedes Abonnements:

Failed to generate image: PlantUML preprocessing failed: [From <input> (line 7) ]

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultTextAlignment center

title Break-even-Punkt — DGX Spark ($4 699) vs Abonnements
rectangle "DGX Spark
$4 699" as spark #FFCDD2
^^^^^
 Syntax Error? (Assumed diagram type: activity)

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultTextAlignment center

title Break-even-Punkt — DGX Spark ($4 699) vs Abonnements
rectangle "DGX Spark
$4 699" as spark #FFCDD2

rectangle "Ollama Pro
$200/Jahr" as opro #C8E6C9
rectangle "Claude Pro
$240 pro Jahr" as cpro #C8E6C9
rectangle "Ollama Max
$1.200 pro Jahr" as omax #FFF9C4
rectangle "Cloud H100
$3/h × 10h/Woche" as cloud #BBDEFB

spark --> opro : 23.5 années ⏳
spark --> cpro : 19.6 années ⏳
spark --> omax : 3.9 années
spark --> cloud : 3.0 années (à 10h/semaine, intermittent)

note bottom of spark
  Sans compter l'électricité (~$150/an)
  Sans compter l'obsolescence hardware
  Sans compter qu'il est 10x plus lent
end note

@enduml

Das Urteil ist brutal. Für die Inferenz:

  • Ollama Pro: Sie müssten23 Jahreum einen DGX Spark abzuschreiben. Der Spark wird seit 20 Jahren obsolet sein.

  • Ollama Max:4 Jahre— vorausgesetzt, man benutzt Spark 24/7, was niemand tut

  • Claude Pro: gleiches Problem,20 Jahrefür ein geschlossenes Einzelmodell

_ Das Versprechen des „Desktop‑KI‑Supercomputers“ stößt auf eine elementare Buchhaltungsrealität: $4.699 / $20 pro Monat = niemals rentabel für den individuellen Gebrauch. _

Selbst bei intensiver Nutzung

Nehmen wir das schlimmste Szenario für die Cloud an: Sie betreiben einen H100 8 Stunden pro Tag, 5 Tage pro Woche, 52 Wochen pro Jahr.

  • 8 × 5 × 52 = 2.080 Stunden/Jahr

  • 2 080 × $2/h (Durchschnittspreis Spot H100) =$4.160 pro Jahr

Der Spark ($4.699) rentiert sich in13 Monate. Ausser dass :

  1. Der H100 ist~10x schnellerdas GB10 von Spark. Sie erledigen in 1 h, was Spark in 10 h erledigt. Bei gleichem Arbeitsvolumen kostet Ihnen der H100 $416/Jahr, nicht $4 160.

  2. Le H100 a 80 Go HBM à 3.35 To/s de bande passante. Le Spark a 128 Go LPDDR5X à 273 Go/s. Pour les gros modèles, la bande passante compte plus que la capacité.

Der Vergleich von 1 h H100 mit 1 h Spark ergibt keinen Sinn. Der H100 erledigt die Arbeit 10× schneller. Der tatsächliche Cloud‑Kostenaufwand für eine gegebene Arbeitslast ist daher etwa 10× geringer als die naive Berechnung basierend auf den Stunden.

Fine-Tuning: Die Cloud ist unschlagbar

Das klassische Argument der Verteidiger des Spark: „Ja, aber beim Fine-Tuning ist es anders.“

Nein, das ist es nicht.

Die reale Kosten eines Fine‑Tune

Ein Feintuning LoRA/QLoRA auf Unsloth eines 7B-Modells :

  • ~2-3h auf einem H100 =$5 bis $9

  • Das Gleiche auf dem Spark =20-30h(10 Mal langsamer), blockiert die Maschine

Mit den $4 699 des Spark, können Sie finanzieren :

  • ~500 bis ~900 Feinabstimmungenin Cloud H100

  • Ou ungefähr 23 Jahrevon Ollama Pro

  • Ou ~4 Jahred’Ollama Max

Und für größere Modelle (70B+):

  • Le Spark avec ses 128 Go peut charger un 70B en Q4 — mais le fine-tune sera extrêmement lent

  • Un H100 avec 80 Go peut fine-tuner un 70B en QLoRA 4-bit en quelques heures

  • Für ein vollständiges Fine‑Tuning braucht man grundsätzlich mehrere GPUs — Spark ist aus dem Rennen.

Die spezialisierten Akteure

Im Jahr 2026 bieten Plattformen wie Unsloth, Modal, Replicate und Together AI serverloses Feintuning an:

  • Keine GPU-Verwaltung

  • Keine Umgebungskonfiguration

  • Zahlung pro Minute

  • integrierte Optimierungen (Flash Attention, automatische Quantisierung)

Comparaison des coûts de fine-tuning

Der einzige wahre Grund: Die Souveränität der Daten

Nachdem die Inferenz, das Fine‑Tuning und das Preis‑leistungs‑Verhältnis eliminiert wurden — was bleibt noch für Spark?

Absolute Vertraulichkeit

Es geht nicht um den Datenschutz: „Ich möchte nicht, dass meine Prompts von einem OpenAI‑Mitarbeiter gelesen werden“. Das ist im Jahr 2026 ein falsches Problem: Ollama, Groq und die meisten seriösen Anbieter haben Richtlinien ohne Logging und ohne Aufbewahrung.

Echte Vertraulichkeit ist:

  • Regulatorischer Luftabstand: Verteidigung, Diplomatie, Gesundheit — Daten können physisch das Gebäude nicht verlassen

  • Kritische proprietäre Daten: Quellcode eines unveröffentlichten Produkts, Geschäftsgeheimnisse, Handelsalgorithmen

  • NetzwerkresilienzDie KI muss weiterlaufen, selbst wenn das Internet ausfällt

Aber seien wir ehrlich: Welcher Prozentsatz der Käufer von DGX Spark ist tatsächlich in diesem Fall? 1 %? Der Rest ist ein „nice to have“, das in eine Ausgabe von 4 699 $ umgewandelt wurde.

Die wahre Berechnung der Vertraulichkeit

Für den individuellen Gebrauch:

  • Ollama Pro($20/Monat) + chinesische Open-Source-Modelle = pragmatische Lösung

  • Wenn ein Prompt bei Ollama austritt, versinkt er in den Millionen täglicher Anfragen. Das ist ein Tropfen im Ozean.

  • Das wahre Risiko besteht nicht im Auslaufen eines Prompts — es ist das Training ohne Einwilligung an Ihren Daten. Und das verbieten ernsthafte Provider vertraglich.

import sys

def main(): data = sys.stdin.read() if data == "": print("", end="") return

tokens = data.split(‘') n = len(tokens) parts = [] for i in range(n): parts.append(tokens[i]) if i < n - 1: parts.append('’)

print(''.join(parts), end="")

if name == 'main': main()

Zusammenfassung: Die Entscheidungsmatrix

Matrice de décision pour choisir sa solution LLM

Kriterium

Ollama kostenlos

Ollama Pro

Cloud GPU H100

DGX Spark

Inferenz

beschränkt

✅ Bequem

✅ Übertreibung

⚠️ Langsam

Feinabstimmung

�❌

❌

�✅ unbesiegbar

⚠️ Möglich aber langsam

Jahreskosten

$0

$200

Variable (~$416-2 080*)

$4 699 im Voraus

Vertraulichkeit

⚠️ Cloud US

�⚠️ Wolke USA

Cloud US (variabel)

✅ Total

Wartung

keine

Keine

einzigartige Einrichtung

Elektrizität, Updates

Obsoleszenz

Keine

keine

Keine

3-5 Jahre

Software-Ökosystem

Alle Modelle offen

Alle Modelle open

Alle Modelle open

CUDA (langsamer)

Urteil

gelegentlich

Empfohlen

Vorteile/Suche

Nur Air-gap

*Variabel gemäß Arbeitsaufwand ; mit H100-Geschwindigkeit ~10x > Spark, die effektiven Kosten für einen gegebenen Workload sind niedrig.

Der Sonderfall: Das Pro-Abonnement gegenüber den chinesischen Modellen

Ein Punkt ist hervorzuheben: die KombinationOllama Pro zu $20/Monat + chinesische Open-Source-ModelleEs ist wahrscheinlich das beste Preis‑Leistungs‑Verhältnis in der Geschichte der KI für den Massenmarkt.

Warum ändern chinesische Modelle alles

  • DeepSeek-V4-Pro: 1.6T Parameter, CSA+HCA, 1M Kontext, wettbewerbsfähig mit Claude 4 und GPT-5 für Code

  • Qwen-3: 235B, 256K Kontext, ausgezeichnet auf Französisch und im Denken

  • GLM-5.1: 744B, MLA+DSA, 200K Kontext, maßgeschneidert für Agentik

Alle verfügbar bei Ollama. Alle Open‑Source (permissive Lizenzen). Alle ohne Einschränkung nutzbar über ein Abonnement von 20 $/Monat.

Mit Ollama Pro hast du Zugriff auf etwa fünf « frontier » Open-Source-Modelle zum Preis eines einzigen geschlossenen Modells (Claude Pro). Der Wert ist so asymmetrisch, dass es fast absurd wird.

Was das für die Hardware bedeutet

Wenn das beste Preis-Leistungs-Verhältnis ein Cloud-Abonnement zu $20 pro Monat ist, wird die lokale Hardware zu einer Frage des Komforts oder des Prinzips — nicht einer wirtschaftlichen Entscheidung.

Ein DGX Spark zu $4 699 ist das Äquivalent von:

  • 235 Monate Ollama Pro

  • Veröffentlichungsdatum für 23 AAA‑Spiele

  • 4 MacBook Air M4

  • Ein Jahr Miete einer Zweizimmerwohnung in Lyon

Für die Berechnung. Langsam.

Und Huawei?

Da die Frage mir während meiner Recherche gestellt wurde: Nein, Huawei vertreibt kein Äquivalent zum DGX Spark.

Was existiert :

  • Ascend 910C : 128 Go HBM, 800 TFLOPS FP16 — mais c’est une puce serveur, pas un desktop

  • Atlas 300I Duo : 96 Go LPDDR4X, carte PCIe à ~$1 400 — nécessite un hôte

  • Atlas 350 : 112 Go HBM, 1.56 PFLOPS FP4 — accélérateur datacenter, pas un boîtier compact

Huawei reste focalisé sur le marché des serveurs et des centres de données. Pour un boîtier compact « prêt à brancher » avec 120+ Go de VRAM, le DGX Spark (128 Go unifié) et le Mac Studio M3 Ultra (192 Go unifié) sont les seules options en 2026. Et pour l’instant, aucun constructeur chinois n’a annoncé de produit équivalent dans ce format.

Fazit: Der Luxus der Nähe

Das DGX Spark ist kein schlechtes Produkt. Es ist eine schlechte Investition für 99% der potenziellen Käufer.

Failed to generate image: PlantUML preprocessing failed: [From <input> (line 10) ]

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultTextAlignment center

title Die KI-Landschaft 2026 — Wer dominiert?
left to right direction

package "Privater Gebrauch / KMU" #C8E6C9 {
  rectangle "🏆 Ollama Pro\n$20/Monat" as pro
  rectangle "Ollama Free
^^^^^
 Syntax Error? (Assumed diagram type: component)

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultTextAlignment center

title Die KI-Landschaft 2026 — Wer dominiert?
left to right direction

package "Privater Gebrauch / KMU" #C8E6C9 {
  rectangle "🏆 Ollama Pro\n$20/Monat" as pro
  rectangle "Ollama Free
$0/Monat" as free
  rectangle "Cloud GPU-Spot
$1-3/h" as spot
}

package "Intensive Nutzung / Pro" #FFF9C4 {
  rectangle "�🏆 Ollama Max
$100/Monat" as max
  rectangle "Dedizierte Cloud-GPU
$2-4/h" as dedicated
  rectangle "Modal / Together AI
Serverless" as serverless
}

package "obligatorischer Luftspalt" #FFCDD2 {
  rectangle "DGX Spark
$4 699" as spark
  rectangle "Mac Studio M3U
~$5 000" as mac
}

note bottom of spark
  1% des cas d'usage — défense,
  santé réglementée, secrets
  industriels critiques
end note

@enduml

__ Ein DGX Spark aus 2026 zu kaufen, ist wie ein Mailserver aus 2010 zu kaufen: technisch möglich, philosophisch befriedigend, wirtschaftlich absurd für eine Person. (Empty)

Die Rechnung ist einfach, und sie lügt nicht:

  • $0um mit DeepSeek auf Ollama Free zu chatten

  • $200/Jahrum ernsthaft mit Ollama Pro zu arbeiten

  • $5-9für ein einmaliges Fine-Tuning auf Cloud-GPU

  • $4.699für…​ das Erlebnis, ein NVIDIA-Gehäuse auf seinem Schreibtisch zu haben ?

Der Markt hat entschieden. Cloud-Abonnements und chinesische Open-Source-Modelle haben die Preisschlacht gewonnen. Lokale Hardware überlebt nur in regulatorischen Nischen, nicht in den Büros der Entwickler.

_ Der DGX Spark ist kein kosteneffizientes Werkzeug. Es ist ein Statement. « Ich möchte meine KI zu Hause haben, nicht in der Cloud eines anderen. » Das ist respektabel. Aber 2026, wenn Ollama dir DeepSeek-V4-Pro in der Cloud für $20/Monat gibt, ist das vor allem ein Statement, das sehr teuer ist. _


Dieser Artikel stammt aus einem Gespräch mit meinem KI-Agenten über die wirtschaftliche Relevanz des DGX Spark, abgeglichen mit einer Marktbeobachtung zu den Cloud-GPU-Preisen (Vast.ai, RunPod), den Preismodellen von Ollama/Claude und dem Ökosystem chinesischer Open-Source-Modelle. Die genannten Preise stammen aus Mai 2026 – sie werden wahrscheinlich noch weiter gefallen sein, wenn Sie diese Zeilen lesen.

Verwandte Artikel