Zum Inhalt springen
Wegenty
Hardware

Kann ein Mini-PC ein 70B-Modell betreiben? Strix Halo, Mac Studio und DGX Spark im Vergleich

Wegenty9 min Lesezeit

Ein 70B-Modell braucht rund 40 GB Speicher. Wir vergleichen die 128-GB-Mini-PCs und Workstations, die ein 70B lokal betreiben — nach Tempo, Software und Preis.

Ja — ein Mini-PC kann ein Modell mit 70 Milliarden Parametern vollständig auf Ihrem eigenen Schreibtisch betreiben, ohne dass etwas das Haus verlässt. Der Haken: Nicht jeder Mini-PC schafft das. Ein 70B-Modell braucht rund 40 GB schnellen Speicher, was praktisch jede Box aus dem Regal ausschließt und Sie auf eine sehr bestimmte, kleine Klasse von Maschinen verweist — jene mit 128 GB Unified Memory. Dieser Beitrag stellt die Kandidaten gegenüber — die AMD-„Strix Halo"-Boxen, den Apple Mac Studio und den NVIDIA DGX Spark — und erklärt, warum sie sich beim selben Modell so unterschiedlich verhalten.

Wenn Sie nur die engere Auswahl mit aktuellen Preisen und Bezugsquellen möchten, springen Sie zur Hardware-Seite. Wenn Sie verstehen wollen, warum eine Box in der halben Zeit einer anderen antwortet, lesen Sie weiter.

Warum ein 70B-Modell rund 40 GB braucht (und warum 128 GB die magische Zahl ist)

Ein Sprachmodell muss in schnellen Speicher passen, um gut zu laufen. Wie viel Speicher es braucht, hängt von zwei Dingen ab: der Anzahl der Parameter und davon, wie stark Sie quantisieren.

  • Ein Modell mit 7–14 Milliarden Parametern auf 4-Bit braucht rund 8–16 GB. Das passt in jede 32-GB-Box — deshalb ist der Einstiegsbereich so zugänglich.
  • Ein Modell mit 70 Milliarden Parametern auf 4-Bit bringt allein an Gewichten rund 40 GB auf die Waage — bevor Sie das Kontextfenster, den KV-Cache und den eigenen Fußabdruck des Betriebssystems hinzurechnen.

Deshalb haben die interessanten Maschinen 128 GB Unified Memory statt 64. Auf diesen Chips teilen sich CPU und GPU einen Speicherpool, von dem bis zu 96 GB von der GPU adressiert werden können. Ein 70B auf 4-Bit landet bequem innerhalb dieses Rahmens, mit Reserve für ein großzügiges Kontextfenster. Unter 128 GB können Sie das Modell entweder gar nicht laden oder lagern es in langsameren Speicher aus und sehen zu, wie die Token-Rate einbricht. Wie man Speicher auf das Modell abstimmt, behandeln wir ausführlicher in welche Hardware Sie brauchen, um ein LLM lokal zu betreiben.

Die Einstiegsfrage — „kann ein Mini-PC ein 70B betreiben?" — wird damit eigentlich zu: „welche 128-GB-Box soll ich kaufen?"

Die Kandidaten: die 70B-fähigen Boxen

Das sind die Maschinen, die ein 70B-Modell in einer einzigen Box laden. Die folgende Spec-Tabelle wird live aus unserem Katalog gespeist, damit die Zahlen aktuell bleiben, wenn sich Preise bewegen.

GerätModelleSpeicherRechenleistungPreis
Minisforum MS-S1 MAX30–70B (clusters higher)128 GB unifiedRyzen AI Max+ 395 · Radeon 8060Sab €2,679
Beelink GTR9 Pro30–70B128 GB unifiedRyzen AI Max+ 395 · Radeon 8060Sca. €4,000
Apple Mac Studio M3 Ultra30–100B+96–256 GB unifiedM3 Ultra · 819 GB/s bandwidthab €4,799
NVIDIA DGX Spark30–70B (infer to ~200B; ~405B linked)128 GB unifiedGB10 Grace Blackwell · full CUDAca. €4,800
RTX 5090 SFF Workstation~30B, very fast32 GB GDDR7 + system RAMGeForce RTX 5090 · CUDA · 1,792 GB/sab €3,999
Framework Desktop30–70B128 GB unifiedRyzen AI Max+ 395 'Strix Halo'ca. €2,400

Sie fallen in drei Lager:

  • AMD-„Strix Halo"-Boxen — der Minisforum MS-S1 MAX, der Beelink GTR9 Pro und der Framework Desktop nutzen alle den Ryzen AI Max+ 395 mit 128 GB Unified Memory bei rund 256 GB/s. Das sind die Preis-Leistungs-Sieger: ein echtes 70B in einer bezahlbaren Box.
  • Apple Silicon — der Apple Mac Studio M3 Ultra betreibt ein 70B (und deutlich größere Modelle) über Metal, mit der höchsten Speicherbandbreite aller Maschinen hier.
  • NVIDIA — der DGX Spark bringt volles CUDA in den Unified-Memory-Formfaktor, während der RTX 5090 SFF ein ganz anderes Tier ist (dazu unten mehr).

Wie schnell läuft ein 70B auf jeder Box? Die Bandbreite entscheidet

Sobald ein Modell passt, regelt eine einzige Zahl, wie schnell es antwortet: die Speicherbandbreite — wie schnell der Chip die Modellgewichte für jeden erzeugten Token streamen kann. Einen Token zu dekodieren bedeutet, das gesamte aktive Modell aus dem Speicher zu lesen; mehr Bandbreite heißt also mehr Token pro Sekunde, fast linear.

BoxSpeicherbandbreiteSoftware
Apple Mac Studio M3 Ultra819 GB/sMetal
NVIDIA DGX Spark273 GB/sCUDA
Strix Halo (MS-S1 MAX / GTR9 Pro / Framework)~256 GB/sROCm / Vulkan
RTX 5090 SFF1.792 GB/s VRAM (nur 32 GB)CUDA

Deshalb dekodiert der Mac Studio M3 Ultra ein 70B am schnellsten unter den Unified-Memory-Boxen — seine 819 GB/s sind mehr als das Dreifache der Bandbreite der Strix-Halo-Maschinen und rund das Dreifache des DGX Spark. Bei einer speichergebundenen Aufgabe wie der Single-Stream-Textgenerierung zeigt sich dieser Vorsprung direkt: Die Wörter erscheinen früher auf dem Bildschirm. Der DGX Spark (273 GB/s) und die Strix-Halo-Boxen (~256 GB/s) liegen untereinander in derselben groben Nachbarschaft und merklich hinter dem Mac.

Die diskreten GPUs spielen in einer eigenen Kategorie: Die 1.792 GB/s VRAM-Bandbreite der RTX 5090 sind enorm — aber nur für das, was in ihre 32 GB passt, und ein 70B passt eben nicht hinein. Mehr zu diesem Vorbehalt unten.

CUDA vs. Metal vs. ROCm: was Sie aufgeben und was Sie gewinnen

Die Bandbreite sagt, wie schnell die Hardware sein kann; der Software-Stack entscheidet, wie leicht Sie dort tatsächlich hinkommen und was Sie sonst noch betreiben können.

  • NVIDIA / CUDA (DGX Spark, die 5090, die Workstation-Karten) ist das breiteste, am besten unterstützte Ökosystem. Wenn eine neue Inferenz-Engine, ein Quantisierungsformat oder ein Serving-Stack erscheint, läuft er zuerst auf CUDA — denken Sie an vLLM und TensorRT-LLM. Genau darin liegt der Reiz des DGX Spark: eine Unified-Memory-Box, die die Lingua franca des Feldes spricht.
  • Apple / Metal (Mac Studio) läuft über MLX, llama.cpp und Ollama. Das Tooling ist ausgezeichnet und reift schnell, und der Mac ist leise und stromsparend — aber es ist kein CUDA, sodass das gelegentliche CUDA-only-Projekt nicht läuft und Sie sich an den Apple-Stack anpassen statt umgekehrt.
  • AMD / ROCm und Vulkan (die Strix-Halo-Boxen) ist der offenste und günstigste Weg zu 128 GB. Für Mainstream-Inferenz funktioniert er heute gut; er ist schlicht weniger erprobt als CUDA an den Rändern, und Sie sollten etwas mehr Einrichtungsaufwand einplanen.

Die vier Silizium-Stacks vergleichen wir ausführlich in AMD vs. Intel vs. Apple vs. NVIDIA für lokale LLMs. Kurzfassung: Wählen Sie CUDA, wenn die Breite des Ökosystems am wichtigsten ist; Metal, wenn rohes Single-User-Tempo und ein leiser Schreibtisch gewinnen; und AMD, wenn Sie am meisten Speicher pro Euro wollen.

Ein Mythos, der ausgedient hat: Die „TOPS"-Zahl auf der Box ist der NPU-Wert, und sie ist Copilot+-Marketing. Lokale LLM-Inferenz läuft auf der integrierten oder diskreten GPU, nicht auf der NPU. Ignorieren Sie die TOPS-Zahl, wenn Sie für ein 70B dimensionieren.

Der RTX-5090-Vorbehalt: brillant für 30B, falsch für 70B

Der RTX 5090 SFF ist verlockend, weil er auf dem Papier die schnellste Box der Liste ist — 1.792 GB/s VRAM-Bandbreite. Der Haken liegt in der Größe dieses VRAM: 32 GB. Ein 70B auf 4-Bit braucht rund 40 GB, passt also schlicht nicht in den Speicher der GPU.

Sie können ein 70B auf einer 5090 dennoch betreiben, indem Sie die überzähligen Schichten in den System-RAM auslagern — aber jeder Token muss dann den deutlich langsameren PCIe-Pfad überqueren, um diese Schichten zu erreichen, und die fulminante VRAM-Bandbreite hilft nicht mehr. In der Praxis ist ein 70B mit Auslagerung auf einer 5090 oft langsamer als dasselbe Modell, das nativ im Unified Memory einer Strix-Halo-Box läuft.

Wo die 5090 wirklich brilliert, sind Modelle der ~30B-Klasse, die in 32 GB passen. Dort ist sie mit großem Abstand die schnellste Option hier. Die 5090 ist also eine fantastische Box — für eine andere Aufgabe. Wenn Ihr Ziel ein 70B in einer Maschine ist, wählen Sie stattdessen eine Box mit 128 GB Unified Memory.

Der Framework-Vorbehalt: eine großartige Referenz-Box, nur im Direktvertrieb

Der Framework Desktop ist dieselbe Strix-Halo-Plattform — 128 GB Unified Memory, ~256 GB/s — in einem offenen, reparierbaren, gut dokumentierten Gehäuse. Wenn Ihnen die Right-to-Repair-Philosophie und ein Referenzdesign wichtig sind, ist er eine ausgezeichnete Wahl. Ein praktischer Hinweis: Er wird ausschließlich direkt verkauft und kann nicht weiterverkauft werden, passt also nicht in einen Beschaffungsweg über Reseller oder Integratoren. Für eine Flotte, die ein Partner bereitstellen und betreuen soll, sind der MS-S1 MAX oder der GTR9 Pro leichter zu beziehen.

Wenn eine Box nicht reicht: Cluster oder eine Workstation

Eine einzelne 128-GB-Box betreibt ein 70B gut für eine oder einige wenige gleichzeitige Nutzerinnen und Nutzer. Zwei Situationen führen darüber hinaus:

  • Viele gleichzeitige Nutzer. Eine einzelne Unified-Memory-Box bedient ein 70B für eine Handvoll Personen; servieren Sie es einer ganzen Abteilung auf einmal, brauchen Sie den höheren Durchsatz einer diskreten GPU-Workstation wie der NVIDIA RTX PRO 6000 Workstation (96 GB ECC-VRAM, gebaut für hohe Nebenläufigkeit). Diese laufen über einen Angebotsweg — siehe Hardware-Seite.
  • Größere Modelle oder mehrere Wissensbasen. Einige dieser Boxen lassen sich clustern: Der MS-S1 MAX ist clustering-ready, und verbundene Maschinen können größere Modelle adressieren, als es jede für sich könnte. Wenn Sie lieber nach oben als in die Breite skalieren, decken die Workstation- und Reseller-Stufen auf der Hardware-Seite 70B-plus und Multi-Tenant-Deployments ab.

Die ehrliche Standardempfehlung lautet jedoch: Starten Sie mit einer Box. Die meisten Teams überschätzen, wie viel Modell sie brauchen; ein gut gesteuertes 70B — oder sogar ein scharfes 14B — auf einer einzigen Maschine überrascht die Leute.

Das Fazit

Für die meisten Unternehmen, die ein 70B in einer Box wollen, ist die Antwort eindeutig:

  • Beste Preis-Leistung als Standard → Minisforum MS-S1 MAX. Ein echtes 70B in 128 GB Unified Memory, clustering-ready, zu einem Preis, den die diskreten GPU-Maschinen nicht erreichen.
  • Schnellste Single-User-Inferenz → Apple Mac Studio M3 Ultra. Seine 819 GB/s Bandbreite machen ihn am schnellsten beim Antworten, und er ist leise — sofern Sie mit dem Metal-Stack leben können.
  • Am besten für das CUDA-Ökosystem → NVIDIA DGX Spark. Eine Unified-Memory-Box, die CUDA spricht, sodass der breiteste Software-Stack griffbereit ist.
  • Sie haben bereits ein ~30B-Ziel → RTX 5090 SFF. Die schnellste Option für Modelle, die in 32 GB passen — nur eben kein 70B.

Live-Specs und offengelegte Bezugslinks finden Sie auf der Hardware-Seite; die Preise waren durch die Speicherknappheit 2026 volatil, betrachten Sie jede Zahl daher als Richtwert und bestätigen Sie sie vor der Bestellung.

Die Box ist nur die halbe Lösung

Die richtige 70B-Box zu wählen ist die leichte Hälfte. Ein Mini-PC, der ein rohes 70B betreibt, ist eine vertrauliche Datenbank, die jedem, der fragt, ihre eigenen Geheimnisse vorliest — die schnellste Hardware zu wählen ändert daran nichts. Was eine lokale KI sicher macht, um sie vor Kundinnen und Kunden zu stellen, ist die Governance-Schicht darum herum: die Grenze zwischen Ihrem internen Wissen und dem öffentlichen Agenten und die Schleife, die ihn laufend verbessert. Lokales Hosting stärkt Ihre DSGVO- und EU-KI-Verordnung-Position, indem Daten im Haus bleiben — aber diese Position bauen Sie auf, sie wird nicht von der Hardware allein geklärt.

Diese Governance ist das eigentliche Produkt; wir begründen das in Das Produkt ist Governance und erklären das umfassendere Modell in Souveräne KI, erklärt. Wählen Sie also die Box, die zu Ihrem Wissen passt — und setzen Sie dann einen gesteuerten Kern darauf.

Weiterlesen