Wie viel VRAM brauchst du, um LLMs lokal auszuführen?

Die zentrale Frage bei der lokalen Ausführung von LLMs ist einfach: Passt das Modell auf deine GPU? Die Antwort hängt von der Modellgröße, der Quantisierung und der Kontextlänge ab. Dieser Leitfaden bietet einen praktischen Ausgangspunkt für die Wahl der richtigen VRAM-Menge.

Wie die Quantisierung den VRAM-Bedarf beeinflusst

Die Quantisierung reduziert die Präzision, mit der die Modellgewichte gespeichert werden. Eine Quantisierung mit weniger Bits verkleinert das Modell und verringert den VRAM-Bedarf, was jedoch zu einem gewissen Qualitätsverlust führt.

Quant Bits pro Gewicht Typische Verwendung
Q8_0 8 Sehr hohe Qualität
Q6_K ~6,6 Sehr gute Qualität
Q5_K_M ~5,5 Gute Qualität und Größe
Q4_K_M ~4,5 Gutes Gleichgewicht zwischen Größe und Qualität
Q3_K_M ~3,5 Weniger VRAM, größerer Qualitätsverlust

Q4_K_M ist eine gängige Wahl, wenn VRAM begrenzt ist. Wenn mehr VRAM zur Verfügung steht, ermöglichen Q5 oder Q6 die Ausführung des gleichen Modells mit geringerer Quantisierung.

Ungefähre VRAM-Bedarfe nach Modellgröße

Diese sind grobe Schätzungen für die Modellgewichte. Der tatsächliche VRAM-Bedarf ist höher, da auch die Laufzeitumgebung, der KV-Cache und der Kontext Speicherplatz belegen.

Modellgröße Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2,5 GB
8B ~9 GB ~7 GB ~5,5 GB ~4,5 GB
12B ~13 GB ~10 GB ~8 GB ~6,5 GB
14B ~16 GB ~12 GB ~9 GB ~7,5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

Diese Werte sind Schätzungen, keine harten Grenzen. Unterschiedliche Modellarchitekturen und Quantisierungsformate können die tatsächliche Größe beeinflussen.

Was mit verschiedenen VRAM-Mengen ausgeführt werden kann

VRAM Praktischer Bereich Aktuelle Beispiele
8 GB Kleine Modelle im Bereich von 4B bis 9B Gemma 4 E4B, Qwen3.5 9B
12 GB Kleine bis mittelgroße Modelle im Bereich von 9B bis 14B Gemma 4 12B, Qwen3.5 9B
16 GB 12B bis 27B mit geringerer Quantisierung Gemma 4 26B-A4B, Qwen3.6 27B bei Q4
24 GB 27B bis 35B bei Q4 bis Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B bis 35B mit höherer Quantisierung Qwen3.8 27B, Gemma 4 31B
48 GB Große dichte Modelle mit geringerer Quantisierung Modelle der 70B-Klasse bei Q3 bis Q4
80 GB Große dichte Modelle mit höherer Quantisierung Modelle der 70B-Klasse bei Q4 bis Q6

Diese Bereiche beziehen sich auf Modelle, deren Gewichte auf der GPU Platz finden. Große MoE-Modelle verhalten sich anders: Nur ein Teil ihrer Parameter ist für jeden Token aktiv, doch das Modell muss sein gesamtes Gewichtssatz speichern. Ein Modell mit 100B oder mehr Gesamt-Parametern passt daher nicht in ein VRAM-Budget von 100B allein deshalb, weil weniger Parameter aktiv sind.

MoE-Modelle

Mixture-of-Experts-Modelle enthalten mehrere Gruppen von Parametern, die als Experten bezeichnet werden. Für jeden Token wird nur ein Teil dieser Experten verwendet, was die Inferenz im Vergleich zu einem dichten Modell mit gleicher Gesamtanzahl an Parametern effizienter gestalten kann.

Jedoch sind die inaktiven Experten weiterhin Teil des Modells. Große MoE-Modelle können daher deutlich mehr Speicherplatz benötigen, als ihre aktive Parameteranzahl vermuten lässt. Sehr große Modelle erfordern möglicherweise mehrere GPUs oder das Auslagern in den System-RAM.

Kontextlänge nutzt ebenfalls VRAM

Die Modellgewichte sind nur ein Teil des Speicherbedarfs. Der KV-Cache wächst mit der Länge des Kontextes, daher kann die Ausführung desselben Modells mit 64K Kontext deutlich mehr VRAM erfordern als bei 4K.

  • Längere Kontexte erfordern mehr VRAM.
  • Die Präzision des KV-Caches beeinflusst den Speicherverbrauch.
  • Batch-Größe und gleichzeitige Nutzer erhöhen ebenfalls den Speicherverbrauch.
  • Halte etwas VRAM für die Laufzeitumgebung frei, anstatt die GPU vollständig mit Modellgewichten zu füllen.

Praktische Tipps

  • Prüfe die tatsächliche Größe des quantisierten Modells, das du ausführen möchtest.
  • Verwende die Dateigröße des Modells nicht als exakte VRAM-Anforderung. Lass Platz für den KV-Cache und die Laufzeitumgebung.
  • Wenn ein Modell nicht vollständig in den VRAM passt, kann ein Teil in den System-RAM ausgelagert werden, die Inferenz ist dann in der Regel jedoch langsamer.
  • Plane für Lastfälle mit langem Kontext oder agentischen Aufgaben mehr VRAM ein, als allein die Modellgewichte erfordern.
  • Mehrere GPUs können ein Modell aufteilen, wenn eine einzelne GPU nicht über genügend VRAM verfügt.

Auf DaDesktop ausführen

Du musst keine GPU kaufen, um ein lokales LLM auszuführen. DaDesktop bietet dir einen Cloud-Desktop mit der benötigten VRAM, sodass du das Modell direkt nutzen kannst, ohne den Hardwarebesitz zu übernehmen.

Wähle die VRAM-Ebene, die zu deinem Modell passt, lade es und beginne mit der Nutzung. Kein Setup, kein Hardwarekauf, keine Treiberprobleme. Sieh dir verfügbare GPUs für die Optionen an.