Warum lokal ausführen?
Modelle auf dem eigenen Rechner zu betreiben bietet Möglichkeiten, die Cloud-APIs nicht bieten können.
Lokale Datenkontrolle
Prompts können auf deinem Gerät bleiben, wenn Anwendung und gewählte Funktionen keine externen Aufrufe machen. Logging, Telemetrie, Integrationen und Cloud-Optionen getrennt prüfen.
Keine API-Kosten
Nach der einmaligen Hardware-Investition ist jeder Token kostenlos. Führe so viele Anfragen aus wie du willst.
Offline-Zugang
Funktioniert ohne Internet. Nutze KI im Flugzeug, in sicheren Umgebungen oder überall ohne Verbindung.
Volle Anpassung
Wähle jedes Modell, jede Quantisierung, alle Parameter. Optimiere für deinen spezifischen Anwendungsfall.
Tiefes Lernen
Nichts lehrt dich besser, wie LLMs funktionieren, als direkt mit ihnen zu experimentieren.
Totale Kontrolle
Keine Rate-Limits, keine Filter die du nicht gewählt hast, keine überraschenden API-Änderungen.
Hardware-Anforderungen
Wähle eine Modellgröße und Quantisierungsstufe um zu sehen, wie viel VRAM du brauchst und welche GPUs das schaffen.
Beginne mit der Speicherrechnung. Ein hypothetisches 70B-Modell braucht mindestens 35 GB (32,6 GiB) für rohe 4-Bit-Gewichte oder 70 GB (65,2 GiB) für 8-Bit-Gewichte. Quantisierungsmetadaten, KV-Cache und Runtime-Puffer kommen hinzu. Eine 24-GB-GPU benötigt daher teilweise Auslagerung oder ein kleineres Modell.
VRAM-RechnerDer MoE-Vorteil für lokale Inferenz
Mixture-of-Experts-Modelle (MoE) leiten jeden Token nur durch eine Teilmenge von "Experten"-Schichten. Der Hauptvorteil ist Geschwindigkeit: weniger aktive Parameter bedeuten schnellere Generierung. Aber alle Parameter bleiben im VRAM — MoE spart keinen Speicher.
Schnellere Generierung
Nur ausgewählte Experten rechnen pro Token. Das kann gegenüber einem dichten Modell mit gleicher Gesamtparameterzahl Rechenarbeit sparen, sagt aber allein keine Tokens pro Sekunde voraus.
Intelligenz großer Modelle
Alle potenziell ausgewählten Expertengewichte müssen erreichbar bleiben. Gesamtparameter bestimmen die gespeicherten Gewichte; aktive Parameter nur einen Teil der Arbeit pro Token.
VRAM basiert auf Gesamtparametern
Alle Experten-Gewichte müssen in den Speicher geladen werden. Mixtral 8x7B bei Q4 braucht ~26 GB VRAM — ähnlich einem dichten 30B-Modell, nicht 13B. MoE spart Rechenzeit, nicht Speicher.
Aktive Parameter bestimmen nur einen Teil der Arbeit pro Token. Gespeichert werden alle Experten. Verändere die beiden Parameterzahlen: Wenige aktive Parameter bedeuten keine kleine Modelldatei. Routing ändert sich pro Token; derzeit inaktive Experten können später gebraucht werden.
MoE trennt gespeicherte Parameter von der Berechnung pro Token. Alle Experten brauchen Speicher, obwohl ein bestimmtes Token nur einen Teil auswählt. Offloading erzeugt Transfers oder CPU-Arbeit. Miss deshalb die konkrete Platzierung.
MoE ist ein fundamentaler Architekturwandel, kein bloßer Optimierungstrick. Zu verstehen, wie Expert-Routing funktioniert, hilft dir das richtige Modell für deine Hardware zu wählen.
Tiefer Einblick in Mixture of Experts →Beliebte Tools
Das lokale Inferenz-Ökosystem ist schnell gereift. Hier sind die wichtigsten Tools, von anfängerfreundlich bis produktionsreif.
Wähle die Runtime nach Plattform, Modellformat und Geräteunterstützung. Bedienkomfort und Geschwindigkeit brauchen eine definierte Aufgabe als Maßstab. Deshalb gibt es hier keine allgemeine Punktbewertung.
Ollama: lokale Modellausführung mit CLI und HTTP-API. Modelllizenz, Downloads, Geräteunterstützung und mögliche Cloud-Aufrufe einzelner Funktionen prüfen.
Quellenllama.cpp: GGUF-Inferenz mit expliziter Geräte- und Offload-Steuerung. Die CLI-Hilfe beschreibt --gpu-layers, --cpu-moe und --n-cpu-moe. --override-kv verändert Modellmetadaten und lädt keine Experten vorausschauend.
QuellenLM Studio: Desktop-Oberfläche für lokale Inferenz. Unterstützte Modellformate und Betriebssystem-Anforderungen in der Dokumentation prüfen.
QuellenDer Quantisierungs-Kompromiss
Quantisierung ist die Schlüsseltechnologie, die lokale Inferenz praktikabel macht. Durch Reduzierung der Präzision der Modellgewichte passen viel größere Modelle in begrenzten VRAM.
Ein hypothetisches 70B-Modell benötigt 140 GB für rohe FP16-Gewichte, 70 GB für 8-Bit-Gewichte oder 35 GB für rohe 4-Bit-Gewichte. Quantisierungsmetadaten, gemischte Tensorformate, KV-Cache und Runtime-Puffer kommen hinzu. Qualität und Geschwindigkeit hängen vom Quantisierer und der Runtime ab.
Tiefer Einblick in Quantisierung →VRAM-Rechner →
Nicht sicher, ob ein Modell auf deine GPU passt? Berechne VRAM-Bedarf und geschätzte Geschwindigkeit für jedes Modell und jede Quantisierungsstufe.
Erste Schritte
Folge diesen fünf Schritten um von null zum ersten lokalen Modell zu kommen.
Tool wählen
Starte mit Ollama oder LM Studio -- sie erledigen alles für dich. Wechsle zu llama.cpp oder vLLM wenn du mehr Kontrolle brauchst.
VRAM prüfen
Führe nvidia-smi (NVIDIA) oder den Aktivitätsmonitor (Mac) aus. Das bestimmt welche Modelle du ausführen kannst.
Modellgröße wählen
Starte mit 7B-Modellen. Sie sind schnell, leistungsfähig und passen auf die meisten GPUs. Wechsle zu 13B oder 70B wenn du mehr brauchst.
Quantisierungsstufe wählen
Q4 ist der Sweet Spot für die meisten: gute Qualität bei vernünftigem VRAM-Verbrauch. Nimm Q8 bei genug Speicher, Q2 wenn es knapp ist.
Ausführen
Lade das Modell herunter und starte den Chat. Mit Ollama: ollama pull llama3.2, dann ollama run llama3.2. Das wars.
Schnellstart-Demo
So sieht es aus, Ollama zu installieren und dein erstes Modell auszuführen -- drei Befehle und du chattest.
Installiere eine Runtime anhand ihrer Anleitung für dein Betriebssystem. Starte mit einem kleinen Modell, prüfe verfügbaren Speicher und miss anschließend den tatsächlichen Lauf. Die Befehle sind Beispiele und kein simuliertes Terminal.
ollama --help ollama list ollama ps llama-cli --helpOllama
Tipps und Tricks
- 1Kontextlänge beeinflusst VRAM-Verbrauch direkt. Ein 7B-Modell mit 128K Kontext braucht deutlich mehr Speicher als mit 4K. Starte klein und erhöhe nach Bedarf.
- 2GPU-Offloading teilt ein Modell zwischen GPU und CPU auf. GPU-Geschwindigkeit für passende Layer, CPU für den Rest. Langsamer als volle GPU, aber größere Modelle möglich.
- 3Die Geschwindigkeit von CPU, GPU und Beschleunigern hängt von Aufgabe und Backend ab. Apple Silicon kann GPU-Inferenz über Metal mit gemeinsamem Speicher ausführen. Das ist keine besonders schnelle reine CPU-Inferenz.
- 4Vergleiche konkrete Modelldatei, Kontext und Runtime-Reserve mit dem verfügbaren Speicher. Ein 70B-Modell mit 4-Bit-Gewichten passt nicht vollständig auf eine 24-GB-GPU. Es braucht Offloading oder zusätzliche Geräte. Selbst 32 GB liegen unter seinen rohen 35 GB Gewichten.
- 5Llama 3.2, Mistral, Phi-3 und Qwen 2.5 sind hervorragend für lokale Inferenz. Jedes glänzt bei anderen Aufgaben -- experimentiere um das Beste für dich zu finden.
- 6Betreibe Modelle als API-Server (Ollama und LM Studio unterstützen das) um lokale Modelle in eigene Anwendungen, Skripte und Workflows zu integrieren.