Lokale Modellinferenz

Einsteiger

Führe grosse Sprachmodelle auf deiner eigenen Hardware aus -- keine Cloud, keine API-Keys, keine Limits.

Zuletzt aktualisiert: 13. Sept. 2026

Warum lokal ausführen?

Modelle auf dem eigenen Rechner zu betreiben bietet Möglichkeiten, die Cloud-APIs nicht bieten können.

Lokale Datenkontrolle

Prompts können auf deinem Gerät bleiben, wenn Anwendung und gewählte Funktionen keine externen Aufrufe machen. Logging, Telemetrie, Integrationen und Cloud-Optionen getrennt prüfen.

Keine API-Kosten

Nach der einmaligen Hardware-Investition ist jeder Token kostenlos. Führe so viele Anfragen aus wie du willst.

Offline-Zugang

Funktioniert ohne Internet. Nutze KI im Flugzeug, in sicheren Umgebungen oder überall ohne Verbindung.

Volle Anpassung

Wähle jedes Modell, jede Quantisierung, alle Parameter. Optimiere für deinen spezifischen Anwendungsfall.

Tiefes Lernen

Nichts lehrt dich besser, wie LLMs funktionieren, als direkt mit ihnen zu experimentieren.

Totale Kontrolle

Keine Rate-Limits, keine Filter die du nicht gewählt hast, keine überraschenden API-Änderungen.

Hardware-Anforderungen

Wähle eine Modellgröße und Quantisierungsstufe um zu sehen, wie viel VRAM du brauchst und welche GPUs das schaffen.

Beginne mit der Speicherrechnung. Ein hypothetisches 70B-Modell braucht mindestens 35 GB (32,6 GiB) für rohe 4-Bit-Gewichte oder 70 GB (65,2 GiB) für 8-Bit-Gewichte. Quantisierungsmetadaten, KV-Cache und Runtime-Puffer kommen hinzu. Eine 24-GB-GPU benötigt daher teilweise Auslagerung oder ein kleineres Modell.

VRAM-Rechner

Der MoE-Vorteil für lokale Inferenz

Mixture-of-Experts-Modelle (MoE) leiten jeden Token nur durch eine Teilmenge von "Experten"-Schichten. Der Hauptvorteil ist Geschwindigkeit: weniger aktive Parameter bedeuten schnellere Generierung. Aber alle Parameter bleiben im VRAM — MoE spart keinen Speicher.

Schnellere Generierung

Nur ausgewählte Experten rechnen pro Token. Das kann gegenüber einem dichten Modell mit gleicher Gesamtparameterzahl Rechenarbeit sparen, sagt aber allein keine Tokens pro Sekunde voraus.

Intelligenz großer Modelle

Alle potenziell ausgewählten Expertengewichte müssen erreichbar bleiben. Gesamtparameter bestimmen die gespeicherten Gewichte; aktive Parameter nur einen Teil der Arbeit pro Token.

VRAM basiert auf Gesamtparametern

Alle Experten-Gewichte müssen in den Speicher geladen werden. Mixtral 8x7B bei Q4 braucht ~26 GB VRAM — ähnlich einem dichten 30B-Modell, nicht 13B. MoE spart Rechenzeit, nicht Speicher.

Aktive Parameter bestimmen nur einen Teil der Arbeit pro Token. Gespeichert werden alle Experten. Verändere die beiden Parameterzahlen: Wenige aktive Parameter bedeuten keine kleine Modelldatei. Routing ändert sich pro Token; derzeit inaktive Experten können später gebraucht werden.

Rohe 4-Bit-Gewichte
35.0 GB
Rohe aktive Gewichte pro Token
5.0 GB

MoE trennt gespeicherte Parameter von der Berechnung pro Token. Alle Experten brauchen Speicher, obwohl ein bestimmtes Token nur einen Teil auswählt. Offloading erzeugt Transfers oder CPU-Arbeit. Miss deshalb die konkrete Platzierung.

MoE ist ein fundamentaler Architekturwandel, kein bloßer Optimierungstrick. Zu verstehen, wie Expert-Routing funktioniert, hilft dir das richtige Modell für deine Hardware zu wählen.

Tiefer Einblick in Mixture of Experts →

Beliebte Tools

Das lokale Inferenz-Ökosystem ist schnell gereift. Hier sind die wichtigsten Tools, von anfängerfreundlich bis produktionsreif.

Wähle die Runtime nach Plattform, Modellformat und Geräteunterstützung. Bedienkomfort und Geschwindigkeit brauchen eine definierte Aufgabe als Maßstab. Deshalb gibt es hier keine allgemeine Punktbewertung.

Ollama: lokale Modellausführung mit CLI und HTTP-API. Modelllizenz, Downloads, Geräteunterstützung und mögliche Cloud-Aufrufe einzelner Funktionen prüfen.

Quellen

llama.cpp: GGUF-Inferenz mit expliziter Geräte- und Offload-Steuerung. Die CLI-Hilfe beschreibt --gpu-layers, --cpu-moe und --n-cpu-moe. --override-kv verändert Modellmetadaten und lädt keine Experten vorausschauend.

Quellen

LM Studio: Desktop-Oberfläche für lokale Inferenz. Unterstützte Modellformate und Betriebssystem-Anforderungen in der Dokumentation prüfen.

Quellen

Der Quantisierungs-Kompromiss

Quantisierung ist die Schlüsseltechnologie, die lokale Inferenz praktikabel macht. Durch Reduzierung der Präzision der Modellgewichte passen viel größere Modelle in begrenzten VRAM.

Ein hypothetisches 70B-Modell benötigt 140 GB für rohe FP16-Gewichte, 70 GB für 8-Bit-Gewichte oder 35 GB für rohe 4-Bit-Gewichte. Quantisierungsmetadaten, gemischte Tensorformate, KV-Cache und Runtime-Puffer kommen hinzu. Qualität und Geschwindigkeit hängen vom Quantisierer und der Runtime ab.

Tiefer Einblick in Quantisierung →
🧮

VRAM-Rechner →

Nicht sicher, ob ein Modell auf deine GPU passt? Berechne VRAM-Bedarf und geschätzte Geschwindigkeit für jedes Modell und jede Quantisierungsstufe.

Erste Schritte

Folge diesen fünf Schritten um von null zum ersten lokalen Modell zu kommen.

1

Tool wählen

Starte mit Ollama oder LM Studio -- sie erledigen alles für dich. Wechsle zu llama.cpp oder vLLM wenn du mehr Kontrolle brauchst.

2

VRAM prüfen

Führe nvidia-smi (NVIDIA) oder den Aktivitätsmonitor (Mac) aus. Das bestimmt welche Modelle du ausführen kannst.

3

Modellgröße wählen

Starte mit 7B-Modellen. Sie sind schnell, leistungsfähig und passen auf die meisten GPUs. Wechsle zu 13B oder 70B wenn du mehr brauchst.

4

Quantisierungsstufe wählen

Q4 ist der Sweet Spot für die meisten: gute Qualität bei vernünftigem VRAM-Verbrauch. Nimm Q8 bei genug Speicher, Q2 wenn es knapp ist.

5

Ausführen

Lade das Modell herunter und starte den Chat. Mit Ollama: ollama pull llama3.2, dann ollama run llama3.2. Das wars.

Schnellstart-Demo

So sieht es aus, Ollama zu installieren und dein erstes Modell auszuführen -- drei Befehle und du chattest.

Installiere eine Runtime anhand ihrer Anleitung für dein Betriebssystem. Starte mit einem kleinen Modell, prüfe verfügbaren Speicher und miss anschließend den tatsächlichen Lauf. Die Befehle sind Beispiele und kein simuliertes Terminal.

ollama --help
ollama list
ollama ps

llama-cli --help
Ollama

Tipps und Tricks

  • 1Kontextlänge beeinflusst VRAM-Verbrauch direkt. Ein 7B-Modell mit 128K Kontext braucht deutlich mehr Speicher als mit 4K. Starte klein und erhöhe nach Bedarf.
  • 2GPU-Offloading teilt ein Modell zwischen GPU und CPU auf. GPU-Geschwindigkeit für passende Layer, CPU für den Rest. Langsamer als volle GPU, aber größere Modelle möglich.
  • 3Die Geschwindigkeit von CPU, GPU und Beschleunigern hängt von Aufgabe und Backend ab. Apple Silicon kann GPU-Inferenz über Metal mit gemeinsamem Speicher ausführen. Das ist keine besonders schnelle reine CPU-Inferenz.
  • 4Vergleiche konkrete Modelldatei, Kontext und Runtime-Reserve mit dem verfügbaren Speicher. Ein 70B-Modell mit 4-Bit-Gewichten passt nicht vollständig auf eine 24-GB-GPU. Es braucht Offloading oder zusätzliche Geräte. Selbst 32 GB liegen unter seinen rohen 35 GB Gewichten.
  • 5Llama 3.2, Mistral, Phi-3 und Qwen 2.5 sind hervorragend für lokale Inferenz. Jedes glänzt bei anderen Aufgaben -- experimentiere um das Beste für dich zu finden.
  • 6Betreibe Modelle als API-Server (Ollama und LM Studio unterstützen das) um lokale Modelle in eigene Anwendungen, Skripte und Workflows zu integrieren.