VRAM-Rechner

Gewichte + KV-Cache + Overhead gegen dein GPU-Budget – jeder Wert transparent vorgerechnet. Alles läuft im Browser; Requests gehen nur nach Klick an Hugging Face oder deine lokalen Ollama-/LM-Studio-Instanzen.

Haftungsausschluss: Alle Werte sind Schätzungen. Für die Richtigkeit der Berechnungen wird keine Haftung übernommen. Die reale Belegung hängt von Architektur, Backend, Batch-Größe und Treiber ab – prüfe sie immer in deiner Engine (LM Studio) bzw. mit nvidia-smi.

Modell hinzufügen

Mein Setup lädt das getestete lokale Setup (Chat: Gemma 4 12B QAT, Embedder: BGE-M3, Router: Qwen3.5 4B) und ersetzt die aktuelle Liste.

Oder ein Preset aus dem eingebauten Offline-Datensatz (funktioniert ohne Internet; „ca."-Werte sind geschätzt und bleiben editierbar):

Modelle im Budget

Die KV-Präzision (kv_bits) ist keine Modell-Eigenschaft, sondern eine Engine-Einstellung, die du selbst wählst: Ollama OLLAMA_KV_CACHE_TYPE, llama.cpp --cache-type-k/v, LM Studio unter „Inference". FP16 ist Standard, Q8 halbiert den KV-Cache nahezu verlustfrei, Q4 spart weiter – mit Qualitätsrisiko.

GPU & Kontext

Dieser Kontext-Regler ist ein Komfort-Default: Er schreibt den Wert in alle Modelle. Jedes Modell lässt sich danach in seiner Karte einzeln anpassen – verschiedene Modelle dürfen verschieden große Kontexte haben.

Overhead = Zusatzbedarf beim Laden (CUDA-Kontext, Compute-Buffer, Fragmentierung). Er wächst mit der Zahl der geladenen Modelle (jedes Modell hat eigenen CUDA-Kontext + Compute-Buffer) und leicht mit dem Kontext: Richtwert ~0,6 GB pro Modell, plus mehr, wenn die GPU zusätzlich den Desktop rendert. Für 2–3 Modelle also grob 1,5–2,5 GB. Der Sicherheitspuffer ist Reserve, die frei bleiben soll – er begrenzt den „max. stabilen Kontext" im Ergebnis.

Ergebnis

Rechenweg

Einheiten: GB = 10⁹ Byte (dezimal), passend zu Modell- und Kartenangaben. Der KV-Cache ist eine konservative Obergrenze – Sliding-Window- und Linear-Attention senken den realen Wert.