Welches KI-Modell läuft auf meinem PC?

Grafikkarte und Arbeitsspeicher eingeben – sofort sehen, welche von 135 lokalen KI-Modellen flüssig laufen, nur mit Auslagerung oder gar nicht. Ohne Anmeldung, alles rechnet in deinem Browser.

Apple Silicon: hier den gesamten Speicher wählen, Grafikkarte auf „Keine“.
Rechnet ~70 % des Speichers als nutzbaren Grafikspeicher.

So rechnen wir

Flüssig auf der GPU: Das Modell passt in der angegebenen Quantisierung komplett in den Grafikspeicher (inkl. Puffer für Kontext). Typisch 20–100 Tokens/s.

Mit Auslagerung: Ein Teil der Schichten liegt im Arbeitsspeicher (z. B. per Ollama oder llama.cpp). Funktioniert, ist aber oft 3–10× langsamer.

Nur CPU: Kleine Modelle laufen auch ohne Grafikkarte – brauchbar zum Ausprobieren, zäh im Alltag (etwa 2–8 Tokens/s).

Die Werte sind Richtwerte aus den Herstellerangaben und unserer Modelldatenbank. Längere Kontexte (z. B. 32k statt 8k Tokens) brauchen spürbar mehr VRAM. Welche Karte sich lohnt, steht in der GPU-Kaufberatung.

Praxiswerte: gemessen auf eigenen Systemen

Richtwerte sind gut – echte Zahlen sind besser. Diese Werte stammen aus dem laufenden Betrieb bzw. aus den Protokollen auf den KI-Rechnern von Ronny Brummer (Stand September 2026), nicht aus einem Labor-Benchmark. Nichts davon läuft in einer Cloud.

AufgabeModellHardwareBelegter VRAMTempo
Text / Chat Qwen3.8-27B, 4-Bit (GPTQ/W4A16), vLLM, 256k Kontext 2× RTX 3090 Ti (je 24 GB), 64 GB RAM ~21 GB je Karte* Einlesen ~1.350 Tokens/s · Antwort ~18 Tokens/s, bis ~70 bei parallelen Anfragen
Programmieren Qwen 2.5 Coder 32B, GGUF Q3_K_M, llama.cpp, 8–16k Kontext 1× RTX 5060 Ti (16 GB), 30 GB RAM ~15 GB ~10 Tokens/s Antwort (Erfahrungswert)
Text / Chat Gemma 3 12B, Q4_K_M, Ollama 1× RTX 5060 Ti (16 GB), 30 GB RAM ~8 GB passt mit viel Luft in 16 GB
Spracherkennung faster-whisper large-v3 (float16) · whisper.cpp medium 1× RTX 5060 Ti (16 GB), 30 GB RAM ~3,9 GB dauerhaft · 1,5 GB whisper.cpp: 11 s Sprache in ~0,09 s verarbeitet (Erfahrungswert)
Bilder mit Referenzfigur Qwen-Image 2.1, 1024×576, 30 Schritte 1× RTX 3090 (24 GB), 30 GB RAM 16,4 GiB ohne · 18,1 GiB mit 1 Referenzbild 47 s ohne · 72 s mit 1 · 137 s mit 2 Referenzbildern
Storyboard-Bilder Qwen-Image, GGUF Q6_K / Q4_K_M, ComfyUI 1× RTX 3090 (24 GB), 30 GB RAM unter 12 GB ~27 s pro Bild
Bilder Qwen-Image, GGUF Q4_K_M / Q6_K, ComfyUI 1× RTX 3090 (24 GB), 62 GB RAM ~12,6 GB ~45 Sekunden pro Bild
Video Wan 2.1 / 2.2 (14B), GGUF Q5_K_M, ComfyUI 1× RTX 3090 (24 GB), 62 GB RAM ~10–10,5 GB (teils ausgelagert) 2,5–4,5 Minuten pro Clip
Video (Produktion) Wan 2.2 Image-to-Video A14B, GGUF Q5_K_M, 4-Step-LoRA, 1024×576, 81 Frames (5 s) 1× RTX 3090 (24 GB), 30 GB RAM, ComfyUI 0.28 ~12–14 GB (geschätzt, nicht gemessen) 232 s für einen 5-Sekunden-Clip
Musik ACE-Step 1.5, ComfyUI-Umgebung 1× RTX 3090 (24 GB), 62 GB RAM ~12 GB, beim Dekodieren kurz bis ~18 GB ~2 Minuten für einen 3:20-Minuten-Song
Musik (Qualitätsvariante) ACE-Step 1.5 XL-SFT (4B), bfloat16, 100 Steps, mit Stil-LoRA 1× RTX 3090 (24 GB), 30 GB RAM + 32 GB Auslagerung ~13 GB (Spitze nicht vermessen) ~48 s pro Minute Audio: 4-Minuten-Song in ~3:12 min (2 Messungen)

Was wir dabei gelernt haben:

  • Ein 27B-Sprachmodell braucht nicht zwingend zwei Karten. In 4-Bit passt es mit kurzem Kontext (8–32k Tokens) auf eine einzelne 24-GB-Karte. Erst sehr lange Kontexte wie 256k machen die zweite Karte nötig.
  • *vLLM reserviert sich vorab einen festen Anteil des Grafikspeichers und füllt ihn mit Kontext-Cache – das Modell selbst braucht deutlich weniger.
  • Mit 16 GB geht ein 27B-Modell nur mit stärkerer Komprimierung (GGUF Q3/Q4) und teilweiser Auslagerung in den Arbeitsspeicher – spürbar langsamer.
  • 16 GB sind eine harte Grenze – aber eine brauchbare. Auf einer RTX 5060 Ti läuft sogar ein 32B-Coder (in Q3) komplett auf der Karte, mit rund 10 Tokens/s. Ein zweites großes Modell daneben passt dann aber nicht mehr – eins muss entladen werden.
  • Spracherkennung ist auf der GPU fast gratis: Whisper large-v3 belegt dauerhaft nur knapp 4 GB und arbeitet ein Vielfaches schneller als Echtzeit.
  • Zwei Karten ohne NVLink-Brücke liefen mit vLLM erst stabil, nachdem die Option custom-all-reduce abgeschaltet war.
  • Bild, Video und Musik passen jeweils einzeln auf eine RTX 3090. ComfyUI lädt Modellteile bei Bedarf nach, statt mit „Out of Memory“ abzubrechen – in zwei Wochen Betrieb gab es keinen einzigen Absturz. Wan 2.2 lädt pro Clip zwei „Experten“ nacheinander; das kostet Zeit, ist aber so gewollt.
  • Musik entsteht schneller als in Echtzeit: ACE-Step braucht je nach Variante 60–80 % der Songlänge. Der größte Hebel sind die Steps, und sie wirken linear: 60 statt 100 Steps kosten etwa 60 % der Zeit. Der eingebaute Planer (ein kleines Sprachmodell, das den Song vorab strukturiert) kostet dagegen einen festen Aufschlag von rund 20–40 Sekunden pro Song, eine Stil-LoRA rund 20 Sekunden. Faustformel für eine RTX 3090: Minuten Audio × (Steps ÷ 100) × 33 s, plus den Aufschlag für den Planer (gemessen in zehn kontrollierten Läufen).
  • Bei Musik-KI wird der Arbeitsspeicher unterschätzt: ACE-Step XL belegte im Dauerbetrieb bis zu 28,6 GB RAM plus bis zu 7,7 GB Auslagerung. 32 GB RAM sind knapp, eine Auslagerungsdatei ist Pflicht.
  • Grafikkarten vor der RTX-30-Generation (z. B. GTX 1080, RTX 20xx) beherrschen kein bfloat16 – ACE-Step läuft dort nicht sinnvoll, egal wie viel Speicher sie haben.
  • ACE-Step XL auf 16 GB – gemessen auf einer RTX 5060 Ti: Das Modell belegt rund 10 GB, der eingebaute Planer kurzzeitig weitere ~900 MB. Das reicht, aber nur ohne grafische Oberfläche und ohne Nebenverbraucher. Mit offenem Desktop (rund 1,1 GB Grafikspeicher) brach die Erzeugung reproduzierbar mit Speichermangel ab. 12 GB werden für die XL-Variante sehr knapp.
  • Video braucht weniger Grafikspeicher, als die Dateien vermuten lassen. Wan 2.2 besteht aus zwei Modellen à 11 GB plus 6 GB Text-Encoder – ComfyUI lädt sie aber nacheinander. Statt 28 GB reichen daher grob 12–14 GB (geschätzt). 16 GB sollten komfortabel sein, 12 GB gehen mit Auslagerung und Geduld.
  • Qwen-Image 2.1 mit Referenzfigur braucht dagegen wirklich 24 GB: gemessene Spitze 18,1 GiB. Auf 16-GB-Karten läuft es nicht sinnvoll – für einfache Bilder per GGUF genügen dagegen 12 GB.
  • Höchstens zwei Referenzbilder: Drei führten in sechs von sechs Versuchen zum Speicherüberlauf. Die Referenzen vorher zu verkleinern hilft nicht, die Pipeline skaliert intern.
  • Auslagern auf die CPU frisst Arbeitsspeicher: Dabei liegt das komplette Modell im RAM – gemessen 17,4 GB RAM plus 16,3 GB Auslagerung. Der Rechner wird zäh, obwohl die Grafikkarte nicht voll ist.
  • VAE-Tiling lohnt sich nicht: Es spart keinen Speicher, kostet 7–25 Sekunden und erzeugt auf großen einfarbigen Flächen (Himmel, Wasser) sichtbare Streifen.
  • Eine Karte, ein System: Musik- und Bild-KI passen nicht gleichzeitig in 24 GB – auf unseren Rechnern schließen sie sich gegenseitig aus.
  • Der erste Lauf nach dem Start ist kein Maßstab: Darin steckt das Laden von Modell und LoRA. Faire Zeiten misst man erst ab dem zweiten Durchgang.

Was dabei herauskommt: Ronny Brummers Musikvideo „The Distance between us“ (YouTube) – Song und Video sind komplett auf dem Heimrechner mit einer RTX 3090 entstanden, mit genau den Werkzeugen aus der Tabelle oben.

Die ganze Geschichte hinter den Zahlen – vier Rechner, was sie leisten und was ich dabei gelernt habe – steht im Erfahrungsbericht „Meine vier KI-Rechner".