Meine vier KI-Rechner: Was RTX 3090 und 5060 Ti im Alltag wirklich leisten – echte Messwerte

Meine vier KI-Rechner: Was RTX 3090 und 5060 Ti im Alltag wirklich leisten – echte Messwerte

Bei mir laufen vier Rechner mit KI – zwei für die Firma, zwei privat. Keiner davon hängt an einer Cloud, alle stecken voller Consumer-Grafikkarten, wie man sie auch gebraucht bei Kleinanzeigen findet. Wenn ich im Netz lese, was eine RTX 3090 oder eine 16-GB-Karte angeblich „schafft", stehen da meistens Datenblattwerte oder Einzelmessungen aus dem Labor. Deshalb habe ich diesmal etwas anderes gemacht: Ich habe die Protokolle meiner eigenen Maschinen ausgewertet – was im Alltag tatsächlich herauskommt, beim Schreiben, Programmieren, bei Bildern, Videos und Musik.

Für die Auswertung wurde nichts extra gestartet. Alle Werte stammen aus dem laufenden Betrieb. Wo etwas nur geschätzt ist, steht das ausdrücklich dabei.

Die vier Maschinen im Überblick

RechnerGrafikkarteCPU / RAMWofür
Firmen-KI2× RTX 3090 Ti (je 24 GB)Ryzen 9 5950X / 64 GBSprachmodell für Texte, Fragen, Dokumente
Medienrechner der Firma1× RTX 3090 (24 GB)Ryzen 7 8700F / 62 GBBilder, Videos und Musik für die Firma
Heimstudio1× RTX 3090 (24 GB)Ryzen 7 7700 / 30 GBMusik und Musikvideos – mein Hobby
Alltags-PC1× RTX 5060 Ti (16 GB)Ryzen 5 8400F / 30 GBProgrammieren, Diktat, kleinere Sprachmodelle

Auffällig: Dreimal steckt eine 24-GB-Karte aus der RTX-30-Generation drin. Das ist kein Zufall. Die RTX 3090 ist gebraucht nach wie vor das beste Verhältnis aus Speicher und Preis – und beim Thema KI entscheidet fast immer zuerst der Grafikspeicher, erst danach die Rechenleistung.

Die Firmen-KI: Qwen3.8-27B auf zwei Karten

Das Herzstück ist ein Sprachmodell mit 27 Milliarden Parametern, Qwen3.8-27B, in einer 4-Bit-Fassung (GPTQ/W4A16). Es läuft über vLLM, verteilt auf beide Grafikkarten, mit einem Kontextfenster von 256.000 Tokens. Dokumente, Fragen und Texte bleiben damit im eigenen Haus.

Die Zahlen aus 87 Messfenstern der letzten 24 Stunden, bei gemischter Last aus dem echten Betrieb:

    • Einlesen des Prompts: typisch rund 1.350 Tokens pro Sekunde – ein langes Dokument ist in Sekunden „gelesen".
    • Antworten: typisch rund 18 Tokens pro Sekunde je Zeitfenster, in der Spitze bis etwa 70, wenn mehrere Anfragen gleichzeitig laufen. vLLM spielt seine Stärke vor allem bei parallelen Anfragen aus.
    • Grafikspeicher: rund 21 GB je Karte. Das klingt nach viel, ist aber gewollt: vLLM reserviert sich vorab einen festen Anteil und füllt ihn mit Zwischenspeicher für den langen Kontext. Das Modell selbst braucht deutlich weniger.

    Zwei Dinge habe ich dabei gelernt. Erstens: Ein 27B-Modell braucht nicht zwingend zwei Karten. In 4 Bit passt es mit kurzem Kontext (8.000 bis 32.000 Tokens) auch auf eine einzelne 24-GB-Karte. Erst der sehr lange Kontext macht die zweite nötig. Zweitens: Zwei Karten ohne NVLink-Brücke liefen mit vLLM erst stabil, nachdem die Option custom-all-reduce abgeschaltet war. So etwas steht in keinem Datenblatt.

    Wer meinen früheren Erfahrungsbericht kennt, wundert sich vielleicht: Dort standen 100 bis 130 Tokens pro Sekunde. Damals lief auf derselben Hardware ein älteres Qwen-Modell – schneller, aber dümmer. Qwen3.8 ist außerdem anders aufgebaut als sein Vorgänger, die Tempo-Werte lassen sich deshalb nicht eins zu eins vergleichen. Ich habe mich bewusst für das neuere, klügere Modell entschieden und nehme dafür das langsamere Tempo in Kauf. Für die Arbeit zählt am Ende, ob die Antwort stimmt, nicht wie schnell sie über den Bildschirm läuft.

    Der Medienrechner: Bilder, Videos – und die Wartemusik unserer Telefonanlage

    Der zweite Firmenrechner hat nur eine Aufgabe: Bilder, Videos und Musik für die Firma. Er arbeitet mit ComfyUI und einer einzelnen RTX 3090. Ein kleines Detail, das mich immer noch freut: Die Wartemusik unserer Telefonanlage stammt von dieser KI. Wer bei uns in der Warteschleife hängt, hört ein Stück, das auf diesem Rechner entstanden ist.

    AufgabeModellGrafikspeicherZeit
    BildQwen-Image (GGUF Q4_K_M / Q6_K)~12,6 GB~45 Sekunden pro Bild
    VideoWan 2.1 / 2.2, 14B (GGUF Q5_K_M)~10–10,5 GB, teils ausgelagert2,5 bis 4,5 Minuten pro Clip
    MusikACE-Step 1.5~12 GB, beim Dekodieren kurz bis ~18 GB~2 Minuten für 3:20 Minuten Musik

    In zwei Wochen Protokoll gab es keinen einzigen Absturz wegen vollem Grafikspeicher. ComfyUI lädt Modellteile bei Bedarf nach, statt abzubrechen. Das kostet etwas Zeit, macht den Rechner aber verlässlich.

    Mein Heimstudio: Musik und Musikvideos

    Privat ist KI für mich ein Hobby, vor allem Musik. Zu Hause steht dafür ebenfalls eine RTX 3090. Die Songs entstehen mit ACE-Step 1.5 in der großen Variante „XL" (4 Milliarden Parameter), die Bilder und Videos dazu mit Qwen-Image und Wan 2.2.

    AufgabeEinstellungGrafikspeicherZeit
    Song (ACE-Step 1.5 XL)100 Schritte, bfloat16, mit Stil-LoRA~13 GB (Spitze nicht vermessen)~48 Sekunden pro Minute Musik
    Bild mit Referenzfigur (Qwen-Image 2.1)1024×576, 30 Schritte, 1 Referenzbild18,1 GiB (gemessen)72 Sekunden
    Storyboard-Bild (Qwen-Image GGUF)Q6_K / Q4_K_Munter 12 GB~27 Sekunden
    Videoclip (Wan 2.2, Image-to-Video)1024×576, 5 Sekunden, 4-Step-LoRA~12–14 GB (geschätzt)232 Sekunden

    Ein Vier-Minuten-Song ist damit in gut drei Minuten fertig, also schneller als in Echtzeit. Der größte Hebel sind die Schritte: 60 statt 100 halbieren die Rechenzeit ungefähr. Beim Video ist die Rechnung genau umgekehrt: Für fünf Sekunden Film rechnet die Karte knapp vier Minuten.

    Was dabei herauskommt, zeigt mein Musikvideo „The Distance between us" auf YouTube. Song und Video sind komplett auf diesem Rechner entstanden.

    Drei Stolpersteine aus dem Heimstudio, die ich jedem mitgeben würde:

    • Eine Karte, ein System. Musik- und Bild-KI passen nicht gleichzeitig in 24 GB. Bei mir schließen sie sich per Umschalter gegenseitig aus.
    • Der Arbeitsspeicher wird unterschätzt. ACE-Step XL belegte im Dauerbetrieb bis zu 28,6 GB RAM plus bis zu 7,7 GB Auslagerung. Mit 32 GB RAM ist das knapp, eine Auslagerungsdatei ist Pflicht. Noch extremer: Wer Qwen-Image auf die CPU auslagert, hält das ganze Modell im RAM – gemessen 17,4 GB RAM plus 16,3 GB Auslagerung.
    • Nicht jede Speicher-Sparfunktion hilft. VAE-Tiling spart bei mir keinen Speicher, kostet 7 bis 25 Sekunden und erzeugt auf großen einfarbigen Flächen wie Himmel oder Wasser sichtbare Streifen. Ich lasse es aus.

    Der Alltags-PC: Was 16 GB schaffen

    Der vierte Rechner ist der interessanteste für die meisten Leser, denn eine RTX 5060 Ti mit 16 GB ist eine ganz normale, aktuelle Karte. Auf ihr laufen:

    • Qwen 2.5 Coder 32B in der Quantisierung Q3_K_M über llama.cpp, komplett auf der Karte (~15 GB), mit 8.000 bis 16.000 Tokens Kontext. Erfahrungswert: rund 10 Tokens pro Sekunde. Deutlich langsamer als ein Cloud-Assistent, für Code aber brauchbar.
    • Gemma 3 12B (Q4_K_M, ~8 GB) über Ollama – passt mit viel Luft.
    • faster-whisper large-v3 für Spracherkennung, dauerhaft geladen mit knapp 4 GB. Für die Diktierfunktion kommt zusätzlich whisper.cpp zum Einsatz: 11 Sekunden Sprache sind in rund 0,09 Sekunden verarbeitet.

    Die Grenze ist klar: 16 GB tragen genau ein großes Modell. Ein 32B-Coder und daneben ein zweites großes Modell geht nicht, eins muss entladen werden.

    Was ich aus vier Rechnern gelernt habe

    • Grafikspeicher zuerst, Rechenleistung danach. Ob ein Modell überhaupt läuft, entscheidet der Speicher. Wie schnell es läuft, entscheidet die Karte.
    • Dateigrößen täuschen. Wan 2.2 besteht aus zwei Modellen à 11 GB plus 6 GB Text-Encoder. Wer das addiert, landet bei 28 GB. ComfyUI lädt die Teile aber nacheinander, real reichen grob 12 bis 14 GB.
    • Manches braucht wirklich 24 GB. Qwen-Image 2.1 mit Referenzfigur erreicht gemessen 18,1 GiB Spitze. Auf einer 16-GB-Karte läuft das nicht sinnvoll. Mehr als zwei Referenzbilder führten bei mir in sechs von sechs Versuchen zum Speicherüberlauf.
    • Ältere Karten haben eine versteckte Grenze. Grafikkarten vor der RTX-30-Generation beherrschen kein bfloat16. ACE-Step läuft dort nicht sinnvoll, egal wie viel Speicher sie haben.
    • Der erste Lauf ist kein Maßstab. Darin steckt das Laden von Modell und Zusatzmodellen. Faire Zeiten misst man ab dem zweiten Durchgang.
    • Wartung kann Arbeit kosten. Automatische Paketupdates können einen Dienst mitten in einer Berechnung neu starten, und nach einem Kernel-Update ohne passendes Treibermodul steht die Grafikkarte. Wer lange Jobs rechnen lässt, sollte das im Blick behalten.

    Was das für dich heißt

    Aus meinen Zahlen ergibt sich eine einfache Orientierung für den eigenen PC:

    • 12 GB: kleinere Sprachmodelle, Spracherkennung, einfache Bilder mit Qwen-Image als GGUF. Video und große Musikmodelle nur mit Auslagerung und viel Geduld.
    • 16 GB: ein großes Sprachmodell bis etwa 32B in starker Quantisierung, Spracherkennung nebenbei. Musik mit ACE-Step XL und Video mit Wan 2.2 sollten nach meiner Einschätzung gehen – das ist aus der Speicherbelegung geschätzt, nicht auf einer 16-GB-Karte gemessen.
    • 24 GB: alles aus diesem Artikel – aber immer nur eins zur gleichen Zeit.
    • 2× 24 GB: ein 27B-Sprachmodell mit sehr langem Kontext und mehreren Nutzern gleichzeitig.
    • RAM nicht vergessen: 32 GB sind für Bild, Video und Musik die Untergrenze, 64 GB entspannen vieles.

Wer für seinen eigenen Rechner nachsehen will, welches Modell passt: Dafür gibt es jetzt unseren Rechner „Welches KI-Modell läuft auf meinem PC?". Grafikkarte und Arbeitsspeicher eingeben, und man sieht sofort, was flüssig läuft, was nur mit Auslagerung und was gar nicht. Wer vor einem Kauf steht, findet in der GPU-Kaufberatung aktuelle Preise.