Gemma 4 12B Unified
von Google · Lizenz: Gemma License · Kommerziell nutzbar
Googles erstes encoder-freies Open-Weight-Modell: Text, Bild, Audio und Video nativ in einem 12B-Decoder — 256K Kontext, 140+ Sprachen, läuft auf 16-GB-Laptops.
Was ist Gemma 4 12B Unified?
Gemma 4 12B Unified ist das erste mittelgroße offene Modell, das Text, Bilder, Audio und Video nativ verarbeitet — ganz ohne separate Encoder. Statt CLIP- oder Audio-Encodern projiziert die encoder-freie Architektur rohe Bildpatches und Audiowellenformen über leichte Linear-Layer direkt in den Embedding-Raum eines einzigen Decoder-Transformers. Das senkt die Latenz multimodaler Anfragen deutlich und erlaubt Fine-Tuning des gesamten Modells in einem Durchgang.
Dazu kommen 256K Token Kontext und Unterstützung für über 140 Sprachen — auch auf Deutsch gehört Gemma traditionell zu den stärksten offenen Modellen seiner Größe. Die lokale Nutzung ist hervorragend: In Q4-Quantisierung genügen etwa 8-10 GB VRAM, das Modell läuft flüssig auf Laptops mit 16 GB Unified Memory, und die Tool-Unterstützung ist breit (Ollama gemma4, LM Studio, llama.cpp/GGUF u. a.
von Unsloth, vLLM, Jan). Die Gemma-Lizenz erlaubt kommerzielle Nutzung mit Googles Nutzungsbedingungen. Wer einen multimodalen Allrounder für lokale Assistenten, Bild-/Audioanalyse und agentische Workflows sucht, findet hier den aktuellen Preis-Leistungs-König.
Fähigkeiten-Matrix
Was kann Gemma 4 12B Unified — und was nicht?
Hardware-Anforderungen
| Größe | Min. RAM | Empf. VRAM | CPU möglich? | Quantisierung | Empfohlene GPU |
|---|---|---|---|---|---|
| 12B | 16 GB | 10 GB | ✓ Ja (langsam) | Q4_K_M | RTX 3060 12GB |
Kompatibilität
Bewertung
Weitere Gemma-Modelle
Gemma 4 31B
Googles leistungsstärkstes offenes Dense-Modell — Platz 3 weltweit unter allen Open-Weight-Modell
Gemma 4 26B MoE
Hocheffizientes Mixture-of-Experts-Modell mit nur 4B aktiven Parametern bei 26B Gesamtkapazität
Gemma 4 E4B
Vielseitiges Edge-Modell mit multimodaler Intelligenz für Text, Bild und Audio
Gemma 4 E2B
Kompaktes multimodales Edge-Modell mit Text-, Bild- und Audio-Verständnis
War diese Übersicht hilfreich?