NeuTTS Air
von Neuphonic · Lizenz: Apache 2.0 · Kommerziell nutzbar
Ultrarealistische Text-to-Speech direkt auf der CPU: 748M-Parameter-Modell mit Instant Voice Cloning aus 3 Sekunden Audio — Apache 2.0, läuft ohne GPU via GGUF.
Was ist NeuTTS Air?
NeuTTS Air vom britischen Startup Neuphonic ist ein Sprachmodell für Text-to-Speech, das komplett lokal und in Echtzeit auf normalen CPUs läuft — ein Novum in dieser Qualitätsklasse. Das Modell kombiniert ein 748M-Parameter-Backbone (Qwen-Architektur, 0.5B-Klasse) mit Neuphonics eigenem NeuCodec-Audiocodec, der mit nur 0,8 kbps arbeitet und 24-kHz-Ausgabe liefert. Das Highlight ist Instant Voice Cloning: Bereits etwa 3 Sekunden Referenzaudio genügen, um eine Stimme zu klonen und beliebige Texte in diesem Stil zu synthetisieren.
Die lokale Nutzung ist vorbildlich einfach: Offizielle GGUF-Quantisierungen (Q4 und Q8) laufen über llama.cpp bzw. llama-cpp-python ohne jede Cloud-Anbindung — perfekt für datenschutzsensible Anwendungen, Voice-Agents und Embedded-Geräte. Ein Gaming-PC ist nicht nötig, 4 GB RAM reichen aus.
Die Apache-2.0-Lizenz erlaubt uneingeschränkte kommerzielle Nutzung. Einschränkungen: Der Fokus liegt auf Englisch, deutsche Synthese ist nicht die Stärke des Modells, und als reines TTS-System beherrscht es weder Chat noch andere Textaufgaben. Für On-Device-Sprachausgabe derzeit eine der besten offenen Optionen.
Fähigkeiten-Matrix
Was kann NeuTTS Air — und was nicht?
Hardware-Anforderungen
| Größe | Min. RAM | Empf. VRAM | CPU möglich? | Quantisierung | Empfohlene GPU |
|---|---|---|---|---|---|
| 0.7B | 4 GB | 2 GB | ✓ Ja (langsam) | Q4/Q8 GGUF | keine GPU nötig (CPU-Echtzeit) |
Kompatibilität
Bewertung
War diese Übersicht hilfreich?