100% Lokal · DSGVO

NeuTTS Air

von Neuphonic · Lizenz: Apache 2.0 · Kommerziell nutzbar

Ultrarealistische Text-to-Speech direkt auf der CPU: 748M-Parameter-Modell mit Instant Voice Cloning aus 3 Sekunden Audio — Apache 2.0, läuft ohne GPU via GGUF.

4.0 Gesamt
Verfügbare Größen: 0.7B

Was ist NeuTTS Air?

NeuTTS Air vom britischen Startup Neuphonic ist ein Sprachmodell für Text-to-Speech, das komplett lokal und in Echtzeit auf normalen CPUs läuft — ein Novum in dieser Qualitätsklasse. Das Modell kombiniert ein 748M-Parameter-Backbone (Qwen-Architektur, 0.5B-Klasse) mit Neuphonics eigenem NeuCodec-Audiocodec, der mit nur 0,8 kbps arbeitet und 24-kHz-Ausgabe liefert. Das Highlight ist Instant Voice Cloning: Bereits etwa 3 Sekunden Referenzaudio genügen, um eine Stimme zu klonen und beliebige Texte in diesem Stil zu synthetisieren.

Die lokale Nutzung ist vorbildlich einfach: Offizielle GGUF-Quantisierungen (Q4 und Q8) laufen über llama.cpp bzw. llama-cpp-python ohne jede Cloud-Anbindung — perfekt für datenschutzsensible Anwendungen, Voice-Agents und Embedded-Geräte. Ein Gaming-PC ist nicht nötig, 4 GB RAM reichen aus.

Die Apache-2.0-Lizenz erlaubt uneingeschränkte kommerzielle Nutzung. Einschränkungen: Der Fokus liegt auf Englisch, deutsche Synthese ist nicht die Stärke des Modells, und als reines TTS-System beherrscht es weder Chat noch andere Textaufgaben. Für On-Device-Sprachausgabe derzeit eine der besten offenen Optionen.

Fähigkeiten-Matrix

Was kann NeuTTS Air — und was nicht?

🇩🇪 Deutsch-Chat
🇬🇧 Englisch-Chat
🗣️ Multilingual
💻 Code-Generierung
🌍 Übersetzung
📋 Zusammenfassung
📄 RAG / Dokumente
🔧 Tool-Use / Function Calling
🌐 Browser-Automatisierung
👁️ Bildverständnis
🧮 Mathematik / Logik
✍️ Kreatives Schreiben

Hardware-Anforderungen

Größe Min. RAM Empf. VRAM CPU möglich? Quantisierung Empfohlene GPU
0.7B 4 GB 2 GB ✓ Ja (langsam) Q4/Q8 GGUF keine GPU nötig (CPU-Echtzeit)

GPU-Kaufberatung mit aktuellen Preisen ansehen

Kompatibilität

Ollama
LM Studio
llama.cpp
vLLM
Open WebUI
Text Gen WebUI
Jan.ai

Bewertung

Output-Qualität ★★★★☆ 4.0/5
Inference-Speed ★★★★☆ 4.5/5
RAM/VRAM-Effizienz ★★★★★ 5.0/5

War diese Übersicht hilfreich?