100% Lokal · DSGVO

VideoChat3

von MCG-NJU (Nanjing University / Shanghai AI Lab) · Lizenz: Apache 2.0 · Kommerziell nutzbar

Vollständig offenes 4B-Video-MLLM: schlägt GPT-5 beim Temporal Grounding, 70,1 auf Video-MME — inklusive Trainingscode und 3 Mio. Trainingssamples.

4.0 Gesamt
Verfügbare Größen: 4B

Was ist VideoChat3?

VideoChat3 ist ein kompaktes 4-Mrd.-Parameter-Modell für Videoverständnis von einem Forschungsteam aus Nanjing University, Shanghai AI Laboratory, NTU und Peking University — und eines der wenigen wirklich vollständig offenen Video-MLLMs: Neben den Gewichten sind Trainingscode, Trainingsrezept und alle drei Trainingsdatensätze (rund 3 Mio. Instruktionssamples) veröffentlicht. Technisch setzt es auf einen Inflated 3D Vision Transformer (I3D-ViT) und adaptive Frame-Auflösung für Streaming-Video, wodurch es nur halb so viele visuelle Tokens erzeugt wie Qwen3-VL.

Die Ergebnisse sind beachtlich: 70,1 auf Video-MME (ohne Untertitel) und Siege über GPT-5 und Gemini 2.5 Flash auf allen drei Temporal-Grounding-Benchmarks (z. B. Charades-STA: 56,1 vs. 40,5 mIoU). Es beherrscht allgemeines Videoverständnis, Langform-Analyse und Live-Streaming-Szenarien.

Lokal läuft VideoChat3 über die offizielle PyTorch/Transformers-Pipeline auf einer 12-GB-GPU; Ollama- oder GGUF-Support gibt es nicht. Ideal für Videoanalyse, zeitliche Ereignissuche und Untertitel-/Zusammenfassungs-Workflows — kommerziell nutzbar dank permissiver Lizenz.

Fähigkeiten-Matrix

Was kann VideoChat3 — und was nicht?

🇩🇪 Deutsch-Chat
1.5
🇬🇧 Englisch-Chat
3.0
🗣️ Multilingual
2.0
💻 Code-Generierung
0.5
🌍 Übersetzung
1.5
📋 Zusammenfassung
3.5
📄 RAG / Dokumente
1.5
🔧 Tool-Use / Function Calling
1.0
🌐 Browser-Automatisierung
👁️ Bildverständnis
4.5
🧮 Mathematik / Logik
1.0
✍️ Kreatives Schreiben
1.5

Hardware-Anforderungen

Größe Min. RAM Empf. VRAM CPU möglich? Quantisierung Empfohlene GPU
4B 16 GB 12 GB ✗ Nein BF16 RTX 3060 12GB

GPU-Kaufberatung mit aktuellen Preisen ansehen

Kompatibilität

Ollama
LM Studio
llama.cpp
vLLM
Open WebUI
Text Gen WebUI
Jan.ai

Bewertung

Output-Qualität ★★★★☆ 4.0/5
Inference-Speed ★★★★☆ 4.0/5
RAM/VRAM-Effizienz ★★★★☆ 4.5/5

War diese Übersicht hilfreich?