VideoChat3
von MCG-NJU (Nanjing University / Shanghai AI Lab) · Lizenz: Apache 2.0 · Kommerziell nutzbar
Vollständig offenes 4B-Video-MLLM: schlägt GPT-5 beim Temporal Grounding, 70,1 auf Video-MME — inklusive Trainingscode und 3 Mio. Trainingssamples.
Was ist VideoChat3?
VideoChat3 ist ein kompaktes 4-Mrd.-Parameter-Modell für Videoverständnis von einem Forschungsteam aus Nanjing University, Shanghai AI Laboratory, NTU und Peking University — und eines der wenigen wirklich vollständig offenen Video-MLLMs: Neben den Gewichten sind Trainingscode, Trainingsrezept und alle drei Trainingsdatensätze (rund 3 Mio. Instruktionssamples) veröffentlicht. Technisch setzt es auf einen Inflated 3D Vision Transformer (I3D-ViT) und adaptive Frame-Auflösung für Streaming-Video, wodurch es nur halb so viele visuelle Tokens erzeugt wie Qwen3-VL.
Die Ergebnisse sind beachtlich: 70,1 auf Video-MME (ohne Untertitel) und Siege über GPT-5 und Gemini 2.5 Flash auf allen drei Temporal-Grounding-Benchmarks (z. B. Charades-STA: 56,1 vs. 40,5 mIoU). Es beherrscht allgemeines Videoverständnis, Langform-Analyse und Live-Streaming-Szenarien.
Lokal läuft VideoChat3 über die offizielle PyTorch/Transformers-Pipeline auf einer 12-GB-GPU; Ollama- oder GGUF-Support gibt es nicht. Ideal für Videoanalyse, zeitliche Ereignissuche und Untertitel-/Zusammenfassungs-Workflows — kommerziell nutzbar dank permissiver Lizenz.
Fähigkeiten-Matrix
Was kann VideoChat3 — und was nicht?
Hardware-Anforderungen
| Größe | Min. RAM | Empf. VRAM | CPU möglich? | Quantisierung | Empfohlene GPU |
|---|---|---|---|---|---|
| 4B | 16 GB | 12 GB | ✗ Nein | BF16 | RTX 3060 12GB |
Kompatibilität
Bewertung
War diese Übersicht hilfreich?