Wann Reference to Video verwenden
Verwende Reference to Video, wenn du brauchst:- Charakter-Konsistenz – dieselbe Person oder Figur über mehrere Shots
- Produktgenauigkeit – ein reales Produkt, das identisch zum Original aussehen muss
- Szenenkontinuität – eine bestimmte Umgebung oder ein Hintergrund über mehrere Generationen
- Multi-Charakter-Szenen – mehrere unterschiedliche Charaktere, die interagieren, ohne sich zu vermischen
Verfügbare Modelle
Kling O3 verwendet einen strukturierten Ansatz mit Elements (Charakter-Identitätsanker mit Frontal- + Referenzbildern) und Scene-Images. Grok Imagine R2V ist einfacher – du lädst Referenzbilder direkt hoch und referenzierst sie im Prompt mit
@Image1, @Image2 usw.
Kling O3 Reference to Video
Kernkonzepte
Kling O3 Reference to Video nutzt drei Arten visueller Inputs, die zusammenspielen:
*Mindestens eines aus: Start-Frame, Elements oder Szenen-Referenzbildern ist Pflicht.
Elements
Ein Element ist ein Charakter oder Objekt, das im Video visuell stabil bleiben soll. Jedes Element besteht aus:- Frontalbild (Pflicht pro Element) – ein klares, frontales Foto des Motivs. Das ist der primäre Identitätsanker. Stell dir das wie das „Passfoto” deines Charakters oder Produkts vor.
- Referenzbilder (1–3, optional) – zusätzliche Ansichten desselben Motivs (Seitenansicht, 45°-Winkel, Rücken). Sie helfen dem Modell, das Motiv im 3D-Raum zu verstehen. Falls nicht angegeben, wird automatisch das Frontalbild als Referenz verwendet.
@Element1, @Element2 usw.
Szenen-Referenzbilder
Szenen-Referenzen definieren die „Bühne”, auf der die Handlung stattfindet. Sie beeinflussen:- Beleuchtung und Farbpalette
- Architektur und Umgebungsdetails
- Gesamten visuellen Stil und Stimmung
@Image1, @Image2 usw. im Prompt.
Limits
Die Gesamtzahl der Bilder über alle Input-Arten ist begrenzt:
Beispielszenarien:
- 7 Elements + 0 Scene-Images = 7 ✓ (keine Frames)
- 5 Elements + 2 Scene-Images = 7 ✓ (keine Frames)
- Erst-Frame (1) + 3 Elements + 3 Scene-Images = 7 ✓
- Erst-Frame (1) + End-Frame (1) + 3 Elements + 2 Scene-Images = 7 ✓
- Erst-Frame (1) + 4 Elements = ✗ (max. 3 Elements mit Frame)
- Erst-Frame (1) + End-Frame (1) + 4 Elements = ✗ (max. 3 Elements mit Frames)
Jedes Element benötigt ein Frontalbild. Wenn du keine Referenzbilder für ein Element angibst, wird das Frontalbild automatisch als Referenz verwendet.
Multi-Shot-Modus
Multi-Shot erlaubt es dir, eine einzige Generierung in mehrere Szenen aufzuteilen, jede mit eigenem Prompt und eigener Dauer. Elements und Scene-Referenzen werden über alle Shots übernommen und sorgen für Konsistenz. Die Gesamtdauer über alle Shots darf 15 Sekunden nicht überschreiten.Schritt-für-Schritt-Anleitung (Video Studio)
1. Video Studio öffnen und Modell auswählen
Geh zu venice.ai/video. Wähle im Model-Browser links eines der Kling O3 Reference to Video-Modelle:- Kling O3 Pro R2V – höhere Qualität, längere Generierungszeit (~6 Min.)
- Kling O3 Standard R2V – schneller, kostengünstiger für Iteration
2. Visuelle Inputs hinzufügen (mindestens einer Pflicht)
Du musst mindestens einen visuellen Input bereitstellen, um ein Video zu generieren: einen Start-Frame, ein Element oder ein Szenen-Referenzbild. Im Input-Panel siehst du den Abschnitt Elements. Klicke Add Element, um ein Element für Charaktere oder Objekte zu erzeugen, die visuell konsistent bleiben sollen. Für jedes Element:- Klicke das Frontal-Feld, um ein klares, frontales Bild deines Charakters oder Objekts hochzuladen
- Optional Add unter Reference Images klicken, um zusätzliche Winkel (1–3) hochzuladen
3. Szenen-Referenzbilder hinzufügen (optional)
Unter dem Elements-Abschnitt siehst du Scene Reference Images. Lade Bilder hoch, die die gewünschte Umgebung definieren – einen bestimmten Ort, ein Lichtsetup oder einen Kunststil. Sie werden automatisch als@Image1, @Image2 usw. getagged.
4. Start-Frame hochladen (optional)
Wenn du das exakte erste Frame deines Videos kontrollieren willst, wechsle zum Input-Typ Image und lade einen Start-Frame hoch. Optional kannst du auch einen End-Frame setzen.5. Prompt schreiben
Beschreibe im Prompt-Feld die gewünschte Handlung und referenziere deine Elements und Scene-Images per@-Tags:
6. Einstellungen konfigurieren
Öffne Video Settings, um anzupassen:Die Audiogenerierung ergänzt native Soundeffekte, Dialog und Ambient-Audio synchron zum Video. Die Kosten steigen um ~25 %.
7. Generieren
Klicke Generate Video. Kling O3 braucht in der Regel 4–6 Minuten, abhängig vom Modell-Tier und der Dauer. Du kannst mehrere Generierungen in die Queue stellen und Ergebnisse in der Video-Galerie durchstöbern.Multi-Shot-Storyboarding
Für narrative Sequenzen Multi-Shot nutzen, um separate Szenen in einer einzigen Generierung zu definieren.- Im Prompt-Bereich auf Add Shot klicken, um weitere Shots anzulegen
- Pro Shot einen eigenen Prompt schreiben
- Pro Shot die Dauer setzen (jeweils 3–15 s, gesamt ≤ 15 s)
Prompting-Tipps
Den Prompt strukturieren
Folge diesem Muster für verlässliche Ergebnisse:Prompts mit 50–150 Wörtern
Kürzere Prompts fehlt Detail. Längere führen zu Widersprüchen. Ziel der „Sweet Spot”.Einfache Kamerasprache nutzen
Das Modell reagiert am besten auf klare Kameraanweisungen:Einheitlichen Wortschatz verwenden
Wenn du einen Charakter mit „a red jacket” beschreibst, wechsle im nächsten Prompt nicht zu „crimson coat”. Das Modell behandelt unterschiedliche Wörter als unterschiedliche Absicht.Kameraanweisungen früh platzieren
Setze die Kameraanweisung nahe dem Prompt-Anfang, das ist verlässlicher:Kling O3 – Preise
Kling O3 Reference-to-Video-Modelle nutzen ein dauerbasiertes Pricing:
Beispiel: Ein 10-Sekunden-Video mit Audio = 10 × $0,14 = $1,40
Nutze die Video-Quote-API für genaues Pricing vor der Generierung.
Kling O3 – API-Nutzung
Kling O3 Reference to Video ist auch über die Venice-API verfügbar. Vollständige Details in der Video-Queue-API.Python
Node.js
cURL
Element-Schema
Jedes Element imelements-Array akzeptiert:
Die API unterstützt auch
video_url für video-basierte Elements, aber das ist im Video Studio UI derzeit nicht verfügbar.Kling O3 – Fehlerbehebung
Grok Imagine Reference to Video
Grok Imagine R2V verfolgt einen einfacheren Ansatz als Kling O3. Statt strukturierter Elements mit Frontal-/Referenzbild-Trennung lädst du flache Referenzbilder hoch und referenzierst sie direkt im Prompt mit@Image1, @Image2 usw. Das Modell integriert diese Motive in das generierte Video.
Wie es funktioniert
- Lade 1–7 Referenzbilder hoch – Fotos von Charakteren, Objekten oder Szenen, die im Video vorkommen sollen
- Schreibe einen Prompt, der das Video beschreibt, und nutze
@Image1,@Image2usw., um bestimmte Bilder zu referenzieren - Das Modell generiert ein Video, das diese Referenzen einbezieht
@Image-Tags im Prompt verwendest, werden alle hochgeladenen Bilder automatisch referenziert.
Einstellungen
Grok Imagine R2V unterstützt weder Audiogenerierung, Multi-Shot-Modus noch Elements. Für diese Funktionen Kling O3 R2V verwenden.
Schritt-für-Schritt-Anleitung (Video Studio)
1. Modell auswählen
Geh zu venice.ai/video. Im Model-Browser Grok Imagine R2V wählen.2. Referenzbilder hochladen
Klicke References in der Input-Toolbar (oder nutze das +-Menü), um das Referenzbild-Panel zu öffnen. Lade 1–7 Bilder der Charaktere, Objekte oder Szenen hoch, die im Video erscheinen sollen. Jedes Bild wird automatisch in der Hochlade-Reihenfolge (links nach rechts) als@Image1, @Image2 usw. getagged.
3. Prompt schreiben
Beschreibe das gewünschte Video. Nutze@Image-Tags, um bestimmte Bilder zu referenzieren:
@ im Prompt-Feld, um ein Autocomplete-Menü der verfügbaren Bildreferenzen zu sehen.
4. Einstellungen konfigurieren und generieren
Öffne Video Settings, um Aspect Ratio, Auflösung und Dauer anzupassen. Klicke Generate Video.Grok Imagine R2V – Preise
Grok Imagine R2V verwendet Dauer- und Auflösungs-basiertes Pricing:
Beispiel: Ein 8-Sekunden-Video in 480p = 8 × $0,063 = ~$0,50
Grok Imagine erhebt eine Content-Moderations-Gebühr für generierte Videos, auch wenn das Video abgelehnt wird. Das ist in den vor der Generierung angezeigten Credit-Kosten berücksichtigt.
Grok Imagine R2V – API-Nutzung
Python
Node.js
cURL
API-Parameter
Grok Imagine R2V nutzt die Felder
elements, image_urls oder imageUrl nicht. Alle Referenzbilder werden über referenceImageUrls übergeben.