Damit derselbe Charakter über mehrere KI-Videoclips gleich bleibt, ist die Antwort kein Modell, sondern eine Reihenfolge: Leg den Charakter zuerst als Standbild fest und erzeuge jeden Clip aus diesem Bild. Auf 8frame ist die günstigste Variante Seedream 5 Lite für 6 Credits für das Porträt und Kling 2.6 Pro für 47 Credits für einen 5-Sekunden-Clip ohne Ton. Ein festgelegter Charakter kostet so etwa 53 Credits statt der 282, die du verbrauchst, wenn du Text-zu-Video sechsmal neu würfelst und hoffst, dass die Gesichter zusammenpassen.
Kurzfassung
- Löse Konsistenz nicht im Videomodell. Löse sie im Standbild und animiere dann das Standbild.
- Günstigste Festlegung: Seedream 5 Lite für 6 Credits (Seedream nimmt bis zu 14 Referenzbilder). Nano Banana 2 für 8 bis 22 Credits je nach Auflösung ist die andere gute Option.
- Video mit Referenzen, vom günstigsten an: Kling O1 Reference für 73 Credits pro 5 Sekunden (bis zu 7 Referenzen), Seedance 2.5 für 157 (Ton inklusive, bis 30 Sekunden), Veo 3.1 im Referenzmodus für 448 (bis zu 3 Referenzen, 8 Sekunden).
- Seedance lehnt Referenzen mit Nahaufnahmen des Gesichts ab. Gib ihm Aufnahmen ab der Hüfte oder Ganzkörperbilder.
- Nichts davon ist perfekt: Rechne mit Abweichungen im Profil, bei langen Einstellungen und wenn zwei referenzierte Gesichter im selben Bild sind.
Warum Text-zu-Video keinen Charakter hält
Text-zu-Video erzeugt bei jedem Durchlauf ein neues Gesicht. Gleicher Prompt, gleiches Modell, zwei verschiedene Menschen. Für einen einzelnen Clip egal; sobald zwei Clips aneinandergeschnitten werden, ist es ein Produktionsproblem. Ein Prompt ist eine Beschreibung, und eine Beschreibung hat viele gültige Antworten. Ein Referenzbild ist eine Vorgabe: Das Modell muss die Pixel einhalten, die du ihm gibst.
Text-zu-Video neu zu erzeugen, bis ein Gesicht passt, kostet bei Kling 2.6 Pro 47 Credits pro Versuch ohne Ton. Sechs Versuche sind 282 Credits, etwa 2,82 US-Dollar zum Paketpreis, und am Ende hast du ein Gesicht, das du in Einstellung zwei nicht wiederholen kannst. Das Standbild zuerst festzulegen kostet 6 Credits.
Schritt 1: den Charakter als Standbild festlegen
Seedream 5 Lite, 6 Credits. Seedream nimmt bis zu 14 Referenzbilder gleichzeitig, mehr als jedes andere Bildmodell auf dem Canvas. Sobald du das Gesicht hast, kannst du es zusammen mit einer Kostüm-, einer Licht- und einer Ortsreferenz zurückgeben.
Nano Banana 2, 8 bis 22 Credits. Preis nach Auflösung, bis zu 4 Bilder pro Durchlauf und bis zu 10 Referenzen. Nimm es, wenn der Charakter einen großen Ausschnitt aushalten muss.
Schreib den Prompt über das, was fest bleiben muss: Alter, Statur, Haare, Augenfarbe, Hautton, ein markantes Merkmal und die Kleidung mit einer benannten Farbe. Die Stimmung darf sich pro Einstellung ändern, die Struktur nicht.
Schritt 2: ein Winkelpaket bauen
Ein frontales Porträt reicht nicht. Erzeuge denselben Charakter in drei bis fünf Ansichten: frontal, Dreiviertel, Profil, aus leicht erhöhter Kamera und eine Aufnahme ab der Hüfte oder als Ganzkörperbild, denn das ist der Bildausschnitt, den Seedance annimmt. Mit Seedream 5 Lite kosten fünf Bilder 30 Credits.
ShotGrid hilft hier: Für 42 Credits erzeugt es ein 3x3-Blatt mit neun Frames aus 1 bis 10 Referenzen, sodass du den Charakter in neun Momenten siehst, bevor du einen Video-Credit ausgibst.
Schritt 3: Video aus dem Standbild erzeugen
Bild-zu-Video aus dem festgelegten Standbild. Kling 2.6 Pro für 47 Credits pro 5 Sekunden ohne Ton (95 mit Ton) ist die Standardwahl. Weil das Gesicht im ersten Frame schon stimmt, ist der größte Teil des Problems gelöst. Vergleich nach Modell in die besten KI-Bild-zu-Video-Tools.
Videomodelle mit Referenzen:
- Kling O1 Reference, 73 Credits pro 5 Sekunden, 146 pro 10. Erzeugt den Clip aus bis zu 7 Referenzbildern. (Kling O1 Video, 109 Credits pro 5 Sekunden, ist ein anderer Modus: Es bearbeitet ein Video, das du hochlädst.)
- Seedance 2.5, 157 Credits pro 5 Sekunden in 720p. Bis 30 Sekunden, Ton standardmäßig an zum gleichen Preis, bis zu 9 Referenzen auf dem Canvas. Nimm Referenzen ab der Hüfte oder Ganzkörperbilder, keine Nahaufnahmen des Gesichts: Der Filter von Seedance lehnt Gesichter in Nahaufnahme in allen unseren Tests mit einem E005-Fehler ab, während dieselbe Person ab der Hüfte durchgeht und ihre Identität behält. Mehr in Seedance flagged as sensitive (E005), auf Englisch.
- Veo 3.1 im Referenzmodus, 448 Credits. Bis zu 3 Referenzen, 8 Sekunden. Lohnt sich für eine Hauptszene, nicht für die elf Einstellungen drumherum.
Eine Sequenz aus sechs Einstellungen: 30 Credits für das Referenzpaket plus sechs Clips mit Kling 2.6 Pro ohne Ton zu je 47 ergeben 312 Credits, etwa 3,12 US-Dollar. Mit den 1.000 Credits des Starter-Plans für 19 US-Dollar, die übertragen werden, solange du abonniert bleibst, sind das drei Sequenzen im Monat.
Vergleichstabelle
| Werkzeug | Schritt | Credits | Was es festhält |
|---|---|---|---|
| Seedream 5 Lite | Standbild | 6 | Bis zu 14 Referenzen |
| Nano Banana 2 | Standbild | 8 bis 22 | Bis zu 10 Referenzen |
| ShotGrid | Storyboard | 42 | Neun Frames aus 1 bis 10 Referenzen |
| Kling 2.6 Pro | Bild-zu-Video | 47 ohne Ton, 95 mit Ton | Identität im ersten Frame |
| Kling O1 Reference | Video | 73 (5 s) | Bis zu 7 Referenzen |
| Seedance 2.5 | Video | 157 (5 s, 720p) | Bis zu 9 Referenzen, keine Gesichts-Nahaufnahmen; bis 30 s; Ton |
| Veo 3.1 Referenzmodus | Video | 448 (8 s) | Bis zu 3 Referenzen |
Was noch schiefgeht
- Lange Einstellungen. Je länger ein durchgehender Clip läuft, desto mehr Raum hat das Gesicht zum Abweichen. Plane Schnitte ein.
- Profile. Frontale Referenzen übertragen sich schlecht auf ein 90-Grad-Profil. Füg eine Profilreferenz hinzu.
- Zwei referenzierte Gesichter in einem Bild. Schwieriger als eines. Erzeuge Einzelaufnahmen und schneide zwischen ihnen.
- Kleidung. Die Referenz hält das Gesicht stärker fest als die Kleidung. Nenne die Farbe in jedem Prompt.
- Nahaufnahmen bei Seedance. Mit E005 abgelehnt. Die Credits kommen automatisch zurück, aber dasselbe Bild erneut zu versuchen hilft nicht: Ändere den Ausschnitt.
Zwei Hinweise für Leserinnen und Leser aus dem deutschsprachigen Raum: Die Preise von 8frame sind in US-Dollar, und die App-Oberfläche gibt es auf Deutsch. Ist dein Browser auf Deutsch eingestellt, öffnet sich die App auf Deutsch.
Häufige Fragen
Wie behalte ich denselben Charakter über mehrere KI-Videos? Erzeuge ein kanonisches Standbild des Charakters, bau ein Paket aus drei bis fünf Winkeln plus einer Aufnahme ab der Hüfte und nutze es als Referenz für jeden Clip. Auf 8frame: Seedream 5 Lite für 6 Credits pro Bild, dann Bild-zu-Video mit Kling 2.6 Pro (47 ohne Ton) oder Kling O1 Reference (73).
Welches KI-Videomodell ist am besten für konsistente Charaktere? Für Menge Bild-zu-Video aus einem festgelegten Standbild mit Kling 2.6 Pro oder Kling O1 Reference mit bis zu 7 Referenzen. Für lange Einstellungen mit Ton Seedance 2.5 mit Referenzen ab der Hüfte oder Ganzkörperbildern. Für eine Hauptszene Veo 3.1 im Referenzmodus.
Warum lehnt Seedance meine Charakterreferenz ab? Sein Filter lehnt Referenzbilder mit dem Gesicht in Nahaufnahme mit einem E005-Fehler ab. Eine Aufnahme desselben Charakters ab der Hüfte oder als Ganzkörperbild geht durch.
Ist Charakterkonsistenz 2026 gelöst? Nein. Für die Produktion reicht es, wenn du vom Standbild aus arbeitest und oft schneidest, aber im Profil, bei langen Einstellungen und mit zwei Charakteren im Bild gibt es weiter Abweichungen.
Erst das Bild, dann das Video, alles auf einem Canvas. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.