Blog · 18. September 2026 · 14 Min. Lesezeit

KI-Video-Generator vs. KI-Videoschnitt

Grafische Titelkarte zum Beitrag „KI-Video-Generator vs. KI-Videoschnitt“ mit einem stilisierten Motiv: Videobild mit Schnittspur.
Grafik: HumanITy

Ein KI-Video-Generator erzeugt Bildmaterial, das es vorher nicht gab, ein KI-gestütztes Schnittprogramm bearbeitet Material, das du aufgenommen hast. Zwei Werkzeuge für zwei Ausgangslagen, die viele Vergleiche im Netz in einen Topf werfen. Am schnellsten sichtbar wird der Unterschied an der Einheit, in der beide arbeiten: Ein Generator liefert einen Clip von wenigen Sekunden. Googles Veo 3.1 erzeugt laut Entwicklerdokumentation Videos von 4, 6 oder 8 Sekunden, standardmäßig in 720p, in 1080p und 4K nur bei der 8-Sekunden-Länge, wahlweise 16:9 oder 9:16, und erzeugt den Ton gleich mit. In der Gemini App liegt dahinter nach Googles Produktseite inzwischen Gemini Omni 1.1 Flash mit 10 Sekunden je Video. Ein Schnittprogramm dagegen arbeitet an Minuten: an dem, was schon da ist. Praktisch heißt das: Der Generator ist stark, wo keine bestimmte Person und kein bestimmter Ort gezeigt werden muss. Soll dagegen ein Gesicht sprechen, das als deines wiedererkannt wird, beginnt auch der Avatar-Weg mit einem Foto oder einer kurzen Videoaufnahme. Alle Modellnamen, Längen und Preise in diesem Beitrag sind am 20. September 2026 an den Anbieterseiten geprüft.

Ich erzeuge meine Reels nicht, ich nehme sie auf und lasse sie schneiden. Generiertes Material kommt bei mir nur als Zulieferung vor, ein paar Sekunden B-Roll in einem Video, das sonst aus echten Aufnahmen besteht. Alles, was ich zu KI im Arbeitsalltag sammle, steht auf der Seite KI; wie ich entscheide, was überhaupt abgegeben wird, in Welche Aufgaben du an KI abgeben kannst.

Zwei Werkzeuge, zwei Ausgangslagen

KI-Video-Generator KI-gestützter Videoschnitt
Was hineingeht Text, oft zusätzlich ein Bild als Referenz dein aufgenommenes Rohmaterial
Was herauskommt ein Clip von wenigen Sekunden, neu erzeugt ein fertiges Video aus vorhandenen Aufnahmen
Einheit der Arbeit die Einstellung die Abfolge
Wer bestimmt Gesicht und Ort das Modell, geführt vom Prompt deine Kamera
Der typische Knackpunkt Länge, Wiedererkennbarkeit, Kennzeichnung Sichtung, Untertitel, Format

Die Zeile, die am meisten erklärt, ist die dritte. Ein Generator liefert eine Einstellung, ein Video besteht aus vielen davon: in einer Reihenfolge, mit Übergängen, mit Ton, der über den Schnitt hinweg trägt. Diese Reihenfolge herzustellen ist Schnittarbeit, egal woher die einzelnen Einstellungen kommen. Wer „KI-Video erstellen aus Text" sucht und ein fertiges Fünf-Minuten-Video erwartet, sucht also zwei Werkzeuge, nicht eines.

Wofür der Generator taugt

Der Generator spielt seine Stärke dort aus, wo du etwas zeigen willst, das du nicht drehen kannst oder nicht drehen willst: eine Kamerafahrt über eine Landschaft, die es so nicht gibt, eine abstrakte Szene als Untermalung, ein Objekt, für das kein Aufbau und kein Drehtag zur Verfügung steht.

Die Preise unterscheiden sich weniger in der Höhe als im Modell. Runway rechnet in Credits: Der Standard-Plan kostet laut Preisseite 12 US-Dollar im Monat bei jährlicher Zahlung und enthält 625 Credits, die der Anbieter mit rund 52 Sekunden Gen-4.5 oder 104 Sekunden Gen-4 Turbo angibt, Wasserzeichen entfallen ab dieser Stufe. Der Gratiszugang besteht aus 125 einmaligen Credits, also aus ein paar Versuchen, nicht aus einem Arbeitsmodus. Bei Google hängt die Videoerzeugung in der Gemini App am kostenpflichtigen Abo, die Funktionen unterscheiden sich nach Plan und Region, und das Mindestalter liegt bei 18 Jahren. Preisseiten abgerufen am 20. September 2026; Tarife und Kontingente ändern sich hier schnell.

Ohne Anbieterkonto bleibt der Weg über offene Modellgewichte auf eigener Hardware, und dann bezahlst du mit Rechenzeit statt mit Geld. Alibabas Wan 2.2 steht unter Apache 2.0 und erzeugt Clips von fünf Sekunden in 480P oder 720P; die große A14B-Variante nennt in der Modellkarte mindestens 80 GB VRAM für eine einzelne Grafikkarte, die kleinere TI2V-5B läuft laut derselben Karte auf einer Consumer-Karte wie der 4090 und erzeugt ein 720P-Video in unter neun Minuten. LTX-Video von Lightricks liefert nach Modellkarte bis zu 1216 mal 704 Pixel bei 30 Bildern pro Sekunde und bis zu 257 Einzelbildern je Erzeugung, auch hier im Sekundenbereich. Bei offenen Gewichten lohnt der Blick über die Lizenzzeile hinaus: Modellbedingungen, Herkunft der Trainingsdaten und Hardwarebedarf entscheiden mit, ob der Weg trägt. Wer den Aufbau nicht allein durchgehen will, bringt die Frage in die Community.

Drei Punkte gehören beim Planen dazu. Erstens die Länge: Bei acht oder zehn Sekunden je Clip brauchst du für eine Minute rechnerisch sechs bis acht Erzeugungen. Rechnerisch ist nicht fertig: Nicht jeder Versuch ist brauchbar, Ausschuss und Wiederholungen gehören in die Kalkulation, und eine Minute, die trägt, entsteht erst im Schnitt. Zweitens die Wiedererkennbarkeit über mehrere Clips hinweg, dasselbe Problem wie bei Bildserien; womit die Anbieter dagegen arbeiten, steht in Bildgenerierung mit KI im Vergleich. Drittens die Aufbewahrung: Google schreibt in der Veo-Dokumentation, erzeugte Videos lägen zwei Tage auf dem Server und würden danach entfernt. Was du behalten willst, lädst du herunter.

Wofür das Schnittprogramm taugt

Alles, was du selbst aufgenommen hast. Das klingt banal und ist trotzdem die Trennlinie: Sobald Material existiert, heißt die Aufgabe nicht mehr „erzeugen", sondern „auswählen, kürzen, beschriften, ausspielen". Die KI übernimmt hier meist Zuarbeit, Transkript und Untertitel und Bildausschnitt, und du oder jemand für dich trifft die Schnittentscheidungen. Welches Programm was davon übernimmt und wo die Grenze liegt, habe ich in KI-Videoschnitt-Software im Vergleich durchgegangen, deshalb hier keine zweite Tabelle.

Ein Punkt gehört hier trotzdem dazu, weil er bei Generatoren genauso gilt: Bei Browserdiensten wandert dein Rohmaterial auf fremde Server. Wenn darin Kunden, Mitarbeiter oder Gespräche vorkommen, ist das eine bewusste Entscheidung. Wie ich das handhabe, steht in KI und Datenschutz: was die KI sehen darf.

Die Mischform, die in der Praxis am häufigsten vorkommt

Der Normalfall ist weder das eine noch das andere, sondern eigenes Material mit generierten Einsprengseln. Du stehst selbst vor der Kamera und sagst, worum es geht, und an drei Stellen liegt etwas darüber, das du nicht gedreht hast: eine Illustration, eine Szene, für die kein Material existiert, ein Übergang.

Vier Dinge machen diese Mischung im Alltag haltbar:

  1. Format vorher festlegen. Wenn das fertige Video 9:16 wird, erzeuge die Einsprengsel gleich in 9:16. Veo unterstützt laut Dokumentation beide Seitenverhältnisse; nachträgliches Beschneiden kostet Bildfläche.
  2. Kurz halten. Generierte Einstellungen fallen weniger auf, je kürzer sie stehen.
  3. Look angleichen. Eine generierte Einstellung, die heller, glatter oder farbiger ist als deine Aufnahme, wirkt wie ein Fremdkörper. Das ist Schnittarbeit, keine Prompt-Arbeit.
  4. Kennzeichnen, wenn es täuschen könnte. Dazu unten mehr.

Der Reihenfolge nach: erst aufnehmen, dann sichten, dann die Lücken benennen, dann erzeugen. Wer umgekehrt anfängt, baut sein Video um die Clips herum, die der Generator zufällig gut hinbekommen hat.

Ein Gesicht, das für dich spricht

Hier liegt die Grenze, die den ganzen Vergleich trägt, und sie verläuft feiner als gedacht. Ein sprechendes Gesicht liefern die Avatar-Anbieter auch ohne Dreh: Synthesia nennt auf seiner Avatar-Seite über 240 fertige Avatare, mit denen das erste Video ohne Aufnahme und ohne Einwilligungsverfahren entsteht, HeyGen über 1.100, laut Anbieterseite kommerziell freigegeben. Das ist dann ein fremdes Gesicht, das deinen Text spricht. Soll dein eigenes sprechen, das Kunden wiedererkennen, beginnt der Avatar-Weg je nach Anbieter mit einem Foto oder einer kurzen Videoaufnahme von dir. Bei Synthesia kommt eine Einwilligungsprüfung live vor der Kamera hinzu, die sich laut Anbieterseite weder hochladen noch umgehen lässt („a live on-camera consent verification that cannot be uploaded or bypassed"); die Person in der Einwilligung muss dieselbe sein wie die im Avatar-Video, mindestens 18 Jahre alt. HeyGen nennt als Einstieg einen kurzen Clip, nach Angaben auf der Avatar-Seite genügen 30 Sekunden, alternativ ein Foto, und verlangt für individuelle Avatare die nachweisliche Einwilligung der nachgebildeten Person.

Mit anderen Worten: Der Weg, der wie „Video ohne Dreh" aussieht, braucht einmal sauberes Ausgangsmaterial von dir. Danach kann der Avatar viele Videos sprechen. Und geht es um ein fremdes Gesicht, gilt ohnehin § 22 KunstUrhG: „Bildnisse dürfen nur mit Einwilligung des Abgebildeten verbreitet oder öffentlich zur Schau gestellt werden." Dieser Beitrag ist keine Rechtsberatung, aber die Richtung ist eindeutig genug, um sie in die Werkzeugwahl einzubauen.

Umgekehrt ist das die gute Nachricht für den Generator: Wo niemand Bestimmtes zu sehen sein muss, entfällt genau dieses Problem. Landschaft, Abstraktion, Objekt, Stimmung. Dafür ist er gebaut.

Kennzeichnung von generiertem Video

Kennzeichnung ist hier nicht eine Pflicht, sondern zwei, und sie treffen verschiedene Adressaten. Technisch: Google schreibt in der Veo-Dokumentation, mit Veo erzeugte Videos würden mit SynthID markiert, und nennt für die Gemini App dasselbe unsichtbare Wasserzeichen, das sich dort durch Hochladen einer Datei abfragen lässt. Rechtlich: Seit dem 2. August 2026 gilt Artikel 50 der KI-Verordnung. Absatz 2 verpflichtet die Anbieter der KI-Systeme, ihre Ausgaben maschinenlesbar als künstlich erzeugt zu markieren; sichtbar ist diese Markierung nicht, und wo ein Werkzeug laut EU-Kommission nur eine unterstützende Funktion für die Standardbearbeitung übernimmt, greift die Pflicht gar nicht. Für Systeme, die vor dem 2. August 2026 auf dem Markt waren, nennt die Kommission in ihrem FAQ mit Seitenstand 24. Juli 2026 eine Schonfrist bis zum 2. Dezember 2026, und nur für diese Markierung; Inhalte von vor dem 2. August 2026 müssen nicht nachträglich gekennzeichnet werden. Dich trifft nach Absatz 4 eine eigene Offenlegungspflicht bei Deepfakes, spätestens beim ersten Kontakt und in klar erkennbarer Form. Auf die Markierung des Anbieters kannst du dich dafür laut Kommission nicht berufen: erkennbar heißt ohne technische Hilfsmittel. Für Spezialeffekte in Filmproduktionen sowie für künstlerische, kreative und satirische Werke nennt die Kommission Ausnahmen beziehungsweise eine eingeschränkte Pflicht.

Was für Bilder gilt, welche Marker die einzelnen Anbieter setzen und wie leicht sie beim Hochladen verloren gehen, habe ich in KI-Bilder erstellen: kostenlos und frei belegt; für Video ist die Lage dieselbe und deshalb hier nur der Verweis. Auch das ist keine Rechtsberatung.

Wie das bei mir läuft

Bei mir macht diese Unterscheidung ein Mitarbeiter sichtbar. Eddi ist mein KI-Mitarbeiter für Video: Er bekommt Rohmaterial und ein Skript und liefert ein fertiges, technisch geprüftes Video zurück, Pausen heraus, Untertitel darauf, Overlays gesetzt, Format 9:16. Er arbeitet über die Kommandozeile mit ffmpeg, einem lokal laufenden Whisper-Modell und Remotion, nicht in einem Schnittprogramm mit der Maus. Er dreht nicht selbst, und er überschreibt nie Rohmaterial. KI-Generierungen kosten Geld, deshalb laufen sie bei ihm nur nach meiner Freigabe, und das Veröffentlichen ist ebenfalls ein Gate.

Damit steht die Antwort auf die Generator-Frage in einem Satz: Ein Generator erzeugt Bewegtbild aus einem Prompt, Eddi schneidet echtes Material. Beides kann im selben Video vorkommen; die Aufnahme, auf der du selbst zu sehen bist, ersetzt keines von beiden. Wie so eine Rolle entsteht, steht in KI-Mitarbeiter einstellen: der Ablauf; wie die Aufgaben bei mir verteilt sind, in Meine KI-Belegschaft.

Häufige Fragen

Was ist der Unterschied zwischen KI-Videoschnitt und einem KI-Video-Generator?

Der Generator erzeugt Bildmaterial, das es vorher nicht gab, aus einem Text und oft zusätzlich aus einem Referenzbild. Der KI-Videoschnitt bearbeitet Material, das du aufgenommen hast: kürzen, untertiteln, Format setzen. Der Generator liefert einzelne Einstellungen von Sekunden, der Schnitt macht daraus eine Abfolge. Kombinieren lässt sich beides, ersetzen nicht.

Kann ich aus einem Text ein fertiges Video erzeugen?

Einen Clip ja, ein fertiges längeres Video nicht in einem Zug. Veo 3.1 erzeugt laut Google Videos von 4, 6 oder 8 Sekunden mit nativ erzeugtem Ton, in der Gemini App sind es 10 Sekunden je Video. Für eine Minute brauchst du also mehrere Erzeugungen, die zueinander passen, plus den Schnitt, der sie verbindet.

Kann ich ein Video aus einem Bild und einem Text erzeugen?

Ja, das ist bei den großen Anbietern der gängige Weg. Google nennt für die Videoerzeugung in der Gemini App bis zu fünf Fotoreferenzen. Ein Referenzbild hilft vor allem dort, wo der Look über mehrere Clips gleich bleiben soll. Eine Garantie für Wiedererkennbarkeit ist es nicht, und für Gesichter gelten zusätzlich die Regeln zur Einwilligung.

Gibt es KI-Video-Generatoren kostenlos oder ohne Anmeldung?

Kostenlose Stufen ja, dauerhaft und ohne Konto eher nicht. Runway gibt für den Gratiszugang 125 einmalige Credits an, das reicht für Versuche, nicht für laufende Arbeit. Die Videoerzeugung in der Gemini App setzt ein kostenpflichtiges Google-AI-Abo und ein Mindestalter von 18 Jahren voraus. Ohne Anbieterkonto bleibt der lokale Weg über offene Modellgewichte.

Gibt es Open-Source-Video-Generatoren?

Ja, mit Hardware als Preis. Wan 2.2 von Alibaba steht unter Apache 2.0 und erzeugt Clips von fünf Sekunden in 480P oder 720P; die große Variante nennt mindestens 80 GB VRAM, die kleinere läuft laut Modellkarte auf einer 4090. LTX-Video von Lightricks liefert bis zu 1216 mal 704 Pixel bei 30 Bildern pro Sekunde. Einrichtung und Rechenzeit übernimmst du selbst.

Muss ich ein KI-Video kennzeichnen?

Die Pflicht zur maschinenlesbaren Markierung richtet sich nach Artikel 50 Absatz 2 der KI-Verordnung an die Anbieter der Systeme, nicht an dich. Dich trifft nach Absatz 4 eine eigene Offenlegungspflicht bei Deepfakes, spätestens beim ersten Kontakt und klar erkennbar; die unsichtbare Markierung des Anbieters genügt dafür nicht. Das ersetzt keine Rechtsberatung.

Wie du weitermachst

Mach die Probe an einem Video, das ohnehin ansteht. Schreib zwei Listen: die Einstellungen, die du selbst aufnimmst, und die, die du nicht drehen kannst. Erzeuge nur für die zweite. Wie lang die beiden Listen ausfallen, beantwortet die Ausgangsfrage schon, bevor du ein Werkzeug öffnest.

Wenn dabei herauskommt, dass nicht das Werkzeug fehlt, sondern jemand, der das Rohmaterial jede Woche zu einem fertigen Video macht: Genau diesen Ablauf, vom Rohmaterial über den Schnitt bis zur Freigabe, zeige ich in meiner Community, mitsamt den fertigen Vorlagen für die Mitarbeiter, die das bei mir übernehmen.

Kevin Welter

Kevin Welter

Entwickler, IT-Architekt, Fachbuchautor (Kubernetes, Cloud-Infrastrukturen) und Speaker. Betreibt sein Business mit einer KI-Belegschaft aus vierzehn KI-Mitarbeitern und zeigt Selbstständigen in seiner Community, wie sie ihren ersten KI-Mitarbeiter einstellen.

Mehr über KI-Mitarbeiter

In einer Stunde läuft dein erster KI-Mitarbeiter

Zur Community