Blog · 19. September 2026 · 15 Min. Lesezeit

So schneidet KI dein Video: Anleitung

Grafische Titelkarte zum Beitrag „So schneidet KI dein Video: Anleitung“ mit einem stilisierten Motiv: Videobild mit Schnittspur.
Grafik: HumanITy

Ein Video mit KI zu schneiden heißt nicht, einen Knopf zu drücken, sondern sechs Schritte zu durchlaufen, in denen jeweils ein Teil automatisch läuft und ein Teil eine Entscheidung bleibt. Erstens sichten: Ein Spracherkennungsmodell erzeugt aus deinem Rohmaterial ein Transkript mit Zeitmarken, du entscheidest, welcher Take der beste ist. Zweitens aufräumen: Stille findet das Werkzeug zuverlässig über den Pegel, Füllwörter nur je nach Sprache und Programm, inhaltliche Versprecher gar nicht; du entscheidest, welche Pause bleibt. Drittens der Rohschnitt: Szenenerkennung und Clip-Vorschläge kommen von der Maschine, Reihenfolge und Aufbau von dir. Viertens Untertitel: automatisch erzeugt, immer gegengelesen. Fünftens der Ton: Lautheit lässt sich messen und auf einen Zielwert rechnen, der verlässlichste Schritt von allen. Sechstens der Export: Format, Bitrate und Seitenverhältnis richten sich nach der Plattform, und danach gehört jede Datei geprüft. Schritt zwei spart am meisten Zeit und geht am häufigsten zu weit: Ein Video, aus dem jede Atempause entfernt wurde, klingt gehetzt, egal wie sauber die Automatik gearbeitet hat.

Ich schneide meine eigenen Videos nicht mehr selbst. Bei mir läuft dieser Ablauf über eine feste Rolle in meiner KI-Belegschaft, über die Kommandozeile mit ffmpeg, einem lokal laufenden Whisper-Modell und Remotion, und ich prüfe am Ende das Ergebnis. Alles, was ich zu KI im Arbeitsalltag sammle, steht auf der Seite KI; wie ich entscheide, welche Aufgaben überhaupt abgegeben werden, in Welche Aufgaben du an KI abgeben kannst. Welches Programm du dafür nimmst, ist eine eigene Frage: Preise und Grenzen stehen in KI-Videoschnitt-Software im Vergleich. Hier geht es um den Ablauf selbst.

Der Ablauf in sechs Schritten

Schritt Was das Werkzeug automatisch macht Was du entscheidest
1. Sichten und sortieren Transkript mit Zeitmarken, technische Daten je Datei Welcher Take, welches Material überhaupt in den Schnitt geht
2. Versprecher und Pausen raus Stille finden, Füllwörter markieren, Lücken kürzen Welche Pause bleibt und wie kurz eine Pause werden darf
3. Rohschnitt Szenenwechsel erkennen, Clip-Vorschläge machen Reihenfolge, Einstieg, Länge, was ersatzlos rausfliegt
4. Untertitel Text und Timing erzeugen Eigennamen, Fachbegriffe, Zeilenumbrüche, Position
5. Ton angleichen Lautheit messen und auf einen Zielwert rechnen Verhältnis von Sprache zu Musik, Umgang mit Ausreißern
6. Export Umwandeln in Format, Auflösung und Bitrate Welche Fassungen es gibt und wohin sie gehen

Die rechte Spalte ist die eigentliche Arbeit. Werkzeuge machen dazu inzwischen Vorschläge, bis hin zu Reihenfolge und Länge; in diesem Ablauf bleiben diese Entscheidungen trotzdem freigabepflichtig, weil ein Vorschlag keine Aussage darüber ist, was wichtig ist. Für die linke Spalte gibt es sehr gute Werkzeuge, und die räumen dir die Zeit für die rechte frei.

Schritt 1: Material sichten und sortieren

Vor dem ersten Schnitt legst du eine Arbeitskopie an und lässt das Original unberührt. Das klingt nach Kleinigkeit und ist der einzige Fehler in dieser Liste, der nicht reparabel ist.

Automatisch: Ein Transkript mit Zeitmarken. Lokal erledigt das Whisper: Die Kommandozeile schreibt direkt eine SRT-Datei (--output_format srt), mit --language German gibst du die Sprache vor, damit das Modell nicht raten muss. Dazu liest du je Datei Auflösung, Dauer und Bildrate aus. Im Transkript kannst du suchen, und Suchen schlägt das Durchspulen von vier Stunden Material.

Deine Entscheidung: Welcher Take der beste ist. Eine Maschine kann zählen, wie oft du dich verhaspelt hast, aber nicht hören, in welchem Anlauf der Satz gesessen hat. Bei drei Versionen derselben Passage markierst du die gewünschte im Transkript, nicht in der Zeitleiste.

Eine Vorentscheidung gehört hierher: Browserdienste verarbeiten dein Rohmaterial auf ihren Servern. Wenn darin Kunden, Patienten oder Mitarbeiter vorkommen, ist der Upload eine bewusste Entscheidung. Wie ich das handhabe, steht in KI und Datenschutz: was die KI sehen darf.

Schritt 2: Versprecher, Pausen und Füllwörter entfernen

Hier liegt die Zeitersparnis, und hier liegt die Grenze.

Automatisch, und zwar gut. Die technische Grundlage ist simpel: Man sucht Stellen, an denen der Pegel für eine Mindestdauer unter eine Schwelle fällt. In ffmpeg macht das der Filter silencedetect, standardmäßig mit einer Rauschschwelle von -60 dB und einer Mindestdauer von zwei Sekunden. Für Sprache setzt man die Schwelle höher, also weniger negativ, und die Mindestdauer kürzer, etwa silencedetect=n=-30dB:d=0.5: Bei -30 dB zählt auch leiser Raumton als Stille, bei -60 dB praktisch nur digitale Stille. Heraus kommt eine Liste mit Anfang, Ende und Dauer jeder Stille, und die ist die Vorlage für den Schnitt. Der verwandte Filter silenceremove arbeitet nur auf der Tonspur; für Video nimmst du die Liste und schneidest Bild und Ton gemeinsam.

In den Programmen heißt dasselbe anders. Premiere Pro filtert das Transkript nach „Pausen" und löscht sie einzeln oder alle auf einmal, wahlweise als „Extract" mit Zuziehen der Lücke oder als „Lift" mit stehenbleibender Lücke; die kürzeste Pause, nach der sich filtern lässt, ist eine Zehntelsekunde. Descript hat zwei getrennte Funktionen: „Remove filler words" für äh und ähm, laut Hersteller nur in englischen Transkripten, und „Shorten word gaps", das alle Lücken über einer gewählten Dauer auf eine Zielgröße kürzt, zum Beispiel 200 Millisekunden.

Und genau hier geht es zu weit. „Alle Lücken über 400 Millisekunden auf 200 kürzen" ist in zwei Sekunden ausgeführt und erzeugt ein Video, das niemand zu Ende schaut. Denn Pause ist nicht gleich Pause: Die Suchpause, in der jemand nach dem Wort sucht, darf weg. Die Atempause am Satzende trägt den Rhythmus. Die Setzpause vor dem wichtigen Satz ist genau deshalb da, weil die Aussage danach kommt. Wer sie alle auf denselben Wert zieht, bekommt eine Tonspur ohne Betonung, und das Video wirkt nicht kürzer, sondern anstrengender.

Dasselbe gilt für Füllwörter. Ein „Äh" vor einer Zahl ist oft der Moment, in dem jemand nachdenkt; schneidet man ihn heraus, klingt die Zahl auswendig gelernt. Descripts Füllwort-Liste lässt dich deshalb je Fundstelle entscheiden: löschen, durch eine Lücke ersetzen, nur aus dem Transkript nehmen und den Ton lassen, oder „Ignore", wo laut Hilfeseite der Ton entfernt wird und das Wort im Skript durchgestrichen stehen bleibt. Du siehst also, was entfernt wurde.

Die Arbeitsregel: Automatik findet, Mensch entscheidet. Lass das Werkzeug alle Kandidaten markieren und geh sie in einem Durchlauf durch, statt sie pauschal zu löschen. Und prüfe die Schnitte am Bild, nicht nur am Ton: Ein sauberer Tonschnitt, bei dem der Kopf im Bild springt, ist schlechter als die Pause, die du gerade entfernt hast.

Schritt 3: Den Rohschnitt setzen

Der Rohschnitt legt die Struktur fest, noch nicht den Feinschliff. Er beantwortet drei Fragen: Womit fängt es an, in welcher Reihenfolge kommt der Rest, wo hört es auf.

Automatisch: Szenenwechsel erkennen und Clips vorschlagen. Die Reel-Automaten gehen weiter und suchen aus einem langen Video selbstständig die Passagen für Kurzclips heraus. Das ist die Stelle, an der eine KI am weitesten in Schnittentscheidungen hineingeht.

Deine Entscheidung: alles, was mit Absicht zu tun hat. Die Maschine erkennt, wo ein Gedanke endet, nicht, ob er wichtig ist. Der stärkste Satz eines Interviews steckt oft mitten in einem Nebensatz. Praktisch heißt das: Du markierst im Transkript die Passagen, die bleiben, und baust daraus die Reihenfolge. Wer den Feinschliff vor der Struktur macht, poliert Material, das später rausfliegt.

Schritt 4: Untertitel

Untertitel sind in diesem Ablauf ein eigener Arbeitsschritt, kein Nebenprodukt. Das Transkript aus Schritt 1 ist die Grundlage, der Rest ist Korrektur: Eigennamen und Fachbegriffe werden von jeder Automatik verhört, Zahlen anders geschrieben, als Untertitel sie schreiben sollten, und Zeilen dort umgebrochen, wo gerade Platz ist. Google empfiehlt in der eigenen Anleitung, automatische Untertitel immer durchzusehen und zu korrigieren. Wie du sie erzeugst und welches Dateiformat wofür taugt, steht in Untertitel automatisch erstellen; welches Werkzeug für Hochkant-Videos was kann, in Untertitel-Tools für Reels im Vergleich. Hier reicht die Merkregel: Der Untertitel kommt nach dem Rohschnitt, nie davor, sonst korrigierst du Text zu Passagen, die du gleich löschst.

Schritt 5: Ton angleichen

Der Schritt, den fast alle überspringen, und der einzige, für den es überhaupt eine genormte Zielgröße gibt.

Automatisch: Lautheit messen und anpassen. Die Referenz aus dem Rundfunk ist EBU R 128: Die Programmlautheit wird auf einen Zielwert von -23,0 LUFS normalisiert, gemessen nach ITU-R BS.1770, und der wahre Spitzenpegel soll in der Produktion -1 dBTP nicht überschreiten. In ffmpeg rechnet der Filter loudnorm nach dieser Messlogik, seine Voreinstellungen sind aber andere: -24,0 LUFS integrierte Lautheit, 7,0 Lautheitsumfang, -2,0 dBTP Spitzenpegel. Wer den Rundfunkwert will, gibt ihn ausdrücklich mit, etwa loudnorm=I=-23:TP=-1. Wenn du die gemessenen Werte des Ausgangsmaterials mit übergibst, rechnet der Filter linear, skaliert also gleichmäßig, statt dynamisch einzugreifen. Das ist der Unterschied zwischen „lauter gemacht" und „richtig ausgepegelt".

Deine Entscheidung: der Zielwert und das Verhältnis. Für Social Media gibt es keinen plattformübergreifenden Normwert, also setzt du selbst einen, der nicht clippt, hältst ihn über alle Videos durch und notierst ihn. Dazu kommt: Wie laut steht die Musik unter der Sprache, was passiert mit dem einen lauten Lacher, klingen zwei Aufnahmen aus zwei Räumen nach demselben Video. Ob dein Pegel sitzt, hörst du, indem du dein fertiges Video direkt nach einem fremden Video im selben Feed abspielst.

Schritt 6: Export und die Prüfung danach

Der Export ist kein Knopf, sondern eine Entscheidung darüber, wie viele Fassungen es gibt.

Für YouTube empfiehlt Google MP4 mit dem moov-Atom am Dateianfang, H.264 im High-Profil, Ton als AAC-LC mit 48 kHz, und als Bitrate für SDR-Material rund 8 Mbit/s bei 1080p und 35 bis 45 Mbit/s bei 4K, bei hoher Bildrate 12 beziehungsweise 53 bis 68 Mbit/s. Die Bildrate der Aufnahme behältst du bei, statt umzurechnen. YouTube Shorts sind vertikal, bis zu drei Minuten lang und werden mit maximal 1080p hochgeladen. Für Instagram Reels nennt Meta 9:16, MP4 oder MOV, bis zu 15 Minuten und maximal 4 GB, und eine Angabe, die für den Schnitt wichtiger ist als jede Bitrate: Mindestens 14 Prozent oben, 35 Prozent unten und 6 Prozent an jeder Seite sollen frei von Text, Logos und Gestaltungselementen bleiben, sonst verdeckt die Bedienoberfläche sie. Deine Untertitel gehören also nicht in die untere Bildmitte, obwohl jedes Werkzeug sie dort voreinstellt.

Und dann prüfst du. Ein Fehler, der besonders leicht durchrutscht, ist ein schwarzes Einzelbild an einer Schnittstelle, das beim Abspielen im Programm nicht auffällt. ffmpeg findet so etwas mit blackdetect, das in der Voreinstellung erst ab zwei Sekunden Schwarzbild anschlägt und bei einem Anteil von 98 Prozent schwarzer Pixel; für ein Reel setzt du die Mindestdauer deutlich herunter. Der Filter meldet dann auch gewollte Schwarzblenden, jeder Treffer braucht also einen Blick. Dazu die erste und die letzte Sekunde ansehen, den Ton auf Stummheit prüfen, die Dateigröße gegen die Erwartung halten. Vier Minuten, die eine Reklamation ersparen.

Wenn dieser Ablauf jede Woche stattfindet

Sechs Schritte für ein Video sind machbar. Sechs Schritte für drei Videos pro Woche sind eine Stelle. Ich habe dafür keine weitere Software eingeführt, sondern die Aufgabe an eine Rolle gegeben: Eddi ist mein KI-Mitarbeiter für Videoschnitt. Er bekommt Rohmaterial und ein Skript und liefert ein fertiges Video zurück: Pausen raus, Untertitel drauf, Overlays gesetzt, Format 9:16, Schwarzbild-Prüfung bestanden.

Er benutzt dieselben Werkzeuge wie oben, ffmpeg, ein lokal laufendes Whisper-Modell und Remotion, alles über die Kommandozeile, ohne Schnittprogramm und ohne Maus. Der Unterschied ist, dass die Prüfschritte bei ihm fest eingebaut sind statt freiwillig. Zu jeder Rohdatei legt er Auflösung, Dauer und eine Prüfsumme an, bevor er sie anfasst, und er überschreibt Rohmaterial nie. Nach jedem Schnitt gleicht er zwei Transkripte gegeneinander ab, um zu sehen, ob beim Kürzen ein Wort verloren gegangen ist. Nach jedem Encode läuft ein Schwarzbild-Scan, vor jedem Vollrender ein Blick auf Test-Standbilder. Diese Routine stammt nicht aus einem Handbuch, sondern aus einer Reklamation von mir: Nach einer Lieferung mit Schwarzbildern ist der Scan fest verdrahtet.

Was er nicht macht, ist genauso klar. Er dreht nicht selbst, ohne Rohmaterial gibt es kein Video, und das Hochladen bleibt mein Gate. Wie so eine Rolle entsteht, steht in KI-Mitarbeiter einstellen: der Ablauf, wie die Arbeit bei mir aufgeteilt ist, in Meine KI-Belegschaft. Und wenn du den Schnitt lieber ganz aus dem Haus gibst: Was ein Dienstleister von dir braucht und wie abgerechnet wird, steht in Video schneiden lassen: Ablauf und Preise.

Häufige Fragen

Kann KI ein Video komplett allein schneiden?

Teilweise. Aus einem langen Video wählen Reel-Automaten die Passagen selbst aus, und auch Reihenfolge, Länge und Stil lassen sich inzwischen vorschlagen oder ausführen. Der Rest ist Zuarbeit: Transkript, Stille-Erkennung, Untertitel, Lautheitsanpassung. Was am Ende drinbleibt, bleibt in diesem Ablauf eine Freigabe von dir, denn der Schnitt ist eine Aussage darüber, was wichtig ist, und das ist keine Rechenaufgabe, sondern das Handwerk, das vor jedem Programm gelernt wird.

Wie entferne ich Pausen automatisch?

Über Stille-Erkennung. In ffmpeg findet silencedetect alle Stellen unter einer Pegelschwelle, für Sprache etwa mit n=-30dB:d=0.5; Premiere Pro filtert das Transkript nach Pausen und löscht sie einzeln oder gesammelt, Descript kürzt alle Lücken über einer gewählten Dauer auf eine Zielgröße. Geh die Treffer einzeln durch, statt sie pauschal zu löschen, sonst verlierst du die Atempausen mit.

Wie kurz darf eine Pause im fertigen Video sein?

Dafür gibt es keinen Normwert, sondern eine Unterscheidung: Suchpausen, in denen jemand nach dem Wort sucht, kannst du fast vollständig entfernen. Atempausen am Satzende und Setzpausen vor einer wichtigen Aussage bleiben, sonst klingt das Video gehetzt. Eine pauschale Zielgröße für alle Lücken macht aus gesparter Zeit ein unhörbares Video.

Brauche ich ein Skript, damit KI-Videoschnitt funktioniert?

Zwingend nicht, hilfreich sehr. Ein Skript oder wenigstens eine Stichpunktliste gibt dir einen Text, gegen den du das automatisch erzeugte Transkript abgleichen kannst. Dieser Abgleich fängt die Fehler, die sonst erst im fertigen Video auffallen: verhörte Eigennamen in den Untertiteln und Sätze, die beim Kürzen ein Wort verloren haben.

Welches Format nehme ich für Social Media?

Hochkant 9:16 für Reels, TikTok und Shorts, Querformat für YouTube. Instagram nimmt für Reels MP4 oder MOV bis 15 Minuten und 4 GB, YouTube Shorts sind vertikal und bis zu drei Minuten lang bei maximal 1080p. Plane die Ränder mit ein: Meta empfiehlt, oben 14 Prozent, unten 35 Prozent und seitlich je 6 Prozent frei von Text und Logos zu lassen.

Wie du weitermachst

Nimm dein nächstes Video und mach nur Schritt 2 anders als sonst: Lass die Stille automatisch finden, aber entscheide bei jeder Pause selbst, ob sie weg darf, und notier, wie viele du behalten hast. Diese Zahl ist deine eigene Untergrenze, und ab dem nächsten Video weißt du, wie weit du die Automatik laufen lassen kannst.

Wenn dabei herauskommt, dass nicht die Werkzeuge dein Engpass sind, sondern die Wiederholung derselben sechs Schritte, ist der nächste Schritt eine feste Rolle statt eines weiteren Abos. Die fertigen Vorlagen dafür liegen in meiner Community.

Kevin Welter

Kevin Welter

Entwickler, IT-Architekt, Fachbuchautor (Kubernetes, Cloud-Infrastrukturen) und Speaker. Betreibt sein Business mit einer KI-Belegschaft aus vierzehn KI-Mitarbeitern und zeigt Selbstständigen in seiner Community, wie sie ihren ersten KI-Mitarbeiter einstellen.

Mehr über KI-Mitarbeiter

In einer Stunde läuft dein erster KI-Mitarbeiter

Zur Community