Im Betrieb entscheidet nicht das schönste Einzelbild, sondern ob das zehnte Bild noch zum ersten passt. Genau dazu sagen die Anbieter unterschiedlich viel, und daran lässt sich besser vergleichen als an Beispielbildern. Google dokumentiert für die Gemini-3-Bildmodelle bis zu 14 Referenzbilder pro Auftrag, beim Pro-Modell davon bis zu fünf Bilder für Figurenkonsistenz und bis zu drei als reine Stilreferenz. Midjourney trennt Stil und Motiv: Eine Style Reference überträgt laut Dokumentation Farben, Medium, Textur und Licht, ausdrücklich aber keine Objekte oder Personen. Adobe geht den Umweg über ein eigenes Modell, für das du 10 bis 30 eigene Bilder hochlädst und daraus einen Illustrations-, Foto- oder Figurenstil trainierst. Wer offene Gewichte lokal fährt, trainiert ein Style-LoRA; Black Forest Labs nennt dafür in seiner Anleitung zu FLUX.2 [klein] 20 bis 40 Bilder als optimale Datensatzgröße. Und OpenAI schreibt die Schwachstelle in die eigene Limitations-Liste: Das Modell könne gelegentlich Mühe haben, wiederkehrende Figuren oder Markenelemente über mehrere Generierungen hinweg visuell konsistent zu halten. Das hier ist ein Dokumentationsvergleich, kein gemeinsamer Qualitätstest von Texttreue, Stil und deutschen Prompts. Alle Angaben stammen aus der Herstellerdokumentation, Stand September 2026.
Ich erzeuge KI-Bilder nicht als Selbstzweck, sondern als Zulieferung: als B-Roll in einem Reel, als Hintergrund für eine Grafik. Deshalb ist für mich der Preis nicht die erste Frage. Welche Werkzeuge eine Gratisstufe haben und was du rechtlich mit dem Ergebnis darfst, steht getrennt in KI-Bilder erstellen: kostenlos und frei. Hier geht es um die Frage danach: womit arbeitest du, wenn du nicht ein Bild brauchst, sondern zwanzig, die zusammen aussehen wie von einer Hand. Alles, was ich zu KI im Arbeitsalltag sammle, steht auf der Seite KI; wie ich entscheide, was überhaupt abgegeben wird, in Welche Aufgaben du an KI abgeben kannst.
Sieben Kriterien, und warum eines davon die anderen schlägt
- Bildqualität für deinen Zweck. Nicht allgemein, sondern für dein Motiv: Produktfoto, Comic-Panel und fotorealistisches Porträt sind drei verschiedene Aufgaben. Prüf dein häufigstes Motiv.
- Umgang mit deutschen Eingaben. Versteht das Werkzeug deinen Prompt, oder übersetzt es ihn vorher?
- Text im Bild. Die klassische Schwachstelle, und eine der wenigen, die die Anbieter im Kleingedruckten selbst einräumen.
- Stil-Treue über mehrere Bilder. Bleibt der Look über eine Serie gleich, oder fängt jedes Bild wieder bei null an?
- Bearbeitung vorhandener Bilder. Kannst du ein bestehendes Bild gezielt ändern, statt es neu zu würfeln?
- Auflösung und Formate. Welche Pixelmaße, welche Seitenverhältnisse, welche Dateiformate kommen heraus?
- Eigener Stil, wiederverwendbar. Lässt sich dein Look festhalten und beim nächsten Auftrag wieder aufrufen?
Punkt 4 und Punkt 7 hängen zusammen und schlagen in meinem Betrieb alle anderen. Ein einzelnes beeindruckendes Bild bekommst du auf allen fünf Wegen.
Was die Anbieter zur Wiedererkennung über eine Serie sagen
Drei Dinge fallen an dieser Tabelle auf. Erstens der Unterschied zwischen Referenz und Profil: Bei Gemini gibst du deine Vorbilder bei jedem Auftrag erneut mit, bei Midjourney und Adobe entsteht etwas, das du später wieder aufrufst. Midjourney beschreibt für Moodboards sogar, dass ein einmal erzeugter Code weiter funktioniert, auch wenn du das Moodboard danach löschst. Das ist in Wahrheit die Frage, ob dein Stil eine Datei ist oder eine Gewohnheit.
Zweitens die Trennung von Stil und Motiv, die Midjourney in der Dokumentation zieht: Wer eine Figur über mehrere Bilder halten will, braucht dort eine zweite Referenzart.
Drittens die ehrlichste Zeile der Tabelle. OpenAI stellt neben die Konsistenz-Grenze eine zweite: Elemente in layoutkritischen Kompositionen platziere das Modell nicht immer präzise. Wer das liest, bevor er eine 20-teilige Kachelserie plant, spart sich einen Nachmittag.
Text im Bild: was die Hersteller selbst einräumen
Hier liegen Werbebild und Alltag am weitesten auseinander. Google beschreibt für die Gemini-3-Bildmodelle ein erweitertes Text-Rendering, das gut lesbaren, stilisierten Text für Infografiken, Menüs, Diagramme und Marketing-Assets erzeugen könne. Das ist eine Herstellerangabe, keine Messung mit offengelegter Methode. OpenAI dagegen führt Text-Rendering ausdrücklich unter den Grenzen: deutlich verbessert, aber das Modell könne weiterhin mit genauer Platzierung und Schärfe des Textes kämpfen. Adobe listet in den bekannten Einschränkungen zu Firefly einen eigenen Eintrag zu verzerrtem Text in generierten Bildern; der Stand dieser Seite ist Dezember 2025, also älter als der Rest dieses Beitrags.
Black Forest Labs gibt für FLUX konkrete Prompt-Regeln aus, und die funktionieren als Prüfliste für jedes Werkzeug: den exakten Text in Anführungszeichen setzen, die Textbeschreibung nach vorne ziehen, Farbe und Effekt benennen, Markenfarben als Hex-Code angeben, und vor allem kurz bleiben, weil lange Zeichenketten schwerer korrekt wiedergegeben werden.
Die Prüfung dauert fünf Minuten: Lass dein Werkzeug denselben kurzen Text dreimal ins selbe Motiv setzen, einmal als einzelnes Wort, einmal als Zeile mit Umlaut, einmal als zwei Zeilen mit Ziffern. Überstehen Umlaute, Bindestriche und Ziffern alle drei Durchgänge, kannst du dem Werkzeug Beschriftungen zutrauen.
Deutsche Eingaben: übersetzt oder verstanden
Die klarste Herstelleraussage zu diesem Punkt kommt von Adobe. Firefly unterstützt Prompts in über 100 Sprachen, und zwar über maschinelle Übersetzung ins Englische durch Microsoft Translator. Adobe schreibt dazu selbst, dass Generierungen auf Basis übersetzter Prompts wegen der Feinheiten jeder Sprache ungenau oder unerwartet ausfallen können. Wer bei Firefly einen sprachlich feinen deutschen Prompt schreibt, arbeitet also gegen eine Zwischenstation.
Black Forest Labs behauptet für FLUX.2 das Gegenteil und führt Mehrsprachigkeit als eigenen Anwendungsfall: Das Modell verstehe mehrere Sprachen, und ein Prompt in der Sprache des Inhalts liefere oft kulturell stimmigere Ergebnisse als ein übersetzter englischer Prompt. Die Dokumentation zeigt dazu einen deutschen Beispielprompt.
Midjourney gibt zum Eingabestil einen Hinweis, der praktisch genauso wichtig ist: Kurze, einfache Prompts erzeugen typischerweise die besten Bilder, lange Listen und ausformulierte Anweisungen verwirren eher. Ein deutscher Prompt mit drei Nebensätzen ist damit bei Midjourney nach dessen eigener Empfehlung der schlechtere Eingabestil.
Für Gemini und OpenAI liefert die hier ausgewertete Dokumentation keine direkt vergleichbare Aussage zur deutschen Prompt-Sprache. Diese Lücke ersetzt kein Bauchgefühl, sondern der Fünf-Minuten-Test aus dem Abschnitt davor.
Praktisch fahre ich zweigleisig: Motivbeschreibung in der Sprache, die das Werkzeug laut Dokumentation versteht, und der Text, der im Bild erscheinen soll, immer wörtlich in Anführungszeichen, mit Umlauten, so wie er am Ende dastehen muss.
Bearbeiten, Auflösung, Formate
Zwei Dinge daran sind wichtiger, als sie aussehen. Das eine schreibt Midjourney selbst in die Dokumentation: Ein Seitenverhältnis ist keine Bildgröße, die tatsächlichen Maße hängen an Version und Upscaler. Für ein Reel in 9:16 reicht das, was die Werkzeuge liefern, meist mühelos; für ein Druckstück rechnet Midjourney vor, dass aus 2048 Pixeln bei 300 dpi rund 6,8 Zoll Kantenlänge werden, und verweist für mehr auf Upscaler von Drittanbietern.
Das andere ist die Maske. Ein Werkzeug, das nur neu erzeugen kann, zwingt dich bei jeder Korrektur zurück an den Anfang und kostet dich die Übereinstimmung zum Rest der Serie. Ein Werkzeug, das den Eingriff auf einen markierten Bereich begrenzt, hält die Serie eher zusammen. Eine Garantie, dass außerhalb der Maske jedes Pixel identisch bleibt, geben die Anbieter dabei nicht, also leg Vorher und Nachher einmal übereinander, bevor du dich auf die Maske verlässt. Zwischen zwei sonst gleichwertigen Kandidaten nimm trotzdem den mit der Maske.
Wo diese Bilder bei mir landen
Ein erzeugtes Bild ist bei mir kein Ergebnis, sondern ein Baustein. Der Schnitt läuft über Eddi, meinen KI-Mitarbeiter für Video: Er bekommt Rohmaterial und ein Skript und liefert ein fertiges, technisch geprüftes Video zurück, mit Untertiteln, Overlays und im Format 9:16. Er arbeitet über die Kommandozeile mit ffmpeg, einem lokal laufenden Whisper-Modell und Remotion, er dreht nicht selbst, und er überschreibt kein Rohmaterial. Für Generierungen bei einem KI-Bilddienst gilt bei ihm eine eigene Regel: Sie kosten Geld, und größere Serien laufen nur nach meiner Freigabe. Wie er arbeitet und wo seine Grenze liegt, steht auf seiner Seite Eddi.
Diese Freigabe ist die Stelle, an der die Kriterien aus diesem Beitrag zusammenlaufen: Eine Serie freizugeben heißt, vorher zu wissen, dass die Bilder zueinander passen, denn eine Serie, die man zweimal erzeugt, kostet zweimal. Welches Programm den Schnitt drumherum macht, habe ich in KI-Videoschnitt-Software im Vergleich durchgegangen; wie die Rollen bei mir insgesamt verteilt sind, steht in Meine KI-Belegschaft.
Häufige Fragen
Welche KI-Bildgenerierung ist die beste?
Das lässt sich nur je Kriterium beantworten, nicht allgemein. Für Text im Bild macht Google die weitreichendste Zusage, OpenAI nennt dazu eine ausdrückliche Grenze. Für einen wiederverwendbaren eigenen Stil bieten Midjourney mit Style Codes und Moodboards, Adobe mit Custom Models und der lokale Weg mit einem LoRA jeweils einen anderen Mechanismus. Entscheide anhand deines häufigsten Auftrags, nicht anhand einer Bestenliste.
Welches Werkzeug hält einen Bildstil über eine ganze Serie durch?
Am ehesten die, die den Stil speichern statt ihn jedes Mal neu zu beschreiben: Midjourney über Style Codes und Moodboards, Adobe über ein Custom Model aus 10 bis 30 eigenen Bildern, ein lokales Setup über ein LoRA aus 20 bis 40 Bildern. Bei Gemini gibst du beim Pro-Modell bis zu drei Stilreferenzen je Auftrag mit. Prüf es vor dem Einsatz an zehn Bildern.
Kann man Bildgenerierung auch lokal betreiben?
Ja, über offene Modellgewichte auf der eigenen Hardware. FLUX ist dabei eine Modellfamilie mit unterschiedlichen Lizenzen: Von FLUX.2 [klein] stellt Black Forest Labs die 4B-Variante unter Apache 2.0 bereit, die 9B-Variante unter der FLUX Non-Commercial License. Lokal betreiben und kommerziell verwerten sind damit zwei getrennte Fragen. Die Anleitung zum Style-LoRA nennt 20 bis 40 Bilder als optimale Datensatzgröße, unter 20 fehle die Variation, über 40 verwässere der Stil. Du zahlst keine Gebühr an einen Anbieter, dafür Rechenzeit, Einrichtung und Pflege. Was das lizenzrechtlich bedeutet, steht in meinem Beitrag zu kostenlosen KI-Bildern.
Schreibt KI zuverlässig Text ins Bild?
Nicht zuverlässig genug, um es ungeprüft zu lassen. OpenAI führt Text-Rendering trotz Verbesserungen weiter unter den Grenzen des Modells, Adobe listet verzerrten Text als bekannte Einschränkung. Die Prompt-Regeln von Black Forest Labs helfen: exakten Text in Anführungszeichen, kurz halten, Farbe und Schriftcharakter benennen. Für Beschriftungen, auf die es ankommt, setzt du den Text hinterher selbst ins Bild.
Muss ich meine Prompts auf Englisch schreiben?
Das hängt am Werkzeug. Adobe übersetzt Prompts aus über 100 Sprachen maschinell ins Englische und weist selbst darauf hin, dass übersetzte Prompts ungenaue oder unerwartete Ergebnisse liefern können. Black Forest Labs empfiehlt für FLUX.2 ausdrücklich die Sprache des Inhalts. Midjourney rät generell zu kurzen, einfachen Prompts. Text, der im Bild erscheinen soll, gibst du in jedem Fall wörtlich vor.
Kann ich vorhandene Bilder mit KI bearbeiten statt neue zu erzeugen?
Ja, und für Serienarbeit ist das der wichtigere Weg. OpenAI bietet einen eigenen Endpunkt für Bearbeitungen, bei dem eine Maske den zu ersetzenden Bereich markiert. Google beschreibt für die Gemini-3-Bildmodelle Bearbeitung über mehrere Runden im selben Dialog. FLUX bringt eigene Werkzeuge zum Entfernen, Erweitern und Entrauschen mit.
Wie du weitermachst
Mach den Serientest, bevor du dich festlegst, und nimm dafür ein Motiv, das du ohnehin brauchst. Erzeuge zehn Bilder derselben Bildwelt, nicht zehn Varianten desselben Bildes: verschiedene Motive, gleicher Look, gleiches Briefing und gleich viele Referenzbilder je Durchgang. Halte außerdem fest, ob das Werkzeug einen Seed oder anderes Zufallsverhalten fixiert. Dann leg Bild eins und Bild zehn nebeneinander und schau, ob jemand den Bruch sieht. Diese Prüfung sagt dir mehr über die Eignung für deinen Betrieb als jede Beispielgalerie, und sie kostet weniger als ein missglückter Kachelsatz.
Und wenn du danach wissen willst, wie diese Bilder in ein fertiges Video wandern, statt im Downloads-Ordner zu liegen: Genau diesen Ablauf, vom Rohmaterial über den Schnitt bis zur Freigabe, zeige ich in meiner Community, mitsamt den fertigen Vorlagen für die Mitarbeiter, die das bei mir übernehmen.