Eine Website für die KI-Suche zu optimieren heißt in der Praxis fünf konkrete Eingriffe, und keiner davon ist exotisch. Erstens: die Suchcrawler der KI-Anbieter in der robots.txt zulassen, und zwar die richtigen, denn Suchcrawler und Trainingscrawler sind bei OpenAI, Perplexity, Anthropic und Google getrennte Programme mit getrennten Namen. Zweitens: dafür sorgen, dass dein Kerninhalt schon in der ausgelieferten HTML-Antwort steht und nicht erst von JavaScript nachgeladen wird. Googlebot rendert JavaScript zwar selbst, für die KI-Crawler der anderen Anbieter ist das nicht belegt. Drittens: je eigenständiger Kundenfrage eine Seite, die diese Frage im ersten Absatz vollständig beantwortet, als Arbeitsregel und nicht als Vorgabe einer Suchmaschine. Viertens: Aussagen und Zahlen mit Fundort versehen und ein sichtbares, ehrliches Datum setzen, das zum Markup passt. Fünftens: strukturierte Daten als saubere Beschreibung dessen einsetzen, was auf der Seite ohnehin steht. Was du dir sparen kannst, steht genauso deutlich in Googles eigenem Leitfaden: keine gesonderten KI-Dateien, kein Spezial-Schema, kein Zerhacken der Texte in Häppchen, kein eigener Schreibstil für KI. Eine Zusage, dass du danach in KI-Antworten vorkommst, gibt dir niemand, ich auch nicht. Was du bekommst, ist eine Seite, die überhaupt in Frage kommt, plus eine Messung, an der du siehst, ob sich etwas bewegt.
Ich führe mein Business als Solo-Selbstständiger mit einer Belegschaft aus KI-Mitarbeitern auf Claude-Basis. Einer davon geht genau diese Liste an meiner eigenen Website durch und legt jeden Befund mit Fundort ab. Wie das Konzept insgesamt aufgebaut ist, steht auf KI-Mitarbeiter einstellen, wer bei mir welchen Job macht, im Organigramm, und wie die Belegschaft angefangen hat, in KI-Belegschaft: 14 Mitarbeiter, ein Chef. Was der Begriff GEO überhaupt bedeutet, wie sich KI-Antworten von Suchergebnissen unterscheiden und wie du Zitate misst, klärt Generative Engine Optimization (GEO) erklärt. Hier geht es ausschließlich darum, was du an der Website selbst anfasst.
Schritt 1: Die richtigen Crawler hereinlassen
Der erste Punkt, an dem es schiefgeht, ist meist eine robots.txt, die den falschen Bot sperrt. Die Anbieter trennen ihre Crawler nämlich nach Zweck, und zwar in ihrer eigenen Dokumentation. OpenAI schreibt zu OAI-SearchBot, er werde „used to surface websites in search results in ChatGPT's search features", während GPTBot „used to make our generative AI foundation models more useful and safe" ist. Perplexity formuliert es noch deutlicher: PerplexityBot „is designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models." Anthropic trennt ClaudeBot, der Inhalte für die Modelle sammelt, von Claude-SearchBot, der „navigates the web to improve search result quality for users". Google-Extended ist gar kein eigener Crawler, sondern ein Steuerungstoken für die Modellnutzung: Es „does not impact a site's inclusion in Google Search".
Daraus folgt die praktische Entscheidung: Du kannst die Nutzung für das Modelltraining ablehnen und in den Suchfunktionen trotzdem auffindbar bleiben. Eine robots.txt, die das umsetzt, sieht so aus:
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Dieser Block ergänzt deine bestehende robots.txt, er ersetzt sie nicht. Steht dort schon eine allgemeine Sperre, prüf, dass Googlebot davon nicht erfasst wird, sonst sperrst du mit der KI-Suche auch die normale Suche aus. Zwei weitere Einschränkungen gehören dazu. Die dritte Spalte der Tabelle gehorcht dieser Datei nur bedingt: OpenAI schreibt zu ChatGPT-User „Because these actions are initiated by a user, robots.txt rules may not apply", Perplexity zu Perplexity-User „Since a user requested the fetch, this fetcher generally ignores robots.txt rules." Und die robots.txt ist nur die halbe Miete, weil viele Seiten zusätzlich über die Firewall oder den Bot-Schutz ihres Anbieters blocken. Öffne deine Datei unter deine-domain.de/robots.txt im Browser und schau danach in die Bot-Einstellungen deines Hosters oder CDN.
Schritt 2: Den Kerninhalt möglichst schon in die HTML-Antwort legen
Für Google ist das keine Bedingung, und das sollte man nicht falsch weitergeben: Google dokumentiert, dass jede Seite mit Status 200 in die Rendering-Warteschlange geht, „no matter whether JavaScript is present on the page", dass ein Headless-Chromium sie rendert und dass Google das gerenderte HTML zur Indexierung nutzt. Verlangt wird nur, dass der Inhalt crawlbar ist. Den Grund, trotzdem serverseitig auszuliefern, schreibt Google in dieselbe Doku: „server-side or pre-rendering is still a great idea because it makes your website faster for users and crawlers, and not all bots can run JavaScript."
Für die anderen Systeme gibt es kein vergleichbares Anbieter-Statement, aber eine Messung: Vercel hat für einen Beitrag vom 17.12.2024 das eigene Netzwerk und nextjs.org ausgewertet und kam zu dem Befund „none of the major AI crawlers currently render JavaScript"; die Crawler von ChatGPT und Claude rufen JavaScript-Dateien demnach ab, führen sie aber nicht aus. Das ist eine Messung eines Dritten von Ende 2024, kein Anbieterversprechen, und Crawler ändern sich. Als Planungsgrundlage reicht es: Was erst nach der Ausführung von JavaScript sichtbar wird, planst du für die KI-Suche besser nicht als Kerninhalt ein.
Der Schnelltest dauert fünf Minuten. Nimm einen Satz, der auf der Seite steht und dort inhaltlich zählt, und suche ihn im rohen Quelltext:
curl -s https://deine-domain.de/deine-seite | grep -c "dein Kernsatz"
Kommt 0 zurück, ist das ein Hinweis und noch kein Beweis: Groß- und Kleinschreibung, HTML-Entities und eine komprimierte Antwort können den Treffer verhindern, obwohl der Satz dasteht. Sieh dir die Rohantwort deshalb auch einmal selbst an. Ohne Terminal geht dieselbe Prüfung, indem du in den Entwicklerwerkzeugen des Browsers JavaScript abschaltest und neu lädst. Typische Fundstellen: Inhalte in Reitern und Ausklapp-Elementen, eingebundene Bewertungs- und Preis-Widgets, Seiten aus einem Frontend-Framework ohne serverseitiges Rendering, Cookie-Banner, die den Inhalt bis zur Zustimmung verdecken.
Schritt 3: Eine Seite je eigenständiger Frage
Google stellt in der Anleitung zu hilfreichen Inhalten zwei Selbstprüfungsfragen, die für KI-Antworten genauso gelten wie für die klassische Suche: „Does the content provide a substantial, complete, or comprehensive description of the topic?" und „Does the content provide original information, reporting, research, or analysis?"
Eine Seite je Formulierung wäre daraus der falsche Schluss, und keine Suchmaschine verlangt das. Sammle erst die echten Kundenfragen und gruppier sie danach nach eigenständiger Absicht: Was dieselbe Absicht hat, gehört auf dieselbe Seite, sonst baust du dünne Seiten, die sich gegenseitig Konkurrenz machen. Innerhalb einer so abgegrenzten Seite haben sich in meiner Vorlage vier Regeln bewährt:
- Der erste Absatz beantwortet die Frage vollständig. Nicht ankündigen, was gleich kommt, sondern es sagen. Wer nur diesen Absatz liest, hat die Antwort.
- Die Seite steht für sich. Kein „wie im vorherigen Beitrag erklärt". Dein Text landet ohne den Kontext deiner Navigation in der Antwort.
- Die Zahlen stehen im Text. Was nur in einer Grafik oder in einem PDF steht, steht für den Crawler nicht auf der Seite.
- Überschriften sind echte Fragen oder echte Aussagen. „Leistungen" ist keine Überschrift, „Was ein Wasserschaden-Gutachten kostet" schon.
Dass diese Punkte in den Leitfäden stehen, heißt nicht, dass sie ein Zitat auslösen. Sie sind die Voraussetzung dafür, überhaupt in Frage zu kommen. Welcher Teil einer Antwort am Ende von wem stammt, entscheidet das jeweilige System. Das Gruppieren der Fragen ist die Arbeit, die dabei wirklich Zeit kostet. Wer dabei nicht allein raten will, bringt seine Liste in die Community: Fremde Augen sehen schneller, welche zwei Fragen in Wahrheit dieselbe sind.
Schritt 4: Quellen und Datum, sichtbar und stimmig
Zur Vertrauenswürdigkeit fragt Google in derselben Anleitung: „Does the content present information in a way that makes you want to trust it, such as clear sourcing, evidence of the expertise involved?" Für Datumsangaben gibt es eine eigene Dokumentationsseite: „Add a user-visible date to the page and feature it prominently", dazu ein Subtyp von CreativeWork mit datePublished und dateModified, und: „Ensure that the date … match between the equivalent user-visible and structured values." Abgeraten wird von künftigen Datumsangaben und von vielen weiteren Daten auf derselben Seite.
Der Gegenpol steht in Googles Liste der Warnsignale: „Are you changing the date of pages to make them seem fresh when the content has not substantially changed?" Ein Datum hochzudrehen, ohne den Inhalt anzufassen, ist keine Optimierung, sondern eines der Muster, vor denen Google warnt. Für Seiten mit Zahlen heißt das außerdem: Quelle mit Namen nennen, verlinken und das Datum der Quelle dazuschreiben, nicht nur das Abrufdatum. Ist eine Studie von 2024, steht 2024 daneben, auch wenn du den Text 2026 schreibst.
Schritt 5: Strukturierte Daten richtig einordnen
Hier ist die Quellenlage unbequem für alle, die Schema-Markup als GEO-Maßnahme verkaufen. Google schreibt in seinem Leitfaden zu den generativen KI-Funktionen: „Structured data isn't required for generative AI search, and there's no special schema.org markup you need to add." Die Frage, welches Schema die KI-Suche braucht, ist damit beantwortet: keines. Sinnvoll bleiben strukturierte Daten trotzdem, nur aus anderem Grund. Organization, LocalBusiness und Article beschreiben maschinenlesbar, was auf der Seite steht, kommen je nach Typ für erweiterte Suchergebnisse in der klassischen Suche in Frage, und bei Article transportieren sie die Datumsfelder aus Schritt 4. FAQPage gehört nicht mehr in diese Aufzählung: Google zeigt die FAQ-Darstellung laut eigener Doku nur „for well-known, authoritative government and health websites", für eine normale Firmenseite bleibt sie also eine gültige Beschreibung ohne sichtbaren Effekt. Eine Regel halte ich streng durch: kein Feld im Markup, das auf der Seite nicht sichtbar steht.
Was du dir sparen kannst
Googles Leitfaden sagt vier verbreitete Maßnahmen ausdrücklich ab: keine neuen maschinenlesbaren Dateien oder KI-Textdateien („You don't need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search"), kein Spezial-Schema, kein Zerlegen der Texte in Kleinstteile („There's no requirement to break your content into tiny pieces") und keinen eigenen Schreibstil. Die Belege samt Einordnung zu llms.txt und zu den Sichtbarkeits-Scores der Monitoring-Anbieter stehen in Generative Engine Optimization (GEO) erklärt.
Die Reihenfolge, in der ich das abarbeite
Schritt 6 lassen die meisten aus, und ohne ihn sind die ersten fünf nicht bewertbar. Wie du die Konten dafür anlegst, steht in Google Search Console einrichten, den technischen Durchlauf für die klassische Seite der Messung beschreibt SEO-Audit mit KI durchführen: Anleitung.
Der Mitarbeiter, der diese Liste an einer Website abarbeitet
Die Liste oben ist kein Hexenwerk. Der Aufwand steckt darin, sie regelmäßig zu wiederholen und jeden Befund so abzulegen, dass er in drei Monaten noch nachvollziehbar ist. Sebastian, mein KI-Mitarbeiter für SEO und GEO, macht genau das mit echten Werkzeugen statt aus dem Gedächtnis: Lighthouse und die PageSpeed-Insights-API für die technische Basis, linkinator für kaputte Links, curl für die rohe HTTP-Antwort und Playwright CLI daneben für die gerenderte Browseransicht, advertools für Crawl-Auswertungen, dazu Search Console und Bing Webmaster Tools. Jede Roh-Ausgabe landet in einem datierten Auftragsordner, jeder Befund nennt seinen Fundort, am Ende steht ein priorisierter Maßnahmenplan. In gewährte Konten kommt er nur lesend, an einer Live-Website ändert er nichts. Er misst, ich entscheide.
Wie so ein Befund aussieht, zeigt eine Auswertung meiner eigenen Website: In einem Export von 4.770 Suchbegriffen entfielen 11.536 von 132.781 Einblendungen, also 8,7 Prozent, auf Begriffe, für die mehrere meiner eigenen Seiten in Frage kamen. Genau das passiert, wenn man Schritt 3 zu eng auslegt. Wie du dir so eine Rolle selbst baust, steht in KI-Mitarbeiter erstellen: so startest du.
Häufige Fragen
Muss mein Inhalt ohne JavaScript lesbar sein?
Für Google nicht: Google rendert nach eigener Doku jede Seite mit Status 200 in einem Headless-Chromium und indexiert das gerenderte HTML. Für die übrigen Systeme solltest du davon ausgehen, weil eine Vercel-Auswertung vom 17.12.2024 ergab, dass die großen KI-Crawler JavaScript nicht ausführen. Wer beide Seiten bedienen will, liefert den Kernsatz schon in der HTTP-Antwort aus.
Kann ich KI-Crawler über die robots.txt zuverlässig aussperren?
Nur teilweise. Die Suchcrawler halten sich laut Anbieterdokumentation an die Datei. Für Abrufe, die ein Nutzer auslöst, schreibt OpenAI „robots.txt rules may not apply" und Perplexity, dieser Abruf ignoriere robots.txt-Regeln in der Regel. Wer wirklich blockieren will, braucht zusätzlich eine Regel in der Firewall oder beim CDN.
Soll ich auf jede Seite ein Aktualisierungsdatum schreiben?
Auf Inhalte, bei denen Aktualität eine Rolle spielt, ja. Google empfiehlt ein prominent sichtbares Datum und dazu passende datePublished- beziehungsweise dateModified-Angaben im Markup. Wichtig ist der Gegentest: Das Datum darf nur mitwandern, wenn sich der Inhalt wirklich geändert hat.
Brauche ich strukturierte Daten für die KI-Suche?
Nein, Google sagt das ausdrücklich. Einsetzen lohnt sich trotzdem, weil Organization, LocalBusiness und Article deine Seite maschinenlesbar beschreiben und in der klassischen Suche erweiterte Darstellungen ermöglichen können. Für FAQPage gilt das nicht mehr: Google zeigt die Darstellung laut eigener Doku nur noch für bekannte, autoritative Regierungs- und Gesundheitsseiten. Als KI-Maßnahme sollte dir keines davon verkauft werden.
Wie du weitermachst
Nimm dir heute eine Stunde für die ersten beiden Schritte, denn sie entscheiden, ob der Rest überhaupt etwas ändern kann. Erstens: deine-domain.de/robots.txt öffnen, gegen die Tabelle oben abgleichen und im Hoster- oder CDN-Konto nachsehen, ob dort ein Bot-Schutz zusätzlich blockt. Zweitens: deine drei wichtigsten Seiten im rohen Quelltext prüfen. Danach schreibst du die Fragen auf, die deine Kunden vor dem Kauf wirklich stellen, fasst zusammen, was dieselbe Absicht hat, und gibst jeder verbleibenden Frage eine Seite, die im ersten Absatz antwortet.
Den Begriffsrahmen und den Messaufbau dazu findest du in Generative Engine Optimization (GEO) erklärt. Die Vorlagen für Prüfläufe und Nachmessung und den Austausch dazu gibt es in meiner Community.