Was ist ein guter AI Visibility Score? Was die Zahl misst und wo sie aufhört zu helfen

Was ist ein guter AI Visibility Score? Was die Zahl misst und wo sie aufhört zu helfen

Kurz gefasst

Jedes Werkzeug in diesem Markt liefert eine Zahl namens AI Visibility Score, und keine zwei davon rechnen dasselbe. Diese Seite trennt die zwei Familien, in die diese Scores fallen, gibt Ihnen für jede eine brauchbare Lesart und sagt klar, was die Zahl nicht aussagt. scaile veröffentlicht die Rechnung hinter dem eigenen Score aus demselben Grund: Eine Diagnose, die Sie nicht nachprüfen können, ist eine Diagnose, mit der Sie nicht arbeiten können.

Veröffentlicht
Lesezeit
10 Min.
Zuletzt aktualisiert

Simon ist Co-Founder von scaile und arbeitet mit Enterprise-Teams an Sichtbarkeit in der KI-Suche, vom ersten Audit bis zu belastbaren Share-of-Voice-Zahlen.

Wichtige Erkenntnisse

  • Es gibt keinen Standard. Semrush liefert einen Benchmark von 0 bis 100, Peec und Profound liefern beide Prozentwerte, teilen aber durch verschiedene Nenner, und Ahrefs Brand Radar liefert gar keinen einzelnen Score. Vier Anbieter, vier Zahlen, keine davon mit einer anderen vergleichbar.

  • Scores fallen in zwei Familien. Readiness Scores werden aus Ihrer eigenen Website berechnet und sind in dem deterministisch, was sie prüfen: dieselben Prüfungen auf derselben Datengrundlage ergeben denselben Wert. Presence Scores entstehen aus Stichproben von Modellantworten und bewegen sich von allein.

  • Diese Bewegung ist kein Rundungsfehler. Antworten werden live aus Retrieval zusammengesetzt, und KI-Suchergebnisse sind laut Semrush selbst schnelllebig und stark personalisiert. Ein einmal gemessener Presence-Wert ist deshalb eine einzelne Stichprobe, kein Niveau.

  • Der kostenlose Health Check von scaile verwendet einen Katalog aus 103 Prüfungen, einen Score von 0 bis 100, eine Note und die ausgewiesene Zahl tatsächlich gelaufener Prüfungen. Der AI Visibility Check beginnt mit einer Kauffrage; der angeforderte Bericht erweitert die Stichprobe auf zehn.

  • Ein Readiness Score ist kein Ranking und sagt keinen Traffic voraus. Er prüft Zugriff und maschinelle Lesbarkeit, beweist aber weder die Indexierung einer Seite noch ihre Auswahl als Quelle.

Es gibt keinen Branchenstandard für den AI Visibility Score. Im Health Check von scaile gilt ab 90 die Bewertung Gut, von 70 bis 89 Verbesserungsbedarf und unter 70 Kritisch. Das sind unsere Diagnosebereiche, keine Branchen-Benchmarks und kein Beleg, dass jede wichtige Prüfung bestanden wurde. Lesen Sie die Befunde und die Zahl der tatsächlich gelaufenen Prüfungen. Für eine Presence-Messung vergleichen Sie Ihre Marke mit denselben Wettbewerbern bei denselben Fragen, KI-Systemen und Testdaten. Einen allgemein guten Prozentsatz gibt es nicht.

Wer Ihnen einen Benchmark nennt, ohne das Instrument dazu zu nennen, nennt Ihnen Rauschen.

Beide Zahlen beschreiben eine Lücke, geschlossen wird sie von keiner. Technische Korrekturen können die Readiness verbessern. Nützliche, belegte Inhalte und glaubwürdige Erwähnungen auf fremden Websites können die abrufbaren Informationen verbessern, ohne einen bestimmten Presence-Wert zu garantieren. scaile übernimmt die Content-Produktion als betreute Infrastruktur: ein benannter AI Search Strategist, Recherche aus Ihrer Wissensbasis, Faktenprüfung und Freigabe durch Ihr Team vor der Publikation.

Warum gibt es keinen einheitlichen AI Visibility Score?

Weil jeder Anbieter seinen eigenen erfunden hat und sich die Definitionen tatsächlich unterscheiden.

Semrush dokumentiert seinen AI Visibility Score als Benchmark von 0 bis 100, der zeigt, wie häufig Ihre Marke im Vergleich zu Wettbewerbern in KI-generierten Antworten auftaucht. Er entsteht nicht dadurch, dass Semrush Ihre Fragen an Modelle stellt: Grundlage ist eine Datenbank mit über 317 Millionen Prompts und Antworten aus ChatGPT, Gemini, AI Overviews und AI Mode, erhoben aus Clickstream-Daten statt über Modell-APIs, über 117 regionale Datenbanken hinweg. Die Prompt-Datenbank wird rollierend täglich aktualisiert, die darauf aufbauenden Markenberichte dagegen wöchentlich. Ein Dashboard, das Sie am Dienstag öffnen, zeigt Ihnen also nicht den Vortag. Die genaue Gewichtung ist proprietär.

Peec definiert seinen Visibility Score mit einer offengelegten Formel: Antworten, die Ihre Marke nennen, geteilt durch alle Antworten, mal 100. Profound weist ebenfalls einen Visibility Score in Prozent aus, teilt die Markennennungen aber durch alle Antworten, die mindestens eine Marke enthalten. Ein anderer Nenner also, aus Prompts, die Profound täglich an die Antwortmaschinen schickt. Schicken Sie dieselbe Marke am selben Tag mit denselben Fragen durch beide Werkzeuge, werden die zwei Zahlen sich widersprechen, und beide sind richtig.

Ahrefs ist einen vierten Weg gegangen. Brand Radar berichtet Markennennungen über die großen KI-Plattformen hinweg. Die Liste ist 2026 zweimal gewachsen, prüfen Sie also auf der Produktseite, was heute abgedeckt ist. Dazu kommt ein AI Share of Voice gegen Wettbewerber, aber kein Score von 0 bis 100. Die eigene Anleitung von Ahrefs hält fest, dass KI-Plattformen nicht deterministisch sind und dass Sie die Spanne Ihres Share of Voice verfolgen sollten statt eines Punktwerts.

Daraus folgen zwei Dinge. Erstens: “Unser AI Visibility Score liegt bei 62” ist keine Aussage über Ihr Unternehmen, solange Sie nicht sagen, wessen 62 das ist. Zweitens: Es existiert kein Branchen-Benchmark zum Vergleich, denn ein Benchmark setzt ein Instrument voraus, das alle teilen. Semrush schreibt das in der eigenen Dokumentation selbst: KI-Suchantworten sind schnelllebig und stark personalisiert, weshalb keine Plattform exakte Zahlen liefern kann.

Selbst die Forschung musste sich ihren eigenen Maßstab bauen. Die GEO-Arbeit, die dieses Feld begründet hat, misst Sichtbarkeit mit drei selbst definierten Metriken: einer normalisierten Wortzahl, einer positionsgewichteten Wortzahl, die mit der Position des Zitats exponentiell abfällt, und einem subjektiven Eindruckswert, den ein Sprachmodell vergibt. Genau deshalb, weil eine Ranking-Position, die Kennzahl der klassischen Suche, eine generative Antwort nicht beschreibt.

Welche zwei Arten von AI Visibility Score gibt es?

Jeder Score am Markt ist eines von zwei Dingen, und die beiden zu verwechseln ist der teuerste Fehler in diesem ganzen Thema.

Readiness Scores werden aus Ihrer eigenen Website berechnet. Kommen die KI-Crawler zu Ihnen durch? Kann eine Maschine aus der Seite eine Antwort herauslesen? Trägt die Seite Datum, Autor und Quelle, damit eine Antwort sie zuordnen kann? Das sind Fragen an Dateien, die jetzt gerade auf Ihrem Server liegen. Ein Readiness Score ist in dem deterministisch, was er prüft, nicht in dem, was er erreichen kann: Dieselben Prüfungen auf derselben Datengrundlage ergeben denselben Wert, und die im Bericht ausgewiesene Zahl der gelaufenen Prüfungen sagt Ihnen, ob die Grundlage dieselbe war. Eine Fremd-API im Timeout, eine Seite, die sich nicht rendern ließ, eine robots.txt, die mit 503 antwortet: Jeder dieser Fälle nimmt eine Prüfung aus dem Nenner, und ein Wert aus 62 Prüfungen ist nicht dieselbe Messung wie einer aus 95.

Presence Scores entstehen aus Stichproben von Modellantworten. Frage an den Assistenten, Antwort lesen, notieren, ob Sie genannt wurden. Wiederholen. Diese Messung erfasst etwas, das Readiness nicht erfassen kann: ob Sie tatsächlich vorkommen, wenn ein Käufer fragt. Sie bewegt sich aber auch von allein, und stärker, als die meisten Dashboards zugeben.

Wie berechnen Sie KI-Sichtbarkeit? Ein Rechenbeispiel

Dieses Beispiel veranschaulicht die Rechnung. Es ist kein Kundenergebnis und kein Branchen-Benchmark. Angenommen, Sie stellen 20 Kauffragen ohne Markennamen an drei KI-Systeme an zwei Terminen und erhalten alle 120 Antworten.

MessgrößeRechnungErgebnis
Auswertbare Antworten20 Fragen × 3 Systeme × 2 Durchläufe120
Antworten mit Ihrer Marke24 ÷ 12020 % Nennungsrate
Antworten mit Verweis auf Ihre Website12 ÷ 12010 % Quellenverweisrate
Nächste vergleichbare Stichprobe mit Ihrer Marke36 ÷ 12030 % Nennungsrate
Veränderung der Nennungsrate30 % − 20 %10 Prozentpunkte oder 50 % relatives Wachstum

Zählen Sie jede Antwort pro Messgröße einmal, auch wenn die Marke mehrfach genannt oder Ihre Website mehrfach verlinkt wird. Eine Nennung ohne Link zählt zur Nennungsrate, nicht zu den Quellenverweisen. Halten Sie fehlgeschlagene Anfragen getrennt fest: Bei Zeitüberschreitungen sind 120 Versuche keine 120 auswertbaren Antworten. Wenn ein System keine Quellen ausweist, kennzeichnen Sie diese Daten als nicht verfügbar statt als null Quellenverweise.

Protokollieren Sie Frage, System, Datum, Sprache, Markt, Markennennung, Verweis auf Ihre Website und Quellen-URLs. Wiederholen Sie dasselbe Fragenset, bevor Sie eine Veränderung als Fortschritt werten. Die 120 Antworten sind nicht zwingend unabhängige Beobachtungen. Diese Rechnung allein belegt weder statistische Signifikanz noch künftigen Traffic.

Diese einfache Nennungsrate ist nicht der zusammengesetzte Wert des AI Visibility Check von scaile. Dieser verbindet Presence, Position, Sichtbarkeitsanteil und Quellenverweise. Vergleichen Sie Gleiches mit Gleichem. Der kostenlose AI Visibility Check liefert einen Einstieg; für die laufende Messung verwenden Sie eine feste, wiederholte Stichprobe.

Warum schwankt der Presence Score ohne eigenes Zutun?

Weil die Antwort live zusammengesetzt wird und zwischen zwei Durchläufen fast nichts an dieser Zusammensetzung festgehalten wird.

Die Hauptursache ist das Retrieval, nicht das Modell. Semrush schreibt es in der eigenen Dokumentation deutlich: KI-Suchantworten sind schnelllebig und stark personalisiert, und genau deshalb kann keine Plattform exakte Zahlen liefern. Ahrefs warnt von der anderen Seite gleichlautend und rät Brand-Radar-Nutzern, KI-Plattformen als nicht deterministisch zu behandeln und eine Spanne statt eines Punktwerts zu lesen. Zwischen Ihrer Montagsstichprobe und Ihrer Donnerstagsstichprobe hat sich der Index hinter dem Assistenten verändert, die abgerufenen Seiten sind andere, und die Personalisierungsschicht hat beide Anfragen unterschiedlich behandelt.

Darunter liegt ein kleinerer, aber überraschender Bodensatz. Thinking Machines hat denselben Prompt 1.000 Mal bei Temperatur null abgefragt, also bei der Einstellung, die die Ausgabe eigentlich deterministisch machen soll, auf einem offenen Modell, und 80 verschiedene Vervollständigungen erhalten, die häufigste davon 78 Mal. Die erste Abweichung trat beim 103. Token auf. Die Ursache war kein Zufall im Sampler, sondern die Batch-Größe auf der Serving-Hardware, die das numerische Ergebnis davon abhängig macht, wie viele andere Menschen zufällig gleichzeitig anfragen. Die wichtigere Hälfte dieses Ergebnisses ist die Lösung: Mit batch-invarianten Kerneln kamen alle 1.000 Vervollständigungen identisch zurück. Das ist also kein Beleg für unvermeidbaren Zufall in Sprachmodellen. Es ist ein Beleg dafür, dass selbst der Idealfall auf gewöhnlicher Serving-Infrastruktur nicht reproduzierbar ist, noch bevor Retrieval und Personalisierung ihre sehr viel größere Bewegung darauflegen.

Die GEO-Forscher sind mit demselben Problem sauber umgegangen: Sie haben pro Anfrage fünf Antworten bei Temperatur 0,7 gezogen, ausdrücklich um statistische Abweichungen zu verringern, auf GEO-bench, einem Benchmark mit 10.000 Anfragen. So viel kostet eine Presence-Messung, wenn sie stillhalten soll.

Wenn ein Dashboard Ihren Presence Score also von 34 auf 31 Prozent gegenüber der Vorwoche bewegt, ist die erste Frage nicht, was den Rückgang verursacht hat. Die erste Frage ist, ob drei Punkte überhaupt außerhalb des Eigenrauschens des Instruments liegen. Bei zehn Fragen, je einmal gestellt, verschiebt eine einzige gekippte Antwort die Zahl um zehn Punkte. An Ihrer Website hat sich nichts geändert.

Deshalb gibt Ihnen der AI Visibility Check von scaile die zugrundeliegenden Antworten in die Hand statt nur eine Schlagzahl: Was die Assistenten tatsächlich gesagt haben, ist nachprüfbar, ein Prozentwert aus einem einzigen Durchlauf nicht. Laufendes Tracking mit genug Wiederholungen, um Signal von Rauschen zu trennen, ist eine andere Aufgabe, und dafür ist die Auswertungsseite der Plattform da.

Was ist ein guter Readiness Score?

Das ist die Familie, in der eine Zahl für sich genommen etwas bedeutet, weil dieselben Prüfungen auf derselben Datengrundlage immer denselben Wert ergeben.

Auf der Skala von 0 bis 100, die der kostenlose AI Search Health Check verwendet:

90 und mehr bedeutet Gut: A von 90 bis 94, A+ ab 95. Das ist ein starkes Ergebnis auf der geprüften Datengrundlage, keine Garantie, dass kein schwerwiegender Befund oder ungeprüftes technisches Problem bleibt. Lesen Sie die einzelnen Befunde und die Prüfabdeckung auch bei einer grünen Gesamtbewertung.

70 bis 89 bedeutet Verbesserungsbedarf: C von 70 bis 79, B von 80 bis 89. Priorisieren Sie die Befunde nach Schweregrad und betroffenen Seiten. Die Gesamtzahl allein sagt nicht, ob eine Korrektur klein ist oder ein bestimmter Crawler blockiert wird.

Unter 70 schlägt Triage die Abarbeitungsliste. Lesen Sie das Ergebnis von oben nach unten nach Schweregrad, statt die Liste durchzugehen, denn ein einzelnes Problem in der Zugriffsschicht kann ein ganzes Bündel von Fehlern darunter erklären.

Entscheidend ist auf dieser Ebene, welchen Bot Sie gesperrt haben. Die Retrieval-Agenten zu sperren, also OAI-SearchBot und PerplexityBot, ist die teure Sperre: Das sind die Agenten, die eine Seite im Moment der Antwort abrufen. In der Engine von scaile löst eine robots.txt, die die Retrieval-Crawler gemeinsam aussperrt, ein Score-Gate aus, das das Ergebnis unabhängig von allem anderen deckelt. Die Trainings-Crawler zu sperren, also GPTBot, ClaudeBot und CCBot, ist dagegen eine Rechteentscheidung darüber, ob Ihre Inhalte künftige Modelle trainieren dürfen. Sie ist legitim, und sie verändert kaum, ob ChatGPT oder Perplexity Sie heute zitieren, denn Zitate laufen über die Retrieval-Agenten. Beheben Sie das Gate, und der Deckel fällt weg. Ändern Sie eine Trainings-Crawler-Zeile, haben Sie Ihre Lizenzhaltung geändert, nicht Ihre Sichtbarkeit.

Ein Score ist nur dann vertrauenswürdig, wenn er seine Rechnung offenlegt. Der Health Check weist aus, wie viele Prüfungen von wie vielen tatsächlich gelaufenen bestanden wurden, nicht von 103. Denn der kostenlose Durchlauf liest Ihre Startseite, Ihre robots.txt und Ihre Sitemap, was für rund 60 der Prüfungen reicht, und der Rest enthält sich, statt zu raten. Eine Prüfung ohne Urteil sollte Ihr Vertrauen in den Wert senken, nicht stillschweigend den Wert.

Was sagt der Score nicht aus?

Ein Readiness Score ist kein Ranking, und er sagt keinen Traffic voraus. Er ist ein Test auf eine Vorbedingung.

Ein Readiness Score ist keine kalibrierte Prognose für Besuche oder Umsatz. Google erfasst AI Overviews und AI Mode in der allgemeinen Websuche der Search Console, nicht in einem getrennten Bericht für KI-Funktionen. Eine Nennung ohne Klick erzeugt keinen Besuch in der Website-Analyse, und die Zuordnung von Verweisen ist unvollständig. Beobachtbare Besuche und Leads lassen sich trotzdem messen und Experimente durchführen. Diese Grenzen machen Forschung nicht unmöglich, aber eine Umsatzgarantie aus einem Score unbegründet.

Readiness-Prüfungen können Zugriffsprobleme aufdecken, stellen aber Googles Indexierungsentscheidung nicht fest. Eine verlinkte Quelle in AI Overviews oder AI Mode muss indexiert und für Snippets zugelassen sein. Die normalen Suchrichtlinien und Anforderungen an hilfreiche Inhalte gelten weiter. Spezielle KI-Dateien oder Schemata sind nicht erforderlich; die Zulassung garantiert keine Auswahl. Prüfen Sie den gespeicherten Indexierungsstatus getrennt in der Search Console. Scheitern mehrere Zugriffsprüfungen gemeinsam, untersuchen Sie gemeinsame Ursachen wie CDN-Regeln, DNS-Fehler oder Zeitüberschreitungen, bevor Sie jeden Fehler als eigenes Inhaltsproblem behandeln.

Sie können 95 erreichen und trotzdem in den untersuchten Antworten fehlen. Prüfen Sie Indexierung, Relevanz zur Frage, belastbare Belege, Erwähnungen durch Dritte, konkurrierende Quellen und Schwankungen der Stichprobe. Inhaltslücken sind eine mögliche Ursache, keine durch den Score bewiesene Diagnose. Die Recherche der Kundenintention hilft, konkrete unbeantwortete Kauffragen zu erkennen. Prüfen Sie auch die anderen Ursachen der Unsichtbarkeit, bevor Sie eine Maßnahme wählen.

Wie nutzen Sie beide Zahlen zusammen?

Prüfen Sie mit einem Readiness Check zunächst Zugriffs- und Ausleseprobleme. Messen Sie Presence getrennt davon. Ein gesperrter Crawler kann den direkten Abruf Ihrer Seiten verhindern, ein Assistent Ihre Marke aber weiterhin anhand fremder Quellen nennen. Ein Readiness Score ersetzt deshalb keine Presence-Messung, und eine Nennung beweist nicht, dass Ihre eigenen Seiten erreichbar sind.

Messen Sie Presence anschließend mit einem festen Fragenset und benannten Wettbewerbern. Halten Sie fest, wie häufig, an welcher Stelle und aus welchen Quellen die Marke erscheint. Wiederholen Sie die Stichprobe, bevor Sie eine Veränderung bewerten. Ein niedriger Wert ist ein Anlass zur Untersuchung; ein Readiness Score allein kann die möglichen Ursachen nicht auseinanderhalten.

Beide Checks von scaile sind kostenlos und keiner verlangt ein Konto. Der Health Check zeigt ein Readiness-Ergebnis direkt auf der Seite. Der AI Visibility Check stellt zunächst eine Kauffrage an die verfügbaren Assistenten und zeigt das Ergebnis. Der vollständige Bericht erweitert die Messung auf zehn Fragen mit Wettbewerber- und Quellenanalyse. Für die Anforderung ist eine E-Mail-Adresse nötig. Der Sitemap Visualiser liefert einen getrennten Blick auf die Struktur.

Häufig gestellte Fragen

Ist 70 ein guter AI Visibility Score?

Im Health Check von scaile bedeutet 70 Verbesserungsbedarf, Note C. Lesen Sie die Befunde, statt die Zahl als Entwarnung zu behandeln. Eine Nennungsrate von 70 Prozent bedeutet, dass die Marke in sieben von zehn auswertbaren Antworten vorkam. Ob das gut ist, hängt von Fragenset, Wettbewerbern und Messmethode ab. Die beiden Werte sind nicht vergleichbar.

Kann ich meinen Semrush AI Visibility Score mit dem eines anderen Tools vergleichen?

Nein. Semrush berechnet einen Benchmark von 0 bis 100 aus einer Clickstream-Prompt-Datenbank, Peec teilt Markennennungen durch alle Antworten, und Profound teilt durch die Antworten, die mindestens eine Marke enthalten. Andere Eingangsdaten, andere Nenner, andere Zahlen für dieselbe Marke am selben Tag.

Warum ändert sich mein AI Visibility Score, obwohl sich auf meiner Website nichts geändert hat?

Weil Presence Scores live erzeugte Antworten als Stichprobe nehmen und diese Antworten bei jedem Durchlauf neu aus dem Retrieval gebaut werden, über einen Index, der sich bewegt, mit Personalisierung obendrauf. Semrush und Ahrefs schreiben das beide in ihrer eigenen Dokumentation. Ein Readiness Score aus Ihren eigenen Dateien bewegt sich nur, wenn Ihre Dateien sich bewegen oder wenn der Prüfer weniger davon erreichen konnte.

Bedeutet ein hoher AI Visibility Score mehr Traffic?

Nein. Ein Readiness Score beschreibt Prüfungen Ihrer Website, ein Presence Score eine Stichprobe von Antworten. Keiner garantiert Klicks. Erfassen Sie beobachtbare Verweise, qualifizierte Leads und wiederholte Sichtbarkeitsmessungen getrennt und benennen Sie fehlende Zuordnungsmöglichkeiten.

Wie wird der AI Visibility Score von scaile berechnet?

Es gibt zwei unterschiedliche Werte. Der Health Check nutzt einen Katalog von 103 Prüfungen, Abzüge nach Schweregrad, Teilergebnisse und ausdrückliche Score-Obergrenzen. Ungeprüfte Punkte zählen nicht als Fehler. Der zusammengesetzte AI Visibility Check gewichtet Presence mit 40 Prozent, Position mit 20 Prozent, Sichtbarkeitsanteil mit 20 Prozent und Quellenverweise mit 20 Prozent. Der Bericht erläutert die Eingangsdaten und nicht verfügbare Quellenangaben. Keiner der Werte ist ein standardisiertes Branchen-Ranking.

Sollte ich einen AI Visibility Score wöchentlich verfolgen?

Nur wenn die Messung oft genug wiederholt wird, um eine echte Bewegung vom Rauschen zu trennen. Ein wöchentlicher Einzeldurchlauf über zehn Fragen ist ein Münzwurf im Gewand einer Trendlinie. Der Readiness Score ist die Zahl, die an jedem einzelnen Tag etwas bedeutet.

Unser Presence Score bewegt sich nicht. Was bewegt ihn?

Prüfen Sie zuerst, ob die Stichprobe stabil und groß genug für eine Aussage ist. Prüfen Sie dann, welche Quellen zitiert werden, welche Kauffragen keine nützliche Antwort haben und wo glaubwürdige Erwähnungen auf fremden Websites fehlen. scaile übernimmt Recherche, Schreiben, Faktenprüfung, Freigabe und Publikation dieser Inhalte. Publizieren ist eine überprüfbare Maßnahme, keine Garantie für einen höheren Score.

Quellen

Weitere Artikel

Sehen Sie, wo Ihre Marke in der KI-Suche steht

Buchen Sie ein Gespräch, und wir gehen Ihre Kategorie gemeinsam durch: die Fragen Ihrer Käufer, wer heute zitiert wird und wo die Chancen liegen.