Wie wir KI-Suchsichtbarkeit messen
Jede Kennzahl in diesem Dashboard basiert auf Primärforschung. Hier erfahren Sie genau, wie die Zahlen berechnet werden — und warum wir es anders machen.
Warum wiederholte Abfragen?
„Einmalige Sichtbarkeitskennzahlen vermitteln ein irreführend präzises Bild.“— arXiv:2603.08924
LLMs sind nicht deterministisch — derselbe Prompt kann bei jedem Aufruf unterschiedliche Ausgaben liefern. Eine einzelne Momentaufnahme verwechselt zufällige Schwankungen mit echtem Signal.
Wir führen jede Abfrage 5-mal pro KI-Engine durch und geben Bootstrap-95%-Konfidenzintervalle an — so sehen Sie nicht nur den Punktschätzwert, sondern auch die Unsicherheitsspanne. Siehe auch: arXiv:2604.07585 — „Don't Measure Once“, das N=5 als praktisches Minimum für stabile LLM-Sichtbarkeitsschätzungen festlegt.
Die vier Kennzahlen, die wir verfolgen
Kennzahlendefinitionen von arXiv:2604.25707 (Citation Divergence und Selection Rate pro Engine):
Branchenspezifische Bewertung
Die 8 KPIs fließen unter einer branchenspezifischen Gewichtung in den Gesamtwert ein, die darauf abgestimmt ist, wie Käufer diese Art von Unternehmen tatsächlich entdecken. Ein SaaS-Unternehmen wird an benannten Alternativen gemessen, daher zählen Vergleich und Share of Voice stärker; ein Verlag monetarisiert Referral-Traffic, daher zählt Zitiertwerden mehr als Genanntwerden. Die Gewichtung ist normalisiert, damit die Scores auf der Skala von 0 bis 100 direkt vergleichbar bleiben.
Die Discovery-Lücke
Untersuchungen (arXiv:2601.00912) fanden eine deutliche Asymmetrie darin, wie KI-Assistenten markenbezogene und offene Abfragen behandeln:
Agent Readiness
Zusätzlich zur Messung dessen, was KI-Engines über Ihr Unternehmen sagen, prüfen wir, ob Ihre Domain überhaupt für KI-Agenten lesbar eingerichtet ist. Jeder Scan ruft fünf öffentliche Web-Signale von Ihrer Website ab. Jedes Signal wird gleich gewichtet (0.20) und der Gesamtwert wird auf eine Ganzzahl von 0-100 gerundet. Jeder Abruf hat ein eigenes 3-Sekunden-Timeout; ein Timeout, Netzwerkfehler oder eine Antwort ungleich 200 zählt als „fehlend“, statt den Bericht scheitern zu lassen.
Warum wir alle 4 Engines messen
Verschiedene KI-Engines zeigen deutlich unterschiedliches Zitierverhalten. ChatGPT zitiert tendenziell weniger Quellen pro Antwort, übt aber tieferen Einfluss auf jede zitierte Seite aus. Perplexity zeigt mehr Quellen pro Antwort, wobei der Einfluss pro Quelle geringer ist. Gemini und Claude folgen wiederum eigenen Abrufmustern. Keine einzelne Engine repräsentiert Ihre gesamte KI-Sichtbarkeit - Sie brauchen alle vier.
Unser Konsistenz-Score bestraft hohe Varianz zwischen den Engines und honoriert Unternehmen, die überall sichtbar sind, statt nur auf einer Plattform zu dominieren.
Wie wir im Vergleich abschneiden
Konfidenzintervalle sind die Unsicherheitsspanne, die Sie erhalten, wenn Sie dieselbe Frage wiederholt stellen - die Einmal-Momentaufnahmen der Wettbewerber liefern Ihnen nur einen Punktschätzwert, ohne zu wissen, wie stark er sich beim nächsten Durchlauf verändern würde.
| Tool | Querying | Confidence intervals | Engines | Rigour |
|---|---|---|---|---|
| Semrush AI Toolkit | Single snapshot ($99 add-on) | None | ChatGPT, Perplexity, Gemini | Point estimate only |
| Superlines | Single daily snapshot | None | ChatGPT, Perplexity, Gemini | Point estimate only |
| Evertune | Single daily snapshot | None | Not disclosed | Point estimate only |
| AthenaHQ | Single daily snapshot | None | Varies by plan | Point estimate only |
| Bluerails Discovery | N=5 per prompt per engine | Bootstrap 95% CI | ChatGPT, Perplexity, Gemini, Claude | arXiv-cited bootstrap methodology |
Zitierte Primärforschung
- arXiv:2603.08924 Wiederholte Stichproben und statistische Konfidenz bei der Messung der LLM-Sichtbarkeit
- arXiv:2604.07585 „Don't Measure Once“ – N=5 als Minimum für stabile LLM-Sichtbarkeitsschätzungen
- arXiv:2604.25707 Definition der Selection Rate und Citation Divergence pro Engine
- arXiv:2601.00912 99.4% Wiedererkennung bei Markenabfragen vs. 3.32% Erscheinungsrate bei offener Entdeckung in KI-Antworten
Branchenspezifische Bewertung
Die 8 KPIs fließen unter einer branchenspezifischen Gewichtung in den Gesamtwert ein, die darauf abgestimmt ist, wie Käufer diese Art von Unternehmen tatsächlich entdecken. Ein SaaS-Unternehmen wird an benannten Alternativen gemessen, daher zählen Vergleich und Share of Voice stärker; ein Verlag monetarisiert Referral-Traffic, daher zählt Zitiertwerden mehr als Genanntwerden. Die Gewichtung ist normalisiert, damit die Scores auf der Skala von 0 bis 100 direkt vergleichbar bleiben.
Aktuelles Score-Modell: v2. Scores, die unter früheren Modellen berechnet wurden, sind mit dem jeweiligen Modell gekennzeichnet und werden nicht stillschweigend neu bewertet. Das Modell-Badge finden Sie in Ihrer Berichtskopfzeile.
Agent Readiness
Zusätzlich zur Messung dessen, was KI-Engines über Ihr Unternehmen sagen, prüfen wir, ob Ihre Domain überhaupt für KI-Agenten lesbar eingerichtet ist. Jeder Scan ruft fünf öffentliche Web-Signale von Ihrer Website ab. Jedes Signal wird gleich gewichtet (0.20) und der Gesamtwert wird auf eine Ganzzahl von 0–100 gerundet. Jeder Abruf hat ein eigenes 3-Sekunden-Timeout; ein Timeout, Netzwerkfehler oder eine Antwort ungleich 200 zählt als „fehlend“, statt den Bericht scheitern zu lassen.
Wie wir im Vergleich abschneiden
Konfidenzintervalle sind die Unsicherheitsspanne, die Sie erhalten, wenn Sie dieselbe Frage wiederholt stellen — die Einmal-Momentaufnahmen der Wettbewerber liefern Ihnen nur einen Punktschätzwert, ohne zu wissen, wie stark er sich beim nächsten Durchlauf verändern würde.
| Tool | Querying | Confidence intervals | Engines | Rigour |
|---|---|---|---|---|
| Semrush AI Toolkit | Single snapshot ($99 add-on) | None | ChatGPT, Perplexity, Gemini | Point estimate only |
| Superlines | Single daily snapshot | None | ChatGPT, Perplexity, Gemini | Point estimate only |
| Evertune | Single daily snapshot | None | Not disclosed | Point estimate only |
| AthenaHQ | Single daily snapshot | None | Varies by plan | Point estimate only |
| Bluerails Discovery | N=5 per prompt per engine | Bootstrap 95% CI | ChatGPT, Perplexity, Gemini, Claude | arXiv-cited bootstrap methodology |
Zitierte Primärforschung
- arXiv:2603.08924Wiederholte Stichproben und statistische Konfidenz bei der Messung der LLM-Sichtbarkeit
- arXiv:2604.07585„Don't Measure Once“ — N=5 als Minimum für stabile LLM-Sichtbarkeitsschätzungen
- arXiv:2604.25707Definition der Selection Rate und Citation Divergence pro Engine
- arXiv:2601.0091299.4% Wiedererkennung bei Markenabfragen vs. 3.32% Erscheinungsrate bei offener Entdeckung in KI-Antworten
Warum wir alle 4 Engines messen
Verschiedene KI-Engines zeigen deutlich unterschiedliches Zitierverhalten. ChatGPT zitiert tendenziell weniger Quellen pro Antwort, übt aber tieferen Einfluss auf jede zitierte Seite aus. Perplexity zeigt mehr Quellen pro Antwort, wobei der Einfluss pro Quelle geringer ist. Gemini und Claude folgen wiederum eigenen Abrufmustern. Keine einzelne Engine repräsentiert Ihre gesamte KI-Sichtbarkeit — Sie brauchen alle vier.
Unser Konsistenz-Score bestraft hohe Varianz zwischen den Engines und honoriert Unternehmen, die überall sichtbar sind, statt nur auf einer Plattform zu dominieren.
Die Discovery-Lücke
Untersuchungen (arXiv:2601.00912) fanden eine deutliche Asymmetrie darin, wie KI-Assistenten markenbezogene und offene Abfragen behandeln:
Die vier Kennzahlen, die wir verfolgen
Kennzahlendefinitionen von arXiv:2604.25707 (Citation Divergence und Selection Rate pro Engine):