KI-Antworten schwanken von Lauf zu Lauf um mehrere Prozentpunkte. Was unsere Messreihe über die Auflösungsgrenze einer Messung sagt, welche drei Regeln eine Reihe belastbar machen, und was eine Reihe zeigt, das ein Einzelwert nie zeigen kann.
Eine einzelne Messung der KI-Sichtbarkeit ist eine Momentaufnahme, kein Ergebnis. In unserer Messreihe seit Juli 2026 (19 Kundenwebsites, 119 Messläufe, 17.790 KI-Antworten) schwankten einzelne Unternehmen zwischen zwei Läufen um bis zu 12,7 Prozentpunkte, ohne dass sich an ihrer Website oder ihrem Markt etwas geändert hätte. Belastbar wird KI-Sichtbarkeit erst als Reihe: gleiche Fragen, gleiche Methode, Mittelwert aus mehreren Läufen.
Alle folgenden Werte stammen aus identischen Fragen, identischer Methode und demselben Rhythmus von 150 Antworten pro Lauf:
Der Grund liegt in der Natur der Systeme: KI-Antworten sind nicht deterministisch. Dieselbe Frage liefert an zwei Tagen zwei verschiedene Antworten, die Live-Suche zieht andere Quellen, die Liste wird anders zusammengesetzt. Dazu kommt die Auflösungsgrenze: Bei 150 Antworten pro Lauf entspricht eine einzige Nennung 0,67 Prozentpunkten. Eine Bewegung von zwei Prozentpunkten sind drei Nennungen mehr oder weniger. Darunter ist nichts interpretierbar.
„Belastbare Aussagen entstehen erst durch regelmäßige Messungen über mehrere Systeme hinweg." (GeoUp, Auswertung von 12.769 KI-Antworten, Juli 2026)
Wie oft sollte KI-Sichtbarkeit gemessen werden? Mindestens monatlich, besser alle zwei Wochen, damit sich schnell ein Mittelwert aus drei Läufen bilden lässt. Entscheidend ist weniger die Frequenz als die Konstanz: gleiche Fragen, gleiche Systeme, gleiche Methode.
Ab wann ist eine Veränderung echt? Als Faustregel: mindestens zwei Prozentpunkte im Vergleich zweier Drei-Läufe-Mittelwerte, bei 150 Antworten pro Lauf also mindestens drei Nennungen, idealerweise mit gleichbleibender Richtung über mehrere Läufe. Alles darunter liegt innerhalb der natürlichen Schwankung.
Kann ich Messungen verschiedener Tools oder Zeiträume vergleichen? Nicht direkt. Unterschiedliche Fragen, Systeme oder Abfragewege liefern unterschiedliche Grundniveaus. Vergleichbar sind nur Läufe innerhalb derselben Reihe.
Warum wird im Dashboard eine andere Zahl angezeigt als in dieser Auswertung? Weil es zwei Kennzahlen gibt. Diese Auswertung rechnet auf Antwort-Ebene: In wie vielen der 150 Antworten kommt das Unternehmen vor? Ein Dashboard zeigt oft die Fragen-Abdeckung: Bei wie vielen der 30 Fragen nennt mindestens ein System das Unternehmen? Beides ist richtig, die Nenner sind verschieden. Stand: September 2026.
Sehen Sie GeoUp in einer kurzen Demo, oder prüfen Sie direkt, wie KI-Systeme heute über Ihr Unternehmen sprechen.