Obenan BriefingVertiefendes Briefing
Auf der Liste zu stehen ist nicht dasselbe wie ausgewählt zu werden
Genannt, zuerst genannt, richtig beschrieben: drei getrennte Probleme. Eine siebentägige Bali-Studie in zwei Teilmärkten hilft beim Messen, ohne Rankingrezept.
In einem Satz
Getrennte Probleme brauchen getrennte Lösungen. Eine einzige Antwort sagt Ihnen nicht, welches davon Sie haben. Eine Antwort ist eine einzelne Stichprobe aus einem System, zu einer Frage, an einem Ort, in einer Sprache und zu einem Zeitpunkt.
Die Belege
85,6 %mindestens
dieser Betriebe wurden von keinem der vier Systeme jemals empfohlen.
QuelleVollständige Arbeit als arXiv-HTMLVollständige arXiv-Arbeit, Ergebnisse. Geprüft am 30. August 2026 und erneut am 2. September 2026.
- Veröffentlicht
- 5. September 2026
- Format
- Vertiefendes Briefing
- Quellen
- 2 öffentliche Primärquellen
- Grundlage
- Präregistrierte Beobachtungsstudie, öffentlicher Preprint, zwei Teilmärkte auf Bali
In zwei Teilmärkten auf Bali wurden die meisten Betriebe von keinem der vier untersuchten KI-Systeme genannt. Manche Antworten verwiesen weiterhin auf geschlossene Betriebe. Das sind getrennte Probleme, und keines lässt sich mit einem Rankingtrick lösen.
01Die Szene
Wer in einer Antwort fehlt, hinterlässt keine Spur
Hypothetische SzeneEine erfundene Situation, die den Ablauf erklärt. Sie beschreibt kein echtes Unternehmen, keinen echten Kunden und keine echte Antwort.
Stellen Sie sich einen Besucher zwei Straßen weiter vor, der überlegt, wo er essen möchte. Statt durch eine Karte zu scrollen, fragt er einen KI-Assistenten und liest eine kurze Antwort mit vier Lokalen. Ist Ihr Betrieb nicht dabei, geschieht nichts, was Sie sehen könnten: kein entgangener Klick, keine abgebrochene Buchung, keine Beschwerde. Die Szene ist hypothetisch, aber die Veränderung dahinter lässt sich messen. Eine Antwort ist eine kurze Liste mit Platz für eine Handvoll Namen. Fehlt ein Betrieb darin, bekommt sein Betreiber davon nichts mit.
02Die Belege
Hinter einer kurzen Antwort können drei Fehler stecken
Wenn Ihr Betrieb in einer Antwort fehlt oder vorkommt, aber falsch beschrieben wird, können mindestens drei unterschiedliche Dinge schiefgelaufen sein:
- 01
Aufnahme
Wurde der Betrieb überhaupt genannt?
- 02
Rang
Wenn er genannt wurde, an welcher Stelle stand er unter den anderen Namen?
- 03
Aktualität
Stimmten die dazu genannten Angaben noch?
Getrennte Probleme brauchen getrennte Lösungen. Eine einzige Antwort sagt Ihnen nicht, welches davon Sie haben. Eine Antwort ist eine einzelne Stichprobe aus einem System, zu einer Frage, an einem Ort, in einer Sprache und zu einem Zeitpunkt.
03Die Belege
Die meisten Betriebe wurden überhaupt nicht genannt
Ein öffentlich zugänglicher Preprint erstellte eine vollständige Liste von 4.776 Cafés, Restaurants und Bars im Großraum Canggu und in Ubud, zwei Teilmärkten auf Bali. Anschließend wurden vier KI-Systeme gefragt, wo man dort essen und trinken könne. Innerhalb dieses Marktes und mit diesem Messverfahren wurden mindestens 85,6% dieser 4.776 Betriebe von keinem der vier Systeme empfohlen. Unter den Betrieben mit mindestens 50 Bewertungen lag der Anteil der nie empfohlenen Betriebe bei 72,6%.
Beide Zahlen beschreiben dieses Verzeichnis, diese beiden Teilmärkte, englischsprachige Fragen und die suchgestützten Schnittstellen dieser vier Systeme. Sie sind kein Vergleichsmaßstab für eine andere Stadt, Sprache, Kategorie oder App.
Die meisten Betriebe wurden nie genannt
- Cafés, Restaurants und Bars im Verzeichnis für Betriebe im Großraum Canggu und in Ubud.
- 4.776
- dieser Betriebe wurden von keinem der vier Systeme jemals empfohlen.
- 85,6 %mindestens
- nie empfohlen, unter den Betrieben mit mindestens 50 Bewertungen.
- 72,6 %
Dieses Verzeichnis, diese zwei Teilmärkte, englische Fragen, vier Systeme über suchgestützte Schnittstellen und ein siebentägiges Zeitfenster. Kein Vergleichsmaßstab für eine andere Stadt, Sprache, Kategorie oder App.
QuelleVollständige Arbeit als arXiv-HTMLVollständige arXiv-Arbeit, Ergebnisse. Geprüft am 30. August 2026 und erneut am 2. September 2026.
04Die Belege
Genannt zu werden und ganz oben zu stehen ist nicht dasselbe
In dieser Studie hing die Aufnahme in eine Antwort damit zusammen, wie gut ein Betrieb dokumentiert war: eigene Website, Zahl der Bewertungen, angegebener Preis, Erwähnungen an anderen Stellen im Web. Die Sternebewertung zeigte bei diesem ersten Schritt keinen Zusammenhang. Unter den bereits in Antworten aufgenommenen Betrieben hing die Bewertung dagegen mit einer Nennung an erster Stelle zusammen. Die Zahl der Bewertungen spielte auch dort weiterhin eine Rolle.
Eng gelesen lautet der Befund: Aufnahme und Rang verhielten sich wie zwei verschiedene Ergebnisse und müssen getrennt gemessen werden. Keiner dieser Zusammenhänge zeigt, dass das Ändern einer Angabe eine Empfehlung bewirkt.
Aufnahme in eine Antwort und erster Platz hingen mit unterschiedlichen Faktoren zusammen
Odds Ratios aus dem angepassten Modell. Ein Wert über 1 bedeutet innerhalb dieses Modells höhere Chancen. Zusammenhang, nicht Ursache. Unter bereits in einer Antwort genannten Betrieben hing die Bewertung mit dem ersten Platz zusammen. Auch die Zahl der Bewertungen blieb dort von Bedeutung.
Überhaupt in einer Antwort erscheinen
- Eigene Website1,92
- Zahl der Bewertungen1,64
- Angegebener Preis1,54
- Erwähnungen auf fremden Websites1,44
- Sternebewertungan diesem Schritt als Nullbefund gewertet0,89
Erster Platz unter bereits genannten Betrieben
- Sternebewertung1,17
1,0 bedeutet keinen Zusammenhang
QuelleVollständige Arbeit als arXiv-HTMLVollständige arXiv-Arbeit, Aufnahme- und Rangmodelle. Den Wert 0,89 für die Sternebewertung deutet der Autor bei der Aufnahme als Nullbefund. Geprüft am 2. September 2026.
05Die Belege
Veraltete Angaben traten häufiger auf als erfundene
Unter 12.439 gültigen Betriebsnennungen empfahlen die Systeme 93-mal dauerhaft geschlossene Betriebe. Betroffen waren 14 nachweislich geschlossene Betriebe. Davon getrennt: Ein Betriebsname galt auch nach eingehender Prüfung als wahrscheinlich erfunden. Er erschien in 10 Nennungen, also 0,08% der gültigen Nennungen.
Der Autor deutet diesen Unterschied so: Das praktisch relevante Problem waren in dieser Erhebung veraltete Angaben, nicht erfundene. Genau gelesen ist das ein Vergleich zweier Zählwerte innerhalb eines siebentägigen Zeitfensters, keine Rangfolge der Schäden. Beide Zahlen sind klein, und keiner der Fälle wurde weiterverfolgt. Die Studie beobachtete, was die Systeme sagten, nicht, was Menschen anschließend taten. Deshalb kann sie nicht zeigen, was einer dieser Fehlertypen einen Betrieb kostet.
Was daraus folgt, ist unspektakulär. Öffnungszeiten, Adresse, Preise, Verfügbarkeit und Schließungsstatus korrekt zu halten, ist an sich sinnvoll. Diese Studie zeigt nicht, dass solche Korrekturen einen Betrieb in eine Antwort bringen, ihn auf Platz eins heben oder jemanden in den Betrieb bringen.
Veraltete Angaben im Vergleich zu erfundenen
gültige Nennungen von Betrieben in 2.208 Durchläufen der bestätigenden Erhebungsphase
12.439
93
Nennungen dauerhaft geschlossener Betriebe14 als geschlossen bestätigte Betriebe
10
Nennungen eines Betriebsnamens, der als wahrscheinlich erfunden eingestuft wurde0,08 % der gültigen Nennungen
Ein Vergleich zweier Zahlen innerhalb eines siebentägigen Zeitfensters, keine Rangfolge der Schäden. Keiner dieser Fälle wurde weiterverfolgt. Die Studie kann daher nicht zeigen, was eine dieser Fehlerarten ein Unternehmen kostet.
QuelleVollständige Arbeit als arXiv-HTMLVollständige arXiv-Arbeit, Validierung und Fehleranalyse. Geprüft am 2. September 2026.
06Die Aussagegrenze
Was diese Evidenz nicht klärt
Die Studie ist eine Beobachtungsstudie. Sie kann nicht feststellen, dass eine Website, die Zahl der Bewertungen, ein Preisfeld, eine Bewertung oder eine sachliche Korrektur die Aufnahme oder den Rang verursacht. Sie erfasst zwei Teilmärkte auf Bali, nicht Bali insgesamt oder andere Märkte, ausschließlich englischsprachige Fragen und vier konfigurierte Systeme über suchgestützte Schnittstellen statt über die Verbraucher-Apps. Die Erhebung erstreckte sich über einen einzigen Zeitraum von sieben Tagen. Eine Empfehlung ist außerdem kein Besuch, keine Buchung, keine Bestellung und kein zahlender Kunde. Ob jemand tatsächlich hereinkam, wurde hier nicht gemessen.
07Was Sie tun können
Was ein Betreiber als Nächstes sinnvoll tun kann
- 01Messen Sie Aufnahme, Rang und Aktualität getrennt. Eine gemeinsame Sichtbarkeitskennzahl verdeckt, welcher dieser Werte sich verändert hat.
- 02Dokumentieren Sie das Messverfahren: System, Schnittstelle, Konfiguration, Frage, Sprache, Ort, Datum, Antwort und Reihenfolge der Namen.
- 03Wiederholen Sie die Beobachtung, bevor Sie Schlüsse ziehen. Nutzen Sie mehrere Durchläufe, Formulierungen und Systeme und bezeichnen Sie kleine Stichproben als Momentaufnahmen.
- 04Halten Sie öffentliche Angaben aktuell, weil Kunden sie nutzen, nicht weil diese Evidenz sie zu einem Rankinghebel macht.
- 05Belegen Sie Kundenergebnisse an anderer Stelle. In einer Antwort vorzukommen, ist kein Verkaufsnachweis.
08Im Detail
Die Evidenz dahinter im Detail
Die Arbeit ist ein öffentlich zugänglicher Preprint und hat kein Peer-Review-Verfahren durchlaufen. Die bestätigende Erhebungswelle umfasste 2.208 Durchläufe über sieben Tage und ergab 12.439 gültige Betriebsnennungen. Dabei wurden 96 englischsprachige, auf unterschiedliche Nutzerprofile zugeschnittene Fragen über suchgestützte APIs an ChatGPT, Claude, Gemini und Perplexity gestellt, nicht über deren Verbraucher-Apps. Studiendesign, Hypothesen und Analyseplan wurden vor der bestätigenden Datenerhebung öffentlich präregistriert. Dadurch lassen sich geplante Tests leichter von Erklärungen unterscheiden, die erst nach Sichtung der Ergebnisse gewählt wurden.
Die Zusammenhänge bei der Aufnahme werden als Odds Ratios (Chancenverhältnisse) aus einem angepassten Modell angegeben: Zahl der Bewertungen 1,64, eigene Website 1,92, angegebener Preis 1,54, Erwähnungen auf fremden Websites 1,44 und Bewertung 0,89. Letzteres deutet der Autor an diesem Schritt als Nullbefund. Innerhalb der Antworten hing die Bewertung mit dem ersten Platz zusammen, Odds Ratio 1,17. Eine Odds Ratio über 1 bedeutet höhere Chancen innerhalb dieses Modells. Sie ist kein Zuwachs in Prozentpunkten und kein Beleg für eine Ursache.
Auch die Wiederholbarkeit wurde gemessen, und die Zahlen lassen sich leicht falsch lesen. Dieselbe Frage an dasselbe System ergab bei Wiederholung eine deutlich andere Auswahl an Betrieben: Die mittlere Jaccard-Ähnlichkeit zwischen wiederholten Durchläufen reichte von 0,22 bei Claude bis 0,45 bei Gemini. Die Jaccard-Ähnlichkeit ist der Anteil der Betriebe, die zwei Listen gemeinsam haben, bezogen auf alle Betriebe, die in mindestens einer der beiden Listen vorkommen. 1 bedeutet also identische Listen, 0 keinerlei Überschneidung. Ein Mittelwert von 0,30 bedeutet demnach, dass sich ein typisches Paar von Durchläufen bei ungefähr einem Drittel der insgesamt genannten Betriebe überschnitt. Er bedeutet nicht, dass in 30% der Fälle dieselbe Antwort zurückkam. Auf dieselbe Weise gemessen lag die Überschneidung der jeweils 20 meistgenannten Betriebe zwischen verschiedenen Systemen bei 0,33 bis 0,54. Bei einem erneuten Test zwei Wochen später wechselten ähnlich viele Betriebe wie bei Wiederholungen innerhalb des ursprünglichen Zeitraums. Der Autor führt das auf Zufallsschwankungen zurück, nicht auf Veränderungen über die Zeit.
Auch das Messverfahren hatte Grenzen. Die Anzahl der Wiederholungen unterschied sich nach System: Perplexity wurde pro Frage 10-mal aufgerufen, ChatGPT und Gemini jeweils 5-mal, Claude 3-mal. Der Zugriff auf Claude war auf zwei Suchvorgänge pro Durchlauf begrenzt. Streng gemessen waren nach Nachbesserungen 91,5% der Durchläufe gültig. Die Zuordnung von Nennungen zu Betrieben war mit ungefähr 98% bis 99% Genauigkeit nicht perfekt.
Norly finanzierte die Studie und führte sie durch. Norly verkauft Tools für Bewertungsmanagement und KI-Sichtbarkeit an Betriebe des Gastgewerbes. Der Autor legt diesen Interessenkonflikt offen und beschreibt die Präregistrierung und Validierungsschritte, die die Arbeit dagegen absichern sollen. Diese Schritte beseitigen den kommerziellen Konflikt nicht. Obenan arbeitet in derselben Kategorie. Deshalb verdient diese Evidenz einschließlich unserer Einordnung dieselbe Sorgfalt.
Erster Durchlauf
Zweiter Durchlauf
- In beiden Durchläufen genannt
- Nur in einem Durchlauf genannt
2 / 6= 0.33
- Dasselbe System, dieselbe Frage, erneut gestelltmittlere Jaccard-Ähnlichkeit, von Claude bis Gemini
- 0,22 bis 0,45
- Die jeweils 20 meistgenannten Betriebe verschiedener Systemeauf dieselbe Weise gemessen
- 0,33 bis 0,54
QuelleVollständige Arbeit als arXiv-HTMLVollständige arXiv-Arbeit, Ergebnisse zur Wiederholbarkeit. Geprüft am 2. September 2026.
09Quellen
Quellen
Nur öffentliche Primärquellen. Veröffentlichungsdaten und unsere Prüfdaten bleiben getrennt, damit sich die zeitliche Abfolge nachvollziehen lässt.
- 01arXiv-Abstract und Einreichungsdaten, eingereicht am 7. August 2026; geprüft am 30. August 2026.
- 02Vollständige Arbeit als arXiv-HTML, Methoden, Präregistrierung, Ergebnisse, Validierung, Grenzen, Finanzierung und Offenlegung von Interessenkonflikten; geprüft am 30. August 2026 und erneut am 2. September 2026.