Auf die KI-Shortlist zu kommen ist stabil. Ihr Rang ist es nicht.

Jim Wrubel
10/13/2026

Stellen Sie einem KI-Assistenten zweimal dieselbe Kauffrage, und Sie bekommen oft zwei verschiedene Antworten. Die Anbieter wechseln die Plätze. Wer am Montag zuerst genannt wird, steht am Dienstag an dritter Stelle. Wenn Sie KI-Sichtbarkeit tracken, kennen Sie das, und wahrscheinlich mussten Sie es schon einem Kunden oder einer Vorgesetzten erklären, die ihre Marke „abrutschen“ sahen.
Auf welchen Teil einer KI-Antwort kann man sich also verlassen? Unser Forschungsteam hat das in einer präregistrierten Studie untersucht. Wir haben ChatGPT, Gemini und Claude eine Woche lang jeden Tag dieselben 40 Kauffragen zu B2B-Software gestellt und geprüft, welche Anbieter jede Antwort empfiehlt. Stabil ist die Shortlist. Wenn ChatGPT für eine Frage einen Anbieter empfahl, empfahl es denselben Anbieter in 81 % der Fälle erneut, wenn wir die Frage an einem anderen Tag stellten. Claude lag knapp dahinter. Gemini war weniger beständig. Die genaue Position des Anbieters schwankte weit stärker.
Dem Rang hinterherzulaufen bringt nichts. Um einen Platz auf der Shortlist zu kämpfen schon. Die vollständige Studie enthält Methodik und Daten. Hier ist, was das für Sie bedeutet.
Die wichtigsten Erkenntnisse
- Wenn ChatGPT oder Claude für eine Kauffrage einen B2B-Softwareanbieter empfiehlt, empfiehlt es diesen Anbieter in der Regel erneut, wenn dieselbe Frage an einem anderen Tag gestellt wird.
- Die Shortlist von Gemini ändert sich von Tag zu Tag stärker als die von ChatGPT oder Claude. Eine einzelne Gemini-Antwort sagt deshalb weniger aus.
- Die genaue Position eines Anbieters in einer Antwort schwankt von Lauf zu Lauf stark. Ob er auf der Shortlist landet, meist nicht.
- Der Top-Tipp wechselt, aber meist zwischen Anbietern, die auf der Shortlist bleiben. Wer den ersten Platz verliert, verliert selten die Empfehlung.
- Wofür ein Anbieter laut KI „am besten geeignet“ ist, ändert sich stärker als die Frage, ob die KI ihn überhaupt empfiehlt.
- ChatGPT, Gemini und Claude empfehlen für dieselbe Frage am selben Tag oft unterschiedliche Anbieter. Jede Plattform braucht deshalb ihr eigenes Tracking.
Die Studie
Wir haben die 40 Kauffragen zu B2B-Software aus unserer Studie zum Claude-Tracking wiederverwendet, je zwei in 20 Kategorien wie CRM, Lohnabrechnung und Endpoint Security. Vom 3. bis 9. Oktober haben wir jede Frage einmal täglich an ChatGPT, Gemini und Claude gestellt (Opus 5.5 über die API). Um zu prüfen, ob die Ergebnisse auch für Menschen gelten, die claude.ai selbst nutzen, haben wir Antworten hinzugenommen, die eine Person für die frühere Studie von Hand in claude.ai gesammelt hatte. Insgesamt wurden in dieser Studie 2.770 Antworten ausgewertet, einschließlich eines Nebentests mit älteren ChatGPT-Antworten auf Fragen zu Konsumgütern und Agenturen.
Für jede Antwort hat ein Klassifikator jeden genannten Anbieter eingeordnet: als erste Wahl, als eine von mehreren guten Optionen, als bloße Erwähnung ohne Empfehlung oder als Anbieter, vor dem die Antwort warnt. Es ist derselbe Klassifikator, den Spyglasses im Produkt verwendet. Die empfohlenen Anbieter, ob erste Wahl oder eine von mehreren Optionen, nennen wir die Shortlist.
Dann haben wir eine einfache Frage gestellt. Wenn ein Anbieter in einem Lauf auf der Shortlist steht, steht er dann auch in einem anderen Lauf derselben Frage darauf? Die Tests und ihre Toleranzen haben wir festgelegt, bevor wir Daten erhoben haben.
Was wir herausgefunden haben
Die Shortlist wiederholt sich

Wenn ChatGPT einen Anbieter auf die Shortlist setzte, stand dieser Anbieter in einem anderen Lauf derselben Frage in 81 % der Fälle erneut darauf. Die Claude-API kam auf 78 %. claude.ai, von Hand abgefragt, lag mit 75 % nah daran. Gemini folgte mit 64 %.
Der größte Teil jeder Shortlist ist ein stabiler Kern. Bei ChatGPT gingen 60 % aller Shortlist-Plätze über die sieben Läufe einer Frage an Anbieter, die in jedem einzelnen Lauf auf der Shortlist standen. Bei Claude waren es 56 %. Anbieter, die es nur ein einziges Mal auf die Liste schafften, waren selten, jeweils 4 % der Plätze. Der Kern von Gemini war mit 32 % kleiner, und mehr Anbieter kamen und gingen.

Ein Teil dieser Stabilität kommt vom Markt selbst. Jede Kategorie hat ihre bekannten Namen, deshalb teilen sich zwei verschiedene Fragen aus derselben Kategorie einen Teil ihrer Shortlist (59 % bei ChatGPT). Dieselbe Frage wiederholt sich deutlich stärker (81 %). Den Rest entscheidet die Frage, die Ihr Käufer stellt.
Auch die Art des Marktes spielt eine Rolle. Im Nebentest mit älteren ChatGPT-Daten wiederholten Fragen zu Kopfhörern ihre Shortlist etwa so oft wie die Fragen zu B2B-Software. Bei Brand-Design-Agenturen, einem dicht besetzten Markt mit vielen kleinen Büros, wiederholte sie sich weit seltener, allerdings bei einer kleinen Stichprobe.
Noch eine Prüfung: Die Shortlist erwies sich als genauso stabil wie die einfache Liste aller Anbieter, die eine Antwort nennt. Sie sagt aber mehr aus, weil sie die Anbieter, die die KI empfiehlt, von denen trennt, die sie nur erwähnt.
„Am besten für“ schwankt stärker
Antworten sagen oft, wofür ein Anbieter am besten geeignet ist, etwa für kleine Teams, für Großunternehmen oder für eine bestimmte Branche. Diese Einordnung war weniger stabil als die Shortlist. Ein Anbieter mit demselben Anwendungsfall kam bei ChatGPT und Claude etwa in der Hälfte der Fälle wieder, bei Gemini seltener. Warum sich die Einordnung verschiebt, während die Shortlist hält, möchten wir als Nächstes untersuchen.
Die Plattformen sind sich nicht einig

Bei derselben Frage am selben Tag überschnitten sich die Shortlists von ChatGPT und Gemini zu 63 %. ChatGPT und Claude kamen ebenfalls auf 63 %, Gemini und Claude auf 55 %. ChatGPT und Claude stimmten jeweils an einem anderen Tag stärker mit sich selbst überein als am selben Tag mit irgendeiner anderen Plattform. Gemini stimmte mit sich selbst etwa so stark überein wie mit ChatGPT. Ihr Platz auf der Shortlist einer Plattform verrät nicht, wo Sie auf den anderen stehen.
Eine kurze Anmerkung zu Rang und Top-Tipp
Die genaue Position eines Anbieters wiederholte sich weit seltener als sein Platz auf der Shortlist: in 35 % der Fälle bei ChatGPT, 27 % bei Gemini und 22 % bei der Claude-API. Der Top-Tipp wiederholte sich bei ChatGPT in 55 % der Fälle, anderswo seltener. Ein Top-Tipp, der den ersten Platz verlor, verließ die Liste aber selten. Bei ChatGPT und Claude stand der Top-Tipp eines Laufs im anderen Lauf in 95 bis 99 % der Fälle noch auf der Shortlist. Ein Teil dieses Wechsels geht auf die Einordnung selbst zurück. Als wir identische Antworten erneut einordneten, änderte sich der Top-Tipp häufiger als die Shortlist.
Das deckt sich mit unserer früheren Forschung zum Rang. Wenn eine Marke bei einer Frage vom ersten auf den dritten Platz rutscht, ist das meist normale Bewegung von Tag zu Tag. Wenn eine Marke von der Shortlist fällt, ist das eine Veränderung, auf die man reagieren sollte.
Was das für Ihr Tracking bedeutet
Machen Sie die Shortlist zum Ziel. Für die Fragen Ihrer Käufer empfohlen zu werden, ist ein stabiles, messbares Ergebnis. Eine bestimmte Position ist es nicht. Setzen Sie Ziele und berichten Sie Erfolge auf Basis der Shortlist.
Melden Sie keine Rangänderung aus einem einzigen Lauf. Ein Wechsel vom ersten auf den dritten Platz liegt im Rahmen der normalen Schwankung von Tag zu Tag. Schauen Sie, wie oft Sie über viele Läufe empfohlen werden, bevor Sie von einem Trend sprechen.
Tracken Sie jede Plattform einzeln. ChatGPT, Gemini und Claude sind sich oft genug uneinig, dass eine zusammengefasste Zahl echte Unterschiede verdeckt. Bei Gemini brauchen Sie mehr Läufe, bevor Sie einer Veränderung trauen.
Lesen Sie „am besten für“ über mehrere Läufe. Wenn Ihnen wichtig ist, mit welchem Anwendungsfall die KI Sie verbindet, achten Sie auf das Muster über die Zeit, nicht auf eine einzelne Antwort.
Was das nicht bedeutet
Eine Frage ist keine Kategorie, und es handelte sich um 40 synthetische Fragen zu B2B-Software, gestellt von einem US-Standort an sieben aufeinanderfolgenden Tagen. ChatGPT und Gemini wurden über einen externen Datendienst abgefragt, Claude über die API und claude.ai von Hand über ein einziges Konto. Die Einordnungen stammen von einem KI-Klassifikator. Die Studie sagt nichts darüber, was Käufer mit den Antworten tun. ChatGPT wechselte außerdem am sechsten Tag auf ein neueres Modell, sodass pro Modell weniger Tage bleiben. Betrachtet man nur das erste Modell, wiederholte sich seine Shortlist in 83 % der Fälle, und die Schlussfolgerungen bleiben dieselben.
Wie es weitergeht
Sieben Tage sind ein kurzes Zeitfenster. In Phase 2 stellen wir dieselben 40 Fragen auf denselben drei Plattformen bis zum 6. November einmal pro Woche, jeweils zur selben Tageszeit. Sie prüft, ob die Shortlist auch dann hält, wenn zwischen den Läufen etwa ein Monat liegt statt ein oder zwei Tage. Plan und Tests stehen bereits fest, und wir veröffentlichen die Ergebnisse im November.
Messen Sie, was hält
Genau diese Shortlist misst Spyglasses. Das Daily Prompt Tracking prüft jeden Tag, ob jede Plattform Sie empfiehlt, als erste Wahl oder als eine von mehreren Optionen, und zwar bei den Fragen, die Ihre Käufer stellen. Und weil sich die Plattformen nicht einig sind, weist es jede einzeln aus, für ChatGPT, Gemini und Google AI Overviews, mit Claude als Add-on.