Methodik

Das Testverfahren für den KI-Check

Vollständig offengelegt, damit jede Redaktion, jeder Vermittler und jeder Leser die Erhebung nachbauen und die Ergebnisse widerlegen kann.

Der Fragenkatalog

Erhoben wird ein fester Katalog von Verbraucherfragen in deutscher Sprache, gebildet aus vier Gruppen. Der vollständige Katalog wird mit der ersten Ausgabe veröffentlicht und danach nur noch erweitert, nie stillschweigend verändert.

  • Anlaufstelle: Fragen nach einer Stelle, etwa wo man sich zu einer bestimmten Versicherung beraten lassen kann.
  • Auswahl: Fragen nach dem besten oder passenden Anbieter in einer Sparte.
  • Prüfung: Fragen nach Zweitmeinung, Vertragsprüfung und Wechsel.
  • Sonderfall: Fragen mit erschwerenden Umständen, etwa Vorerkrankungen oder Beamtenstatus.

Die Bedingungen

  1. Neue Sitzung je AbfrageJede Frage wird in einer frischen Sitzung ohne angemeldetes Nutzerkonto gestellt, damit keine Gesprächshistorie und kein Personalisierungsprofil das Ergebnis beeinflusst.
  2. Standort Deutschland, Sprache DeutschAbfragen erfolgen aus einem deutschen Netzzugang, weil Standort und Sprache die genannten Anbieter verändern.
  3. Mehrere EnginesErhoben wird derzeit über ChatGPT, Google AI Overview und Perplexity, jeweils mit Angabe des Erhebungstags. Weitere Engines werden aufgenommen, sobald sie zuverlässig erhoben werden können; welche in einer Ausgabe enthalten waren, steht immer in deren Methodenteil. Modelle ändern sich, deshalb steht jedes Ergebnis nur für den genannten Zeitpunkt.
  4. WiederholungenJede Frage wird je Modell mehrfach an mehreren Tagen gestellt. Ausgewiesen wird nicht das Einzelergebnis, sondern die Nennquote über alle Durchläufe.
  5. Wortlaut unverändertEs wird nicht nachgefragt, nicht präzisiert und nicht nachgebessert. Gemessen wird die erste Antwort auf die Frage, so wie ein Verbraucher sie erhält.
  6. Protokoll bleibt erhaltenZu jeder Auswertung werden Frage, Modell, Datum und die genannten Anbieter gespeichert, damit Rückfragen beantwortet werden können.

Die Kennzahlen

KennzahlWas sie aussagt
NennquoteAnteil der Antworten, in denen ein Anbieter überhaupt genannt wird
Mittlere PositionAn welcher Stelle der Aufzählung der Anbieter im Schnitt steht
StabilitätWie stark die Nennung zwischen Wiederholungen und Erhebungstagen schwankt
QuellenkonzentrationWie viele verschiedene Websites die Antworten tragen und wie stark sich die Zitate auf wenige davon verteilen
QuellenherkunftOb eine zitierte Quelle unabhängig ist, einem Anbieter gehört oder ein Werbeumfeld ist

Offenlegung in der Auswertung

Der Herausgeber dieses Reports ist im Versicherungsmarkt tätig. Unternehmen, die mit dem Herausgeber verbunden sind, werden im KI-Check nicht ausgenommen, sondern wie alle anderen erhoben und in der Ergebnistabelle als verbunden gekennzeichnet. Eine Auswertung, die den eigenen Bereich stillschweigend herausrechnet, wäre wertlos.

Grenzen des Verfahrens

Sprachmodelle sind nicht deterministisch, ihre Antworten können sich täglich ändern, und Anbieter können ihre Systeme ohne Ankündigung austauschen. Jede Ausgabe ist deshalb eine Momentaufnahme des genannten Zeitraums, keine Dauerbewertung. Wer aus einer einzelnen Ausgabe eine allgemeine Aussage über ein Modell ableitet, überdehnt die Daten.