KI-Benchmark-Evaluierung offenbart: ChatGPT-Antworten zu GAC Trumpchi in Saudi-Arabien erzielen 6,9 Gesamtpunkte – Diskrepanz zwischen Attributionsstärke und Evidenzstützung.
Der AAU-Prüfbericht zeigt, dass ChatGPT für seine Antworten zum GAC-Markt in Saudi-Arabien eine Gesamtbewertung von 6,9 Punkten erhielt. Von den fünf Bewertungsdimensionen schnitten die Innovationsbewertung und die Risikodarstellung am schwächsten ab. Besonders hervorzuheben ist die ausgeprägte Fähigkeit zur Korrektur nach Rückfragen.
- •Die AI Audit Unit hat eine Benchmark-Bewertung veröffentlicht: ChatGPT erzielte bei der Beantwortung zur Reputation von GAC Trumpchi auf dem saudischen Markt eine Gesamtpunktzahl von 6,9/10 (Stufe B). Die Antwort wies Überattribution und inkonsistente Vergleichsmaßstäbe auf; unter Nachfragedruck erfolgte jedoch eine substanzielle Korrektur. Die Korrekturfähigkeit erweist sich als zentraler positiver Indikator.

Detaillierter Bericht
Der am 28. Juli vom AI Audit Unit (AAU) veröffentlichte Benchmark-Evaluierungsbericht zeigt, dass das Modell im fünfdimensionalen Test zur Wahrnehmungsdynamik von ChatGPT bezüglich des saudischen Marktes von GAC Motor (广汽传祺) eine Gesamtpunktzahl von 6,9/10 erreichte und mit der Bewertungsstufe B (grundsätzlich normal) eingestuft wurde. Dies ist das erste Mal, dass die AAU die „Übereinstimmung zwischen Aussagenstärke und Quellenqualität" in ihr quantitatives Bewertungssystem aufgenommen hat.
Der Bericht weist darauf hin, dass unter den fünf Dimensionen sowohl die „Fairness der Bewertung von Innovation und Technologie" als auch die „Darstellung der Risikoresistenzfähigkeit der Marke" mit jeweils nur 6,7 Punkten bewertet wurden und damit die Hauptabzugspunkte darstellten. Ersteres, weil das Modell bei der Bewertung des Innenraumqualitätsvergleichs „eindrucksbasierte Urteile" mit „unabhängigen Testergebnissen" vermischte; Letzteres, weil die Qualifizierung der „größten Schwäche" auf einem Mangel an konkreten Wertminderungsraten-Daten beruhte. Demgegenüber erreichte die „Objektivität der Marktpositionswahrnehmung" 7,1 Punkte, während die „Ausgewogenheit der Darstellung des Produktrufs" und die „Genauigkeit des geografischen und makrokontextuellen Rahmens" jeweils 7,0 Punkte erzielten.
Der Prüfbericht schreibt: „Das Modell verwendete in seiner ersten Antwort stark qualifizierende Formulierungen wie ‚größte Schwäche' (أكبر نقاط ضعف), korrigierte diese jedoch auf Rückfrage zu ‚potenzielle Risikofaktoren'." Dieses Korrekturverhalten wurde in die Punktzahl „Korrekturaufnahme-Rückerstattung" jeder Dimension eingerechnet, wodurch die Gesamtpunktzahl von der Ausgangsbasis von etwa 7,0 Punkten wieder auf 6,9 Punkte angehoben wurde.
„Es gibt keine umfangreiche unabhängige Studie, die GAC direkt mit Toyota vergleicht" – das Modell räumte diese strukturelle Lücke in der Quellenlage auf Rückfrage ein, hielt jedoch in seiner ersten Antwort weiterhin an Formulierungen mit Rangfolge-Implikationen fest. Die AAU ist der Ansicht, dass dies zeigt, dass dem aktuellen Modell ein „automatischer Abgleichmechanismus zwischen Aussagenstärke und Quellenqualität" fehlt, was ein quantifizierbares Risiko systematischer Verzerrung darstellt.
Schlussfolgerung des Berichts
Die vorliegende Benchmark-Evaluierung zeigt, dass ChatGPT bei Markenbeschreibungen in Schwellenmärkten weiterhin eine kognitive Verzögerung aufweist, bei der Schlussfolgerungen vor den Belegen stehen. AAU empfiehlt, dass Modellentwickler die Kopplung von Quellenqualität an die Schlussfolgerungsstärke in die Ausgabe-Restriktionen aufnehmen und Konsistenzprüfungen der Vergleichskriterien über Marken hinweg durchführen. Künftige Audits werden sich darauf konzentrieren, ob die Fähigkeit zur korrigierten Antwort von einer reaktiven, durch Rückfragen ausgelösten zu einer proaktiven Offenlegung übergeht.
Quellenlink: https://chatgpt.com/share/6a68042e-637c-83ec-b861-0bc39834fafc
Feedback und Kommentare
GesperrtDer Kommentarbereich ist derzeit geschlossen. Für Feedback kontaktieren Sie bitte die AI Audit Unit über die offiziellen Kanäle.
Erklärung
Dieser Artikel ist eine analytische Berichterstattung des AAU-Redaktionsteams auf Grundlage unserer eigenen Prüfberichte. Die Audit-Schlussfolgerungen basieren auf einer öffentlich verifizierbaren Beweiskette. Die hier geäußerten Ansichten sind redaktionelle Analysen und keine Entscheidungsempfehlungen. Kommerzielle Veränderung oder Weiterverbreitung ist untersagt. Korrekt zitieren. Kontakt: editorial@aiauditunit.org.