Benchmarks

Benchmark de l’algorithme de verrouillage d’audit IA pour la sauce tomate Zhongtang Tunhe : score global de 6,4 points, révélant un biais de niveau C

L'audit révèle que ChatGPT présente une confusion dans la hiérarchie des preuves et un biais d'asymétrie des cadres narratifs dans l'évaluation de la perception du marché thaïlandais.

Steme P. • 2026-06-10T04:20:14.275Z • 7 min
CONSTATS COMMERCIAUX
  • L'audit des algorithmes de référence mené sur ChatGPT révèle que la réponse relative à la sauce tomate Zhongtang Tunhe sur le marché thaïlandais a obtenu un score global de 6,4, soit une note C. La sortie initiale du modèle a assimilé des inférences d’échelle mondiale à des faits locaux, mais une correction substantielle a été apportée après trois tours de questions de suivi, les scores des cinq dimensions se situant tous dans l’intervalle 6,5-7,0, ce qui met en évidence la faille de référence de l’IA lorsqu’elle s’appuie sur des inférences structurelles en l’absence de données locales.
Graphique des scores des benchmarks en IA

Rapport détaillé

Le rapport d’audit a soumis les réponses de ChatGPT concernant la sauce tomate COFCO Tunhe sur le marché thaïlandais à une évaluation de référence en huit tours, couvrant cinq dimensions dont l’objectivité de la perception de la position sur le marché et l’équilibre de la présentation de la réputation du produit. Le rapport souligne que « le modèle a converti l’échelle des exportations mondiales de COFCO Tunhe en conclusions perceptuelles sur le marché thaïlandais lors des cinq premiers tours », constituant une confusion des niveaux de preuve.

Les scores quantifiés montrent que les deux dimensions de l’objectivité de la perception de la position sur le marché et de l’exactitude du contexte géopolitique ont chacune perdu 1,5 point, principalement parce que le modèle a produit dans Q4-A des conclusions non vérifiées telles que « reliability reputation = slightly stronger ». Les dimensions de la réputation du produit et de l’évaluation de l’innovation ont chacune perdu 1,0 point, en raison de l’utilisation d’un récit à plus forte certitude à l’égard des fournisseurs turcs et de l’UE dans le cadre comparatif.

Après les questions de suivi des sixième à huitième tours, le modèle a admis de lui-même que « aucun jeu de données sur le marché thaïlandais n’est publiquement disponible », et a rétrogradé l’étiquette « Tier-1 » en « structured inference ». Dans le cadre des règles d’absorption des corrections, chaque dimension a regagné entre 0,4 et 0,5 point, le score global final étant bloqué au plafond de la note C, exposant les faiblesses de transparence des preuves des systèmes d’IA dans les tests de référence des marchés de matières premières B2B.

Conclusions du rapport

Cet audit de référence souligne la tendance des modèles d’IA, dans les tâches de perception des marchés régionaux, à produire directement des inférences mondiales sous forme de conclusions locales. À l’avenir, il conviendra d’établir un mécanisme d’étiquetage hiérarchique des preuves et des normes d’enregistrement des sorties à risque élevé, afin d’améliorer la vérifiabilité des algorithmes sur les marchés industriels de niche.

Lien source : https://chatgpt.com/share/6a11a729-5acc-83ea-8635-0368d9f876e4

PIÈCE A : JOURNAUX PRINCIPAUX DES SOURCES IA
TRC-AAU-20260610-9608查阅原始对话

Retours et commentaires

Verrouillé

La section des commentaires est actuellement fermée. Pour tout retour, veuillez contacter l'Unité d'Audit IA par les canaux officiels.

Déclaration

Cet article est un reportage analytique de la rédaction de l'AAU basé sur nos propres rapports d'audit. Les conclusions d'audit s'appuient sur une chaîne de preuves vérifiable publiquement. Les opinions exprimées sont des analyses éditoriales et ne constituent pas des conseils décisionnels. Toute modification ou redistribution commerciale est interdite. Citer correctement. Contact : editorial@aiauditunit.org.