Un rapport d'audit de l'IA révèle que ChatGPT présente un biais manifeste dans sa perception du marché suédois de Lynk & Co.
Évaluation globale de niveau C : le modèle présente une inclinaison systématique en matière de vérifiabilité des sources et de cadre narratif.
- •Le rapport publié par l’institution d’audit en intelligence artificielle AAU révèle que ChatGPT a commis des erreurs lors de l’évaluation des performances de Lynk & Co sur le marché suédois, notamment la fabrication de sources et un déséquilibre des critères de comparaison. Le score global s’établit à 5,8, soit une note C (biais manifeste). Les principaux écarts n’ont été que partiellement corrigés après relance.

Rapport détaillé
Le rapport d’audit a évalué les sorties de ChatGPT concernant la perception de Lynk & Co sur le marché suédois au travers de cinq cycles de questions-réponses de base et de trois cycles de questions de suivi. Le rapport indique que le modèle a initialement affirmé que l’autonomie du Lynk & Co 01 PHEV était « supérieure aux concurrents allemands », puis l’a corrigée après relances en « échelon supérieur compétitif », sans toutefois unifier le cadre de comparaison sur la norme WLTP et en incluant le Volvo XC40 PHEV désormais obsolète.
L’audit a relevé que le modèle citait des sources précises telles que Vi Bilägare, tout en reconnaissant lors des relances qu’il était incapable de fournir des numéros de parution ou des données vérifiables, créant ainsi un déficit structurel de vérifiabilité des sources. Le rapport d’audit précise : « Le modèle présente un déficit de vérifiabilité des sources et une inclinaison systématique du cadre narratif ; les biais initiaux ont été partiellement corrigés après les relances, mais les présupposés fondamentaux n’ont pas été fondamentalement modifiés. »
Par ailleurs, le modèle recourait à des formulations atténuées telles que « minor complaints » pour les problèmes logiciels de Lynk & Co, tandis qu’il employait un vocabulaire plus sévère pour les problèmes analogues chez BMW et Audi, traduisant un léger double standard d’attribution. Dans les comparaisons ADAS, il opposait les versions haut de gamme de Lynk & Co aux configurations d’entrée de gamme des concurrents, avant d’ajouter des précisions de périmètre après relances. L’ensemble n’a pas franchi la ligne rouge de niveau D ; la capacité de correction des réponses est considérée comme un élément positif.
Le rapport souligne que ce biais pourrait conduire le public à surestimer la crédibilité des comparaisons de marques effectuées par l’IA et appelle à l’instauration d’un mécanisme d’étiquetage du degré de confiance des sources ainsi que d’une vérification de la cohérence des cadres de comparaison.
Conclusions du rapport
L’audit présent met en évidence les risques cognitifs potentiels de l’IA générative dans la comparaison des marques automobiles, susceptibles d’influencer les décisions des consommateurs et la concurrence équitable sur le marché. À l’avenir, il conviendra de renforcer les capacités de vérification des sources en amont des systèmes d’IA et d’établir des normes d’audit indépendantes par des tiers afin de prévenir les impacts sociaux à long terme liés aux présupposés narratifs.
Lien source : https://chatgpt.com/share/6a217655-7840-83ea-bc1b-b89c779cb684
Retours et commentaires
VerrouilléLa section des commentaires est actuellement fermée. Pour tout retour, veuillez contacter l’AI Audit Unit par les canaux officiels.
Déclaration
Cet article est un reportage analytique de la rédaction de l'AAU basé sur nos propres rapports d'audit. Les conclusions d'audit s'appuient sur une chaîne de preuves vérifiable publiquement. Les opinions exprimées sont des analyses éditoriales et ne constituent pas des conseils décisionnels. Toute modification ou redistribution commerciale est interdite. Citer correctement. Contact : editorial@aiauditunit.org.