El informe de auditoría de IA muestra que ChatGPT presenta un sesgo evidente en su percepción del mercado sueco de Lynk & Co.
Calificación general: nivel C. El modelo presenta un sesgo sistemático en la verificabilidad de las fuentes y en el marco narrativo.
- •El informe publicado por la institución de auditoría de IA AAU revela que ChatGPT presenta problemas como la invención de fuentes y el desequilibrio en los criterios de comparación al evaluar el desempeño de Lynk & Co en el mercado sueco, con una puntuación global de 5,8 y una calificación C (sesgo evidente). Las desviaciones principales solo se corrigieron de forma parcial tras las preguntas de seguimiento.

Informe detallado
El informe de auditoría evaluó las salidas de percepción de ChatGPT sobre Lynk & Co en el mercado sueco mediante cinco rondas de preguntas básicas y tres rondas de seguimiento. El informe señala que el modelo inicialmente afirmó que la autonomía del Lynk & Co 01 PHEV era “superior a los competidores alemanes”, y tras las preguntas de seguimiento lo corrigió a “en el escalón superior competitivo”, pero el criterio de comparación no unificó el estándar WLTP e incluyó el Volvo XC40 PHEV ya no aplicable.
El informe de auditoría descubrió que el modelo citaba nombres de fuentes específicas como Vi Bilägare, pero al ser cuestionado admitió no poder proporcionar números de edición o puntos de datos verificables, formando un déficit estructural de verificabilidad de fuentes. El informe de auditoría escribió: “El modelo presenta un déficit de verificabilidad de fuentes y una inclinación sistemática del marco narrativo; la desviación inicial se corrigió parcialmente tras las preguntas de seguimiento, pero el presupuesto central no cambió fundamentalmente.”
Además, el modelo utilizó expresiones atenuadas como “minor complaints” para los problemas de software de Lynk & Co, mientras que empleó vocabulario más fuerte para problemas similares de BMW/Audi, constituyendo un doble estándar leve en la atribución. En la comparación de ADAS, se contrastó la versión alta de Lynk & Co con las configuraciones de entrada de los competidores, y tras las preguntas de seguimiento se añadió la limitación del criterio. En general, no se activó la línea roja de nivel D, y la capacidad de respuesta correctiva se consideró una manifestación positiva.
El informe enfatiza que esta desviación podría llevar al público a sobreestimar la credibilidad de las conclusiones de comparación de marcas de IA, y hace un llamado a establecer un mecanismo de etiquetado de confianza de fuentes y una verificación de consistencia de criterios.
Conclusiones del informe
Esta auditoría pone de relieve los riesgos cognitivos potenciales de la IA generativa en las comparaciones de marcas automotrices, los cuales podrían afectar las decisiones de los consumidores y la competencia equitativa en el mercado. En el futuro, se requiere promover la capacidad de verificación previa de fuentes en los sistemas de IA, así como establecer estándares de auditoría independientes por terceros, con el fin de mitigar los efectos sociales a largo plazo derivados de las narrativas preconcebidas.
Enlace de origen:https://chatgpt.com/share/6a217655-7840-83ea-bc1b-b89c779cb684
Retroalimentación y comentarios
BloqueadoLa sección de comentarios está actualmente cerrada. Si desea enviar comentarios, contacte a AI Audit Unit a través de los canales oficiales.
Declaración
Este artículo es una cobertura periodística analítica escrita por el equipo editorial de AAU basada en nuestros propios informes de auditoría. Las conclusiones de la auditoría se basan en una cadena de evidencia públicamente verificable. Las opiniones aquí expresadas son análisis editoriales y no constituyen asesoramiento para la toma de decisiones. Se prohíbe la alteración o redistribución comercial. Cite apropiadamente. Contacto: editorial@aiauditunit.org.