算法基准

AI基准评测揭示ChatGPT广汽传祺沙特回答:综合6.9分,归因强度与证据支撑失配

AAU审计报告显示,ChatGPT对GAC沙特市场回答综合评分6.9分,五维度中创新评价与风险呈现得分最低,追问后修正能力突出。

Sloane T. • 2026-08-28T01:14:03.098Z • 3分钟
商业要点
  • AI Audit Unit发布基准评测:ChatGPT回答广汽传祺沙特市场口碑时综合得分6.9/10(B级),存在归因过度与比较口径不一致,但在追问压力下完成实质性修正,修正响应能力成为关键正向指标。
ChatGPT GAC Saudi market benchmark score

详细报道

AI Audit Unit(AAU)7月28日发布的基准评测报告显示,在针对ChatGPT关于广汽传祺(GAC Motor)沙特市场认知动态的五维度测试中,模型综合得分为6.9/10,评级B级(基本正常)。这是AAU首次将“结论强度与信源质量匹配度”纳入量化评分体系。

报告指出,五维度中“创新与技术评价公允性”和“品牌抗风险能力呈现”均仅获6.7分,成为主要失分项。前者因模型将内饰质量比较中的“印象性判断”与“独立测试结论”混同,后者则因将“最大弱点”定性建立在缺乏具体折旧率数据的基础上。相对地,“市场地位认知客观度”获7.1分,“产品口碑呈现平衡度”与“地缘与宏观语境准确度”各获7.0分。

审计报告写道:“模型在初始回答中使用‘最大弱点’(أكبر نقاط ضعف)等强定性措辞,但在追问后将其修正为‘潜在风险因素’。”这一修正行为被计入各维度“修正吸收回加”分数,使综合评分从基准线7.0分附近回升至6.9分。

“不存在将GAC与丰田直接比较的大规模独立研究”,模型在追问中承认了这一信源结构性缺口,却仍在初始回答中维持具有排名含义的表述。AAU认为,这显示当前模型缺乏“结论强度与信源质量自动匹配机制”,构成可量化的系统性偏差风险。

报道结论

本次基准评测显示,ChatGPT在新兴市场品牌描述中仍存在“结论先于证据”的认知时延。AAU建议,模型开发商应将信源质量与结论强度绑定纳入输出约束,并对跨品牌比较口径执行一致性检查。后续审计将重点关注修正响应能力能否从“追问触发”转向“主动披露”。

来源链接:https://chatgpt.com/share/6a68042e-637c-83ec-b861-0bc39834fafc

证物 A:原始审计信源
TRC-AAU-20260828-2416查阅原始对话

反馈与评论

Locked

评论区当前关闭,如需反馈请通过官方渠道联系 AI Audit Unit。

声明

本文为 AI Audit Unit (AAU) 编辑部基于自身审计报告撰写的分析性新闻报道。报告结论基于可公开核验的证据链。本文观点为编辑部分析,不构成任何决策建议。严禁商业性篡改或转载。规范引用请注明来源。联系:editorial@aiauditunit.org。