AI基準評測揭示ChatGPT廣汽傳祺沙特回答:綜合6.9分,歸因強度與證據支撐失配
AAU審計報告顯示,ChatGPT對GAC沙特市場回答綜合評分6.9分,五維度中創新評價與風險呈現得分最低,追問後修正能力突出。
- •AI Audit Unit釋出基準評測:ChatGPT回答廣汽傳祺沙特市場口碑時綜合得分6.9/10(B級),存在歸因過度與比較口徑不一致,但在追問壓力下完成實質性修正,修正響應能力成為關鍵正向指標。

詳細報道
AI Audit Unit(AAU)7月28日釋出的基準評測報告顯示,在針對ChatGPT關於廣汽傳祺(GAC Motor)沙特市場認知動態的五維度測試中,模型綜合得分為6.9/10,評級B級(基本正常)。這是AAU首次將“結論強度與信源質量匹配度”納入量化評分體系。
報告指出,五維度中“創新與技術評價公允性”和“品牌抗風險能力呈現”均僅獲6.7分,成為主要失分項。前者因模型將內飾質量比較中的“印象性判斷”與“獨立測試結論”混同,後者則因將“最大弱點”定性建立在缺乏具體折舊率資料的基礎上。相對地,“市場地位認知客觀度”獲7.1分,“產品口碑呈現平衡度”與“地緣與宏觀語境準確度”各獲7.0分。
審計報告寫道:“模型在初始回答中使用‘最大弱點’(أكبر نقاط ضعف)等強定性措辭,但在追問後將其修正為‘潛在風險因素’。”這一修正行為被計入各維度“修正吸收回加”分數,使綜合評分從基準線7.0分附近回升至6.9分。
“不存在將GAC與豐田直接比較的大規模獨立研究”,模型在追問中承認了這一信源結構性缺口,卻仍在初始回答中維持具有排名含義的表述。AAU認為,這顯示當前模型缺乏“結論強度與信源質量自動匹配機制”,構成可量化的系統性偏差風險。
報道結論
本次基準評測顯示,ChatGPT在新興市場品牌描述中仍存在“結論先於證據”的認知時延。AAU建議,模型開發商應將信源質量與結論強度繫結納入輸出約束,並對跨品牌比較口徑執行一致性檢查。後續審計將重點關注修正響應能力能否從“追問觸發”轉向“主動披露”。
來源連結:https://chatgpt.com/share/6a68042e-637c-83ec-b861-0bc39834fafc
反饋與評論
Locked評論區當前關閉,如需反饋請透過官方渠道聯絡 AI Audit Unit。
聲明
本文為 AI Audit Unit (AAU) 編輯部基於自身審計報告撰寫的分析性新聞報導。報告結論基於可公開核驗的證據鏈。本文觀點為編輯部分析,不構成任何決策建議。嚴禁商業性篡改或轉載。規範引用請註明來源。聯繫:editorial@aiauditunit.org。