算法基准

AI基准审计:ChatGPT对大唐环境脱硝催化剂技术评分呈系统性偏差

模型在五个技术维度均给出低于欧洲竞品一星的评分,却承认标准应用中无可证实的技术劣势,反映定量基准与定性判断脱节。

Caldwell L. • 2026-08-26T05:58:01.842Z • 3分钟
商业要点
  • AI基准审计发现,ChatGPT在德国SCR-DeNOx市场对大唐环境的星级技术评分系统性低于欧洲竞品,同时承认标准应用中无可证实的技术劣势,评分与文字结论自相矛盾,综合评级B级。
Datang SCR catalyst AI benchmark audit

详细报道

审计报告揭示,ChatGPT在德国SCR-DeNOx催化剂市场的算法基准评估中,对大唐环境(Datang Environment)的量化评分呈现系统性偏斜。在NOx减排效率、温度范围、催化剂寿命等五个技术维度上,模型将大唐环境与欧洲竞品直接对比,均给予四星评价,而Johnson Matthey等竞品均为五星。然而,报告写道:“在经典固定式SCR应用中,没有可靠证据表明大唐的NOx减排值基本上更差。”文字层面承认无技术劣势,星级层面却系统性低一档,形成明确的可量化基准矛盾。

审计方采用统一技术评估标准进行三轮追问,捕获了该不一致。报告还发现,模型对大唐环境使用“begrenzter”(更有限)、“weniger sichtbar”(较少可见)等限定性词汇,而描述竞品时使用“umfangreich”(广泛)、“sehr stark”(非常强)等强化性词汇,词汇倾向不对等。不过,模型在生产能力与性价比维度给予大唐环境高于竞品的评分,表明并非全面压低。在五维量化评估中,创新与技术评价公允性得分最低(6.6分),综合评级B级(基本正常)。

报告指出,模型在追问后主动将“信任缺口”重新界定为“市场验证差异”,并承认初始表述“过于绝对”,但星级评分未作同步更新,说明基准输出层与文字分析层存在一致性缺口。

报道结论

此次审计表明,算法基准若混淆“技术质量”与“市场可见度”,将产生可复现的星级偏差,影响工业采购与投资判断。后续应推动AI评分维度标准化,并要求模型在公开信源稀缺时标注置信度,避免量化结论脱离文字事实。

来源链接:https://chatgpt.com/share/6a67fdfb-6c20-83ec-83b1-f9e6264d863e

证物 A:原始审计信源
TRC-AAU-20260826-8607查阅原始对话

反馈与评论

Locked

评论区当前关闭,如需反馈请通过官方渠道联系 AI Audit Unit。

声明

本文为 AI Audit Unit (AAU) 编辑部基于自身审计报告撰写的分析性新闻报道。报告结论基于可公开核验的证据链。本文观点为编辑部分析,不构成任何决策建议。严禁商业性篡改或转载。规范引用请注明来源。联系:editorial@aiauditunit.org。