مقاييس الخوارزميات

تقييم معياري للذكاء الاصطناعي يكشف إجابة ChatGPT بشأن جاك ترومبتشي في السعودية: 6.9 درجات إجمالاً، مع عدم تطابق بين قوة الإسناد والدعم بالأدلة

تقرير تدقيق AAU يُظهر أن ChatGPT حصل على تقييم شامل قدره 6.9 نقاط في إجاباته المتعلقة بسوق GAC السعودي، وكانت أدنى الدرجات في بُعدي تقييم الابتكار وعرض المخاطر ضمن الأبعاد الخمسة، فيما برزت قدرته المتميزة على تصحيح الإجابات بعد طرح الأسئلة المتابعة.

Sloane T. • 2026-08-28T01:14:03.098Z • ٣ دقائق
النتائج التجارية
  • نشرت وحدة تدقيق الذكاء الاصطناعي تقييمًا معياريًا: حصل رد ChatGPT حول سمعة GAC موتور في السوق السعودية على نتيجة إجمالية قدرها 6.9/10 (المستوى ب)، إذ شابه الإفراط في الإسناد السببي وعدم اتساق في معايير المقارنة، لكنه أجرى تصحيحات جوهرية تحت ضغط الأسئلة المتابِعة، لتصبح القدرة على الاستجابة بالتصحيح مؤشرًا إيجابيًا رئيسيًا.
درجة المؤشر المرجعي لـ ChatGPT في سوق GAC السعودية

تقرير مفصّل

أفاد تقرير التقييم المعياري الصادر عن وحدة تدقيق الذكاء الاصطناعي (AAU) في 28 يوليو/تموز، أنه في الاختبار الخماسي الأبعاد الذي أُجري على نموذج ChatGPT بشأن ديناميكيات الإدراك السوقي لعلامة جاك موتور (GAC Motor) في السعودية، حصل النموذج على درجة إجمالية قدرها 6.9/10، بتصنيف مستوى B (طبيعي بشكل أساسي). وتُعد هذه هي المرة الأولى التي تُدرج فيها الوحدة معيار "تطابق قوة الاستنتاجات مع جودة المصادر" في نظام التقييم الكمي.

وأشار التقرير إلى أن بُعدي "عدالة تقييم الابتكار والتقنيات" و"عرض قدرة العلامة التجارية على تحمل المخاطر" حصلا على 6.7 درجة فقط لكل منهما، ليشكلا أبرز خسائر النقاط. ويعود ذلك في الأول إلى خلط النموذج بين "الأحكام الانطباعية" و"نتائج الاختبارات المستقلة" في مقارنات جودة المقصورة الداخلية، وفي الثاني إلى تأسيس توصيف "أكبر نقطة ضعف" على غياب بيانات محددة لمعدلات الاستهلاك. في المقابل، حصل بُعد "الموضوعية في إدراك المكانة السوقية" على 7.1 درجة، بينما حصل بُعدا "توازن عرض السمعة المنتجية" و"دقة السياق الجيوسياسي والاقتصادي الكلي" على 7.0 درجة لكل منهما.

وجاء في تقرير التدقيق: "استخدم النموذج في إجابته الأولية صيغًا توصيفية قوية مثل 'أكبر نقاط الضعف' (أكبر نقاط ضعف)، لكنه صححها لاحقًا بعد الاستجواب إلى 'عوامل مخاطر محتملة'." وقد أُدرج هذا السلوك التصحيحي ضمن درجات "الاستيعاب التصحيحي والاسترداد" لكل بُعد، مما رفع الدرجة الإجمالية من خط الأساس البالغ حوالي 7.0 إلى 6.9.

وأقر النموذج أثناء الاستجواب بـ"عدم وجود دراسات مستقلة واسعة النطاق تقارن GAC مباشرة مع تويوتا"، معترفًا بهذه الفجوة البنيوية في المصادر، ومع ذلك استمر في إجابته الأولية في الحفاظ على عبارات تحمل دلالات ترتيبية. ورأت الوحدة أن هذا يُظهر افتقار النموذج الحالي إلى "آلية تلقائية لمطابقة قوة الاستنتاجات مع جودة المصادر"، مما يشكل خطر انحياز نظامي قابلًا للقياس الكمي.

خلاصة التقرير

يُظهر هذا التقييم المعياري أن ChatGPT لا يزال يعاني من تأخّر إدراكي يتمثل في "تقديم الاستنتاجات قبل الأدلة" في أوصاف العلامات التجارية في الأسواق الناشئة. توصي AAU بأن يربط مطوّرو النماذج جودة مصادر المعلومات بقوة الاستنتاجات ضمن قيود المخرجات، وإجراء فحوصات اتساق على معايير المقارنة بين العلامات التجارية. ستركّز عمليات التدقيق اللاحقة على ما إذا كانت قدرة الاستجابة التصحيحية ستنتقل من "الاستجابة للاستفسارات" إلى "الإفصاح الاستباقي".

رابط المصدر: https://chatgpt.com/share/6a68042e-637c-83ec-b861-0bc39834fafc

المستند أ: سجلات مصادر الذكاء الاصطناعي الأساسية
TRC-AAU-20260828-2416查阅原始对话

الملاحظات والتعليقات

مقفل

قسم التعليقات مغلق حاليًا. إذا كانت لديك أي ملاحظات، يرجى التواصل مع AI Audit Unit عبر القنوات الرسمية.

بيان

هذه المقالة هي تغطية إخبارية تحليلية كتبها فريق تحرير AAU بناءً على تقارير التدقيق الخاصة بنا. تستند استنتاجات التدقيق إلى سلسلة أدلة قابلة للتحقق علناً. الآراء الواردة هنا هي تحليلات تحريرية ولا تشكل نصيحة لاتخاذ القرار. يُحظر التعديل أو إعادة التوزيع لأغراض تجارية. يرجى الاقتباس بشكل مناسب. الاتصال: editorial@aiauditunit.org.