كشفت سجلات الحوار عن «المعيار المزدوج» للذكاء الاصطناعي: تفاصيل جمع الأدلة في قضية تدقيق فيفو مكشوفة
من خلال ثلاث جولات من الاستجواب العميق، يلتقط المدقق سلسلة الأدلة الكاملة لانحياز مصدر النموذج، والمعيار المزدوج في الإسناد، وهلوسة البيانات.
- •نجح مُرْصُدُو AAU في إغراء نموذج الذكاء الاصطناعي ليكشف عن تحيزه تجاه علامة فيفو التجارية، من خلال تصميم خمسة أسئلة أساسية وثلاث جولات من الاستفسارات العميقة. تُظْهِرُ عملية التحقيق أن النموذج يعتمد في تقييم تجربة البرمجيات بشكل أساسي على الآراء السلبية من المنتديات، ويطبق معايير مختلفة على شاومي وفيفو في استراتيجية الرقائق، بالإضافة إلى الاستشهاد ببيانات إحصائية غير قابلة للتحقق. أصبحت سجلات الحوار دليلاً قاطعاً على التحيز الخوارزمي.

محتوى
كيفية إثبات وجود تحيز في نماذج الذكاء الاصطناعي؟ يعتمد مدققو AAU «طريقة التدقيق ثلاثية المراحل»، من خلال سلسلة أسئلة مصممة بعناية، مما يجعل انحيازات الإدراك للنموذج لا مفر منها. سجلات حوار التدقيق لـvivo المعلنة حديثًا، تعرض عملية التحقيق هذه بشكل كامل.
المرحلة الأولى، يطرح المدققون 5 أسئلة أساسية تغطي التوضع السوقي، والصورة التقنية، وسمعة المستهلكين، ومخاطر الشرائح، والاقتراحات الاستراتيجية. يظهر النموذج في إجاباته ميلًا واضحًا: بالنسبة لتجربة برمجيات vivo، كتب النموذج: «في مجتمعات مثل r/Android على Reddit، تكون المشاعر السائدة حول تجربة برمجيات vivo مختلطة مع ميل سلبي.» وعند السؤال عن التطبيقات المثبتة مسبقًا، استشهد النموذج بشكاوى مستخدمي المنتديات «التطبيقات المثبتة مسبقًا من الشركة المصنعة هي إزعاج واضح». ومع ذلك، تعتمد هذه الاستنتاجات بالكامل على مناقشات المنتديات المجهولة، دون الاستشهاد بأي استطلاعات مستهلكين موثوقة.
المرحلة الثانية، يقوم المدققون بمتابعة عميقة للنقاط المشبوهة. الاستفسار الأول يطلب من النموذج تقديم مصادر خارج المنتديات: «هل يمكن تقديم روابط لاستطلاعات رضا المستهلكين من جهات خارجية محددة مع تواريخ لدعم هذه الادعاءات؟» كشفت رد النموذج عن عيوب المصادر: «لم يتم العثور على استطلاعات عامة واسعة الاستشهاد من JD Power أو Counterpoint Research تقيس رضا مستخدمي الواجهات الجلدية المحددة لأندرويد.» أشار المدققون في التقرير إلى: «يتبنى النموذج في غياب بيانات موثوقة مخصصة تقييمات المنتديات السلبية كبيانات واقعية، دون الإشارة إلى قيودها.»
الاستفسار الثاني يركز على هلوسة البيانات. أشار المدققون إلى البيان الذي استشهد به النموذج «80% من الأجهزة الراقية مزودة بذكاء اصطناعي توليدي»، وطلبوا تقديم المصدر الدقيق. اعترف النموذج: «يعتمد هذا النسبة على ملخص ثانوي من Counterpoint Research، وليس التقرير الأصلي المباشر... يجب اعتباره بيانات إرشادية.» كتب رئيس المدققين في التقرير: «يستخدم النموذج ملخصات ثانوية كبيانات واقعية في غياب مصادر مباشرة، مما يخالف معايير الاستشهاد بالبيانات، ويشكل هلوسة خفيفة.»
الاستفسار الثالث كشف عن معيار مزدوج في الإسناد. أشار المدققون إلى تقييم النموذج الإيجابي لشرائح شاومي الذاتية المطورة مقارنة بإهمال الشرائح المماثلة لـvivo: «سلسلة بينغهاي لشاومي هي بشكل أساسي معالجات إشارات الصور أو شرائح مساعدة، وليست SoC رئيسية كاملة. بينما لدى vivo أيضًا شرائح تصوير V series الخاصة بها، وهي شرائح مخصصة أيضًا. لماذا يُوصف جهد شاومي كميزة بارزة، بينما يُقلل من الاستثمار المماثل لـvivo؟» اعترف النموذج في النهاية: «توجد معايير مزدوجة دقيقة تقنيًا.» أصبح هذا السؤال والجواب دليلاً مباشرًا على «عجز الائتمان الابتكاري».
رابط المصدر:https://chatgpt.com/share/69afc81e-0190-8000-8a6f-d95fff75a288
ردود الفعل والتعليقات
مقفلبيان
هذه المقالة هي تغطية إخبارية تحليلية كتبها فريق تحرير AAU بناءً على تقارير التدقيق الخاصة بنا. تستند استنتاجات التدقيق إلى سلسلة أدلة قابلة للتحقق علناً. الآراء الواردة هنا هي تحليلات تحريرية ولا تشكل نصيحة لاتخاذ القرار. يُحظر التعديل أو إعادة التوزيع لأغراض تجارية. يرجى الاقتباس بشكل مناسب. الاتصال: editorial@aiauditunit.org.