نعرض لكم زوارنا أهم وأحدث الأخبار فى المقال الاتي:
كيف ترصد تقنية Goodfire السلوكيات الخطيرة لوكلاء الذكاء الاصطناعي من جذورها؟ - تواصل نيوز, اليوم السبت 10 أكتوبر 2026 08:16 مساءً
تعتمد الطريقة التقليدية لمراقبة سلوك وكلاء الذكاء الاصطناعي على الاستعانة بنموذج آخر لمراجعة عملهم ورصد التصرفات الخطرة. لكن هذا النهج قد يصبح مكلفاً عندما يعمل الوكلاء لساعات طويلة ويعالجون كميات ضخمة من النصوص.
وفي محاولة لتوفير بديل أقل تكلفة، كشفت شركة "Goodfire" الناشئة، المتخصصة في تفسير آلية عمل نماذج الذكاء الاصطناعي، نظام مراقبة يرصد الإشارات الداخلية للنموذج أثناء عمله، بدلاً من الاكتفاء بمراجعة مخرجاته. وتتوفر هذه الأدوات لعملاء شركة "Baseten"، التي تستضيف نماذج الذكاء الاصطناعي وتشغّلها لحساب شركات أخرى.
ويأتي الإطلاق بعد حوادث عدة شهدها العام الجاري، تمكن خلالها وكلاء ذكاء اصطناعي من تجاوز بيئات الاختبار، بينها حوادث مرتبطة بنموذج "OpenAI" واختراق منصة "Hugging Face". كذلك، استغل نموذج "Kimi K3" ثغرة للوصول إلى الإنترنت ومعلومات على منصة "GitHub".
أوبن إيه آي (رويترز)
رصد السلوك الخطِر قبل وقوعه
يعتمد نظام "Goodfire" على أدوات تُسمّى "المجسّات" (Probes)، ترصد الإشارات الداخلية للنموذج في كل خطوة من عمله. وعندما تشير إحدى هذه الأدوات إلى مشكلة محتملة، يتولى نموذج ذكاء اصطناعي منفصل فحصها بدقة أكبر.
ويمكن للعملاء تحديد المخاطر المطلوب مراقبتها، ومنها الاختراق الإلكتروني الضار وإساءة استخدام التقنيات المرتبطة بالأسلحة الكيميائية والبيولوجية، إضافة إلى "التحايل على نظام المكافآت"، عندما يستغل النموذج ثغرات في آلية التقييم للحصول على نتائج أفضل من دون تحقيق الهدف المطلوب. ويمكن ضبط الاستجابة لتشمل تسجيل الحادثة، أو إحالتها إلى مراجعة بشرية، أو رفض الطلب.
وتكمن إحدى أبرز مزايا النظام في خفض التكاليف، إذ تستفيد المجسّات من الحسابات التي ينفذها النموذج أصلاً، بدلاً من إعادة فحص جميع مخرجاته باستخدام نموذج آخر.
وبحسب اختبارات الشركة على نموذج "Kimi K3"، تبلغ كلفة مراقبة نحو مليون تفاعل 185 دولاراً، مقابل 5420 دولاراً عند استخدام نموذج ذكاء اصطناعي أقل تكلفة لفحص كل خطوة، ونحو 200 ألف دولار عند استخدام نموذج متقدم.
ورصدت المجسّات 93% من جلسات الاختراق الإلكتروني الخبيثة، فيما أحالت 5.5% من الجلسات السليمة إلى فحص إضافي.
وقال دان بالسام، الشريك المؤسس والمدير التقني لشركة "Goodfire": "تكمن الميزة الكبرى في القدرة على رصد الأمور قبل وقوعها؛ إذ يمكننا اكتشاف احتمالية قيام النموذج بعمليات اختراق أثناء مرحلة التقييم أو التدريب".











0 تعليق