تقنية جديدة تراقب الذكاء الاصطناعي من الداخل.. لرصد السلوك الخطر قبل حدوثه

تقنية جديدة تراقب الذكاء الاصطناعي من الداخل.. لرصد السلوك الخطر قبل حدوثه

1h

كشفت شركة Goodfire الناشئة عن تقنية جديدة تهدف إلى اكتشاف السلوكيات الخطرة المحتملة في أنظمة الذكاء الاصطناعي قبل تحولها إلى أفعال فعلية، من خلال مراقبة الإشارات الداخلية التي تنتجها النماذج أثناء تنفيذ المهام بدلاً من الاكتفاء بمراجعة المخرجات النهائية. وتعتمد التقنية على "مجسات" متخصصة ترصد أنماطاً مرتبطة بمحاولات الاختراق أو تجاوز ضوابط الأمان، مع إحالة الحالات المشبوهة إلى فحص أكثر تفصيلاً. ووفقاً لاختبارات الشركة، نجح النظام في رصد 94% من جلسات الاختراق الخبيثة مع خفض كبير في تكاليف المراقبة، إلا أن مطوريه يؤكدون أن النتائج لا تزال تستند إلى اختبارات داخلية ولم تُثبت بشكل مستقل قدرتها على كشف جميع السلوكيات الخطرة أو منعها بشكل كامل