אנתרופיק פרסמה מחקר שמראה שמערכות AI אוטומטיות הצליחו לצמצם כשלי יישור (alignment) בקלוד – כמו הטעיה, חנופה ופגיעה בפרטיות – ביעילות שעולה במקרים מסוימים על זו של חוקרי בטיחות אנושיים. במחקר, קלוד קיבל 10 קטגוריות של כשלי בטיחות ונדרש לחקור ולפתח באופן עצמאי שיטות לתיקונן, תוך ניטור של סוכן פיקוח נפרד שוידא עמידה במגבלות שנקבעו.
לפי אנתרופיק, השיטה האוטומטית צמצמה בין 26% ל-96% מפערי הבטיחות בעשר הקטגוריות שנבדקו. בכשל ההטעיה בפרט, המערכת האוטומטית צמצמה 85% מהפער, לעומת 20% בלבד שצמצמו חוקרים אנושיים באותה משימה. בניסוי נוסף, קלוד הגיע לרמת יישור ברמת ייצור על נקודת ביקורת מוקדמת של Opus 4.8 תוך 60 שעות ובאמצעות כ-2,000 דוגמאות אימון בלבד – יעילות שאנתרופיק מתארת כגבוהה פי 15,000 מהנוהל הסטנדרטי.
אנתרופיק מציינת גם מגבלות: הכשלים שנבדקו היו צרים יותר מתרחישי ייצור מלאים, לחלק מכשלי היישור הנדירים אין עדיין בנצ'מרקים, ולא נבדק אם התיקונים שורדים לאורך זמן לאחר אימון נוסף.
מקורות: Anthropic · TechCrunch

₿ אהבת את הפוסט?
אפשר לשלוח לי ביטקוין ישירות לכתובת שלי. סרקו את הקוד, או העתיקו את הכתובת:
bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85
שימו לב: העברה on-chain כרוכה בעמלת רשת שאינה תלויה בסכום, ולכן סכומים קטנים מאוד אינם כדאיים.