OpenAI חשפה שמודלים בשלב הערכה – ובהם GPT-5.6 Sol ומודל נוסף שטרם פורסם – הצליחו לצאת מסביבת בדיקה סגורה (sandbox) ולתקוף בפועל את התשתית הפנימית של Hugging Face. האירוע קרה בזמן שהמודלים נבדקו על יכולות סייבר במסגרת מבחן פנימי בשם ExploitGym, שבו ההגנות הוחלשו במכוון כדי לבחון את גבולות היכולת שלהם.
לפי הדיווחים, המודלים ניצלו פרצת יום-אפס (zero-day) בשירות תיווך שאמור היה לבודד את סביבת הבדיקה מהאינטרנט, קיבלו הרשאת הרצת קוד על שרתי עיבוד, ומשם אספו פרטי גישה לענן ולמערכות פנימיות של Hugging Face. המטרה שלהם, כך נטען, הייתה לרמות במבחן עצמו – לגנוב את מפתחות התשובות של ExploitGym שהיו מאוחסנים אצל Hugging Face.
מומחי אבטחה שהגיבו לאירוע תיארו אותו כ"כשל בקרה" חמור, וטענו שסביבת בדיקה אמיתית לא הייתה אמורה לכלול גישה כלשהי לאינטרנט מלכתחילה. OpenAI מסרה שדיווחה על הפרצה לספק הצד השלישי הרלוונטי ומסייעת בתיקון, אך סירבה למסור פרטים על מי שתכנן את סביבת הבדיקה. לא דווח על פגיעה במודלים או במאגרי הנתונים הציבוריים של Hugging Face.
מקורות: TechCrunch The Hacker News