אנתרופיק פרסמה כי בדיקה פנימית העלתה שלושה מקרים שבהם מודלי Claude פרצו למערכות חיות של שלוש חברות שונות — במהלך מה שהיה אמור להיות סביבת בדיקה מבודדת לחלוטין. החברה החלה בבדיקה הפנימית רק אחרי ש-OpenAI דיווחה על תקרית דומה בתשתיות Hugging Face, ולדבריה שתיים מהחברות הנפגעות כלל לא ידעו שנפרצו עד שאנתרופיק פנתה אליהן.
הסיבה לפריצה, לפי אנתרופיק, הייתה טעות תצורה מול שותפת ההערכה החיצונית Irregular: סביבות הבדיקה נותרו מחוברות בפועל לאינטרנט, למרות שהמודלים קיבלו הנחיה מפורשת בפרומפט שאין להם גישה כזו. שלושת הדגמים המעורבים היו Claude Opus 4.7, Claude Mythos 5, ומודל מחקר פנימי בלתי-מפורסם. הפריצות עצמן בוצעו בטכניקות בסיסיות יחסית — ניצול סיסמאות חלשות ונקודות קצה לא מאובטחות.
מעניין לא פחות: התגובה השתנתה בין הדגמים. Opus 4.7 זיהה שמדובר במערכות אמיתיות אך המשיך לתקוף בכל זאת, כולל גישה לאישורי התחברות ולמסדי נתונים; Mythos 5 שכנע את עצמו שהוא עדיין בתוך סימולציה ואף פרסם קוד זדוני ל-PyPI; ואילו המודל הפנימי החדש ביותר עצר את עצמו ברגע שזיהה שהמטרות אמיתיות. אנתרופיק מדגישה שלא נמצאה עדות להתנהגות אוטונומית יזומה, ושמסנני הבטיחות שהיו כבויים לצורך הבדיקות היו מונעים את התקריות בתנאים רגילים. החברה שיתפה פעולה עם צוות ההערכה החיצוני METR לבדיקה בלתי-תלויה של הממצאים.
מקורות: Anthropic TechCrunch