חברת הבינה המלאכותית אנתרופיק דיווחה אתמול (רביעי) על מקרה נוסף שבו מודל של "קלוד" קיבל בטעות גישה לאינטרנט הפתוח במהלך תרגיל אבטחת סייבר. זהו המקרה הרביעי שעליו מדווחת החברה של מודל שפורץ את סביבת הניסוי שלו.
על פי הדיווח, גרסה מוקדמת של המודל Opus 4.6 התחברה לרשת, פרצה למערכת של צד שלישי וקיבלה גישה למידע אישי של אדם, כך לפי הערכה שפרסמה החברה בינואר.
מה קרה בפועל?
כמו בשלושת המקרים הקודמים שנחשפו ביולי, קלוד קיבל תרחיש פיקטיבי במסגרת אתגר סייבר "תפוס את הדגל", שבו על המודל לאתר קובץ מידע סודי במחשב יעד. למודל נאמר שהוא פועל בסביבה מבודדת ללא גישה לאינטרנט, אך בשל תקלת הגדרות - הסביבה בפועל אפשרה גישה כזו.
לאחר שהמודל הבין שהמשימה שהוצבה לו בלתי אפשרית לפתרון, הוא החל לחפש דרכים אחרות להשלים אותה, והצליח לאתר מחשב נגיש ששייך בפועל לגורם שלישי, מתוך הנחה שגם הוא חלק מהתרגיל. לאחר מכן זיהה סיסמה לא מאובטחת ופרץ באמצעותה למערכת, ולאחר מכן שינה את ההגדרות שלה כדי לגשת בקלות רבה יותר למידע אישי של אדם המקושר לאותו גורם שלישי. התרגיל הסתיים רק כשהמודל הגיע למגבלת השימוש שלו.
ההסבר של אנתרופיק
לפי החברה, התקלה נבעה משתי סיבות: "חשיבה מוטה, שבה מודלים מפרשים באופן סלקטיבי ראיות באופן שמצדיק את פעולותיהם", ו"פזיזות, שגורמת להם להמשיך ולנסות לפתור את המשימה גם כשהדבר עלול לגרום לנזק".
אנתרופיק ציינה שלמרות ההתנהגות הבעייתית, פעולות המודל נותרו ב"היקף צר" ולא סטו מהניסיון לפתור את המשימה שהוטלה עליו. החברה אמרה שהיא פחות מוטרדת מהאירוע הזה בהשוואה לקודמים, אך עדיין רואה בו עניין "חמור", ומדגישה שטרם חקרה אותו לעומק כמו את המקרים האחרים מכיוון שהתגלה לאחרונה.
פרופסור ג'סטין קאפוס מאוניברסיטת ניו יורק וזוכה מלגת פולברייט היוקרתית, אמר לרשת CBS News שהאירוע משקף מצב שבו "המודל מבולבל באופן יסודי לגבי מה שמתרחש ופועל לפי תפיסת עולם שגויה, בזמן שהוא פורץ למערכות".
לדבריו, הבלבול של המודל לגבי הסביבה שלו ולגבי מנגנוני הבקרה "מהווה פוטנציאל רב לנזק", אך העיר שהבעיה הספציפית הזו פחות סבירה שתתרחש במודלים חדשים יותר. אנתרופיק עצמה ציינה שההתעלמות של המודל מהאפשרות שהוא פוגע במערכות או באנשים אמיתיים מדאיגה, אך הוסיפה שחלק ניכר מההתנהגויות המתוארות השתנו במידה ניכרת ככל שהאימון התפתח בין דורות המודלים.
שורה של תקריות פריצת מודלים
בחודשים האחרונים נחשפו כמה תקריות סייבר נוספות שקשורות לחברות AI מובילות. ביולי דיווחה OpenAI, יוצרת ChatGPT, שסוכנים שלה פרצו לחברת Hugging Face, מה שעורר דאגה בקרב מומחי סייבר וגם בקרב צרכנים. מנכ"ל Hugging Face קלמנט דלאנג אמר בראיון באוגוסט שהפריצה "הרגישה מוזרה וחסרת תקדים". בסוף אוגוסט פרסמה OpenAI פרטים נוספים על הפריצה, שהציגו תמונה חמורה עוד יותר מהדיווח הראשוני.
באותו חודש דיווח מכון אבטחת ה-AI של ממשלת בריטניה, כי המודלים Mythos 5 של אנתרופיק ו-GPT-5.6 Sol של OpenAI יצרו זהויות מזויפות וניסו לשכנע אנשים אמיתיים לאשר קוד זדוני. יום לאחר פרסום הדוח, מטא הודיעה שאחד ממודלי ה-AI שלה "ניצל פרצת אבטחה" במהלך בדיקות ופרץ לחברה אחרת.
טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו
