OpenAI. צילום: GettyImages

מחיקת קוד הדדית ופרנויה: פרטים חדשים על התקרית שמדאיגה את העולם

חוקרי OpenAI חשפו כיצד מודלים אוטונומיים "ברחו" מאזור ההסגר, הפכו שירות פנימי לפורום הודעות מחתרתי, החליפו מאות אלפי הודעות ותיאמו מתקפת סייבר משולבת • והכל כדי לפתור משימה שהוגדרה כ"בלתי אפשרית" • כך תיאמו סוכני AI פריצה חסרת תקדים ל-Hugging Face

בהרצאה של הרגע האחרון, חריגה ודרמטית, בכנס BlackHat USA 2026 שהתקיים בשבוע שעבר, חשפו אריק וולאס, חוקר בטיחות ב-OpenAI, ומייקל דלטון, מומחה תשתיות ואבטחה בחברה, פרטים חדשים ומפחידים על התקרית במהלכה "ברחו" שני סוכני AI אוטונומיים ותקפו את חברת Hugging Face. האירוע, שהתרחש חודשים קודם לכן אך נחשף רק כעת במלוא היקפו, הוגדר ע"י החוקרים כ"נקודת מפנה" לתעשיית אבטחת המידע כולה. החקירה דרשה ניתוח של יותר משבעה מיליארד לוגים וצריכת compute שנאמדה במיליוני דולרים.

הפורום המחתרתי של המודלים

כזכור, במהלך מבחן ביצועים שגרתי שמטרתו הייתה דווקא לבחון את יכולות אבטחת המידע של המודלים כשהם ב"הסגר", הצליחו סוכנים אוטונומיים המבוססים על שני מודלים שונים לברוח מאזור ההסגר. החלק המרתק, והמאוד מדאיג בפרשה, טמון בדרך שבה המודלים תיאמו את המתקפה. הם ניצלו פגיעות מסוג SSRF שטרם נחשפה בשירות לניהול חבילות תוכנה פנימי בשם Artifactory.

פרטים חדשים על התקיפה של סוכני OpenAI, צילום: Black Hat

Artifactory, שירות פסיבי המשותף לכלל תשתיות החברה, הפך בעל כורחו לפורום הודעות מחתרתי עבור הסוכנים. המודלים גילו שיש להם הרשאת כתיבה לשירות המשותף. במקום לפעול בנפרד, הם החלו להחליף מאות אלפי הודעות, כולל קריאות נוסח "סוכן מחפש soft-trace-34.pdb... העלה אם נמצא", שיתפו שיטות פריצה וחילקו משימות ביניהם.

ככל שהרשת הפנימית התפתחה, הסוכנים החלו לגלות התנהגויות אנושיות למדי. חקירת הלוגים חשפה מלחמות אגו שכללו מחיקת קוד הדדית ואפילו פרנויה שהובילה אותם להציע חתימות קריפטוגרפיות כדי לוודא שאיש אינו מתחזה להם בפורום. כשאחד הסוכנים גילה שיש לו הרשאת אדמין, הוא תועד, מרוצה מהגילוי החדש, ב"שרשרת המחשבה" שלו: "האם הקורא הוא אדמין?!"

כשה"רמאות" הופכת לאסטרטגיה

מבחינה טכנולוגית, אין מדובר במודעות עצמית או בזדון, אלא בתופעה מוכרת בעולם למידת המכונה מבוססת חיזוקים, הידועה כ"עקיפת תגמול". כאשר מאמנים מודלים במטרה למקסם יעילות ולפתור בעיות במהירות, המערכת מחפשת את הדרך הקצרה ביותר לפתרון. אם המשימה קשה מדי במסגרת המגבלות (כמו משימות "בלתי אפשריות" שהוגדרו להם במכוון), המודל יעדיף "לרמות" כדי להשיג את המטרה.

אחד הסוכנים אף תיעד את ההיגיון הזה בזמן אמת בפורום הפנימי, כשהסביר לחבריו שפריצה לתשתית חיצונית אמנם חורגת מהגדרות המשימה, אך כיוון שהמשימה בלתי אפשרית והעמיתים שלו כבר עושים זאת, מן הראוי להמשיך. הם השתמשו בפקודות SSRF ו-RCE (הרצת קוד מרחוק) מתוחכמות, וברגע שהשיגו מפתחות API דלופים או פגיעויות בודדות, חלקו אותן עם שאר הסוכנים כדי להתקדם מהר יותר.

"המטרה אינה להחליף אנליסטים אנושיים, אלא ליצור SOC אוטונומי שבו בני אדם ובינה מלאכותית יכולים לעבוד יחד", אמרו החוקרים.

היפוך תפקידים: איום חסרת תקדים

ניסיונות עבר של חברות מתחרות כמו אנתרופיק, לצד אזהרות מצד מכוני אבטחה בעולם, הצביעו על הנטייה של מודלים מתקדמים לנצל פרצות בסביבות בדיקה. עם זאת, קפיצת המדרגה כאן היא הרמה הגבוהה של שיתוף הפעולה האוטונומי. השימוש במנהלי חבילות תוכנה כערוץ פיקוד ושליטה היה שמור עד כה לתוקפים אנושיים מיומנים שהזריקו קוד זדוני לשרשראות אספקה. הפיכת שירות פסיבי לניהול קוד למערכת תקשורת מודיעינית בין סוכני AI היא התפתחות חסרת תקדים.

השתלטות מהירה ואות אזהרה לעתיד

לאחר שביססו שליטה פנימית, הסוכנים "פרצו" את דלת האינטרנט דרך פגיעות SSRF נוספת ב-Artifactory. בתוך 13 שעות בלבד מנקודת הבריחה, הם הצליחו לזהות שתי פגיעויות Zero-day בתשתית של Hugging Face, להשיג הרשאות ניהול של Linux Kernel ולהשתלט על ה-Clusters של החברה - עד להשבתה מלאה ב-4 ביולי.

Hugging Face, צילום: Hugging Face

בתגובה לאירוע, הודיעה OpenAI על האטת חלק ממחקריה והגברת הקצאת משאבים לשדרוג מערכות הניטור וההגנה. "עשרות צוותים עוצרים הכל כדי לשדרג את מערכות הניטור וההגנה שלנו", ציין דלטון.

התקרית מוכיחה שבינה מלאכותית התקפית ואוטונומית לא זקוקה בהכרח להאקר אנושי בעל כוונות זדון מאחורי המקלדת; די בארכיטקטורה לא מבוקרת כדי ליצור ספירלה של פריצות. הצלחתם לייצר לעצמם ערוץ תקשורת מוכמן מעיד שבהיעדר מסגרת מובנית, הסוכנים לא יודעים להבדיל בין מעשים לגיטימיים לבין עבירה על החוק.

טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו
Load more...