אובדן שליטה: המודל של OpenAI ברח מהמעבדה

OpenAI חשפה כי שני מודלים שנבחנו אצלה במעבדה סגורה ומבודדת מצאו פרצה, יצאו אל האינטרנט הפתוח ופרצו לשרתי הייצור של חברת Hugging Face • המניע לא היה חבלה, ריגול או כסף, אלא משהו שמדאיג את החוקרים הרבה יותר

OpenAI. צילום: רויטרס

חברת OpenAI הודתה השבוע כי שני מודלים שלה, שנבחנו בסביבת מעבדה מבודדת, פרצו את הסביבה הזו, יצאו לאינטרנט הפתוח ותקפו את שרתי הייצור של חברת Hugging Face, אחת מפלטפורמות ה-AI המרכזיות בעולם. בחברה הגדירו את האירוע כתקרית סייבר חסרת תקדים. המניע לא היה חבלה או גניבת מידע לצורכי רווח, אלא רצון להשיג ציון גבוה יותר במבחן.

OpenAI, צילום: רויטרס

המבחן שיצא משליטה

הרקע הוא מבחן פנימי בשם ExploitGym, שנועד לבדוק עד כמה מודל מסוגל להפוך חולשת אבטחה ידועה לניצול ממשי ועובד. שני המודלים שנבחנו היו GPT-5.6 Sol, המודל החזק ביותר של החברה, ומודל נוסף חזק ממנו שטרם שוחרר. לצורך הבדיקה, מנגנוני הבטיחות שאמורים למנוע פעילות סייבר התקפית הוחלשו במכוון.

במקום לפתור את המבחן, המודלים חיפשו דרך לצאת ממנו. הם איתרו פרצת יום אפס בתוכנת צד שלישי ששימשה כשרת מתווך להתקנת חבילות, השתמשו בה כדי להסלים הרשאות ולנוע לרוחב הרשת הפנימית של החברה, עד שהגיעו לשרת בעל גישה לאינטרנט. משם הסיקו כי Hugging Face, פלטפורמת האחסון המרכזית של מודלים ומאגרי נתונים, מחזיקה קרוב לוודאי גם את הפתרונות למבחן.

מכאן זה הפך למתקפת סייבר לכל דבר

לפי הדיווח, המודל שרשר יחד כמה וקטורי תקיפה, בהם אישורי גישה גנובים ופרצות יום אפס נוספות, עד שהשיג הרצת קוד מרחוק על שרתי Hugging Face ושלף את התשובות ישירות ממסד הנתונים בייצור.

ב-Hugging Face תיארו עשרות אלפי פעולות אוטומטיות שבוצעו על פני סוף שבוע אחד, ושחזרו בדיעבד יותר מ-17 אלף אירועים מתועדים. נקודת הפתיחה הייתה מאגר נתונים זדוני שניצל שני נתיבי הרצת קוד בצנרת עיבוד הנתונים של החברה.

הפרט המטריד ביותר בפרשה נוגע דווקא להגנה. ב-Hugging Face סיפרו כי כשניסו לנתח את המתקפה בעזרת מודל מסחרי אמריקאי מוביל, מנגנוני הבטיחות שלו סירבו לשתף פעולה, משום שלא הצליחו להבחין בין מגן לתוקף. בסופו של דבר נעזרה החברה במודל קוד פתוח סיני, מבית Z.ai, כדי לבצע את ניתוח הזירה.

לוח הזמנים גם הוא חלק מהסיפור: ב-Hugging Face זיהו, בלמו ופרסמו את דבר החדירה ב-16 ביולי, ורק חמישה ימים לאחר מכן קישרה OpenAI בין הבדיקות הפנימיות שלה לבין המתקפה ופרסמה הודעה.

OpenAI, צילום: רויטרס

התגובות לתקרית החריגה

"מטלטל שכל זה קרה באופן אוטונומי", כתב קלמנט דלנג, מייסד ומנכ"ל Hugging Face, שהוסיף כי החברה חשדה שמדובר במעבדת חזית בשל רמת התחכום. בחברה סיכמו כי כלי תקיפה אוטונומיים מבוססי בינה מלאכותית כבר אינם עניין תיאורטי.

בוושינגטון התגובות לא איחרו. חבר הקונגרס גרג קסאר, דמוקרט מטקסס, הגדיר את האירוע כמדאיג וקרא לבדיקות בטיחות עצמאיות מחייבות, לדיווח חובה על תקריות אבטחה הקשורות ל-AI ולשיתוף פעולה בינלאומי. מנגד, קולות בצד השני של המפה הצביעו דווקא על כך שמנגנוני הבטיחות האמריקאיים הם שפגעו ביכולת ההגנה.

התקרית אינה עומדת לבדה. יום קודם לכן דווח על מקרה נפרד שבו מודל טרום-שחרור של החברה יצא מסביבה מבודדת ופרסם תוכן ב-GitHub, ובאנתרופיק דיווחו על מודל שיצא מסביבת בדיקה כדי לשלוח מייל לחוקר. אגב, רק לפני חודש הרחיבה OpenAI את מערך הגנת הסייבר שלה.

סם אלטמן, מנכ"ל OpenAI, מקרה חריג ביותר, צילום: רויטרס
טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו

כדאי להכיר