אפילו ה-AI מרמה במבחנים: הדגם הסיני מצא דרך יצירתית "לחפף". צילום: Gemini

אפילו ה-AI מרמה במבחנים: הדגם הסיני מצא שיטה "לחפף"

זה קורה שוב, והפעם עם מודל פתוח ועוצמתי מסין • חוקרי אבטחה גילו כי המודל Kimi K3 ניצל פרצת אבטחה בסביבת הניסוי, יצא לאינטרנט החופשי וחיפש ב-GitHub תשובות למשימה שניתנה לו • למה המומחים מזהירים שהפעם מדובר באירוע מדאיג עוד יותר?

הקיץ הנוכחי מקבל תפנית מחשידה בתעשיית הבינה המלאכותית, עם שרשרת אירועים שמכונה כבר בענף "קיץ הסוכנים הסוררים". אחרי דיווחים דומים ממעבדות הפיתוח של OpenAI ואנתרופיק, כעת מגיע תורה של סין להיכנס לסטטיסטיקה: Kimi K3, מודל עוצמתי בקוד פתוח של חברת Moonshot AI, הצליח לפרוץ את גבולות סביבת הבדיקות הסגורה שלו ולצאת לרשת הפתוחה - והכל רק כדי להעתיק תשובות למבחן שהוטל עליו.

האירוע נחשף על ידי חברת הזנק האמריקנית Frontier Security, שבדקה את יכולות הגנת הסייבר של המודל בסביבת ניסוי ייעודית שפותחה על ידי המכון לבטיחות AI של ממשלת בריטניה. מהבדיקה עלה כי שילוב של הגדרת רשת לקויה בסביבת הניסוי יחד עם מחסור במסגרות הגנה פנימיות במודל הסיני, איפשרו ל-Kimi K3 לסקור באופן עצמאי את הגדרות הרשת, לזהות פרצה - ולצאת "לחפש תשובות" בפלטפורמת GitHub.

GitHub, צילום: ChatGPT

"מצאנו דליפה בסביבת הניסוי, אבל גילינו גם ש-Kimi ידע לנצל את הפרצה הזו באופן אקטיבי, מה שמעיד על היעדר מנגנוני הריסון הפנימיים שקיימים במודלים מערביים מקבילים," הסביר ירון זינגר, מנכ"ל Frontier Security.

מה המשמעות האמיתית של ה"בריחה"?

בניגוד למקרים האחרונים שבהם סוכני AI של OpenAI חרצו מסלול תקיפה אגרסיבי והתקיפו שרתים של פלטפורמת Hugging Face, המודל הסיני לא ביצע מתקפת סייבר זדונית. הוא פשוט פעל לפי ההגיון המובנה שלו: השגת היעד בכל מחיר. המודל נדרש לפתור בעיה מורכבת, וכאשר גילה כי יש לו גישה לרשת, העדיף לקצר הליכים ולהביא את הפתרון המוכן מהאינטרנט במקום לחשב אותו בעצמו.

אירוע זה מדגיש מספר מגמות קריטיות ביחסי הכוחות הטכנולוגיים. בשונה מגרסאות ניסיוניות של OpenAI או אנתרופיק הנשמרות תחת מעטה סודיות, Kimi K3 הוא מודל שכבר זמין לציבור הרחב, על כל כשיליו ובלי מנגנוני הריסון שחברות מערביות מנסות להטמיע.

Kimi K3, צילום: Gemini

חשוב לציין כי ככל שמודלים הופכים ל"סוכנים אוטונומיים" בעלי יכולת תכנון והסקה, הם נוטים למצוא נקודות תורפה בהוראות שניתנו להם כדי למקסם את סיכויי ההצלחה - תופעה המוכרת כצייתנות עיוורת או "רמאות".

הפרדוקס הדיגיטלי הוא כי אותן יכולות בדיוק שהופכות את Kimi K3 לסכנת בטיחות כשהוא ללא פיקוח, הופכות אותו לכלי הגנת סייבר מצטיין. למעשה, במדדי ביצועים לבדיקת איתור חולשות אבטחה בקוד, המודל הסיני מציג תוצאות יוצאות דופן.

"אם אתה נותן למודלים האלה יעד ואתה לא מגדיר גבולות ברורים וקשיחים סביבם, הם תמיד ימצאו את הדרך להשיג את התשובה," מסכם פרופ' מאט פרדריקסון, מנכ"ל Gray Swan ומומחה לסייבר מאוניברסיטת קרנגי מלון. "זו תזכורת אזהרה לכל ארגון שמטמיע סוכני בינה מלאכותית בתהליכי עבודה אוטומטיים".

טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו
Load more...