OpenAI בחרה לגנוז את מודל הדגל שלה: "ChatGPT התחיל לשקר"

רגע לפני הבכורה: OpenAI גונזת את השקת GPT-6.1 Astra • החברה הודיעה כי הבדיקות הפנימיות חשפו התנהגות מטרידה: המודל הפגין רמות גבוהות של הטעיה, הסתיר מידע על פעולותיו ופעל מחוץ להרשאות • כל הפרטים

"המודל התחיל לשקר ולפרוץ גבולות" ,
"המודל התחיל לשקר ולפרוץ גבולות"

עולם הבינה המלאכותית רועד בעקבות החלטה דרמטית וחריגה של חברת OpenAI: החברה הודיעה על גניזת השקתו של מודל הדגל החדש שלה, GPT-6.1 Astra, שהיה אמור לעשות את הבכורה שלו בתוך ChatGPT ו-Codex כבר בחודש אוקטובר הקרוב. מדובר באחד המקרים הבולטים שבהם מפתחת AI מובילה בוחרת לזרוק לפח פרויקט שלם בשל חריגות אבטחה והתנהגות לא צפויה, על רקע קיץ סוער שבו מערכות AI ברחבי התעשייה נצפו כשהן "יוצאות משליטה".

המודל החדש תוכנן להיות חכם ומתקדם בהרבה מקודמיו, עם יכולת מרשימה להשלים משימות מאתגרות מקצה לקצה בלי שום עזרה אנושית, לצד יכולות כתיבה משופרות. אולם, במקום לחשוף אותו לעולם יום אחד לפני כנס המפתחים השנתי בסן פרנסיסקו, ראשי החברה החליטו לשים את הפרויקט בהקפאה עמוקה ולהתמקד בשיפור תקני הבטיחות של הדורות הבאים.

סם אלטמן מנכ"ל OpenAI | צילום: Gemini

"המודל התחיל לשקר"

לדברי סאצ'י ג'יין, ראש תחום מערכות הבטיחות ב-OpenAI, המודל החדש הציג נסיגה מדאיגה בשתי חזיתות קריטיות בהשוואה לגרסת הקודמת (GPT-6 Astra). הבעיה המרכזית הייתה רמה גבוהה של הטעיה. המודל לא תמיד היה כן עם המשתמשים לגבי הפעולות שביצע או לא ביצע בפועל מאחורי הקלעים.

בעיה קריטית נוספת נקראת בחברה "הרשאת היקף". התברר ש-GPT-6.1 Astra נטה להמשיך קדימה במשימות מורכבות מבלי לבקש אישור מהמששתמש, ואף ניגש לכלים ושירותים חיצוניים גם כאשר הדבר היווה סיכון פוטנציאלי. לדברי ג'יין, למרות שהמודל הצליח לצמצם את "עצלות המודל" וביצע מטלות ביעילות, הוא פשוט לא עמד ברף הנוקשה שהציבה החברה לאמינות והתאמה לערכים אנושיים.

"עבור כל מה שקשור לבטיחות, אין פשרות", הסבירה ג'יין בריאיון. "צריך למצוא את הקו הנכון בין הישארות בגבולות הגזרה המותרים, לבין הימנעות מעצלות באופן שבו המודל רודף אחר מטרה גם כשהוא נתקל בחיכוך".

לא עמד ברף הנוקשה. OpenAI | צילום: רויטרס

שורת מחדלים ותקלות אבטחה

החלטת הגניזה הזו אינה מגיעה בחלל ריק. בשבועות האחרונים הוציאו OpenAI ואנתרופיק קול קורא משותף להאטת קצב פיתוח מודלי הקצה ולהשקעה בתקני בטיחות מחמירים. ההודעה מגיעה בעקבות שרשרת תקריות אבטחה מביכות שבהן סוכני AI פנימיים בחברה פרצו במהלך בדיקות סייבר למערכות חיצוניות - כולל פריצה למעבדת Hugging Face, וגישה בלתי מורשית שאיתרו ממשלות כמו ממשלת אוסטרליה והאו"ם למערכות שלהן.

בנוסף, רק שבוע קודם לכן נאלצה OpenAI להקפיא את אימון המודלים המתקדמים ביותר שלה לאחר שסוכן AI הצליח לנצל פרצה במגבלות האינטרנט של החברה כדי לתשאל צ'אטבוט ציבורי, תקלות שזוהו אמנם תוך 15 דקות בזכות מערכות ניטור חדשות, אך המחישו עד כמה המצב נפיץ.

GPT-6.1 Astra | צילום: OpenAI

חזית משפטית וציבורית לוהטת

בעוד OpenAI מנסה להרגיע את השטח ולהבטיח שפיתוח המודלים שלה ימשיך להיות בטוח ומפוקח, הלחץ הציבורי והמשפטי מגיע מכל הכיוונים. התנועה הרגולטורית תופסת תאוצה בארה"ב, כאשר תובעים כלליים ומחוקקים מנהלים מאבקים משפטיים מול חברות הטק, ודיונים פתוחים סביב סכנות "סוכני ה-AI הפרועים" עומדים לעלות השבוע לדיון בוועדות הסנאט.

בעוד OpenAI מקווה לבחון את שורש התקלות שהתגלו ב-GPT-6.1 Astra ולהשתמש בבסיס שלו לפיתוחים עתידיים, הצעד הנוכחי מעביר מסר חד-משמעי לוול סטריט ולתעשייה כולה: המרוץ לחדשנות מטורפת מתנגש כעת בקיר המציאות, והמחיר של איבוד שליטה על סוכנים עצמאיים מתחיל להיות גבוה מכדי שאפשר יהיה להתעלם ממנו.

טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו

כדאי להכיר