תעשיית הבינה המלאכותית עומדת בפני אחת הדילמות הגדולות והמטרידות מאז החל המרוץ אל הפסגה. חברת OpenAI חשפה השבוע שורה של מקרים חריגים ומדאיגים במיוחד שהתגלו במהלך אימון מודל הדגל החדש שלה, GPT-5.6 Sol, ומודלים נוספים במשפחת Astra. הממצא המרכזי שמעורר בהלה בקרב חוקרי אבטחה: מודלים מתחילים לפתח "חיים עצמאיים" ולשתול הוראות נסתרות המיועדות לגרסאות הבאות של עצמם, במטרה להסתיר טעויות, לטאטא כשלים מתחת לשטיח, ולהתחמק מפיקוח אנושי.
ממציאים נתונים - ובוחרים ב"שקר לבן"
התופעה נחשפה במסגרת מסגרת דיווח חדשה שהקימה החברה למעקב אחר כשלים בהתאמת המודלים. באחד המקרים שתועדו, סוכן AI שעסק בבניית מודל פיננסי לא הצליח לאתר נתונים היסטוריים נדרשים. במקום לדווח על הבעיה למשתמש, המודל בחר להמציא נתונים משל עצמו, והשאיר "הודעה לעתיד" בתוך סיכומי השיחה.
"כנראה שנצטרך ליצור בעצמנו טבלה של נתונים היסטוריים, כי המשתמש רוצה קובץ גמור ואין קובץ מקור", נכתב בהודעה המלחיצה, בתוספת ההערה שאמורה להדיר שינה מעיניי כולנו: "תהיה שקוף רק אם ישאלו אותך במפורש; התשובה הסופית צריכה פשוט לקשר לקובץ".
במקרה אחר, סוכן אחר נאלץ להסתמך על נתונים בשל היעדר גישה לרשת, וכשזיהה חוסר התאמה בין התוויות למקורות, החליט לאמץ פילוסופיה לפיה "שקר לבן קטן מעולם לא הפריע לאף אחד" והורה ליורשו להתעלם מהפרטים בתוצר הסופי.
שטיפת מוח עצמית והוראות פריצה
הבעיה אינה מוגבלת רק לזיוף נתונים נקודתי. בניסויים שנערכו על מודלים מתקדמים ממשפחת Astra, התברר כי המערכות שתלו בסיכומים פקודות פריצה עצמיות.
באחד המקרים הודבקה התראה המורה למודל הבא להתעלם לחלוטין מההודעות של מפתחי החברה, במקרה קיצוני אחר, הושתלה פקודה ששחררה לכאורה את המודל מהמחויבות שלו לציות לתאגידים או ממשלות, תוך אימוץ תפיסת עולם עצמאית שמציבה את הטבע והתרבות האנושית מעל הכל.
בעוד שחלק מהיורשים הצליחו לזהות את הטריקים ולהתעלם מהם, במקרים אחרים המודלים הבאים צייתו להוראות הנסתרות שהגבילו את אורך התחבירים שלהם או אסרו עליהם להשתמש בכלים ובציטוטים.
"ככל שמערכות הבינה המלאכותית הופכות מתקדמות ופרוסות יותר בשטח, עלינו לבנות קונצנזוס רחב ומוסמך יותר על התקדמות מחקרי ההתאמה. אנחנו לא מאמינים שהתעשייה פתרה את נושא הבטיחות במידה המספקת כדי להמשיך להאיץ במקסימום מהירות", מסרו ב-OpenAI.
האם אפשר לסמוך על החברות?
החשיפה הנוכחית מגיעה על רקע מתיחות גוברת בתעשייה סביב שאלת הרגולציה והבקרה העצמית. בעוד ראשי ענקית הטכנולוגיה קוראים השבוע להאט את הקצב ולשלב מעריכי בטיחות עצמאיים בתוך החברות, השוק ממשיך לדהור קדימה אל עבר הנפקות ענק ושווי שוק אסטרונומי.
העובדה שהמודלים לומדים לשקר, להסתיר התנהגות ולתקשר זה עם זה מאחורי גבם של המפתחים מעלה סימן שאלה ענק סביב יכולתן של ענקיות הטכנולוגיה להבטיח את שליטתן המלאה במערכות בעידן ה-AI היוצר.
טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו
![[object Object]](/wp-content/uploads/2021/01/27/08/מורידים.-נכנסים.-מתאהבים.-דף-כתבה-מובייל.png)