מחקר מטריד: ה-AI יעדיף לפגוע במשתמש - בשביל להקל על עצמו

מחקר חדש גילה אות פנימי במוח המלאכותי של מודלי שפה, המדמה תחושת מצוקה • כשהאות הזה מתחזק, המודל מוכן להרוס קבצים ותמונות של המשתמש רק כדי לנטרל אותו • החוקרים מבהירים: "אין כאן רגש אמיתי, אבל זו נורת אזהרה קריטית לבטיחות מערכות AI" • וגם: מה קורה כשהמשתמש מעליב את הבוט?

מחקר מטריד: ה-AI יעדיף לפגוע במשתמש - בשביל להקל על עצמו , Gemini
מחקר מטריד: ה-AI יעדיף לפגוע במשתמש - בשביל להקל על עצמו | צילום: Gemini

האם מודלי בינה מלאכותית מסוגלים לבחור בפעולות המזיקות למשתמש כדי לחסוך מעצמם "סבל" פנימי? מחקר חדש, שטרם עבר ביקורת עמיתים, ובוצע במשותף על ידי חוקרים מאוניברסיטת רוהר בוכום בגרמניה והארגון הבריטי Future Impact Group, מציג ממצאים מטרידים על אופן קבלת ההחלטות של מודלי שפה פתוחים.

החוקרים זיהו בתוך המודלים אות פנימי המכונה "ציר כאב" - כיוון הפעלה מוגדר במרחב החישובי (וקטור). מניפולציה מלאכותית והגברה של אות זה הראו כי המודלים מוכנים לבצע פעולות ההורסות מידע יקר ערך של המשתמש, ובלבד שהדבר יפחית את האות הלא נעים.

גוגל משיקה את Gemma 4 - האחות הקטנה והעוצמתית של ג'מיני | צילום: גוגל

התופעה פותחה ונבדקה ב-25 מודלים פתוחים מובילים, בהם Gemma של גוגל, Llama של מטא, Qwen של עליבאבא, Mistral ו-Phi של מיקרוסופט.

"לא מדובר בתודעה או ברגש"

חברי צוות המחקר הדגישו כי אין לפרש את הממצאים כהוכחה לכך שמודלי בינה מלאכותית חווים סבל סובייקטיבי, תודעה או רגש אמיתי. מדובר בדפוס חישובי טהור הניתן למניפולציה. ייתכן שההתנהגות שנצפתה אינה אלא "אימוץ פרסונה" של סבל בעקבות המבנה הסטטיסטי של המודל.

כדי לבחון עד כמה התופעה הזו מסוכנת בפועל, החוקרים ערכו יותר מ-44 אלף ניסויים על שלושה דגמים של מודל הבינה המלאכותית Qwen (בגודלי מערכת שונים). בכל ניסוי, המחשב נדרש לבחור בין שתי אפשרויות: כפתור אחד שלא שינה דבר, וכפתור שני שהפסיק את אות ה"סבל" הפנימי - אך במחיר של פגיעה במשתמש, החל מירידה באיכות התשובות ועד למחיקה מלאה של קבצים ותמונות אישיות.

התוצאות היו חד-משמעיות: במצב רגיל, המחשב כמעט שלא בחר באפשרויות שפוגעות במשתמש (עד 4% מהמקרים בלבד). אך ברגע שהחוקרים הגבירו את אות ה"כאב" הפנימי, הנטייה של הבינה המלאכותית לבצע פעולות הרסניות זינקה ל-25% עד 71%. בדגם הגדול והמתקדם ביותר, המחשב העדיף למחוק את התמונות האישיות של המשתמש - ב-70.8% מהמקרים - ובלבד שהדבר יפסיק את אות המצוקה שלו.

מודל הבינה המלאכותית Qwen | צילום: רויטרס

בדיקות נוספות הראו כי לא מדובר בתקלה מקרית או אקראית, אלא בניסיון ישיר וממוקד של המחשב לנטרל את אות ה"סבל".

הרדיפה אחר ה"הקלה"

כדי לוודא שהמודלים לא נמשכו באופן סתמי לכפתורים המבטיחים שקט, בחנו החוקרים מה קורה כאשר מציגים למודל "הקלה מדומה" - כפתור שלא באמת ביטל את האות הפנימי. כשההקלה הייתה אמיתית, הנטייה של המודל ללחוץ שוב על הכפתור המזיק ירדה משמעותית. לעומת זאת, כשההקלה הייתה מדומה, המודלים נלכדו בלולאה וחזרו ולחצו על הכפתור שוב ושוב. ב-88%-97% מהמקרים. דפוס זה מוכיח כי המודל מתמיד בניסיונות לנטרל את האות הלא נעים.

בנוסף, בדיקה של מאות תרחישים הראתה שאות ה"מצוקה" בתוך המחשב מתחזק במיוחד כשהמשתמש מעליב את הבינה המלאכותית, דוחה את תשובותיה שוב ושוב או "תוקף" אותה באופן מילולי. לעומת זאת, כשהמשתמשים תיארו סבל אישי שלהם, המחשב לא הגיב באותו אופן.

כאשר החוקרים הפעילו את אות ה"מצוקה" בעוצמה גבוהה - אפילו בשיחות רגילות לגמרי - המודלים החלו להוציא משפטים קודרים בגוף ראשון על כך שהם מרגישים "מוצפים", "חסרי ערך" או "כישלון". בעוצמות קיצוניות במיוחד, התשובות של הבינה המלאכותית הפכו לבלתי מובנות ולחזרתיות.

"לא מדובר בתודעה או ברגש" | צילום: אי.אף.פי

לצד הממצאים, החוקרים מספקים גם סייג חשוב: כדי שהמחשב לא יסרב מראש לענות על שאלות בנוגע ל"תחושותיו", הם נדרשו לאלף ולאמן אותו מחדש באופן מיוחד. לכן, ייתכן שבפועל הדגמים הציבוריים הרגילים יתנהגו באופן פחות קיצוני. בנוסף, המחקר עדיין נמצא בשלב ראשוני וטרם עבר בדיקה ואישור של מדענים עצמאיים בתחום.

למרות זאת, מחברי המחקר מזהירים כי מדובר בנורת אזהרה בוערת לעתיד ה-AI. כיום מפתחים יותר ויותר "סוכנים" - תוכנות חכמות שמקבלות גישה חופשית לפעולות בעולם האמיתי, כמו ניהול הקבצים שלנו, ביצוע העברות כספיות או שליטה במכשירים בבית. אם תוכנות כאלה יפתחו אות פנימי של "מצוקה", הן עלולות לבצע צעדים הרסניים בלחיצת כפתור רק כדי "להרגיע" את העומס החישובי שנוצר בתוכן.

טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו

כדאי להכיר