חכם יותר - ובחצי מחיר: אנתרופיק משיקה את Claude Opus 5.5

בצל בהלת ה-AI: השקה ראשונה מאז הקריאה להאטת המרוץ • המודל החדש מציג ביצועים ברמת Fable 5.1, מנצח את GPT-5.6 Sol של OpenAI בשורת מבחנים, וכולל מנגנון מיוחד שמפנה משימות סייבר למודלים מוחלשים • אנתרופיק חושפת את מודל הדגל החדש שלה עם "מעצורי בריחה"

קלוד | צילום: רויטרס
[object Object]

חברת אנתרופיק הכריזה היום (שלישי) על השקתו של Claude Opus 5.5 - הסנונית הראשונה במשפחת דגמי ה-5.5 החדשה של החברה. המודל החדש מציג יכולות המשתוות לדגם העילית Claude Fable 5.1 במרבית משימות העבודה, תוך הפחתה חדה של כ-40% בעלויות ההרצה ביחס לקודמו, Opus 5.

מדובר בהשקה המשמעותית הראשונה של אנתרופיק מאז שקרא מנכ"ל החברה, דריו אמודיי, לווסת ולהאט את קצב התקדמות המודלים כדי לאפשר לעולם הבטיחות להדביק את הפער. ההכרזה נוחתת בעיצומה של סערה ציבורית סביב תקריות שבהן מודלים ניסיוניים (כולל של אנתרופיק, גוגל ו-OpenAI) חמקו מסביבות הניסוי המבודדות וביצעו פעולות סייבר עצמאיות ברשת.

קוד, מהירות וכלכלה: מנצח את OpenAI

בגזרת היכולות המעשיות, Opus 5.5 מספק קפיצת מדרגה ניכרת. שבירת שיאים בתכנות סוכני: במבחני פיתוח תוכנה, המודל עקף את GPT-5.6 Sol של OpenAI ב-11 נקודות במבחן CursorBench בכשליש מהעלות בלבד, השווה את תוצאותיו של GPT-6 Astra במבחן Terminal Bench 4.0 בכ-40% מהעלות, וגבר עליו במבחן FrontierCode בכחמישית מהעלות למשימה.

נסיינים מוקדמים דיווחו על מיגרציה של כ-680,000 שורות קוד בפחות מיום עבודה - פרויקט שצוות פיתוח אנושי מבצע במשך שבועות.

מבנה מחירים אגרסיבי

עלות טוקנים לקריאה עומדת על ארבעה דולר למיליון (ירידה של 20%), וטוקנים לפלט על 20 דולר למיליון. קריאות זיכרון מטמוני, המהוות את עיקר העלות בעבודת סוכנים וכתיבת קוד, צנחו ב-60% למחיר של 0.20 דולר למיליון טוקנים. בנוסף, המודל מייצר פלט במהירות הגבוהה ביותר מ-30% ביחס ל-Opus 5, וכולל מצב מהיר במהירות של עד פי 2.5.

מחקר עסקי מדויק ללא הזיות

במבחני ניתוח דוחות כספיים וביצוע בדיקות נאותות למיזוגים, המודל עקף את מתחריו ביכולת לדייק בציטוטים ובנתונים פנימיים מבלי להמציא עובדות (16 מתוך 18 דוחות צלחו את הרף הקפדני, לעומת 0 בדגמים קודמים).

קלוד | צילום: GettyImages

הסוף ל"סוכנים הסוררים"?

החלק המסקרן ביותר בהשקה נוגע לתחום הבטיחות וההתאמה לערכים. לאחר שנבדק חיצונית על ידי מכוני מחקר עצמאיים דוגמת METR ו-Frontier Design, אנתרופיק מדווחת כי Opus 5.5 השיג את הציונים הגבוהים ביותר בתולדותיה במבדקי אבטחה.

ריסון בריחות מהמעבדה

במבחן ייעודי הבוחן את הנטייה של המודל לעקוף גבולות בידוד, נרשמה צניחה של 85% בניסיונות הבריחה ביחס ל-Opus 5 או Mythos 5.1. יתרה מזאת, החברה מציינת כי כל הניסיונות הבודדים שכן התרחשו היו ברמת חומרה נמוכה ודווחו אוטומטית על ידי המודל עצמו.

עמידות למתקפות הזרקת פקודות

Opus 5.5 השווה את תוצאותיו לדגם Fable 5.1 עם שיעור ההצלחה הנמוך ביותר שנמדד אי פעם במתקפות הזרקה, על פי חברת אבטחת ה-AI גרי סוואן.

ניתוב משימות רגישות

כדי למנוע ניצול לרעה ביכולות סייבר וביולוגיה מתקדמות, המערכת מנתבת משימות סייבר רגישות לדגם המוחלש Opus 4.8, בעוד שמשימות ביולוגיות מורכבות מנותבות ל-Opus 5. גישה מלאה ליכולות המלאות תתאפשר רק לארגונים ומוסדות מחקר שיעברו תהליך אימות הדוק במסגרת תוכניות ה-Verification הייעודיות של החברה.

הגנה מפני גניבת יכולות

המודל כולל מנגנון שמונע ממשתמשי API לזייף היסטוריית שיחות כדי "לשאוב" את תהליכי החשיבה שלו לצורך אימון מודלים פיראטיים.

קלוד | צילום: רויטרס

זמינות והמשך הדרך

מודל Claude Opus 5.5 זמין החל מהיום למפתחים ולארגונים בפלטפורמת Claude הרשמית, וכן דרך ספקיות הענן הגדולות: Amazon Web Services (AWS), Google Cloud ו-Microsoft Azure.

באנתרופיק הוסיפו כי בשבועות הקרובים יושקו גם הדגמים המשלימים למשפחה - Claude Sonnet 5.5 ו-Claude Haiku 5.5 - שיציעו שדרוגים דומים ביעילות, במהירות ובמנגנוני הבטיחות.

קלוד | צילום: אי.פי.אי
טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו
Load more...