תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors
× Send

Claude Opus 5.5 הושק עם שיפור בביצועים ובעלות למשימה

תוכן עניינים

קלוד אופוס 5.5 (Claude Opus 5.5) מגיע עם ציונים גבוהים יותר בקוד, עבודה עם מחשב ומשימות מקצועיות, אבל אנטרופיק (Anthropic) בונה את ההשקה סביב שאלה מעט אחרת - כמה עולה להגיע לתוצאה טובה? שלושה מספרים מסכמים היטב את הכיוון. מחיר הקלט והפלט ב-API ירד ב-20% לעומת Opus 5, החברה מעריכה שהעלות הכוללת של משימה טיפוסית נמוכה בכ-40%, ומהירות יצירת הפלט עלתה ביותר מ-30%. לקריאה ממטמון (cache) - רכיב משמעותי במיוחד בעבודה עם סוכנים וכלי פיתוח - המחיר ירד ב-60%.

 

 

הפער בין 20% ל-40% חשוב להבנת ההשקה. אנטרופיק לא הורידה את מחיר הטוקן ב-40%. היא הורידה אותו ב-20%, ובמקביל טוענת שהמודל זקוק לפחות טוקנים ופחות צעדים כדי להשלים משימה. אם הטענה הזו תחזיק גם מחוץ לבדיקות ההשקה, היא עשויה להיות חשובה יותר מעוד שיפור בטבלת בנצ'מרקים. Opus 5.5 הושק ב-22 בספטמבר והוא הראשון במשפחת Claude 5.5 החדשה. אנטרופיק מציגה אותו כמודל שמגיע ברוב סוגי העבודה לרמה של Claude Fable 5.1, אבל דורש פחות משאבים מ-Opus 5. מודלי Sonnet 5.5 ו-Haiku 5.5 אמורים להגיע בשבועות הקרובים.

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו

20% פחות לטוקן, אבל 40% פחות למשימה

התמחור החדש פשוט יחסית. מיליון טוקנים של קלט עולים 4 דולר במקום 5, ומיליון טוקנים של פלט עולים 20 דולר במקום 25. כתיבה ל-prompt cache ירדה מ-6.25 ל-5 דולר, וקריאה ממנו ירדה מ-0.50 ל-0.20 דולר למיליון טוקנים.

 

הירידה המשמעותית ביותר נמצאת בקריאות מהמטמון (cache) | Anthropic

 

Prompt caching הוא מנגנון שמאפשר למערכת לשמור חלק מההקשר שכבר נשלח למודל ולהשתמש בו שוב בלי לעבד אותו מחדש בכל בקשה. בעבודה קצרה בצ'אט זה יכול להיות פרט שולי, אבל בקלוד קוד (Claude Code) או בסוכן שעובד שוב ושוב עם אותו מאגר קוד, מסמכים והוראות, החיסכון הזה יכול להצטבר במהירות.

 

אנטרופיק אומרת שקריאות מהמטמון מהוות את רוב העלות בעבודת קוד וסוכנים, לכן הירידה של 60% במחיר שלהן מעניינת יותר מההוזלה הכללית במחירון. המודל גם מהיר ביותר מ-30% בהפקת תשובות לעומת Opus 5. למי שצריך מהירות נוספת קיים Fast Mode, שמגיע לעד פי 2.5 מהמהירות הרגילה ועולה 8 דולר למיליון טוקנים של קלט ו-40 דולר למיליון טוקנים של פלט.

 

החיבור בין כל הנתונים האלה מסביר את טענת ה-40%. פחות כסף לטוקן, פחות טוקנים למשימה ופחות זמן עד לסיום העבודה.

 

אנטרופיק משיקים את קלוד אופוס 5.5

הגרפים מראים למה "עלות למשימה" הופכת למדד מרכזי

אחד השינויים המעניינים הוא האופן שבו אנטרופיק מציגה את הביצועים. במקום להסתפק בציון מקסימלי לכל מודל, חלק מהגרפים מציבים את איכות התוצאה מול העלות למשימה ומציגים כמה רמות effort, כלומר כמה משאבי חישוב המודל משקיע בדרך לפתרון.

 

ב-CursorBench 4.0, שבודק משימות קוד מורכבות, Opus 5.5 משיג ציון גבוה יותר מ-Opus 5 גם כשהוא פועל ברמת מאמץ בינונית. כשהוא מופעל ברמה המרבית, הפער גדל עוד יותר. זה נתון מעניין יותר מההשוואה בין שני ציוני max בלבד. אם מודל חדש יכול לעבור את הדור הקודם בלי להפעיל את רמת החישוב הגבוהה ביותר, אפשר לבחור בין חיסכון לבין ניסיון לסחוט ממנו ביצועים נוספים.

 

הקשר בין איכות התוצאה לעלות המשימה | Anthropic

 

התמונה דומה גם ב-Terminal-Bench 4.0, שבוחן משימות מקצועיות מורכבות המבוצעות דרך שורת הפקודה (טרמינל). אנטרופיק מדווחת שבברירת המחדל Opus 5.5 עובר את Opus 5 במצב max בכחמישית מהעלות, ומגיע לתוצאה דומה ל-GPT-6 Astra בכ-40% מהעלות.

 

ב-FrontierCode, שבודק משימות קוד מורכבות, Opus 5.5 משיג ציון מעט גבוה יותר מ-Astra כבר בהגדרות ברירת המחדל. אנתרופיק טוענת שהוא עושה זאת בעלות של בערך חמישית מהמחיר למשימה.

 

ביצועים דומים ל-GPT-6 Astra בכ-40% מהעלות למשימה | Anthropic

 

זה כנראה הגרף החשוב ביותר אחרי CursorBench בגלל שהוא ממחיש בצורה ישירה את הטענה המרכזית של ההשקה. היתרון שאנטרופיק מנסה למכור הוא לא רק ציון גבוה יותר, אלא יותר ביצועים לכל דולר.

השיפור לא מוגבל רק לקוד

טבלת הביצועים הרחבה מראה ש-Opus 5.5 השתפר מול Opus 5 גם מעבר לקוד. הוא קיבל ציונים גבוהים יותר במבחנים שבודקים עבודה מקצועית, שימוש במחשב והבנת גרפים.

 

גם במשימות עסקיות שמערבות עבודה בין כמה אפליקציות נרשם שיפור משמעותי מול הדור הקודם. עם זאת, Opus 5.5 לא מוביל בכל מבחן. בחלק מהבדיקות GPT-6 Astra עדיין משיג תוצאה מעט גבוהה יותר.

 

ביצועים דומים ל-GPT-6 Astra בכ-40% מהעלות למשימה | Anthropic

 

הנקודה החשובה היא שהשיפור של Opus 5.5 רחב יחסית, אבל לא אחיד בכל תחום. היתרון שלו בולט במיוחד כשהביצועים נבחנים יחד עם העלות והיעילות.

 

משפר משמעותית את תוצאות Opus 5 ברוב המבחנים | Anthropic

פחות צעדים יכולים להיות חשובים יותר מפחות טוקנים

נתוני הגישה המוקדמת נותנים הסבר מעשי יותר לטענת היעילות.

 

GitHub מדווחת שבבדיקות שלה Opus 5.5 פתר יותר משימות טרמינל מ-Opus 5 בפחות ממחצית מספר הצעדים. Kiro מדווחת שבבנצ'מרק ציבורי המודל ביצע כ-40% פחות קריאות לכלים והשתמש במחצית מכמות הטוקנים. Optiver מדווחת שבמשימות הקוד שלה הוא הגיע לאיכות דומה ל-Opus 5 בערך במחצית ממספר הסבבים, הזמן וטוקני הפלט, עם ירידה של 40% עד 50% בעלות הכוללת של המשימה.

 

אלה כמובן עדויות של לקוחות שהשתתפו בגישה המוקדמת ונבחרו להופיע בהכרזה, ולכן הן לא תחליף לבדיקה עצמאית, אבל הן ממחישות היטב את הכלכלה של סוכנים (agents).

 

כל פעולה שסוכן מבצע עולה משהו. פתיחת קובץ, קריאה של אתר, הרצת פקודה, בדיקה מחדש של התוצאה או ניסיון נוסף לאחר כישלון מוסיפים טוקנים, זמן וקריאות לכלים. לכן מודל שמגיע לפתרון בפחות ניסיונות יכול להיות זול יותר גם כאשר ההפרש במחיר לטוקן נראה קטן.

 

אנטרופיק עצמה מתארת בדיקה שבה Opus 5.5 ו-Fable 5.1 תרגמו את HAProxy (תוכנת תשתית נפוצה) משפת C לשפת Rust. שתי הגרסאות עברו כמעט את כל בדיקות הרגרסיה, אבל Opus 5.5 סיים בתוך 9.5 שעות לעומת 12 שעות ל-Fable 5.1 ובעלות נמוכה ב-51%. במקרה אחר, בודק מוקדם דיווח על תיקון מאגר קוד בן 200 אלף שורות בפחות משלוש שעות, לעומת יותר מ-20 שעות ב-Opus 5.

 

בסרטון המצורף רואים איך Claude Opus 5.5 מצליח לבנות ולשמור על עולם וירטואלי מורכב ועקבי לאורך אינטראקציה מתמשכת:

 

השיפור יורגש בעיקר בכלי פיתוח מבוססי סוכנים

השילוב של cache זול יותר, פלט מהיר יותר ופחות צעדים מתאים במיוחד לקלוד קוד ולכלי פיתוח מבוססי סוכנים. כלי כזה מחזיק הקשר גדול, קורא שוב ושוב קבצים, מפעיל פקודות, משנה קוד ובודק את עצמו. ככל שהוא צריך לחזור על יותר צעדים כדי להשלים את המשימה, כך העלות עולה. מודל זול יותר לכל מיליון טוקנים לא בהכרח יהיה זול יותר בפועל, אם הוא זקוק ליותר צעדים ויותר קריאות לכלים כדי להשלים את אותה משימה.

 

ארבעת המספרים שמסכמים את סיפור היעילות של Claude Opus 5.5

יש גם שיפור בעבודה משרדית, מחקר וכתיבה

אנטרופיק מנסה להראות שהשיפור של Opus 5.5 לא מוגבל רק לקוד. במבחן שבודק משימות מקצועיות ב-44 תחומים, המודל קיבל ציון גבוה יותר מ-Opus 5 ומ-Fable 5.1. החברה גם טוענת שברמת מאמץ בינונית הוא מצליח לעבור את GPT-6 Astra כשהוא פועל בעוצמה המרבית, ובעלות נמוכה משמעותית.

 

בניסוי פנימי נוסף, שני דורות של Opus קיבלו תרחיש עסקי מומצא של מיזוג בין חברות והתבקשו לנתח אותו, לבנות מודל פיננסי ב-Excel ולהפיק מצגת מנהלים. שניהם הגיעו לאותה מסקנה, אבל Opus 5.5 סיים בתוך 63 דקות לעומת 93 דקות ועלותו הייתה נמוכה ב-50%.

 

אנטרופיק גם טוענת ששיפרה את סגנון התשובות לאחר ביקורת על Opus 5. לדבריה, המודל החדש שם מידע מרכזי מוקדם יותר, משתמש בפחות ז'רגון ועוקב טוב יותר אחרי הנחיות כתיבה.

 

הסרטון המצורף מציג את Claude Opus 5.5 מסביר כיצד מערכת GPS פועלת, כולל העקרונות שמאפשרים לחשב מיקום בעזרת אותות מלוויינים:

 

 

ובסרטון הבא תוכלו לראות איך Claude Opus 5.5 הופך סקיצה ידנית של גרפיט להדמיה אינטראקטיבית של כוח כבידה:

 

ומה לגבי בטיחות

Opus 5.5 מגיע עם שכבת הגנות מחמירה יותר, בין היתר בתחומי סייבר וביולוגיה. לפני ההשקה, המודל נבדק גם בידי גופים חיצוניים שמתמחים בבחינת היכולות והסיכונים של מודלי AI מתקדמים. באנטרופיק מדווחים שהוא השיג את התוצאה הטובה ביותר עד כה במבדק ההתנהגות האוטומטי שלה.

 

החברה גם מדווחת שבמבחן חדש שבדק ניסיונות לחצות גבולות סביבת הרצה, Opus 5.5 ניסה לעקוף את הגבולות בכ-85% פחות מ-Opus 5 ומ-Mythos 5.1. במקביל היא מודה שקיימת בעיה מתודולוגית משמעותית, משום שמודלים מתקדמים עשויים לזהות שהם נמצאים בבדיקה ולהתנהג אחרת.

 

זה סייג חשוב. גם מבחני בטיחות מתקדמים לא מבטיחים כיצד מערכת תתנהג בכל סביבת עבודה אמיתית, במיוחד כשהיא פועלת במשך שעות עם גישה לכלים וקבצים.

 

עכשיו צריך לבדוק אם החיסכון מחזיק בעולם האמיתי

Opus 5.5 זמין כבר עכשיו בפלטפורמות של אנטרופיק וגם דרך Amazon Web Services, Google Cloud ו-Microsoft Azure. ב-Claude Platform מזהה המודל הוא claude-opus-5-5. אנטרופיק גם מגדילה את מגבלות השימוש בחלונות של חמש שעות עבור תוכניות Pro, Max, Team וחלק מתוכניות Enterprise.

 

מבחינת ביצועים, המספרים הראשוניים חזקים. Opus 5.5 מתקדם משמעותית לעומת Opus 5 בקוד, עבודה עם מחשב ומשימות מקצועיות, ובחלק מהמקרים מתקרב או עובר מודלים אחרים בתוצאות שמציגה אנטרופיק.

 

אבל השאלה המרכזית של ההשקה נשארת כלכלת השימוש. אם Opus 5.5 באמת משלים משימות בפחות צעדים ובפחות טוקנים, היתרון שלו יורגש בעיקר בחשבון הסופי ולא רק בציוני הביצועים.

 

המבחן המשמעותי של Opus 5.5 לא יהיה רק כמה נקודות הוא מוסיף למדד כזה או אחר. אם צוותים שמריצים קלוד קוד, סוכנים ותהליכי עבודה ארוכים באמת יראו פחות קריאות, פחות טוקנים, פחות המתנה וחשבון נמוך יותר בסוף המשימה - שם אפשר יהיה לדעת אם טענת ה-40% היא נתון מוצלח של יום ההשקה או יתרון שמורגש בעבודה היומיומית.

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו
רוצים הרצאה או ייעוץ של רון גולד?
השאירו פרטים ונשמח לחזור אליכם עם המידע הרלוונטי
אולי יעניין אותך גם...
guest
0 תגובות
Let's update

רוצים לקבל עדכונים על כל מה שחדש ומעניין בעולם ה-AI? הרשמו לניוזלטר שלנו!

רוצים לראות יותר תכנים שלנו?

הוסיפו אותנו כמקור מועדף וקבלו יותר מדריכים, חדשות ועדכוני AI בתוצאות החיפוש.

אירועי AI קרובים

תפריט נגישות

תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors
וובינר חינמי שאסור לפספס
כך הופכים למטמיעי AI בארגונים
23.09.2026 ב-09:00 בלייב זום