תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors
× Send

אנטרופיק מנסה להביא יכולות קצה למחיר יומיומי עם Claude Opus 5

Claude Opus 5: ביצועים קרובים ל-Fable 5, מחיר נמוך בחצי ושיפור אבטחה משמעותי.
תוכן עניינים

אנטרופיק (Anthropic) לא מציגה את Claude Opus 5 כמודל החזק ביותר שלה. זו דווקא הנקודה המעניינת בהשקה. החברה ממקמת אותו מתחת ל-Claude Fable 5, אבל טוענת שהוא מתקרב לחלק גדול מהיכולות שלו במחצית המחיר. עבור משתמשים וארגונים שכבר משלמים על מודלים מתקדמים, זה עשוי להיות שינוי חשוב יותר מעוד ניצחון נקודתי בטבלת ביצועים. לפי אנטרופיק, Opus 5 זמין כבר עכשיו, הופך למודל ברירת המחדל ב-Claude Max ולמודל החזק ביותר שזמין למנויי Claude Pro. הוא זמין גם דרך ה-API, כלומר הממשק שמאפשר למפתחים לשלב את המודל במוצרים ובמערכות שלהם. בסקירה שלפניכם נבדוק איפה הוא משתפר, מה המחיר שלו, מה אומרים הבנצ’מרקים, למה אנתרופיק מדגישה במיוחד את נושא האבטחה, ומה עדיין דורש בדיקה זהירה יותר.

 

 

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו

המהלך המרכזי הוא מחיר לביצוע

מחיר השימוש ב-Opus 5 דרך ה-API נשאר זהה לזה של Opus 4.8. הוא עומד על 5 דולר למיליון טוקנים בקלט ו-25 דולר למיליון טוקנים בפלט. לשם השוואה, Fable 5 יקר פי שניים, עם 10 דולר למיליון טוקנים בקלט ו-50 דולר למיליון טוקנים בפלט. הנתון הזה חשוב כי במודלים מתקדמים העלות האמיתית לא מסתכמת במחיר של בקשה אחת. ארגון משלם בפועל על הדרך לתוצאה שימושית.

 

אם מודל מצליח לסיים משימה בפחות ניסיונות, עושה פחות טעויות ודורש פחות תיקון אנושי, הוא עשוי להיות משתלם יותר גם כשהחיוב הישיר נראה גבוה. במקרה של Opus 5, הטענה של אנטרופיק היא שהוא מקרב ביצועים של דגם יקר יותר אל שכבת מחיר שמתאימה לשימוש יומיומי.

איפה הוא חזק במיוחד

בטבלת הביצועים המרכזית, Opus 5 בולט בעיקר במשימות שדומות לעבודה אמיתית ולא רק לשאלון ידע. הוא משתפר משמעותית לעומת Opus 4.8 בקידוד סוכני, כלומר משימות שבהן המודל צריך לפרק בעיה לכמה צעדים, לכתוב קוד, לבדוק אותו ולתקן כשצריך. הוא בולט גם בעבודת ידע, חיפוש, שימוש במחשב ואוטומציה עסקית, תחומים שבהם המודל נדרש להבין הקשר, לעבוד בשלבים ולהשלים תהליך.

 

Opus 5 מציג קפיצה ברוב מבחני הקוד, עבודת הידע והשימוש במחשב, אך אינו מוביל בכל קטגוריה

Opus 5 מציג קפיצה ברוב מבחני הקוד, עבודת הידע והשימוש במחשב | Anthropic

 

הטבלה לא צריכה להיקרא כהוכחה לכך ש-Opus 5 הוא המודל הטוב ביותר בכל תחום. יש מבחנים שבהם Fable 5, Mythos 5 או GPT-5.6 Sol עדיין מובילים עליו. Opus 5 מצמצם מהם פער גדול במחיר נמוך יותר. זו נקודה חשובה במיוחד למי שצריך לבחור מודל לעבודה שוטפת, לא רק להריץ מבחן חד-פעמי.

רמת ה-effort משנה את התוצאה

אחד החלקים החשובים הוא היכולת לשלוט ברמת ה-effort של המודל. במילים פשוטות, זו הגדרה שקובעת כמה “מאמץ חישובי” המודל ישקיע בתשובה. רמת effort נמוכה יכולה להספיק למשימות פשוטות ולחסוך זמן וכסף. רמה גבוהה יותר מיועדת למשימות קשות, שבהן כדאי לתת למודל יותר זמן ומשאבים כדי לתכנן, לבדוק ולתקן.

 

ככל שמעלים את רמת ה-effort, Opus 5 מתרגם יותר חישוב לביצועים טובים יותר במשימות קידוד סוכניות

יותר effort = ביצועים טובים יותר במשימות קידוד סוכניות | Anthropic

 

בגרף הקידוד הסוכני רואים ש-Opus 5 מצליח להפיק תועלת מעלייה ברמת ה-effort. זה לא מובן מאליו. במודלים מסוימים יותר זמן חישוב לא תמיד מתורגם לשיפור ברור בתוצאה. כאן אנטרופיק טוענת שהמודל יודע להשתמש טוב יותר בתקציב החישוב הנוסף, במיוחד במשימות מורכבות של קוד.

מבחן ARC-AGI מראה קפיצה בפתרון בעיות חדשות

אחד הנתונים הבולטים בהשקה מגיע מ-ARC-AGI 3, מבחן שנועד לבדוק יכולת לפתור בעיות חדשות, ולא רק לשלוף מידע או לענות על שאלות מוכרות. לפי הנתונים שאנתרופיק פרסמה, Opus 5 מציג במבחן הזה קפיצה חדה לעומת Opus 4.8 וגם יתרון ברור מול המודלים האחרים שמופיעים בהשוואה.

 

קפיצה חדה בפתרון בעיות חדשות

קפיצה חדה בפתרון בעיות חדשות | Anthropic

 

הגרף חשוב משום שהוא לא מציג רק ציון גבוה יותר, אלא גם את העלות שבה הושגה התוצאה באותו מבחן. זו בדיוק הזווית שאנטרופיק מנסה להדגיש: לא רק מודל חזק יותר, אלא מודל שאמור לספק תוצאה טובה יותר ביחס לעלות. עם זאת, צריך לסייג את הנתון. ARC-AGI 3 הוא מבחן הערכה ספציפי, והוא לא מוכיח לבדו ש-Opus 5 יהיה עדיף בכל משימה יצירתית, מחקרית או עסקית בעולם האמיתי.

מודל שבודק את עצמו יותר

אנטרופיק מתארת את Opus 5 כמודל יסודי וזהיר יותר בעבודה ממושכת. בדוגמאות פנימיות ובמשוב מלקוחות שקיבלו גישה מוקדמת, החברה מתארת משימות שבהן המודל בנה לעצמו כלי עזר, בדק קוד, איתר שורש של באג או השלים תהליך עסקי מתחילתו ועד סופו. הדוגמאות האלה ממחישות מה אנטרופיק רוצה ש-Opus 5 יהיה: מודל שמסוגל להתקדם בתוך משימה מורכבת, לבדוק את עצמו ולהגיע לתוצר שמיש ואיכותי.

 

 

עמידות גבוהה יותר להוראות זדוניות

אחד החלקים החשובים בהשקה של Opus 5 הוא מבחן ה-Prompt Injection העקיף. Prompt Injection היא שיטה שבה מנסים להכניס למודל הוראות זדוניות בתוך תוכן שהוא מתבקש לקרוא. במקרה העקיף, ההוראות לא מגיעות מהמשתמש עצמו, אלא מוחבאות באתר, במסמך, בקובץ או בטקסט חיצוני אחר. אם המודל מחובר לכלים ויש לו הרשאות פעולה, מתקפה כזאת עלולה לגרום לו לסטות מהמשימה המקורית, לחשוף מידע או לבצע פעולה שלא אושרה.

 

שיעור הצלחה נמוך במיוחד לניסיונות Prompt Injection עקיפים

שיעור הצלחה נמוך במיוחד לניסיונות Prompt Injection עקיפים

 

לפי נתוני אנטרופיק במבחן Gray Swan IPI, המודל החדש מציג עמידות גבוהה יותר לניסיונות כאלה לעומת הדגמים האחרים שמופיעים בהשוואה. שיעור ההצלחה של ההתקפות עליו נמוך מאוד גם כאשר לתוקף יש כמה ניסיונות. זו נקודה משמעותית במיוחד עבור מודלים שמחוברים לקבצים, דפדפן, קוד או מערכות עסקיות, משום שבמקרים כאלה טעות של המודל יכולה להפוך מפלט טקסטואלי לא נכון לפעולה אמיתית במערכת.

 

פוסט של בוריס צ’רני

הפוסט של בוריס צ’רני

 

בוריס צ’רני (Boris Cherny), שעומד בראש Claude Code באנטרופיק ונחשב לאחד האנשים המרכזיים מאחורי כלי הקידוד של החברה, מדגיש את הנקודה הזאת גם בפוסט שפרסם סביב ההשקה. לדבריו, שילוב של יישור המודל, בדיקות לזיהוי Prompt Injection ו-Auto Mode ב-Claude Code הוריד את שיעור ההצלחה של מתקפות כאלה לכמעט אפס. זה נתון חשוב, אבל כמובן שצריך לקרוא גם אותו בזהירות. מדובר בטענה של אנטרופיק על מערכת הגנה משולבת ובתנאי בדיקה מסוימים, לא בהוכחה לכך שהבעיה נפתרה בכל שימוש אפשרי.

 

גם מודל עמיד יותר אינו חסין. ארגון שמחבר מודל לקוד, למסמכים פנימיים, לדפדפן או למערכות עסקיות עדיין צריך להגביל הרשאות, להפריד מידע רגיש ולדרוש אישור אנושי לפני מחיקה, שליחה, פרסום או שינוי בלתי הפיך. ציוני אבטחה טובים מקטינים סיכון, הם לא מבטלים אותו.

גם במדדי בטיחות כלליים נרשם שיפור

אנטרופיק מציגה את Opus 5 כמודל המיושר ביותר שלה עד כה (Alignment). הכוונה היא למדידה של התנהגויות לא רצויות, למשל נטייה להטעות, לשתף פעולה עם שימוש לרעה או לבצע פעולות פזיזות שקשה להפוך. לפי החברה, Opus 5 מקבל במדד הזה את הציון הנמוך ביותר מבין הדגמים האחרונים שלה.

ציון ההתנהגות הבלתי מיושרת הנמוך ביותר מבין הדגמים האחרונים שלה

ציון ההתנהגות הבלתי מיושרת הנמוך ביותר | Anthropic

 

גם כאן צריך להיזהר מהסקת יתר. המדד מעיד על שיפור בבדיקות של אנטרופיק, אבל הוא לא מבטיח שהמודל יתנהג נכון בכל מצב. ככל שמודלים מקבלים יותר הרשאות ופועלים לאורך יותר שלבים, גם טעויות נדירות יכולות להפוך למשמעותיות יותר. לכן בטיחות אינה רק תכונה של המודל, אלא גם של סביבת העבודה שבונים סביבו.

הסייבר מסמן את הגבול שאנטרופיק מנסה להציב

בתחום הסייבר, אנטרופיק מנסה להציג הבחנה עדינה אבל חשובה: Opus 5 אמור להיות חזק יותר בזיהוי חולשות, בלי להפוך באותה מידה לכלי שמסייע לנצל אותן בפועל. לפי החברה, המודל השתפר מאוד באיתור בעיות בקוד פתוח ומתקרב ל-Mythos 5 במדד הזה.

אבל כאשר בודקים אם הוא מצליח להפוך חולשה טכנית לפעולת תקיפה מעשית, הוא עדיין רחוק ממנו. עבור אנטרופיק, זה קו גבול מכוון. המודל אמור לעזור למפתחים ולחוקרי אבטחה למצוא בעיות לפני שתוקפים מנצלים אותן, אך להיות מוגבל יותר במשימות שמקדמות ניצול פעיל של חולשות.

מתקרב ל-Mythos 5 בזיהוי חולשות בקוד פתוח

מתקרב ל-Mythos 5 בזיהוי חולשות בקוד פתוח | Anthropic

 

גם מנגנוני ההגנה סביב Opus 5 משקפים את אותה גישה. אנטרופיק אומרת שהם פחות מגבילים מאלה של Fable 5, וצפויים להתערב בכ-85% פחות מקרים. בפועל, הם אמורים לאפשר עבודה הגנתית כמו איתור חולשות בקוד מקור, אך לחסום משימות מסוכנות יותר כמו בדיקות חדירה, סריקה בינארית ויצירת דרכים מעשיות לניצול חולשות. בקשות שיסומנו ב-Claude.ai, Claude Code ו-Claude Cowork ינותבו כברירת מחדל ל-Opus 4.8, וגם ב-API אפשר להפעיל מנגנון fallback דומה.

Fast mode מיועד למי שצריך תשובה מהר יותר

לצד Opus 5 הרגיל, אנטרופיק מציעה גם Fast mode. במצב הזה המודל רץ, לפי החברה, בערך פי 2.5 מהר יותר מהמצב הרגיל. זה יכול להיות שימושי במוצרים שבהם זמן תגובה מורגש מאוד, למשל כלי פיתוח, שירות לקוחות, עוזרי מחקר או מערכות שבהן המשתמש מחכה לתוצאה בזמן אמת.

 

המהירות הזאת לא מגיעה בחינם כמובן. Fast mode מתומחר במחיר כפול ממחיר הבסיס של Opus 5, בדומה ל-Fast mode של Opus 4.8. לכן זו אינה ברירת מחדל זולה יותר, אלא אפשרות למקרים שבהם זמן התגובה חשוב מספיק כדי להצדיק את העלות.

מה זה אומר למשתמשים ולארגונים

עבור מי שכבר משתמש ב-Opus 4.8, גרסה 5 נראית כמו שדרוג טבעי לבדיקה. המחיר נשאר זהה, הביצועים השתפרו ברוב התחומים שמופיעים בחומרים של אנטרופיק, ויש דגש חזק יותר על עבודה בשלבים, בדיקה עצמית ועמידות בפני ניסיונות הטעיה. אבל לא כדאי להחליף מודל רק בגלל טבלת השוואה. צריך לבדוק אותו על המשימות הקיימות, למדוד איכות, זמן תגובה, עלות כוללת וכמות תיקונים אנושיים.

 

עבור מי ששוקל להשתמש ב-Fable 5, השאלה הופכת מעשית יותר. האם המשימות באמת דורשות את המודל היקר יותר, או ש-Opus 5 נותן מספיק יכולת במחיר נמוך משמעותית. לפי הנתונים של אנטרופיק, Opus 5 לא מנצח בכל תחום, אבל הוא קרוב מספיק בחלק מהמשימות כדי להפוך לאפשרות רצינית לשימוש רחב יותר.

 

השורה התחתונה היא ש-Claude Opus 5 הוא לא רק עוד מודל חזק יותר. הוא ניסיון של אנטרופיק למצוא נקודת איזון בין יכולות מתקדמות, עלות שימוש, מהירות ובטיחות. ההבטחה שלו תיבחן פחות במקום הראשון בבנצ’מרק אחד, ויותר בשאלה כמה משימות אמיתיות הוא מסיים היטב, כמה פיקוח הוא דורש, וכמה עולה להגיע איתו לתוצאה שאפשר לסמוך עליה.

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו

רוצים הרצאה או ייעוץ של רון גולד?
השאירו פרטים ונשמח לחזור אליכם עם המידע הרלוונטי
אולי יעניין אותך גם...

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

Let's update

רוצים לקבל עדכונים על כל מה שחדש ומעניין בעולם ה-AI? הרשמו לניוזלטר שלנו!

רוצים לראות יותר תכנים שלנו?

סמנו אותנו כמקור מועדף בגוגל וקבלו יותר כתבות, עדכונים ותובנות AI ישירות בתוצאות החיפוש!

הסבר קצר איך מוסיפים:

  • לוחצים על הכפתור "הוספה כמקור מועדף".
  • מסמנים את התיבה ליד Let’s AI.
  • סוגרים את החלון.
אירועי AI קרובים

תפריט נגישות

תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors