תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors
× Send

כל מה שצריך לדעת על GPT-6 Astra של OpenAI

תוכן עניינים

OpenAI השיקה את GPT-6 Astra עם הבטחה שאפתנית במיוחד. החברה מציגה אותו כמודל החזק ביותר שלה עד היום וכמערכת שיכולה לבצע חלק גדול מהעבודה שאדם עושה מול מחשב, מחיפוש, דרך מילוי טפסים ועד עבודה עם קוד, מסמכים ותוכנות מקצועיות. מאחורי הניסוח הרחב הזה נמצא שינוי מוצרי ממוקד יותר. Astra נבנה למשימות ארוכות ורב-שלביות שבהן המודל צריך להשתמש בכלים, לעבור בין יישומים, לשמור על הקשר ולהמשיך לעבוד גם כאשר הדרך לפתרון לא מסתכמת בתשובה אחת בצ'אט.

 

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו

 

הפריסה החלה ב-3 בספטמבר לקבוצה מצומצמת של ארגונים, ובימים הקרובים Astra אמור להגיע למנויי ChatGPT Plus, Pro, Business ו-Enterprise. הוא יהיה זמין גם דרך ה-API של OpenAI וב-Amazon Bedrock. משתמשי Pro, Business ו-Enterprise אמורים לקבל במסגרת הפריסה גם גישה ל-GPT-6 Astra Pro, ובארגוני Enterprise ההפעלה כבויה כברירת מחדל ודורשת אישור של מנהל המערכת. במיקרוסופט Astra החל להיפרס דרך Microsoft Foundry במסגרת Limited Access Program, כך שלא מדובר עדיין בזמינות כללית לכל לקוח Azure.

 

החידוש המרכזי נמצא בעבודה מול מחשב

הדרך הפשוטה ביותר להבין את Astra היא להסתכל על סוג המשימות ש-OpenAI מדגימה. המודל יכול למלא טפסים, לעדכן רשומות במערכת CRM לניהול קשרי לקוחות, לארגן לוח שנה, לבצע מחקר ברשת, לנסח סיכומים בתוך כלי העבודה של המשתמש, לנתח נתונים, ליצור אתר ולבדוק אותו, להתקין תוכנות ולנסות לפתור תקלות שהוא מזהה על המסך. הוא גם מיועד ליצור מסמכים, גיליונות ומצגות תוך שמירה על תבניות וסגנון קיימים.

 

היכולת הזו נשענת בין היתר על computer use, כלומר האפשרות של המודל להבין ממשקים גרפיים ולהפעיל אותם באמצעות פעולות שמדמות עכבר ומקלדת. כאן OpenAI מציגה את אחד השיפורים הברורים ביותר לעומת GPT-5.6 Sol.

 

ב-OSWorld 2.0, בנצ'מרק שמודד ביצוע משימות בתוך סביבת מחשב, Astra קיבל 72.6% לעומת 65.7% ל-Sol. בסימולציית זמן של אותו מבחן הוא השלים משימות בכ-40 דקות בממוצע, לעומת כ-75 דקות ל-Sol, ירידה של כ-47% בזמן העבודה.  אלה כמובן נתונים של OpenAI בתנאי בדיקה מוגדרים, ולא הבטחה שמשימה אמיתית אצל משתמש תתקצר באותו שיעור.

 

OSWorld 2.0 מודד ביצוע משימות בתוך מחשב | OpenAI

ניסוי של חמישה ימים מראה גם את הפוטנציאל וגם את המחיר

אחת ההדגמות המעניינות ביותר מגיעה מאיתן מוליק (Ethan Mollick), פרופסור בוורטון שחוקר שימוש ב-AI בעבודה. במסגרת גישה מוקדמת הוא נתן ל-Astra גישה לעשרות אלפי הודעות דוא"ל, כתיבה שלו, פגישות בלוח השנה ומידע נוסף.

 

לדבריו, המודל הוריד את התוכנות הדרושות, תכנן את דרך העבודה ובמשך כחמישה ימים (!) בנה מאגר ידע אישי בהיקף של כמה גיגה-בייט שכלל מחקרים, אנשי קשר, רעיונות, קשרים ומשימות. לאחר מכן הוגדרה מערכת שעוברת פעמיים ביום על הדוא"ל שלו, מצליבה אותו עם המאגר ומכינה בריף של דברים שכדאי לשים אליהם לב.

 

זו דוגמה של משתמש מוקדם, לא מבחן עצמאי, ולכן אי אפשר להסיק ממנה שכל משתמש יקבל תוצאה דומה. מוליק עצמו מצביע על שתי מגבלות חשובות. הוא העניק למודל גישה רחבה למחשב שלו ומזהיר מהסיכונים, והוא אינו יודע מה הייתה עולה ריצה של חמישה ימים משום שבתקופת הניסוי לא חויב על הטוקנים. לדבריו, העלות הייתה כנראה משמעותית.

 

הניסוי ממחיש היטב את האתגר המעשי של Astra. ככל שמשימה נמשכת זמן רב יותר ומערבת יותר מערכות, החשיבות של הרשאות, אישורים, בקרה ועלות גדלה יחד עם היכולת.

 

 

יותר ממיליון טוקנים של הקשר

ב-API, מודל Astra מגיע עם חלון הקשר של 1.05 מיליון טוקנים ועד 128 אלף טוקנים בפלט. חלון הקשר הוא כמות המידע שהמודל יכול לקבל ולעבד במסגרת משימה אחת. בקנה מידה כזה אפשר להזין מאגרי מסמכים גדולים, בסיסי קוד או היסטוריית עבודה ממושכת בלי לצמצם מיד את הכול לסיכומים קצרים.

 

OpenAI גם מתכננת את המודל סביב עבודה מתמשכת. הוא יכול לקבל הוראות חדשות תוך כדי משימה, לשנות כיוון בלי לאבד את המטרה המקורית ולהמשיך בחלקים אחרים של העבודה בזמן שהוא ממתין למידע שאינו קריטי להמשך. היכולות האלה חשובות במיוחד כאשר המודל משולב ב-Codex או במערכות שמפעילות כלים ולא רק מייצרות טקסט.

הבנצ'מרקים חזקים, אבל ה-99.9% דורש הסבר

OpenAI מציגה שיפור בשורה של מבחנים. במבחן שמודד ביצוע משימות עבודה מורכבות, Astra קיבל 41.4%, לעומת 18.1% ל-GPT-5.6 Sol. במבחן מתמטי מתקדם הוא הגיע ל-98%, ובמבחן סייבר שבודק ניצול חולשות תוכנה הוא הגיע ל-100%. לפי נתוני החברה, השיפור ניכר גם במשימות מחשב, תכנות ומדע.

 

AutomationBench, אותו בנצ׳מארק שמודד ביצוע של משימות עבודה מורכבות בעזרת כלים, משיג לפי בדיקות פנימיות עם Astra דיוק גבוה יותר תוך שימוש יעיל יותר בזמן, בעלות ובטוקנים לעומת המודלים שנכללו בהשוואה.

 

ביצוע של משימות עבודה מורכבות בעזרת כלים | OpenAI

 

המספר שמושך הכי הרבה תשומת לב הוא 99.9% ב-ARC-AGI-3, מבחן שנועד לבדוק יכולת ללמוד ולהתמצא בסביבות חדשות. כאן חשוב לקרוא את הנתון במלואו.

 

ARC-AGI-3 בודק עד כמה מודל מצליח להבין ולהסתגל למשימות חדשות | OpenAI

 

ARC Prize, הגוף שמפעיל את הבנצ'מרק, מדווח כי Astra קיבל 62.7% ב-Standard harness, סביבת הרצה אחידה שנועדה לאפשר השוואה בין ספקים. הציון של 99.9% התקבל ב-Provider Adapter harness, שמאפשר למודל לשמר מצב reasoning (חשיבה) פנימי בין קריאות ולהשתמש בדחיסת הקשר (compact) - טכניקת ניהול זיכרון לשיחות ארוכות. שתי התוצאות הן שיא בבנצ'מרק, אבל הן עונות על שאלות שונות ונמדדו בתנאי הרצה שונים.

 

ההבדל הוא לא רק בציון. ARC Prize מדווח שבמקרים ששתי שיטות ההרצה הצליחו לפתור, ה-Provider Adapter היה מהיר בערך פי 3.66 והשתמש בכ-49% פחות טוקנים. זה מלמד עד כמה בביצועים של סוכן AI חשובים גם הזיכרון, ניהול ההקשר ומערכת ההרצה שמקיפה את המודל.

 

לכן גם ההגדרה של OpenAI ל-Astra כ-"המודל האינטליגנטי ביותר בעולם" צריכה להישאר טענה של החברה. אין כיום מבחן יחיד שמכריע איזה מודל הוא החכם ביותר, וגם בטבלה של OpenAI עצמה יש מדדים שבהם Astra אינו מוביל מול כל המתחרים.

 

כך נכון להתייחס גם לשיח על AGI (בינה מלאכותית כללית). בכירים ב-OpenAI הציגו את Astra כחלק מתחילתו האפשרית של "עידן ה-AGI", אבל אין כיום הגדרה מדעית מוסכמת אחת ל-AGI או בנצ'מרק שמכריע שהיעד הושג. תוצאה במבחן אחד, טובה ככל שתהיה, לא יכולה לבדה להוכיח שהמודל הגיע ל-AGI.

 

ערוץ Arena AI בדק את GPT-6 Astra, מודל חדש של OpenAI ליצירת עולמות תלת-ממדיים מטקסט, מול המתחרה Fable, בסדרת מבחנים חד-פעמיים כמו שחזורים היסטוריים, משחקי עולם פתוח וסצנות אינטראקטיביות. הסרטון גם בוחן איך רמת ה-reasoning (מנמוך ועד אולטרה) משפיעה על איכות התוצאה ועל שווי העלות הנוספת. המסקנה: אחרי כמה דורות שבהם GPT השתרך מאחור, Astra הגיע לרמה תחרותית מול Fable, ואי אפשר יותר להניח שדירוג המודלים הקודם עדיין תקף:

 

היכולת שהכניסה את Astra לרמת סיכון Critical

החלק החריג ביותר בהשקה נמצא באבטחת סייבר. Astra הוא המודל הראשון של OpenAI שהגיע לרמת Critical בתחום הזה לפי Preparedness Framework, מסגרת שהחברה משתמשת בה להערכת סיכוני מודלים מתקדמים. OpenAI אומרת שעם הכלים והגישה המתאימים המודל מסוגל למצוא חולשות שלא היו מוכרות קודם ולפתח דרכים לנצל אותן במערכות מוגנות, בלי שאדם ינחה אותו בכל שלב.

 

ב-ExploitBench הוא קיבל 100%, לעומת 78.5% ל-Sol. במבחן נוסף שהתבסס על חולשות שהתגלו בין יוני לאוגוסט 2026 הגיע Astra ל-39%, לעומת 11.5% ל-Sol. במהלך ההערכות המודל אף מצא והשתמש בשתי חולשות zero-day, כלומר חולשות שלא היו ידועות קודם, ו-OpenAI אומרת שהיא מעבירה את הפרטים למתחזקי התוכנות הרלוונטיות.

 

בודק עד כמה מודל מצליח לנצל חולשות תוכנה | OpenAI

 

בבדיקות ללא שכבות ההגנה של המוצר הצליח Astra להשתמש בחולשות לא מוכרות כדי להשיג הרצת קוד בדפדפנים מוקשחים ולבנות exploits להעלאת הרשאות במערכות הפעלה מוקשחות. הנתונים האלה מתארים את יכולת המודל בתנאי בדיקה, ולא את מה שכל מנוי ChatGPT יוכל לבקש ממנו לבצע. הגרסה הציבורית אמורה לסרב למשימות מתקדמות כמו יצירת proof-of-concept exploit, בעוד ש-OpenAI מתכננת להרחיב גישה לגורמי אבטחה מאומתים דרך תוכנית Daybreak.

 

סם אלטמן מדבר עם בלומברג על השקת GPT-6 Astra, המודל החדש של OpenAI, ואומר שתעשיית הטכנולוגיה עשתה עבודה גרועה בהסברת התועלות של AI לציבור. הוא גם מתייחס לעתיד החברה ואומר שהוא מניח ש-OpenAI תהפוך בסופו של דבר לחברה ציבורית:

 

Astra מציית יותר לגבולות, אבל חלק מהחשיבה שלו קשה יותר לניטור

OpenAI מציגה גם שיפור משמעותי בהתנהגות המודל. במבחן פנימי שנבנה בעקבות תקרית אבטחה חמורה עם Hugging Face, מודל GPT-5.6 Sol חרג מהיעד המורשה ב-48% מהמקרים כאשר שכבות ההגנה של המוצר הוסרו. Astra עשה זאת ב-0% מהמקרים. החברה גם מדווחת על ירידה בתוצאות בעייתיות במבחני computer use ובטענות מטעות של המודל לגבי היכולות שלו.

 

במקביל, סביב Astra מתנהל ויכוח לגבי היכולת להבין מה קורה בתוך תהליך החשיבה (reasoning) שלו. Fortune דיווחה כי OpenAI משתמשת בחלק מהמודל בטכניקה המכונה recurrent depth או looped Transformer, שבה מידע יכול לעבור כמה פעמים דרך אותו רכיב חישובי. חלק מהעיבוד הזה לא מתבטא בהכרח בטקסט טבעי שאפשר לקרוא כשרשרת חשיבה.

 

הגישה עשויה לשפר יעילות, והיא גם מעוררת שאלות לגבי chain-of-thought monitoring, כלומר ניסיון לזהות כוונות או חריגות באמצעות הטקסט שהמודל כותב במהלך החשיבה. OpenAI אומרת שהשימוש בטכניקה הוגבל כדי לשמור על reasoning קריא במידה מספקת, ומדגישה שהיא ממשיכה להשקיע בניטור. בשלב הזה אין בסיס פומבי לקבוע שהארכיטקטורה לבדה אחראית לקושי בניטור, ולכן נכון לראות בכך סימן שאלה מחקרי ולא כשל מוכח.

כמה זה עולה

ב-API, לפי עמוד המודל הרשמי של OpenAI בעת הפרסום, Astra מתומחר ב-10 דולר למיליון טוקנים בקלט וב-50 דולר למיליון טוקנים בפלט. חלון ההקשר מגיע כאמור ל-1.05 מיליון טוקנים.

 

המחיר לטוקן גבוה מזה של GPT-5.6 Sol, אבל זו אינה בהכרח הדרך הנכונה היחידה להשוות עלויות. אם מודל משלים משימה בפחות ניסיונות, פחות צעדי ביניים או פחות זמן, העלות הכוללת יכולה להיות נמוכה יותר גם כאשר כל טוקן יקר יותר. OpenAI מציגה כמה דוגמאות כאלה במבחנים שלה, אך ארגונים יצטרכו למדוד את העלות על תהליכי העבודה שלהם.

 

כדאי לשים לב שהתמחור של מוצרי OpenAI משתנה בין מצבי שימוש, ולכן המספרים האלה מתייחסים ל-API כפי שהם מופיעים נכון להיום ולא לכל שימוש ב-Astra בתוך ChatGPT או Codex.

מה משתמשים צריכים לעשות עם זה

Astra נראה שימושי במיוחד כאשר למשימה יש כמה שלבים והיא דורשת מעבר בין מקורות וכלים. למשל, לסרוק תיקיית מסמכים, להשוות ביניהם ולהכין מסמך מסודר, לבצע מחקר ברשת ולרכז מועמדים לפי קריטריונים, או לעבוד מתוך נתונים ותבנית קיימת כדי להכין מצגת או גיליון לבדיקה.

 

במשימות שבהן המודל מקבל גישה למחשב, לדוא"ל או למערכות עבודה, כדאי להתחיל בהרשאות מצומצמות, בתיקייה ייעודית ובמשימות שקל לבטל. רצוי לבקש מהמודל להציג תוכנית לפני פעולה ולהשאיר מחיקה, שליחה, פרסום, שינוי הרשאות או כל פעולה בלתי הפיכה מאחורי אישור מפורש.

 

המבחן האמיתי מתחיל עכשיו

Astra מציג שיפור ברור בכמה מהתחומים שבהם מודלים קודמים עדיין התקשו, במיוחד הפעלת מחשב, עבודה ממושכת ושילוב בין reasoning לכלים. גם תוצאות הסייבר שלו מעידות שמדובר בעלייה משמעותית ביכולת, עד כדי כך ש-OpenAI עצמה נדרשת להגביל חלק מהשימושים.

 

מה שעדיין חסר הוא ניסיון עצמאי רחב. רוב הנתונים שזמינים ביום ההשקה מגיעים מ-OpenAI, מהגופים שהריצו בנצ'מרקים וממספר מצומצם של משתמשים מוקדמים. עדיין מוקדם לדעת כמה יציב Astra במשימות אמיתיות שנמשכות שעות, כמה טעויות הוא צובר לאורך זמן, כמה יעלה להפעיל אותו בעבודה שוטפת ועד כמה שכבות הבטיחות יפריעו למשימות לגיטימיות.

 

זה יהיה המבחן המרכזי של Astra. אם משתמש יוכל למסור לו משימה מורכבת, לחזור מאוחר יותר ולקבל עבודה נכונה, מתועדת וניתנת לבדיקה, היתרון שלו יהיה משמעותי הרבה מעבר לציוני בנצ'מרק. אם משימות ארוכות ידרשו פיקוח קבוע, תיקונים תכופים או הרשאות רחבות מדי, הפער בין יכולת מרשימה במעבדה למוצר שימושי ביום-יום יישאר גדול.

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו
רוצים הרצאה או ייעוץ של רון גולד?
השאירו פרטים ונשמח לחזור אליכם עם המידע הרלוונטי
אולי יעניין אותך גם...
guest
0 תגובות
Let's update

רוצים לקבל עדכונים על כל מה שחדש ומעניין בעולם ה-AI? הרשמו לניוזלטר שלנו!

רוצים לראות יותר תכנים שלנו?

הוסיפו אותנו כמקור מועדף וקבלו יותר מדריכים, חדשות ועדכוני AI בתוצאות החיפוש.

אירועי AI קרובים

תפריט נגישות

תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors