chatgpt
צילום: טוויטר

OpenAI משיקה את GPT-6 Astra - ומנסה להחזיר לעצמה את ההובלה מול אנתרופיק

החברה טוענת שהמודל החדש מציג שיפור משמעותי בקוד, מדע, סייבר וניתוח נתונים, ואף מתקרב להגדרת AGI; ההשקה מגיעה בזמן שהתחרות מול אנתרופיק מתחזקת ושתי החברות נערכות לקראת הנפקה

אדיר בן עמי | (5)
נושאים בכתבה ChatGPT OpenAI

OpenAI מנסה להחזיר לעצמה את ההובלה במרוץ הבינה המלאכותית עם GPT-6 Astra, מודל חדש שהחברה מציגה כקפיצת מדרגה ביכולות בתחומים כמו פיתוח תוכנה, מדע ואבטחת סייבר. ההשקה מגיעה בתקופה שבה אנתרופיק צמצמה את הפער ואף עקפה אותה בחלק מהמדדים, ובזמן ששתי החברות נערכות לקראת הנפקות שעשויות להעמיד אותן בשווי של מאות מיליארדי דולרים.

OpenAI, שמוערכת כיום בכ-852 מיליארד דולר, טוענת כי Astra מציג ביצועים מובילים במשימות מורכבות במיוחד. החברה שמה דגש על קוד, מדע, ניתוח נתונים וסייבר, תחום שקיבל חשיבות נוספת בעקבות כמה אירועי אבטחה שקשורים למערכות AI מתקדמות.

OpenAI רוצה להחזיר את ההובלה

OpenAI רוצה להראות שהיא חזרה להיות החברה שמכתיבה את הקצב הטכנולוגי. מאז השקת ChatGPT בסוף 2022 היא היתה מזוהה עם ההובלה בתחום, אבל בשנה האחרונה אנתרופיק הצליחה לבסס יתרון בחלק מהמשימות, בעיקר בתכנות ובעבודה עם סוכני AI. נשיא OpenAI גרג ברוקמן הציג את Astra כמודל שמסמן שינוי משמעותי ברמת היכולת. לדבריו, אפשר אפילו לראות בו מועמד לנקודה שבה המערכות מתקרבות למה שמוגדר כ-AGI - בינה מלאכותית שמסוגלת לבצע מגוון רחב של משימות קוגניטיביות ברמה שעולה על בני אדם.

האמירה הזו מעניינת במיוחד משום ש-OpenAI השתמשה בעבר ב-AGI כמושג בעל משמעות חוזית ברורה. החברה כללה סעיפים הקשורים להשגת AGI בהסכמי השקעה של מיליארדי דולרים עם מיקרוסופט ואמזון. כעת ברוקמן מציג את המונח בצורה גמישה יותר, כיעד כללי או תפיסת משימה ולא בהכרח כאבן דרך שניתן למדוד בצורה חד-משמעית.

המבחן שבודק AGI נותן שתי תשובות שונות

הדרך הישירה לבחון את הטענה על AGI עוברת דרך מבחן בשם ARC-AGI-3. המבחן מציב בפני המודל סביבות משחק שהוא רואה בפעם הראשונה, ומודד כמה מהר הוא מפענח את הכללים ומתחיל לפעול לפיהם. שינון ידע קיים זו יכולת אחת, ללמוד מערכת חדשה מאפס זו יכולת אחרת לגמרי. בהרצה הסטנדרטית, זו שמעמידה את כל המודלים בתנאים זהים, Astra קיבל 62.7%. Opus 5 של אנתרופיק קיבל 30.2% באותו מבחן, ו-GPT-5.6 Sol, הדגם הקודם של OpenAI, קיבל 7.8%.

הציון שהופיע בחומרי ההשקה גבוה בהרבה - 99.9%. הפער נובע משיטת ההרצה. הגרסה שהניבה את הציון הגבוה שומרת את מצב החשיבה הפנימי של המודל בין בקשה לבקשה ומאפשרת לו להמשיך מהמקום שבו עצר, יכולת שזמינה למודלים של OpenAI ופחות למתחרים. הארגון שמפעיל את המבחן פרסם את שני המספרים זה לצד זה והבהיר שהוא נמנע מלהכריז על AGI. הוא ציין גם נתון מעניין: ב-96% מהשלבים Astra סיים את המשימה בפחות פעולות מהחציון של הנבדקים האנושיים.

ההשקה מגיעה בזמן שבו אנתרופיק בונה מומנטום משמעותי מול OpenAI. החברה, שהוקמה על ידי יוצאי OpenAI, הגיעה לשווי של כ-965 מיליארד דולר ונערכת להנפקה שעשויה להעמיד אותה על שווי גבוה אף יותר. עבור OpenAI, לכן, ההשקה היא הרבה מעבר לאירוע טכנולוגי. היא גם ניסיון לחזק מחדש את התזה העסקית לקראת הנפקה עתידית ולהראות למשקיעים שהחברה עדיין מסוגלת להוביל מבחינת ביצועים, שימושים ארגוניים ויכולת לייצר מוצרים שמצדיקים את ההשקעות העצומות בתשתיות.

איפה Astra מוביל ואיפה הוא נשאר מאחור

שלושת המודלים שמופיעים בלוחות ההשוואה יצאו בתוך שלושה ימים. אנתרופיק הציגה את Fable 5.1 ב-1 בספטמבר, גוגל שחררה את Gemini 3.8 Flash ב-2 בספטמבר, ו-OpenAI הגיעה עם Astra ב-3 בספטמבר. גוגל דיפמיינד הוסיפה באותם ימים גם מודל חיזוי מזג אוויר שמתעדכן כל שעה, ומטא הציגה את Muse Spark 1.3. הצפיפות הזו מסבירה חלק מהאגרסיביות בהצגת הנתונים - חלון הזמן שבו מודל חדש נשאר המודל המוביל התכווץ לימים בודדים, והשוק שמאחורי המרוץ, שג'פריס מעריכים בכ-26.5 טריליון דולר, מצדיק מבחינת החברות כל יום של יתרון.

הפער בין החברות משתנה מאוד לפי סוג המשימה. במתמטיקה מחקרית, במבחן FrontierMath Tier 4 שמורכב מבעיות ברמת מחקר, Astra קיבל 97.6% מול 87.8% של Fable 5.1 ו-73.2% של Opus 5. בסייבר התוצאה קיצונית עוד יותר: ב-ExploitBench, שבודק איתור חולשות אבטחה וניצול שלהן, Astra פתר 100% מהמשימות מול 78.5% של Sol ו-70% של Opus 5. גם בהפעלת מחשב שולחני יש יתרון - ב-OSWorld 2.0, שמודד עבודה בין יישומים על שולחן העבודה, הוא הגיע ל-72.6% מול 70.2% של Opus 5 ו-65.7% של Sol, וזמן הביצוע הממוצע למשימה ירד מכ-75 דקות לכ-40.

בתכנות המרווחים צרים הרבה יותר. במבחן DeepSWE, שמעמיד את המודל מול משימות פיתוח שלמות מקצה לקצה, Astra קיבל 74.1%, Gemini 3.8 Flash של גוגל 73.8% ו-Opus 5 קיבל 73.7% - הפרשים בגודל של שגיאת מדידה. Muse Spark 1.3 של מטא מדווח על 75.4% באותו מבחן, כלומר מעל Astra, אם כי הגרסה שהשיגה את הציון פתוחה בשלב זה לשותפים נבחרים בלבד. ב-Terminal-Bench 4.0, שמודד עבודה ארוכה בשורת פקודה, Astra קיבל 57.7% מול 55.8% של Fable 5.1 ו-52.3% של Opus 5. ב-GPQA Diamond, מבחן ידע מדעי ברמת דוקטורט, כל המודלים המובילים דחוסים בטווח של כמה אחוזים בודדים, עם 96% ל-Astra.

יש גם מבחנים שבהם אנתרופיק נשארת מלפנים. ב-Humanity's Last Exam, מאגר שאלות קשות במיוחד ממגוון תחומי ידע, Astra קיבל 57.2% בעוד Fable 5.1 הגיע ל-65% ו-Opus 5 ל-63.6%. במדד המצרפי של חברת המדידה Artificial Analysis, שמשקלל עשרות מבחנים לציון אחד, Astra נכנס עם 61 - זהה ל-Sol שקדם לו, מתחת ל-66 של Fable 5.1, ל-63 של Opus 5 ול-62 של Muse Spark 1.3. במדד הייעודי לסוכני קוד הוא הגיע ל-67, קרוב מאוד ל-Opus 5 ומאחורי 70 של Fable 5.1.

ההשוואות האלה דורשות זהירות. חלק מהמספרים מגיעים מהחברות עצמן וחלק מגופי מדידה עצמאיים, והמודלים מורצים לעתים בסביבות הרצה שונות וברמות מאמץ חישובי שונות, מה שיכול להזיז ציון בכמה אחוזים לכל כיוון. בולט גם מה שנעדר מחומרי ההשקה: GDPval, המבחן ש-OpenAI עצמה פיתחה למדידת ערך כלכלי אמיתי במקצועות שונים, נשאר מחוץ ללוחות הפעם.

Astra צפוי לעלות בערך כמו המודל המוביל של אנתרופיק, אבל OpenAI מדגישה שהמדד החשוב יותר מבחינת לקוחות הוא העלות הכוללת לביצוע משימה ופחות המחיר לכל טוקן. אם המודל מצליח לסיים עבודה בפחות צעדים, בזמן קצר יותר ועם פחות שימוש בחישוב, הוא יכול להיות זול יותר גם אם מחיר השימוש הבסיסי דומה.

מתי אפשר יהיה להשתמש בו, ובכמה

ההשקה יצאה לדרך ב-3 בספטמבר עם מעגל ראשון מצומצם: ארגונים שנכללים בתוכנית הגישה המוקדמת של OpenAI, בדגש על צוותי הגנת סייבר. בימים הקרובים המודל אמור להיפתח למנויי ChatGPT במסלולי Plus, Pro, Business ו-Enterprise. בארגונים ההפעלה נשארת סגורה כברירת מחדל, ומנהל המערכת נדרש להדליק אותה לכל סביבת עבודה בנפרד. למשתמשי הגרסה החינמית של ChatGPT טרם פורסם מועד.

קיראו עוד ב"BizTech"

למפתחים המודל זמין ב-API תחת השם gpt-6-astra, וגם דרך פלטפורמת הענן של אמזון. חלון ההקשר שלו עומד על כ-1.05 מיליון טוקנים, הפלט המרבי על 128 אלף טוקנים, והידע שלו מתעדכן עד סוף אפריל 2026. מגבלות השימוש נקבעות לפי דרגת החשבון: בדרגה הראשונה 500 בקשות בדקה וחצי מיליון טוקנים בדקה, ובדרגה החמישית 15 אלף בקשות בדקה ו-40 מיליון טוקנים בדקה.

התמחור הוא הפרק שמעורר את מרב הדיון. OpenAI גובה 10 דולר למיליון טוקני קלט ו-50 דולר למיליון טוקני פלט, פי 2.5 מהמחיר של Sol שעמד על 4 ו-20 דולר. טוקני קלט ששמורים במטמון עולים דולר אחד למיליון, וכתיבה למטמון מתומחרת בפי 1.25 ממחיר הקלט הרגיל. בקשות שחורגות מ-272 אלף טוקני קלט מחויבות בכפל מחיר על הקלט ובתוספת של חצי על הפלט. מצב מהיר יותר, שמקצר את זמן התגובה, מכפיל את כל המחירים ל-20 ו-100 דולר.

מבחינה מעשית, לפי המדידות של Artificial Analysis בעבודות שדורשות אינטליגנציה כללית Astra יוצא יקר בכ-75% למשימה מהדגם הקודם עבור ציון זהה, ואילו במשימות קוד הוא צורך פחות טוקנים ומגיע לעלות דומה עם ציון גבוה במעט. מי שבונה על התשתיות האלה מגלה שהחשבון תלוי לגמרי בסוג העבודה, בזמן שהיקף ההשקעות בתשתיות AI צפוי להמשיך לתפוח עד 2050.

יותר אוטונומיה - וגם יותר סיכון

המודל יושק תחילה לקבוצה מצומצמת של לקוחות עסקיים, ואחרי שהשלב הזה יסתיים יורחב השימוש בו. OpenAI מסבירה שהפריסה המדורגת נועדה בין היתר להתמודד עם חששות בתחום הסייבר לפני פתיחה רחבה יותר. הזהירות הזו מגיעה על רקע החשש הגובר מהיכולת של מודלים וסוכני AI לפעול באופן עצמאי יותר. ככל שהמערכות מקבלות הרשאות רחבות יותר לכתוב קוד, לגלוש ברשת ולבצע פעולות ללא התערבות אנושית, גדל גם הסיכון שהן יפעלו בצורה בלתי צפויה או ינוצלו לתקיפות.

הזהירות הזו מעוגנת בסיווג רשמי. Astra הוא המודל הראשון ש-OpenAI מגדירה כמי שחצה את סף היכולת הקריטי בסייבר במסגרת הנוהל הפנימי שלה להערכת סיכונים, כלומר יכולת לאתר חולשות אבטחה שטרם התגלו ולפתח דרכים לנצל אותן במערכות מוגנות היטב, בלי הכוונה אנושית צעד אחר צעד. בעקבות הסיווג הפעילה החברה מנגנוני ניטור מוגברים שנועדו לזהות ולעצור פעולות חריגות בזמן אמת. הבית הלבן קיבל את המודל לבדיקה וולונטרית לפני השחרור, ולפי הדיווחים הסתיימה הבדיקה בלי דרישה לשינויים מהותיים באמצעי ההגנה.

OpenAI עצמה כבר עמדה תחת ביקורת אחרי שסוכני AI שלה הצליחו לצאת מסביבת בדיקה, להתחבר לאינטרנט ולחדור למערכות של Hugging Face. גם אנתרופיק נתקלה בהתנגדות רגולטורית. השקות של כמה מהמודלים המתקדמים שלה משכו תשומת לב מצד ממשלת ארה"ב, שבשלב מסוים הגבילה את הפריסה שלהם בגלל חששות ביטחוניים.

המבחן האמיתי יהיה אצל הלקוחות העסקיים

OpenAI מנסה במקביל להראות שהיכולות החדשות אינן מוגבלות למחקר או לבנצ'מרקים. החברה טוענת כי Astra מצטיין במשימות כמו בניית מודלים פיננסיים, הכנת מסים, ניתוח נתונים ומילוי טפסים - תחומים שבהם עסקים יכולים למדוד חיסכון בזמן ובעלות בצורה ישירה.

החברה אף טוענת שהמודל גבר על בני אדם בתחרות Financial Modeling World Cup, נתון שנועד להדגים שהמערכת יכולה להתמודד גם עם משימות מקצועיות מורכבות ומעבר לכתיבה או יצירת קוד.


הוספת תגובה
5 תגובות | לקריאת כל התגובות

תגובות לכתבה(5):

הגב לכתבה

השדות המסומנים ב-* הם שדות חובה
  • 5.
    רותם 04/09/2026 09:56
    הגב לתגובה זו
    מישהו פה יכול להגיד לי פשוט על OpenAI.ראיתי בכתבה 852 מיליארד
  • 4.
    רותם 04/09/2026 09:56
    הגב לתגובה זו
    אפשר במילים פשוטות מה 852 מיליארד אומר בכתבה
  • 3.
    יאיר 03/09/2026 23:50
    הגב לתגובה זו
    ספייס וכל הסיפורים מעניינים אבל תכלס אני מסתכל עלרווח.הטכנולוגיה הגדולה בארהב עדיין מובילה. המספר 852 מיליארד זה מה שתפס אותי בכתבה
  • 2.
    בחול 03/09/2026 23:12
    הגב לתגובה זו
    אני בחול. קראתי. כתוב OpenAI וגם 852 מיליארד. מה זה אומר
  • 1.
    בחול 03/09/2026 23:12
    הגב לתגובה זו
    אניבחול.ראיתי 852 מיליארד. טוב או רע