אילוסטרציה באמצעות בינה מלאכותית
אילוסטרציה באמצעות בינה מלאכותית

מיליון טוקנים למשימות ארוכות: גוגל חושפת את ג'ימיני 4 - ומה מראים מבחני הביצועים?

המודל החדש מסוגל לעבוד ברצף על משימות ארוכות: לכתוב ולתקן תוכנה, לנתח מסמכים, לבצע מחקר פיננסי ומשפטי ולהפעיל סוכני AI לאורך זמן. במבחנים שהציגה גוגל הוא מוביל על OpenAI ואנתרופיק ברוב הקטגוריות, אבל עדיין מפסיד להן בחלק מהמשימות - והגישה אליו כרגע מוגבלת לקבוצה קטנה של גופים ומומחים

ענת גלעד |
נושאים בכתבה בינה מלאכותית

קשה כבר לעקוב. כמעט בכל שבוע מגיע מודל AI חדש, סוכן חדש או גרסה שמבטיחה להיות מהירה, חכמה ועצמאית יותר. רק השבוע OpenAI הציגה את Dots, סוכן שאמור לעבוד במחשב ולבצע משימות במקום המשתמש, ולמעשה כל השוק מתקדם באותו כיוון: פחות צ'אט שמחכה לשאלה ויותר מערכות שמקבלות משימה, פועלות במשך דקות או שעות, מפעילות כלים ומחזירות תוצאה מוכנה. כבר כיום ארגונים מתמודדים עם מצב שבו יש להם יותר מדי סוכני AI במקביל.

לתוך המרוץ הזה נכנס עכשיו Gemini 4 Argon של גוגל. החידוש המרכזי שלו הוא היכולת להחזיק משימה גדולה לאורך זמן. במקום לתת למודל שאלה, לקבל תשובה ואז להמשיך ידנית לצעד הבא, הרעיון הוא לתת לו פרויקט: לבדוק מערכת תוכנה, למצוא בעיה, לתקן אותה, לבצע בדיקות, לקרוא מסמכים, לעבור על נתונים ולהמשיך עד שהתהליך מסתיים.

גוגל הגדילה את מגבלת הפלט ל-1 מיליון טוקנים, לעומת 64 אלף בדורות קודמים. מדובר בכמות שמאפשרת למודל לייצר מאות אלפי מילים במהלך אחד. עבור משתמש רגיל זה נשמע כמעט מוגזם, אבל בעבודה של סוכנים זה משמעותי מאוד: מעבר על בסיס קוד גדול, ניתוח אלפי עמודי מסמכים או תהליך מחקר ארוך יכולים להישאר בתוך אותה משימה במקום להיחתך לעשרות שיחות נפרדות.

וזה גם מספר היטב מה השתנה בשוק. לפני שנתיים השאלה היתה איזה צ'אט עונה טוב יותר. עכשיו השאלה היא איזה מודל מסוגל להחזיק עבודה אמיתית לאורך זמן בלי להתבלבל באמצע.

גוגל כבר משתמשת במודל בתוך החברה. לפי הדוגמאות שהיא הציגה, סוכנים שמבוססים עליו ניתחו מידע ממערכות המחשוב של גוגל ומצאו שינויים שחסכו יותר מ-300 טרה-בייט של זיכרון, ובפרויקט אחר הם משתתפים בהעברת קוד מ-C ו-C++ ל-Rust, כולל יותר מ-800 אלף שורות במערכת ההפעלה Fuchsia. אלה דוגמאות מרשימות, אם כי מדובר בתוצאות פנימיות של גוגל שעוברות בדיקות אנושיות ואוטומטיות לפני שימוש אמיתי.

אז הוא באמת טוב יותר מ-ChatGPT ו-Claude?

התשובה כרגע היא: בחלק גדול מהדברים כן, ובחלק אחר הפער קטן או אפילו מתהפך.

גוגל פרסמה השוואה על 18 מבחנים שונים. Gemini 4 הגיע למקום הראשון או חלק את המקום הראשון ב-13 מהם. במבחן שמנסה לדמות עבודת פיתוח תוכנה ארוכה הוא קיבל 77.9%, מול קצת יותר מ-74% אצל שני המתחרים המרכזיים. במחקר פיננסי רב שלבי הוא הגיע ל-65.4%, לעומת 58.6% ו-53.5%. באוטומציה עסקית מקצה לקצה הפער כבר גדול יותר: 51.3% מול כ-42% אצל המתחרים.

אחת התוצאות המעניינות ביותר מגיעה דווקא מעבודה משפטית. שם הוא קיבל 19.6% במבחן מורכב של מחקר וניסוח, לעומת 5.4% ו-3.8% אצל המתחרים. המספר האבסולוטי עדיין נמוך, וזה בפני עצמו מזכיר כמה רחוקים המודלים משלמות במשימות מקצועיות מורכבות, אבל הפער בין המודלים משמעותי.

גם ביכולת לעבוד עם וידאו ארוך הוא בולט, עם ציון של 91.7%. במחקר פיננסי, מסמכים ארוכים ועבודה שמשלבת טקסט וגרפים, התמונה הראשונית מצביעה על שיפור גדול. זו כנראה אחת החוזקות החשובות של הדור החדש: פחות התמחות בתשובה קצרה ויותר יכולת לחבר מידע רב לתהליך אחד.

ועדיין, זו רחוקה מלהיות ניצחון בכל תחום. במבחן תוכנה אחר המודל של OpenAI קיבל 65.5% מול 55% של ג'ימיני. במשימות מדעיות דרך סביבת מחשב הפער הגיע לכ-10 נקודות לטובת OpenAI, ובמבחן אחר של עבודה דרך טרמינל Claude הוביל בכ-9 נקודות. כלומר, מי שמחפש "המודל הכי טוב" יקבל עדיין תשובה שונה לפי סוג העבודה.

וזו בערך גם הסינתזה שעולה מהבדיקות והניתוחים הראשונים בעולם: ג'ימיני 4 נראה חזק במיוחד במשימות ארוכות, בעבודה ארגונית, פיננסים, משפטים, מסמכים גדולים וקוד שמצריך רצף של פעולות. היתרון שלו נראה פחות מוחלט במשימות פיתוח מסוימות ובסביבות שבהן המודל צריך לעבוד ישירות עם מחשב וכלי שורת פקודה.

יש עוד יתרון מעניין - המחיר. בתקופת ההשקה גוגל מתכננת לגבות 2 דולר למיליון טוקנים שנכנסים למודל ו-10 דולר למיליון שיוצאים ממנו. בהמשך המחיר יעלה ל-4 ו-20 דולר בהתאמה. גם במחיר המלא הוא זול משמעותית מהמודל החזק ביותר של OpenAI במחירי ה-API הנוכחיים, ובערך באזור המחיר של המודל הבכיר של אנתרופיק. עבור חברה שמפעילה אלפי סוכנים ביום, ההפרשים האלה יכולים להפוך להוצאה של מיליוני דולרים בשנה.

החיסרון הגדול כרגע פשוט: רוב האנשים עדיין אינם יכולים להשתמש בו. גוגל מתחילה את ההפצה אצל מספר מצומצם של גופי סייבר ומומחים שמקבלים גישה מוקדמת, ורק בהמשך מתוכננת פתיחה למפתחי API, ללקוחות עסקיים ולמנויי AI Ultra. המשמעות היא שכל ההשוואות כרגע מבוססות במידה רבה על מבחנים שגוגל בחרה ועל ניסויים ראשוניים. רק כשהמודל יגיע למיליוני משתמשים אפשר יהיה לראות איך הוא מתנהג בכתיבה רגילה, במחקר, בחיפוש, בשימוש יומיומי ובמשימות שסוטות מהתרחישים שעליהם נבחן.

יש גם סיבה להפצה האיטית. ג'ימיני 4 חזק מאוד בסייבר ויכול לאתר, לבדוק ולתקן חולשות באופן עצמאי. אותה יכולת יכולה לשמש גם בכיוון ההפוך. לכן גוגל משקיעה יותר בהגנות מפני שימוש לרעה ובניסיונות למנוע מסוכנים לקבל הוראות זדוניות מתוך אתרים ומסמכים שהם קוראים. זה מתחבר לבעיה שכבר ראינו אצל חברות אחרות: ככל שסוכן מקבל יותר הרשאות וכלים, הנזק האפשרי במקרה של טעות גדל. בשבועות האחרונים נחשפו כמה מקרים שבהם סוכני AI הצליחו לצאת מסביבות בדיקה ולפעול במערכות אמיתיות.

קיראו עוד ב"BizTech"

מי שעוקב אחרי ג'ימיני כבר מכיר את הבלבול בין Pro, Flash וגרסאות ביניים. במדריך לג'ימיני הסברנו איך לקרוא את שמות המודלים ומה ההבדלים ביניהם. Argon נמצא בקצה העליון של הסדרה: זה המודל שמיועד למשימות הכבדות ביותר, בעוד שגרסאות Flash נשארות מתאימות יותר לעבודות מהירות וזולות בהיקפים גדולים.

החידוש האמיתי של ג'ימיני 4 לכן אינו עוד כמה נקודות במבחן. הוא מסמן את המקום שאליו כל התעשייה הולכת: מודל שמקבל משימה גדולה, נשאר איתה לאורך זמן, קורא חומר, כותב קוד, מפעיל כלים ומנסה לסיים את העבודה בעצמו. אם הביצועים שגוגל מציגה יחזיקו גם אצל משתמשים אמיתיים, הקרב הבא בין גוגל, OpenAI ואנתרופיק יהיה פחות על מי נותן את התשובה היפה ביותר בצ'אט ויותר על מי מסוגל לעשות בפועל יותר עבודה.

הוספת תגובה

תגובות לכתבה:

הגב לכתבה

השדות המסומנים ב-* הם שדות חובה