
אנתרופיק רוצה להיפטר מהכתיבה ה"קלודית": המודל החדש זול ב-40% ומהיר יותר
אחד הדברים המצחיקים שקרו לבינה המלאכותית בשנה האחרונה הוא שלכל מודל כבר יש כמעט מבטא משלו. מי שמשתמש הרבה בקלוד מכיר את זה: תשובות ארוכות, ניסוחים מנומסים מאוד, מבנים מסודרים מדי ולפעמים הסבר של אותה נקודה בעוד דרך ועוד דרך. התופעה נעשתה מוכרת מספיק כדי לקבל כינוי משלה, כתיבה "קלודית".
עכשיו אנתרופיק מנסה לטפל בזה, ובאותה הזדמנות גם בחשבון. החברה השיקה את קלוד אופוס 5.5, מודל שמגיע, לפי הבדיקות שלה, לרמה דומה לפייבל 5.1 ברוב עבודות הידע, בזמן שעלות ההפעלה שלו נמוכה בכ-40% לעומת אופוס 5. הוא גם מפיק תשובות ביותר מ-30% מהר יותר ומשתמש בפחות טוקנים בדרך לתוצאה.
המחיר למפתחים יורד מ-5 דולר ל-4 דולר למיליון טוקנים שנכנסים למודל, ומ-25 דולר ל-20 דולר למיליון טוקנים שיוצאים ממנו. כלומר, מחיר הטוקן עצמו יורד ב-20%. הפער הגדול יותר בעלות הכוללת מגיע מכך שהמודל צריך פחות טוקנים כדי להשלים משימה. גם קריאה של מידע שכבר נשמר בזיכרון המטמון הוזלה מ-50 סנט ל-20 סנט למיליון טוקנים, ירידה של 60%.
למשתמש פרטי שמבקש מקלוד לנסח מייל ההפרש זניח. לחברה שמריצה אלפי סוכני AI, מנתחת מיליוני מסמכים או נותנת למודל לעבוד שעות על קוד, אלה כבר מספרים אחרים לגמרי.
ניקח מערכת ארגונית שמייצרת בכל חודש 500 מיליון טוקנים של תשובות. במחיר של 25 דולר למיליון, רכיב הפלט לבדו מגיע ל-12,500 דולר. במחיר החדש הוא יורד ל-10,000 דולר. אם במקביל המודל מצליח לבצע את אותה העבודה עם 20% עד 30% פחות טוקנים, החשבון יכול לרדת בעוד אלפי דולרים. בחברה שמריצה את המערכת בהיקף גדול פי מאה, החיסכון מגיע מהר מאוד למיליוני דולרים בשנה.
כאן הכתיבה ה"קלודית" הופכת מעניין של סגנון לעניין כלכלי. טקסט ארוך מדי עולה יותר כסף למי שמשלם לפי טוקנים, והוא גם דורש יותר זמן מהעובד שקורא אותו. אנליסט שמקבל שלושה עמודים במקום עמוד, עורך שצריך לקצר מסמך, עורך דין שעובר על תשובה ארוכה או מפתח שקורא הסבר מפורט מדי, כולם משלמים את העלות הזאת בשעות עבודה.
אנתרופיק אומרת שאופוס 5.5 שם את המידע החשוב מוקדם יותר, משתמש פחות בז'רגון ונצמד טוב יותר להוראות סגנון. לפי החברה, בדיקות מוקדמות הראו תשובות קצרות וברורות יותר. באחת מבדיקות הלקוחות המודל השתמש בכשליש מכמות הטוקנים של אופוס 5, והתשובות היו קצרות בכ-40% בלי ירידה באיכות שנמדדה אצל אותו לקוח.
זה מתחבר לשינוי רחב יותר. כתבנו כאן שהקרב ב-AI עובר בהדרגה מהשאלה מי המודל החזק ביותר לשאלה כמה עולה לבצע איתו משימה. הפערים בביצועים בין המודלים המובילים מצטמצמים, ובארגונים גדולים המחיר מקבל משקל הולך וגדל.
מודל חזק בפחות כסף
אנתרופיק מציבה את אופוס 5.5 במקום מעניין בתוך המשפחה שלה. פייבל 5.1 נשאר המודל המתקדם והיקר יותר, עם מחיר של 10 דולר למיליון טוקנים נכנסים ו-50 דולר ליוצאים. אופוס 5.5 עולה 4 ו-20 דולר בהתאמה ומגיע, לפי החברה, לרמה דומה ברוב עבודות הידע.
בבדיקה אחת בתחום פיתוח התוכנה, למשל, אופוס 5.5 הגיע לתוצאה של 92.8% לעומת 92.3% לפייבל 5.1, כשהעלות למשימה שנפתרה הייתה 22 סנט לעומת 1.19 דולר בפייבל. זו בדיקה אחת בתנאי מבחן מוגדרים, וקשה להסיק ממנה על כל משימה בעולם האמיתי, אבל הכיוון ברור: אנתרופיק מנסה להביא חלק גדול מהיכולות המתקדמות שלה למחיר שמתאים לשימוש יומיומי.
הפער הזה חשוב במיוחד בגלל מה שכבר קורה אצל הלקוחות. כתבנו כאן שלקוחות אנתרופיק נוטים יותר ויותר למודלים הזולים, ופייבל היקר תפס חלק קטן יחסית מההוצאה העסקית. עסק שמפעיל מאות או אלפי עובדים דרך כלי AI יכול להעדיף מודל שנותן 95% מהיכולת בחצי מחיר, גם כשיש מודל חזק ממנו.
אנתרופיק מדגישה גם עבודה עם קוד. במבחן Terminal-Bench 4.0 קיבל אופוס 5.5 ציון של 66.4%, לעומת 55.8% לפייבל 5.1 ו-52.3% לאופוס 5. במבחן אחר של עבודה עם קוד הוא הגיע ל-54.4% לעומת 50.3% לפייבל. החברה מציגה גם מקרה שבו המודל טיפל בהסבה של בסיס קוד של כ-680 אלף שורות בפחות מיום, משימה שלדבריה הייתה יכולה לדרוש מצוות מהנדסים שבועות. מבחנים כאלה נותנים אינדיקציה ליכולת, אבל הם רחוקים מהבטחה שכל פרויקט יראה תוצאה דומה.
גם למנויים הרגילים יש שינוי. מכסות השימוש בחלונות של חמש שעות גדלות ב-20%, והיעילות הגבוהה יותר אמורה למתוח את המכסה בפועל עוד יותר. סונט 5.5 והייקו 5.5 אמורים להצטרף למשפחה בהמשך, כך שאנתרופיק מנסה להוריד את עלות העבודה לאורך כל קו המוצרים.
וזה כנראה הסיפור הגדול יותר מאופוס 5.5 עצמו. לפני כמה חודשים הפער במחירי המודלים כבר הפך לשאלה מרכזית עבור משתמשי קלוד. עכשיו אנתרופיק עצמה מאותתת שהדור הבא צריך להיות חכם יותר, אבל גם קצר יותר, מהיר יותר וזול יותר להפעלה. בעולם שבו כל פסקה מיותרת היא עוד טוקנים בחשבון ועוד דקות של עובד מול המסך, כתיבה טובה הופכת לחלק ממודל העלויות של ה-AI.