
מה זה טוקן, ולמה הוא קובע כמה תשלמו
מדריך למי שמשתמש בצ'אטים של בינה מלאכותית ורוצה להבין את החשבון: איך טקסט נחתך ליחידות תמחור, למה עברית יקרה יותר מאנגלית, מה ההבדל בין קלט לפלט, וכמה באמת עולה סיכום של מסמך אחד
טוקן: היחידה שהמודל באמת סופר
כשאתם מקלידים שאלה לצ'אט, המודל אינו מקבל אותיות ואינו מקבל מילים. הוא מקבל רצף של מספרים. לפני שהטקסט נכנס פנימה, רכיב תוכנה קטן חותך אותו לחתיכות שהוגדרו מראש, וכל חתיכה מתורגמת למספר מזהה. החתיכה הזאת נקראת טוקן.
באנגלית טוקן ממוצע הוא בערך ארבעה תווים, כלומר שלושת רבעי מילה. מאה מילות אנגלית שקולות לכ-130 טוקנים. כל חברות הבינה המלאכותית מתמחרות לפי מיליון טוקנים, ולכן הבנת היחידה הזאת היא ההבדל בין חשבון שאפשר לחזות מראש לבין הפתעה בסוף החודש. לתמונה הרחבה של הענף אפשר להתחיל במדריך המלא לעולם צ'אטי הבינה המלאכותית.
איך משפט נחתך לחתיכות
החיתוך אינו אקראי. לפני האימון בונים מילון של עשרות אלפי חתיכות נפוצות, ואז כל טקסט מפורק לרצף החתיכות הארוכות ביותר שקיימות במילון. מילה שכיחה מקבלת טוקן אחד שלם, ומילה נדירה מתפרקת לשברים.
בפועל זה אומר שאורך הטקסט מנבא בצורה גרועה את מספר הטוקנים. שם של חברה, קוד מוצר, כתובת אינטרנט או מספר ארוך נחתכים לחלקים קטנים ויקרים. גם רווחים וסימני פיסוק נספרים. טבלה שנראית קומפקטית על המסך עשויה לעלות יותר מפסקת פרוזה באותו גודל, מפני שכל תו הפרדה נסחב איתה.
למה עברית עולה יותר מאנגלית
כאן נמצא הפרט המעשי שרוב הקוראים הישראלים אינם מכירים. בדיקות שפורסמו במהלך 2026 מדדו פסקה זהה במשמעות בשתי השפות. אצל מחולל הטוקנים של GPT-4o הגרסה האנגלית הסתכמה ב-67 טוקנים והעברית ב-90, פער של כשליש. אצל ג'מיני היחס היה 111 מול 67. אצל קלוד הפסקה העברית דרשה 188 טוקנים מול 99 באנגלית, כמעט כפול. בדור הקודם של מחוללי הטוקנים המצב היה חמור בהרבה, ואותה פסקה עברית הגיעה ל-265 טוקנים, פי ארבעה כמעט מהאנגלית.
שלוש סיבות מצטברות. הראשונה, מילוני הטוקנים נבנו מגוף טקסט שרובו אנגלי, ולכן מעט צירופים עבריים זכו למקום קבוע. השנייה, אותיות עבריות תופסות שני בתים בקידוד הסטנדרטי מול בית אחד לאותיות לטיניות. השלישית, העברית מדביקה אותיות שימוש ומיליות למילה עצמה, כך שאותה מילה מופיעה בעשרות צורות וכל צורה נחתכת מחדש.
המשמעות כפולה: אותה עבודה עולה בעברית בין 30% ל-90% יותר, וגם חלון ההקשר, כלומר כמה חומר המודל מסוגל להחזיק בבת אחת מתמלא מהר יותר.
קלט ופלט: שני מחירים, ולא במקרה
כל בקשה מתומחרת פעמיים. הקלט הוא כל מה שנכנס: השאלה שלכם, ההנחיות הקבועות, המסמך שצירפתם וכל היסטוריית השיחה. הפלט הוא מה שהמודל כותב בחזרה, והוא יקר פי שלושה עד שישה.
ההסבר נמצא בחומרה. את הקלט המעבד קורא במעבר מקבילי אחד, וכל הטוקנים נטענים יחד. את הפלט המודל מייצר טוקן אחרי טוקן, וכל טוקן מחייב מעבר מלא דרך כל שכבות הרשת. זמן המעבד לכל מילה שנכתבת גדול בהרבה מזמן המעבד לכל מילה שנקראת.
- ראלי התוכנה סגר שבוע של 8%
- דוקסימיטי הכפילה את עצמה בין לילה ונפתחה בזינוק של 55%; המנכ״ל חשף: כל חיפוש AI מכניס פי 10 מהעלות ש
נכון לאוגוסט 2026, המחיר למיליון טוקנים אצל השחקניות המרכזיות: Claude Opus 5 של Anthropic עומד על 5 דולר לקלט ו-25 לפלט, Sonnet 5 על 3 ו-15, GPT-5.6 Sol של OpenAI על 5 ו-30, ג'מיני 3.1 Pro של גוגל על 2 ו-12, ודיפסיק V4-Flash על 0.14 ו-0.28. הפער בין הקצה היקר לזול מגיע לפי מאה ויותר, והוא תוצאה של מלחמת המחירים שהמודלים הסיניים פתחו. התחרות הזאת הובילה גם לחיתוך של 80% במחיר אחד הדגמים של OpenAI.
דוגמה: סיכום מסמך של 20 עמודים בעברית
נניח דוח בעברית באורך 20 עמודים, כ-7,500 מילים. בקצב של קצת יותר משני טוקנים למילה עברית מדובר בכ-16 אלף טוקני קלט. אתם מבקשים סיכום של 800 מילים, כלומר כ-1,700 טוקני פלט.
עלות הרצה אחת: אצל Claude Opus 5 כ-12 סנט, אצל Sonnet 5 כ-7 סנט, אצל GPT-5.6 Sol כ-13 סנט, ואצל ג'מיני 3.1 Pro כ-5 סנט. אצל הדגמים הזולים המספר צונח: GPT-5.6 Luna עולה כחצי סנט לאותה משימה, ודיפסיק V4-Flash פחות משליש סנט.
אותו דוח באנגלית היה נספר בכ-11 אלף טוקנים, והחשבון היה נמוך בכשליש. ברמת עסק התמונה מתחדדת: אלף מסמכים כאלה בחודש עולים כ-120 דולר בדגם היקר, כ-25 דולר בדגם ביניים וכשלושה דולרים בדגם הזול.
מנוי חודשי מול תשלום לפי שימוש
מדובר בשני מודלים עסקיים שונים לגמרי. המנוי הצרכני עולה כ-20 דולר לחודש אצל שלוש החברות הגדולות נכון לאוגוסט 2026, וקיימות מדרגות כבדות יותר בסביבות 100 עד 200 דולר. במנוי משלמים סכום קבוע ומקבלים מכסת הודעות בחלון זמן. אין חשבון משתנה, וקיימת תקרה שחוסמת הרצה של אלפי משימות אוטומטיות.
ממשק המפתחים פועל הפוך: אין מכסה ואין סכום קבוע, משלמים על כל טוקן, ומחברים את המודל לתוכנה שלכם. חישוב האיזון פשוט. אם סיכום המסמך עולה 12 סנט, מנוי של 20 דולר שקול לכ-170 סיכומים. מי שמבצע חמש משימות ביום ירוויח מהמנוי, ומי שמריץ אלף משימות אוטומטיות בחודש ירוויח מהממשק ומדגם קטן. המדריך לעצמאים ולעסקים קטנים נכנס לחישוב הזה לעומק.
טוקני חשיבה: החלק שלא רואים בתשובה
הדור הנוכחי של המודלים מייצר לעצמו שרשרת חשיבה פנימית לפני שהוא עונה. השרשרת עשויה מטוקנים לכל דבר, היא נספרת כפלט, והיא מחויבת גם כשהיא מוסתרת מהמסך.
המשמעות דרמטית. תשובה שנראית קצרה עשויה לגרור שלושת אלפים טוקני חשיבה. בדגם שגובה 25 דולר למיליון טוקני פלט מדובר בכשבעה וחצי סנט, יותר מכל 16 אלף טוקני הקלט של המסמך מהדוגמה. לכן החברות הוסיפו מתגי מאמץ, מנמוך ועד מרבי, שקובעים כמה המודל יחשוב לפני שיענה. משימת סיווג פשוטה שרצה במאמץ גבוה היא בזבוז ישיר. הרקע למנגנון שמייצר את הטוקנים האלה אחד אחרי השני מסביר למה זה עובד כך.
מהירות: כמה מחכים וכמה זורם
שני מדדים נפרדים מתארים את התחושה מול המסך. זמן ההמתנה הוא הפרק שבין שליחת השאלה להופעת המילה הראשונה. קצב הזרימה הוא כמה טוקנים נכתבים בשנייה אחרי שהתשובה התחילה.
בשיחה חיה זמן ההמתנה הוא שקובע אם הכלי מרגיש מהיר, וחשיבה פנימית מאריכה אותו מאוד. תשובה טובה מהדור החדש עשויה להתחיל לזרום אחרי עשר שניות ויותר. בעיבוד של 500 מסמכים בן לילה המצב הפוך, ושם קצב הזרימה מכתיב מתי העבודה נגמרת. חלק מהספקים מוכרים מסלול מהיר בתוספת תשלום, ומנגד מציעים מסלול אצווה איטי בהנחה של 50% תמורת המתנה של עד 24 שעות.
איך מקטינים את החשבון בפועל
לקצץ את מה ששולחים. אם שני פרקים עונים על השאלה, אין סיבה להעלות את הדוח כולו.
להגביל את אורך התשובה מראש. בקשה לסכם בעד 300 מילים חוסכת ישירות בצד היקר.
לנצל מטמון הנחיות. חלק קבוע וחוזר של ההנחיה אפשר לשמור בזיכרון הספק ולשלם עליו כעשירית מהמחיר בכל קריאה חוזרת. הכתיבה למטמון יקרה בכ-25%, ולכן המהלך משתלם מהבקשה השנייה ואילך.
לעבור לאצווה. משימות שאינן דחופות זוכות להנחה של חצי מהמחיר.
להתאים דגם למשימה. סיווג, חילוץ שדות ותרגום מבוצעים היטב בדגמים הקטנים והזולים.
לשקול עבודה באנגלית בצינורות אוטומטיים. תרגום בסוף התהליך חוסך כשליש מהטוקנים.
לפתוח שיחה חדשה לנושא חדש. כל תור בשיחה שולח מחדש את כל ההיסטוריה, ושיחה ארוכה מייקרת כל שאלה נוספת. ההשוואה המעשית בין הצ'אטים מפרטת איזה כלי מתאים לאיזו משימה.
שאלות ותשובות
כמה מילים עבריות נכנסות בטוקן אחד?
פחות ממילה. הכיוון הפוך: מילה עברית ממוצעת נחתכת לשניים עד שלושה טוקנים, בעוד שמילה אנגלית ממוצעת דורשת קצת יותר מטוקן אחד.
למה קיבלתי חשבון גדול אף שכתבתי הודעה קצרה?
מפני שההודעה שלכם היא חלק זעיר מהקלט. ההנחיות הקבועות של המערכת, המסמכים המצורפים וכל היסטוריית השיחה נשלחים מחדש בכל תור.
האם מנוי של 20 דולר מספיק לעסק קטן?
לשימוש ידני של אדם אחד או שניים, בדרך כלל כן. ברגע שנדרשת הרצה אוטומטית של מאות משימות ביום, ממשק המפתחים עם דגם זול יוצא זול יותר וגם אינו נחסם במכסה.
האם עדיף פשוט לעבוד באנגלית?
בצינורות אוטומטיים בקנה מידה גדול זה חוסך כשליש. בשימוש יומיומי החיסכון זניח, ואיכות התשובה בעברית טובה דיה כדי להעדיף אותה.
איך יודעים מראש כמה טוקנים יש בטקסט?
כל הספקים מציעים כלי ספירה ייעודי, וגם ממשק ייעודי שמחזיר את המספר המדויק לפני השליחה. הערכה גסה בעברית: מספר המילים כפול שניים וחצי.
האם מספר הטוקנים משפיע גם על האיכות?
בעקיפין. ככל שהקלט תופס יותר מחלון ההקשר, כך גדל הסיכוי שהמודל יאבד פרטים מהחלק המוקדם של החומר. עברית מגיעה לגבול הזה מוקדם יותר.
המחירים ימשיכו לרדת?
המגמה עד כה יורדת בחדות, בעיקר בזכות התחרות ושיפורי היעילות. במקביל, מודלים חדשים צורכים יותר טוקני חשיבה למשימה, כך שהחשבון בפועל אינו יורד באותו קצב.
עדכונים
2026 - מחירי הדגמים המובילים התייצבו בטווח של 2 עד 10 דולר למיליון טוקני קלט, כשהמודלים הסיניים נמכרים בעשירית מכך. אנתרופיק מתמחרת את Sonnet 5 במחיר השקה מוזל של 2 ו-10 דולר עד סוף אוגוסט 2026, ולאחר מכן 3 ו-15. חלונות ההקשר בדגמים המובילים הגיעו למיליון טוקנים ללא תוספת מחיר, וטוקני החשיבה הפכו לרכיב העלות שצומח הכי מהר. במקביל, נתוני סימילרווב מראים שנתח השוק של ChatGPT ירד מ-80% לכ-54%, מה שמגביר את התחרות המחירית בין כל השחקניות.