
שאלות ותשובות על טוקנים: קלט מול פלט, מטמון וטוקני החשיבה
הפלט מתומחר פי שלושה עד שישה מהקלט, מטמון הנחיות מוזיל קריאה חוזרת לכעשירית מהמחיר, ומסלול האצווה נותן 50% הנחה תמורת המתנה של עד יממה
חשבון של עסק שמריץ אלף סיכומי מסמכים בחודש נע בין שלושה דולרים ל-120, לפי הדגם שנבחר, וההבדל כולו נמדד ביחידה אחת: הטוקן. מי שכבר הבין מה נספר ולמה עברית נספרת ביוקר מגיע לשאלות הדור השני: איפה מסתתרים טוקני החשיבה, למה הפלט יקר כל כך, ואילו מתגים מקטינים את החשבון בלי לפגוע בתוצאה.
מדריך הטוקנים המלא מסביר איך משפט נחתך לחתיכות, ולמה פסקה עברית מגיעה אצל חלק מהמודלים לכמעט כפול טוקנים מהמקבילה האנגלית. כאן מרוכזות התשובות התפעוליות, אלה שמתרגמות את ההבנה לחשבון קטן יותר בסוף החודש.
למה טוקן של פלט יקר פי כמה מטוקן של קלט?
בגלל החומרה. את הקלט המעבד קורא במעבר מקבילי אחד שבו כל הטוקנים נטענים יחד, ואת הפלט המודל מייצר טוקן אחרי טוקן, כשכל אחד מחייב מעבר מלא דרך כל שכבות הרשת. לכן המחירונים מפוצלים: Opus 5 גובה 5 דולר למיליון טוקני קלט ו-25 לפלט, ו-GPT-5.6 Sol גובה 5 ו-30.
טוקני חשיבה מחויבים גם כשהם מוסתרים מהמסך?
כן. שרשרת החשיבה הפנימית עשויה מטוקנים לכל דבר, נספרת כפלט ומחויבת גם כשאינה מוצגת. תשובה שנראית קצרה עשויה לגרור שלושת אלפים טוקני חשיבה, שעולים בדגם יקר כשבעה וחצי סנט, יותר מכל טוקני הקלט של מסמך שלם. הפתרון: מתג המאמץ, שמכוונים לנמוך במשימות סיווג פשוטות.
למה אותו מסמך נספר אחרת אצל כל ספק?
לכל ספק מחולל טוקנים משלו, עם מילון חתיכות שונה, ולכן אותו טקסט מתפרק למספר שונה של יחידות. דגמי Claude מדור 4.7 והלאה, למשל, עברו למחולל שמייצר כ-30% יותר טוקנים על אותו טקסט. השוואת עלויות אמיתית נעשית בהרצת אותה משימה בשני הכלים ובבדיקת החשבון, ולא בהשוואת המחיר למיליון.
מה נותן מטמון ההנחיות, ומתי הוא מתחיל להשתלם?
חלק קבוע וחוזר של ההנחיה נשמר בזיכרון הספק, וכל קריאה חוזרת אליו מתומחרת בכעשירית מהמחיר הרגיל. הכתיבה הראשונית למטמון יקרה בכ-25%, ולכן המהלך משתלם מהבקשה השנייה ואילך. בצינור אוטומטי שמריץ מאות בקשות עם אותה הוראת מערכת, זה אחד החסכונות הגדולים שקיימים.
מהו מסלול האצווה, ולמי הוא מתאים?
משימות שאינן דחופות נשלחות בחבילה, הספק מריץ אותן כשנוח לו, והמחיר נחתך בחצי. ההתחייבות היחידה היא סבלנות: התוצאות חוזרות בתוך עד 24 שעות. עיבוד לילי של מאות מסמכים, תיוג ארכיון או תרגום מאגר הם המועמדים הטבעיים, ושיחה חיה עם משתמש כמובן אינה מתאימה. ההנחה הקבועה: 50%.
למה טבלה עולה יותר מפסקה באותו גודל?
כל תו הפרדה נספר: קווים אנכיים, טאבים, רווחים וסימני פיסוק נסחבים עם הטבלה בכל שליחה. גם מספרים ארוכים, קודי מוצר וכתובות אינטרנט נחתכים לשברים קטנים ויקרים, כי הם אינם קיימים במילון החתיכות הנפוצות. טבלה קומפקטית למראה עשויה כך לעלות יותר מפסקת פרוזה שמכילה את אותו מידע.
עסק שמריץ אלף מסמכים בחודש - איך נראה החשבון?
לפי הדוגמה שבמדריך, סיכום מסמך עברי של 20 עמודים עולה כ-12 סנט בדגם היקר, כ-7 סנט בדגם ביניים ופחות משליש סנט בדגם הזול. באלף מסמכים בחודש: כ-120 דולר, כ-25 דולר, וכשלושה דולרים בהתאמה. פער של פי 40 על אותה עבודה, שנקבע כולו בבחירת הדגם.
- גולדמן זאקס: זעזוע הוצאות ה-AI עדיין לפנינו - ההשקעות בתשתיות עשויות להימשך עד 2028
- החשמל הוא הזהב החדש: מי ירוויח מהמרוץ לחוות השרתים בישראל?
אילו משימות בטוח להעביר לדגמים הקטנים והזולים?
סיווג, חילוץ שדות ממסמכים ותרגום מבוצעים היטב בדגמים הקטנים, שעולים אחוזים בודדים ממחיר דגמי הדגל. הדוגמה מהמדריך: GPT-5.6 Luna מסכם את אותו מסמך בכחצי סנט, מול 13 סנט בדגם הגדול של אותה חברה. ההשוואה המעשית בין הכלים מפרטת איזה דגם מתאים לאיזו משימה.
דיפסיק מתמחרת לפי שעות - איך זה עובד?
מ-19 באוגוסט 2026 המחירון משתנה לפי שעת הבקשה: V4-Flash עולה 0.44 דולר למיליון טוקני קלט ו-1.32 לפלט בשעות השיא, ומחצית מכך בשעות השפל. צינורות אוטומטיים שמריצים את העבודה בלילה נהנים כך מהנחה נוספת על מחיר שממילא נמוך בסדרי גודל מהמערבי.
בקשה להגביל את אורך התשובה באמת חוסכת כסף?
ישירות. הפלט הוא הצד היקר, פי שלושה עד שישה מהקלט, וכל מילה שהמודל אינו כותב נחסכת במלואה. סיכום של 800 מילים שקול לכ-1,700 טוקני פלט, ובקשה מפורשת ל-300 מילים חותכת מהם יותר ממחצית. בצינורות אוטומטיים ההגבלה הזאת מצטברת לחיסכון של עשרות אחוזים בצד הפלט.