כתיבת פרומפט (רשתות חברתיות)
צילום: (רשתות חברתיות)

חלון ההקשר: מה המודל זוכר, מה הוא שוכח ולמה זה משנה

מדריך למי שעובד עם צ'אט בינה מלאכותית ומרגיש שהוא מתחיל לאבד את החוט: מה בדיוק נכנס לחלון ההקשר בכל פנייה, למה שיחה ארוכה מתדרדרת, מה ההבדל בין החלון לבין זיכרון לאורך שיחות, וכמה זה עולה

עמית בר |

מה נכנס לחלון ההקשר בכל פנייה

קל לחשוב שהצ'אט שאתם מדברים איתו זוכר אתכם. בפועל המודל אינו זוכר דבר בין הודעה להודעה. בכל פעם שאתם שולחים שורה חדשה, התוכנה שמפעילה את הצ'אט אוספת מחדש את כל מה שנאמר עד עכשיו, מצרפת את השורה החדשה בסוף, ושולחת את החבילה כולה כאילו זו הפעם הראשונה. החבילה הזאת היא חלון ההקשר, וזה כל מה שהמודל רואה כשהוא כותב.

ארבעה סוגי תוכן נדחסים לתוכה. הוראות המערכת, טקסט קבוע שהחברה כתבה מראש וקובע איך המודל מתנהג ומה אסור לו. היסטוריית השיחה, כל מה שכתבתם וכל מה שהוא ענה, כולל תשובות ששכחתם מזמן. קבצים שהעליתם, שנפרסים לטקסט לפי גודלם. ותוצאות של כלים שהמודל הפעיל בדרך, חיפוש ברשת או הרצת קוד.

הגודל נמדד ביחידות שנקראות טוקנים, חתיכות טקסט קטנות שהמודל סופר במקום מילים, ולכן הוא קשור ישירות לאופן שבו נספרים הטוקנים ומה זה עושה לחשבון. בעברית החלון מתמלא מהר יותר, מפני שאותה פסקה נחתכת לפי שניים ויותר טוקנים למילה. את התמונה הרחבה של הענף אפשר לקרוא במדריך המלא לעולם צ'אטי הבינה המלאכותית.

למה שיחה ארוכה מתחילה להתפרק

ההנחה הרווחת היא שכל עוד נשאר מקום, הכל בסדר. המחקר מראה שהאיכות יורדת הרבה לפני שהחלון מתמלא, בשלושה כשלים שמופיעים יחד.

אובדן פרטים מהאמצע. מידע שיושב בשליש האמצעי של שיחה ארוכה נשלף בהסתברות נמוכה בהרבה מאשר בהתחלה או בסוף. בדיקה של חברת כרומה על 18 מודלים מובילים מצאה ירידות דיוק של 30% עד 50% לפני הגבול המוצהר, וההסקה הרב שלבית נפגעת יותר משליפת עובדה בודדת.

חזרתיות. ככל שההיסטוריה מתארכת, גדל בתוכה משקל הטקסט שהמודל עצמו כתב. הוא מזין את עצמו, מנסח מחדש פסקאות שכבר נאמרו ומגיע לאותן מסקנות בניסוח שונה מעט. שיחה שהתחילה חדה הופכת למעגל.

שכחת הוראות מוקדמות. הכשל המעשי ביותר. הוראה שנתתם בהודעה הראשונה, כמו לענות בקצרה או לעבוד בשקלים, נדחקת אל עומק ההיסטוריה ומאבדת משקל מול חמישים הודעות שבאו אחריה. המודל אינו מודיע שהוא שכח, והתשובה נראית סבירה עד שבודקים אותה מול הדרישה המקורית. במצבים כאלה עולה גם הסיכון שהמודל ימלא פערים בהמצאה במקום להודות שחסר לו מידע.

כמה גדול החלון בכלים המרכזיים

נכון לאוגוסט 2026 קיים פער גדול בין מה שהמודל מקבל דרך ממשק המפתחים לבין מה שממשק הצ'אט נותן למנוי.

בממשק המפתחים. משפחת קלוד של Anthropic מציעה מיליון טוקנים בדגמי Opus 5, Sonnet 5 ו-Fable 5, ו-200 אלף ב-Haiku 4.5. GPT-5.6 Sol של OpenAI מוגדר בכ-1.05 מיליון, אך בסביבת הפיתוח Codex הגבול המעשי הוקטן ביולי 2026 לכ-272 אלף. ג'מיני 3.1 Pro של גוגל מקבל מיליון בקלט ומייצר עד 64 אלף בתשובה אחת. מיליון טוקנים שקולים לכ-555 אלף מילות אנגלית, בסביבות 1,500 עמודים.

בממשקי הצ'אט. כאן המספרים נמוכים בהרבה ותלויים במסלול. באפליקציית ג'מיני החשבון החינמי מוגבל לכ-32 אלף טוקנים, מסלול הביניים לכ-128 אלף, ומסלולי Pro ו-Ultra מקבלים מיליון. ב-ChatGPT החינמי עומד על כ-16 אלף, Plus על כ-32 אלף בדגם המהיר ועד כ-256 אלף בדגם החושב, ו-Pro על כ-128 אלף. בצ'אט של קלוד המנויים בתשלום עובדים עם כחצי מיליון טוקנים.

המספרים משתנים כמעט מדי חודש, ובחירת דגם שונה בתוך אותה אפליקציה יכולה להכפיל או לחצות את החלון. ההשוואה המעשית בין הצ'אטים נכנסת לפרטים לפי סוג משימה.

חלון הקשר וזיכרון: שני דברים שונים לגמרי

זה הבלבול הנפוץ ביותר בתחום. חלון ההקשר חי בתוך שיחה אחת ונעלם כשפותחים חדשה. זיכרון לאורך שיחות הוא מנגנון נפרד, שנבנה מעל המודל ולא בתוכו.

כך הוא עובד: תוכנה חיצונית קוראת את השיחות שלכם, מחלצת מהן משפטים קצרים כמו שם העסק או סגנון הכתיבה, ושומרת אותם בקובץ נפרד. בשיחה הבאה אותם משפטים מוזרקים בראש חלון ההקשר, ולכן נדמה שהמודל זוכר אתכם. הוא אינו זוכר. מישהו הכניס לו פתק.

שלוש החברות הגדולות הרחיבו את היכולת ב-2026. אצל OpenAI הופעל ביוני מנגנון שמארגן ומעדכן את פריטי הזיכרון ברקע. אצל Anthropic זיכרון השיחות נפתח לכל המסלולים כולל החינמי, ובתוך פרויקט נבנה מסמך זיכרון שמתעדכן במחזור לילי. גוגל מפעילה התאמה אישית לפי היסטוריית השימוש.

קיראו עוד ב"BizTech"

שלוש הבחנות שכדאי להחזיק. הזיכרון שומר תמצית ולא את השיחה המלאה, ולכן החלטות ביניים ונימוקים אובדים. הוא אינו מגדיל את החלון אלא צורך ממנו מקום, מפני שהפתקים נשלחים כטקסט. והוא מבודד לכל פלטפורמה, ומה שנשמר בכלי אחד אינו נגיש לאחר.

מה קורה כשעוברים את הגבול

בממשק המפתחים ההתנהגות ברורה: הבקשה נדחית עם הודעת שגיאה שמפרטת כמה טוקנים נשלחו וכמה מותר, בלי קיצוץ אוטומטי.

בממשקי הצ'אט הצרכניים התמונה מטושטשת, ושם נולד רוב התסכול. חלק מהכלים מציגים אזהרה לפני הודעה שתחרוג מהגבול ומציעים לפתוח שיחה חדשה. אחרים חותכים ברקע את התורות הישנים או מחליפים אותם בתקציר אוטומטי. מבחינתכם המסך נראה זהה, כל ההודעות עדיין גלולות למעלה, והמודל כבר אינו רואה אותן.

זה המקום שבו נשמע המשפט "הוא שכח מה אמרתי". הוא לא שכח. הטקסט הוסר מהחבילה לפני שהגיעה אליו.

החשבון: כל השיחה נשלחת מחדש בכל תור

מכיוון שהחבילה נשלחת מחדש בכל פנייה, עלות השיחה מואצת ואינה מצטברת בקצב קבוע. בשיחת עבודה טיפוסית התור הראשון שולח כ-500 טוקנים, בתור העשירי החבילה עומדת על כ-15 אלף בכל קריאה, ובתור העשרים היא עוברת 40 אלף. אותה שאלה קצרה עולה בסוף השיחה פי עשרות מאשר בתחילתה.

במנוי חודשי זה מתבטא במכסה שנגמרת מהר, והודעה בשיחה ארוכה נספרת כבדה יותר. בממשק המפתחים זה מתבטא בכסף ממש. הפתרון המקובל הוא מטמון הנחיות, ששומר אצל הספק את החלק הקבוע של החבילה ומחייב עליו כעשירית מהמחיר בקריאות הבאות, בתוספת של כרבע מהמחיר בכתיבה הראשונה. הלחץ על המחירים גדל גם בזכות התחרות: OpenAI חתכה 80% ממחיר אחד הדגמים שלה בסוף יולי 2026.

דוגמה: השיחה ששכחה את ההוראה הראשונה

עצמאית שמכינה הצעות מחיר פתחה שיחה בהוראה מסודרת: כל הסכומים בשקלים, בלי מע"מ, וכל הצעה בעד 200 מילים. אחר כך העלתה מחירון של 14 עמודים, טבלת שעות ושלוש הצעות ישנות לדוגמה, וניהלה כארבעים תורות של תיקוני נוסח, גרסאות ותכתובות מייל שהודבקו פנימה.

בתור הארבעים ושניים היא ביקשה הצעה ללקוח חדש. מה שחזר היה מסמך של כ-600 מילים, עם סכומים בדולרים וכולל מע"מ. שלוש ההוראות הופרו יחד.

מה קרה בפועל: ההוראה נכתבה פעם אחת בהודעה הראשונה, ומאז נדחקה מתחת לכ-90 אלף טוקנים של מחירונים, טבלאות ותכתובות. היא נשארה בחלון, אבל משקלה מול כל מה שבא אחריה נעשה זניח. גרוע מזה, שלוש ההצעות הישנות שהועלו כדוגמה היו נקובות בדולרים, כך שהחומר הבולט סתר את ההוראה המרוחקת.

מה היה מונע את זה: לחזור על האילוץ בגוף הבקשה עצמה במקום להסתמך על הפתיחה. שלוש שורות בסוף ההודעה, שקלים, ללא מע"מ, עד 200 מילים, יושבות בקצה החבילה ומקבלות את מלוא תשומת הלב. חלופה יציבה יותר היא לרשום את האילוצים בשדה ההוראות הקבועות או בהגדרות הפרויקט, מקום שנשלח בראש כל פנייה ואינו נדחק. זה חלק מהאופן שבו כותבים פרומפט שבאמת עובד.

איך עובדים עם זה בפועל

שיחה חדשה לכל נושא חדש. ברגע שהמשימה השתנתה, ההיסטוריה הישנה הפכה לרעש שמייקר ומבלבל.

למסור הקשר במעבר. לפני פתיחת שיחה חדשה בקשו תקציר של עד עשר שורות עם ההחלטות, האילוצים ומה נשאר פתוח, והדביקו אותו כהודעה ראשונה. מקבלים חלון נקי עם המידע החיוני, במחיר של אלפי טוקנים במקום עשרות אלפים.

לפצל משימה גדולה. מחקר, ניסוח וביקורת באותה שיחה מייצרים היסטוריה עצומה. שלוש שיחות נפרדות, שכל אחת מקבלת את התוצר של קודמתה, שומרות על חלון קטן ועל ריכוז גבוה.

להעלות את החלק הרלוונטי בלבד. שני פרקים מתוך דוח של 200 עמודים עדיפים על הדוח כולו. חומר עודף דוחק את הדברים החשובים לאמצע.

לשים את האילוצים במקום קבוע ולחזור על הדרישה הקריטית. מה שחייב לקרות בתשובה הזאת צריך להופיע גם בבקשה הזאת.

גם החברות עצמן מעבירות מסר דומה למפתחים. אנתרופיק פרסמה השנה הנחיות שבהן היא ממליצה להפסיק לכתוב פרומפטים ארוכים ולהעדיף הקשר ממוקד. ההיגיון זהה: חלון עמוס פוגע באיכות במקום לשפר אותה. הרקע לכך נמצא באופן שבו מודל שפה מאמן ומחשב את המילה הבאה.

שאלות ותשובות

אם החלון גדול, למה בכלל לפתוח שיחה חדשה?

מפני שהאיכות יורדת הרבה לפני הגבול. חלון גדול מבטיח שהטקסט ייכנס, ואינו מבטיח תשומת לב שווה לכל חלק ממנו.

איך אני יודע כמה מהחלון כבר תפוס?

בממשקי המפתחים המספר מוחזר בכל תשובה. בממשקי הצ'אט המידע לרוב חסום, ולכן אורך השיחה וכמות הקבצים משמשים כאומדן גס.

אם אמחק הודעה מהצ'אט, היא תשוחרר מהחלון?

ברוב הכלים כן, מחיקה או עריכה בונה מחדש את החבילה בלעדיה. עריכת הודעה קודמת היא דרך יעילה לנקות שיחה שהתמלאה בניסיונות כושלים.

הזיכרון בין שיחות מחליף את הצורך לחזור על הקשר?

חלקית. הוא שומר עובדות קבועות כמו תחום העיסוק והשפה, ואינו שומר פרטים של פרויקט מסוים או נימוקים להחלטות.

עברית מקצרת את החלון?

למעשה כן. אותו תוכן בעברית נספר בכ-30% עד 90% יותר טוקנים מאשר באנגלית, ולכן השיחה מגיעה לגבול מוקדם יותר.

קובץ שהעליתי פעם אחת נשלח שוב בכל הודעה?

בדרך כלל כן, כל עוד הוא נמצא בשיחה. לכן העלאת מסמך ענק בתחילת שיחה מייקרת כל שאלה קטנה שתבוא אחריה.

עדיף שיחה אחת ארוכה או כמה קצרות?

כמה קצרות, כשכל אחת מקבלת תקציר של הקודמת. זה זול יותר, מדויק יותר וקל יותר לחזור אחורה כשמשהו משתבש.

עדכונים

2026 - חלון של מיליון טוקנים הפך לסטנדרט בדגמים המובילים של Anthropic, OpenAI וגוגל, ובלי תוספת מחיר. במקביל התחדדה ההבנה שגודל אינו איכות: בדיקות על 18 מודלים הראו ירידות דיוק של 30% עד 50% לפני מילוי החלון, וכמה ספקים הקטינו ביודעין את הגבול המעשי בכלי הפיתוח שלהם. בצד השני, זיכרון לאורך שיחות הפך לתכונה סטנדרטית בשלוש הפלטפורמות הגדולות, כולל במסלולים החינמיים, ועמו התחדדה שאלת הפרטיות של מה שנשמר בפתקים האלה.

הוספת תגובה

תגובות לכתבה:

הגב לכתבה

השדות המסומנים ב-* הם שדות חובה