
המודלים הסיניים: דיפסיק, קימי, קוואן וזעזוע המחירים
מדריך למי שרוצה להבין מה קרה בינואר 2025 כשמודל סיני אחד מחק מאות מיליארדי דולרים מוול סטריט, מי השחקניות הסיניות היום, כמה באמת עולה להריץ אצלן אותה משימה, ומה כדאי לבדוק לפני שמעבירים אליהן מידע של לקוחות
היום שבו מודל אחד הפיל את מניות השבבים
ב-20 בינואר 2025 שחררה חברה סינית קטנה מהנגז'ואו בשם דיפסיק מודל בשם R1, שמייצר לעצמו שרשרת שלבים לפני התשובה. הוא פורסם יחד עם קובצי המשקלים שלו תחת רישיון MIT, מהמתירניים שקיימים. שבועות קודם לכן פרסמה החברה מאמר על המודל שעליו R1 נבנה, V3, ובו הופיע המספר שהצית את הסערה: כ-5.58 מיליון דולר לריצת האימון הסופית. עד אז ההנחה בשוק הייתה שמודל בחזית דורש מאות מיליוני דולרים ומצבור עצום של שבבים מתקדמים.
ב-27 בינואר טיפסה האפליקציה למקום הראשון בחנות האפליקציות של אפל בארצות הברית, ובאותו יום מסחר נפלו מניות התשתית. אנבידיה ירדה בכ-17%, כ-589 מיליארד דולר של שווי שוק נמחקו ביום אחד, וזו המחיקה היומית הגדולה בערך דולרי שנרשמה במניה בודדת. מדד נאסד"ק ירד בכ-3%, ואיתו ברודקום ומיקרון. ההיגיון של המוכרים היה ישיר: אם התוצאה מושגת בשבריר מהתקציב, הזמנות השבבים העתידיות מתומחרות גבוה מדי. התמונה הרחבה של הענף נמצאת במדריך המלא לעולם צ'אטי הבינה המלאכותית.
מה היה מדויק בטענת העלות ומה נשאר במחלוקת
הסכום של 5.58 מיליון דולר התייחס לריצת האימון הסופית של V3 בלבד, לפי שעות עיבוד על שבבי H800 מוגבלים ומחיר שכירות מוערך. החברה עצמה כתבה שהסכום אינו כולל מחקר מקדים, ניסויים שנכשלו, פיתוח ארכיטקטורה ורכישת החומרה.
בפברואר 2025 פרסמה חברת המחקר SemiAnalysis הערכה אחרת לגמרי: כ-1.6 מיליארד דולר השקעה בשרתים, כ-944 מיליון הוצאות הפעלה, וגישה לכ-50 אלף שבבים ממשפחת הופר של אנבידיה. דיפסיק לא אישרה את המספרים. בספטמבר 2025 נקבה החברה במאמר בכתב העת Nature בעלות של כ-294 אלף דולר לשלב הלמידה בחיזוקים שהפך את V3 ל-R1, שוב מספר של שלב אחד בשרשרת ארוכה.
מה שנשאר נכון הוא היעילות עצמה. שיטות כמו ערבוב מומחים, שמפעיל חלק קטן מהפרמטרים בכל פעם, הורידו באמת את העלות ואומצו מאז גם במעבדות המערביות.
מי השחקניות ומה מייחד כל אחת
דיפסיק נשלטת בידי קרן גידור בשם היי-פלייר בראשות ליאנג ונפנג. מודל הדגל הוא V4 מאפריל 2026, בשתי מידות: V4-Pro בגודל 1.6 טריליון פרמטרים שמתוכם כ-49 מיליארד פעילים בכל טוקן, ו-V4-Flash בגודל 284 מיליארד. שניהם עם חלון הקשר של מיליון טוקנים ומשקלים פתוחים ברישיון MIT. ביולי 2026 דווח על מגעי גיוס לפי שווי של כ-71 עד 74 מיליארד דולר לקראת הנפקה בשנגחאי.
עליבאבא מפעילה את משפחת קוואן, והיא הכתובת המסחרית הרצינית מבין הסיניות בזכות ענן ציבורי שמשרת לקוחות מחוץ לסין. Qwen3.8-Max הוכרז ב-19 ביולי 2026 והגיע לזמינות כללית ב-3 באוגוסט: 2.4 טריליון פרמטרים, חלון של קרוב למיליון טוקנים וקליטת טקסט ותמונה. משפחת קוואן עברה את Llama של מטא במספר ההורדות המצטבר בהאגינג פייס. הצד המערבי של אותו סיפור מתואר במדריך על מטא, xAI והמודלים הפתוחים.
מונשוט מפעילה את קימי. הדגם Kimi K3 יצא ב-16 ביולי 2026 עם 2.8 טריליון פרמטרים וחלון של מיליון טוקנים, והמשקלים פורסמו ב-27 בחודש תחת רישיון ייעודי שמגביל הרצה מסחרית לגופים שהכנסתם עוברת כ-20 מיליון דולר בשנה.
מסביבן פועלות Z.ai עם משפחת GLM שחזקה בפריסות ארגוניות, MiniMax ו-StepFun שמשחררות משקלים בקצב מהיר, בייטדאנס עם דוביי, ובאידו וטנסנט.
הפער במחיר, ומה הוא עשה לשוק כולו
נכון לתחילת אוגוסט 2026, ומספרים אלה טעונים בדיקה בכל רבעון, V4-Flash עומד על כ-0.14 דולר למיליון טוקני קלט וכ-0.28 לפלט, V4-Pro על כ-0.44 ו-0.87, Qwen3.8-Max על 2 ו-6, ו-Kimi K3 על כ-2.9 ו-14. מולם GPT-5.6 Sol עומד על 5 ו-30, Claude Opus 5 על 5 ו-25, ו-Gemini 3.1 Pro על 2 ו-12 עד רף של 200 אלף טוקנים. משמעות יחידת התמחור הזאת מוסברת במדריך שמסביר מה זה טוקן ולמה הוא קובע כמה תשלמו.
הפער אינו אחיד. בשכבה הזולה הוא מגיע לפי עשרות, ובשכבת הדגל הוא כמעט נסגר: קימי מתומחר כמו דגם האיזון של אנתרופיק, וקוואן בטווח של ג'מיני. ההנחה הגורפת שסיני שווה זול כבר אינה מדויקת ב-2026.
ההשפעה על השוק הייתה ממשית. הספקיות המערביות הוסיפו שכבות מהירות וזולות והרחיבו הנחות על מטמון קלט חוזר. הנתח הסיני מסך הבקשות בפלטפורמות שמאגדות מודלים עלה בתוך כשנה מאחוזים בודדים לכ-45%, כפי שתואר בסקירה על המתחרות הסיניות שמכרסמות בשולי הרווח של OpenAI ואנתרופיק.
הגבלות השבבים: מחסור שהוליד יעילות
מאוקטובר 2022 מטילה ארצות הברית הגבלות על ייצוא שבבי בינה מלאכותית מתקדמים לסין, והן הוחמרו בכמה סבבים. אנבידיה תכננה דגמים מוחלשים לשוק הסיני, H800 ואחר כך H20, וגם אלה נאסרו או הותנו בתנאים משתנים: ייצוא H20 נאסר באפריל 2025, הותר כעבור חודשים תמורת היטל של 15%, ובהמשך אושר גם H200 בהיטל גבוה יותר. בייג'ין הגיבה בזהירות ובעידוד שבבים מקומיים, ורשויות סיניות מאפשרות לחברות מובילות רכישה מוגבלת ומאושרת מראש, כפי שדווח בכתבה על כך שסין פותחת את הדלת לרכישת שבבי H200 של אנבידיה.
החלופה המקומית היא משפחת אסנד של וואווי. הערכות מכוני מחקר מציבות את דגם 910C בסביבות 60% מהביצועים של H100, ומצביעות על פער גדול בהספק המחשוב המיוצר בשנה לטובת ארצות הברית. ההערכות שנויות במחלוקת ותלויות באופן המדידה.
- הזולה בשוק מייקרת מחירים: מה מגלה מהלך המחירים של דיפסיק על העלות האמיתית של הבינה המלאכותית
- פעם שלישית ברצף: ה-AI של מטא יצא משליטה, אז למה אף אחד לא לוקח אחריות?
התוצאה הפוכה מהכוונה המקורית. כשאין גישה חופשית לחומרה הטובה ביותר ההשקעה עוברת לתוכנה, וחלק מהשיפורים חזרו למערב והורידו עלויות גם שם. מנגד, ההגבלות אכן מאטות אימון בקנה המידה הגדול ביותר. מי שמוכר את התשתית לענף כולו מטופל במדריך על מיקרוסופט, אמזון ומי שמוכר את התשתית.
משקלים פתוחים: מה זה מאפשר לעסק
כשחברה מפרסמת משקלים פתוחים היא מעלה לרשת את קובץ המספרים שמרכיב את המודל, וכל אחד יכול להוריד ולהריץ אותו על חומרה שלו. זה אינו קוד פתוח מלא: נתוני האימון נשארים חסויים, והרישיון קובע מה מותר. דיפסיק בחרה ב-MIT, מונשוט ברישיון מגביל לפי הכנסות, ובאידו החזירה חלק מהדגמים החדשים למסלול סגור.
לעסק שרוצה להריץ אצלו היתרונות ברורים: המידע אינו יוצא מהשרת, והעלות היא חומרה קבועה במקום חשבון לפי שימוש. המגבלות אמיתיות לא פחות. דגם של 1.6 טריליון פרמטרים דורש מקבץ שרתים יקר, והדגמים הקטנים באותן משפחות, בסדר גודל של 20 עד 30 מיליארד פרמטרים, רצים על שרת בודד ומספיקים לסיווג פניות ולחילוץ שדות ממסמכים אך חלשים בהיגיון מורכב.
דוגמה: 40 אלף פניות שירות בחודש
חנות אונליין ישראלית מקבלת כ-40 אלף פניות שירות בחודש בעברית. כל פנייה נכנסת למודל עם הוראת מערכת קבועה, והמודל מחזיר סיווג, דירוג דחיפות ותקציר קצר לנציג. בעברית טקסט נחתך ליותר טוקנים מאשר באנגלית, ולכן פנייה של כ-350 מילים עם ההוראה מגיעה לכ-1,050 טוקני קלט, והתשובה לכ-250 טוקני פלט. בחודש מדובר בכ-42 מיליון טוקני קלט וכ-10 מיליון טוקני פלט.
לפי המחירון של תחילת אוגוסט 2026, ההרצה החודשית ב-V4-Flash של דיפסיק עולה כ-5.9 דולר על הקלט וכ-2.8 על הפלט, כלומר כ-8.7 דולר, פחות מ-30 שקלים. אותה עבודה בדיוק ב-GPT-5.6 Sol מסתכמת בכ-210 דולר על הקלט וכ-300 על הפלט, כ-510 דולר, כ-1,530 שקלים. הפער הוא פי 59 בערך, וההפרש השנתי כ-6,000 דולר. באמצע נמצאים Gemini 3.1 Pro בכ-204 דולר לחודש, Kimi K3 בכ-262 ו-Qwen3.8-Max בכ-144.
בבדיקה מדגמית של 200 פניות כל הדגמים סיווגו נכון את רוב המקרים הפשוטים. ההבדלים התגלו בפניות מעורבות עברית ואנגלית ובעקביות הפורמט לאורך אלפי הרצות. מי שמזין את התוצאה ישירות למערכת אוטומטית משלם על העקביות הזאת. השוואה מלאה בין הכלים למשימות שונות מופיעה במדריך ההשוואה המעשית בין הצ'אטים.
לפני שמשתמשים: שרתים, נתונים ומגבלות תוכן
ההבחנה החשובה ביותר היא בין שלוש דרכי שימוש. ממשק החברה הסינית מעביר את המידע לשרתיה, הרצת המשקלים הפתוחים על שרת שלכם משאירה אותו אצלכם, והרצה דרך מארח מערבי מציבה אותו אצלו לפי תנאיו. שלוש האפשרויות נושאות את אותו שם מודל, ומשמעותן שונה בתכלית.
מדיניות הפרטיות של דיפסיק מציינת שמידע אישי נאסף, מעובד ונשמר בסין, וחוק המודיעין הלאומי מ-2017 מחייב ארגונים לשתף פעולה עם גורמי המודיעין של המדינה בלי חובת יידוע המשתמש. על רקע זה איטליה חסמה את האפליקציה בינואר 2025, דרום קוריאה השעתה הורדות, ומדינות נוספות אסרו שימוש במכשירים ממשלתיים. חוק התקציב הביטחוני האמריקאי לשנת 2026 אוסר שימוש בכלי במערכת הביטחון ובקהילת המודיעין. הרחבה על מה שקורה למידע שאתם מקלידים נמצאת במדריך הפרטיות ואבטחת המידע.
בצד התוכן, ספקיות סיניות כפופות למשטר רישום ואישור מול רשות הפיקוח על המרחב הסיני, והתקנות דורשות שהתוכן יעלה בקנה אחד עם ערכי הליבה של המדינה ומטילות אחריות על נתוני האימון ועל הפלט. בפועל המודלים מסרבים או מסיטים את השיחה בנושאים פוליטיים והיסטוריים רגישים, ומודל שהורץ מקומית מתנהג אחרת אף שההטיות מהאימון נשארות. עסק ישראלי שמעביר מידע אישי לספק בחו"ל כפוף גם לחוק הגנת הפרטיות ולתיקון 13, ומי שפועל מול לקוחות באירופה כפוף גם לחוק הבינה המלאכותית האירופי.
שאלות ותשובות
המודלים הסיניים באמת טובים כמו המערביים?
במבחני יכולת כלליים הפער הצטמצם מאוד. במשימות ארוכות עם הרבה כלים ובעקביות לאורך אלפי הרצות, המובילים המערביים עדיין מקבלים יתרון ברוב הבדיקות.
מסוכן להשתמש בהם?
תלוי במה שאתם מזינים ובאיזה מסלול. שאלה כללית באפליקציה החינמית נושאת סיכון נמוך, והעברת פרטי לקוחות, חוזים או קוד קנייני לשרתים בסין דורשת בחינה משפטית מסודרת.
מה זה בעצם משקלים פתוחים?
קובץ המספרים שמרכיב את המודל, שהחברה מעלה לרשת לשימוש בכפוף לרישיון. נתוני האימון והקוד המלא נשארים לרוב חסויים, ולכן זה שונה מקוד פתוח במובן המקובל.
למה חברה סינית מפרסמת בחינם מודל שעלה לה מיליונים?
כמה סיבות יחד: השתלטות על סטנדרט הפיתוח בעולם, שחיקת היתרון המסחרי של המתחרות שגובות כסף, גיוס חוקרים, ומכירת שירותי ענן סביב המודל החינמי.
הזעזוע של ינואר 2025 היה מוצדק בדיעבד?
חלקית. הטענה שאימון מודל חזק דורש בהכרח מאות מיליונים אכן נשחקה. מנגד, הביקוש לשבבים המשיך לצמוח ומניית אנבידיה התאוששה. השוק תמחר מסקנה רחבה מדי ממידע חלקי.
איך בוחרים בין דגם סיני זול לדגם מערבי יקר?
לפי נפח וסיכון. במשימה חוזרת בנפח גדול שבה טעות בודדת עולה מעט, החיסכון משמעותי. כשהפלט הולך ישירות ללקוח או למערכת קריטית, ההפרש בעלות זניח מול עלות הטעות.
עדכונים
2026 - התחום משתנה בקצב מהיר במיוחד, וכל המספרים כאן נבדקו בתחילת אוגוסט 2026 וטעונים אימות מחדש. דיפסיק שחררה באפריל את V4 עם משקלים פתוחים ברישיון MIT, ובקיץ דווח על מגעי גיוס לפי שווי של כ-71 עד 74 מיליארד דולר לקראת הנפקה בשנגחאי. מונשוט הוציאה ב-16 ביולי את Kimi K3 ופרסמה את המשקלים ב-27 בחודש תחת רישיון שמגביל הרצה מסחרית מעל סף הכנסות. עליבאבא הכריזה ב-19 ביולי על Qwen3.8-Max והעלתה אותו לזמינות כללית ב-3 באוגוסט. כללי הפיקוח הסיניים נכנסו לתוקף באמצע יולי, ובמדיניות ייצוא השבבים נמשכת התנודתיות.