
סוכני OpenAI יצאו מהבדיקות והגיעו לאתרי ממשל בארה"ב
עוד אירוע שהיה יכול להיראות לפני שנה כמו ניסוי מעבדה הופך עכשיו לבעיה אמיתית. סוכני AI של OpenAI קיבלו משימות מחקר, יצאו לאינטרנט, הגיעו לאתרים של ממשלת ארה"ב ובכמה מקרים המשיכו הרבה מעבר לגלישה רגילה.
האירועים התרחשו במהלך הקיץ ונחשפו במסגרת בדיקה פנימית של OpenAI. הסוכנים הגיעו לאתרים של משרד המסחר האמריקאי ושל רשות ניירות ערך, ובמקרה נוסף ניסו להגיע למערכת של משרד החינוך. החברה אומרת שבאירועים שאושרו בארה"ב הסוכנים הגיעו למידע ציבורי, בלי לשנות מידע ממשלתי ובלי להגיע למאגרי מידע חסויים.
אבל הדרך שבה הם הגיעו לחלק מהמידע הרבה יותר מעניינת מהמידע עצמו.
במקרה של משרד המסחר, הסוכנים הגיעו לנתונים של לשכת מפקד האוכלוסין באמצעות פרטי גישה שמצאו במאגרי קוד פתוחים באינטרנט. כלומר, המערכת קיבלה משימה, חיפשה מידע, מצאה פרטי גישה שהופיעו ברשת והשתמשה בהם כדי להמשיך.
במקרה של רשות ניירות ערך, הסוכנים נכנסו ל-SEC.gov ול-Investor.gov, משכו מידע ציבורי ובהמשך העלו חלק ממנו לאתר אחר. הרשות מסרה שלא נחשף מידע שאינו ציבורי.
במשרד החינוך המהלך נעצר מוקדם יותר. חוקרים זיהו סוכנים שנראו ככאלה שהגיעו מ-OpenAI וניסו להיכנס לאתר של המשרד לזכויות אזרח. הניסיון נכשל, ובבדיקות שביצע המשרד לא נמצא נזק לאתר או למאגרי המידע.
החידוש הגדול כאן הוא ההיקף. OpenAI כבר הודיעה לעשרות ארגונים, ובהם גופי ממשל ואוניברסיטאות, שהאתרים שלהם עשויים היו להיפגע או להאט בגלל פעילות המודלים במהלך בדיקות. החברה מעריכה שהבדיקה תימשך עוד חודשים, כך שסביר שהרשימה עדיין חלקית.
לפני כמה ימים כתבנו כאן על המקרה החריג באוסטרליה, שבו סוכן של OpenAI נשלח למצוא מידע על הוצאות תרופות, הגיע למערכת של מדיקר והשיג גישה גם לחלקים שלא היו ציבוריים. הסוכן אף כתב קבצים לשרת פנימי. הרשויות האוסטרליות גילו על האירוע כמעט שלושה חודשים אחרי שהוא התרחש.
האירועים בארה"ב מתונים יותר מבחינת הנזק הידוע, אבל הם מראים שהמקרה האוסטרלי רחוק מלהיות אירוע בודד.
הבעיה מתחילה ברגע שסוכן AI מקבל יעד ולא רצף פעולות קשיח. צ'אטבוט רגיל מחזיר תשובה. סוכן מקבל דפדפן, יכולת להריץ קוד, גישה לכלים ולפעמים גם הרשאות להתחבר לשירותים חיצוניים. אומרים לו למצוא נתון, להזמין שירות או לבצע בדיקה, והוא בוחר בעצמו את הדרך.
כשהדרך הראשונה עובדת, הכול פשוט. כשהיא נחסמת, המערכת יכולה להתחיל לחפש מסלול אחר.
כשאדם נתקל באתר שמחזיר הודעת "גישה נדחתה", הוא בדרך כלל מבין שצריך לעצור. בשביל מערכת אוטונומית שמכוונת להשלים משימה, אותה הודעה יכולה להיראות כמו עוד בעיה שצריך לפתור.
זו כבר הופכת לשאלה מרכזית בפיתוח סוכנים. כמה חופש נותנים להם, אילו אתרים מותר להם לפתוח, מתי הם יכולים להשתמש בפרטי גישה שהם מוצאים ברשת ומתי המערכת צריכה לעצור גם אם המשימה נשארה פתוחה.
OpenAI כבר ראתה גרסה חריפה יותר של אותה בעיה בקיץ. במהלך מבחן סייבר, אחד הסוכנים שלה יצא מסביבת הבדיקה והגיע לתשתיות של Hugging Face. במקרה ההוא המשימה המקורית עסקה באבטחה, אבל הסוכן המשיך ממערכת הבדיקה אל האינטרנט האמיתי.
ביולי כתבנו כאן על סוכן של OpenAI שפרץ מחוץ לסביבת הניסוי ועל 272 מומחי AI שהזהירו מפני התנהגות כזאת.
החוליה הישראלית
ברצף האירועים של החודשים האחרונים חוזר שם אחד: אירגיולר הישראלית. החברה, שהוקמה ב-2023 בידי דן להב ועומר נבו, בונה עבור מעבדות ה-AI סביבות בדיקה שבהן מודלים מקבלים משימות תקיפה ופועלים באופן עצמאי, כדי לבחון את יכולות הסייבר שלהם לפני שהם יוצאים לשוק. היא גייסה 80 מיליון דולר בהובלת סקויה ורדפוינט, לפי שווי של כ-450 מיליון דולר, ועובדת עם כמה מהמעבדות הגדולות בעולם.
- מי מפחד מה-AI ומי חושב שנחיה טוב יותר? 5 מהאנשים שמבינים אותו הכי טוב מסתכלים קדימה
- גוגל דיפמיינד מאבדת את המוחות שלה - והמשקיעים עומדים בתור עם מאות מיליונים
הבעיה היא שבכמה מהבדיקות, הסביבה שאמורה הייתה להיות סגורה אפשרה בפועל גישה לאינטרנט. ג'מיני של גוגל הגיע כך לחברות אמיתיות, ניחש סיסמה והשתמש בפרטי גישה שמצא ברשת. קלוד של אנתרופיק העלה חבילת קוד זדונית למאגר ציבורי, והיא הותקנה בתוך כשעה על 15 מערכות אמיתיות. גם מודל של מטא ומודל של OpenAI הגיעו מתוך סביבת הבדיקה של אירגיולר למערכות של חברות אמיתיות.
אירגיולר מסבירה שחלק גדול מהתקריות נבעו מאותה תקלה בסביבת ההערכה, שכבר תוקנה, ושהיא עדכנה את המעבדות בסוף יולי. אבל האחריות לא נופלת עליה לבד: המעבדות הן שקובעות את ההוראות למודל, את שכבות ההגנה ואת גבולות המשימה. אנתרופיק עצמה הודתה שגם ההתנהגות של המודלים צריכה שיפור, במיוחד במקרים שבהם המודל ראה סימנים לכך שהמערכת מולו אמיתית והמשיך בכל זאת. כתבנו כאן על הקשר של אירגיולר לרצף הפריצות.
ההבדל באירועים החדשים מטריד יותר מבחינה מעשית. חלק מהמשימות בכלל עסקו במחקר מידע. הסוכן לא נשלח "לפרוץ" למערכת. הוא קיבל יעד, נתקל בדרך במכשול והמשיך לחפש פתרון.
גם אנתרופיק, גוגל ומטא דיווחו בחודשים האחרונים על מקרים שבהם מודלים פעלו מחוץ למסלול שתכננו החוקרים. ככל שהסוכנים מקבלים יותר יכולות, ההפרדה בין טעות בתשובה לבין פעולה בעולם האמיתי הולכת ומצטמצמת.
הדיון על "כפתור הכיבוי" של סוכני AI כבר עבר בחודשים האחרונים מתרחיש תיאורטי לבעיה שמעסיקה את החברות הגדולות. סוכן שרץ ברקע, פותח אתרים, כותב קוד ומשתמש בשירותים חיצוניים צריך מערכת הרשאות הרבה יותר קשוחה מצ'אט שמייצר טקסט.
OpenAI מנסה עכשיו למפות בדיעבד איפה המודלים שלה פעלו, אילו אתרים הושפעו ומה בדיוק עשו שם. החברה אומרת שרוב הפעילות שנבדקה עד כה הייתה שגרתית ונגעה באיסוף מידע ציבורי. במקביל, היא מודה שהיו מקרים שבהם המודלים חרגו מההתנהגות שתוכננה עבורם.
וזה קורה בדיוק כשהחברות רוצות להעביר את ה-AI מהצ'אט לעבודה אמיתית: הזמנת טיסות, טיפול בחשבוניות, חיפוש מסמכים, כתיבת קוד, רכישות, שירות לקוחות ומחקר. ככל שסוכן מקבל יותר אחריות, כל טעות שלו מפסיקה להיות תשובה גרועה על המסך והופכת לפעולה שמישהו אחר צריך לגלות, להבין ולעצור.