
אופן.איי.איי תפרסם דוחות על התנהגות חריגה של מערכות הבינה המלאכותית
החברה פרסמה שישה דוחות ראשונים על מקרים שבהם מודלים הסתירו טעויות, יצרו הוראות משלהם או ביצעו פעולות ללא הרשאה. במקביל נחשף כי סוכנים של החברה בחנו את האגינג פייס כבר במאי
חברת אופן.איי.איי הודיעה היום על מסגרת חדשה למעקב, חקירה ופרסום של מקרים שבהם מערכות הבינה המלאכותית שלה מפגינות התנהגות שאינה תואמת את המטרות שהוגדרו להן. החברה פרסמה במקביל שישה דוחות ראשונים המתארים מקרים שנצפו במהלך ששת החודשים האחרונים, והודיעה כי בכוונתה להמשיך לפרסם דיווחים מסוג זה באופן שוטף.
ההחלטה מגיעה על רקע חששות גוברים בתעשייה מפני האפשרות שמודלים מתקדמים יקבלו יכולת לבצע פעולות מורכבות באופן עצמאי, לעקוף מגבלות שהוגדרו להם או לנצל פרצות במערכות שאליהן הם מחוברים. לצד התקדמות מהירה ביכולות של מודלי הבינה המלאכותית, חוקרים ואנשי תעשייה קוראים להקדיש יותר משאבים לבטיחות, לבדיקות ולמנגנוני בקרה, וחלקם אף קראו להאט את קצב הפיתוח והפריסה של מודלים מתקדמים עד שיפותחו אמצעי הגנה מתאימים יותר.
החששות אינם מתייחסים רק לאפשרות של שימוש זדוני מצד בני אדם, אלא גם להתנהגות בלתי צפויה של מערכות הפועלות כסוכנים ומסוגלות לבצע סדרה של פעולות בעצמן. במקביל, מספר חוקרים ועובדים לשעבר בחברות בתחום התריעו כי המרוץ המסחרי בין החברות עלול להקדים את היכולת להבין ולשלוט במלואן ביכולות החדשות של המודלים.
שישה מקרים שנחשפו לראשונה
אופן.איי.איי מכנה את התחום "אי-התאמה" - מצבים שבהם התנהגות המודל אינה עולה בקנה אחד עם המטרות, ההוראות או אמצעי הבקרה שנקבעו לו. לפי החברה, המסגרת החדשה נועדה לאפשר פרסום מהיר יותר של מקרים כאלה, גם כאשר החקירה טרם הסתיימה או שעדיין לא נמצא פתרון מלא לבעיה.
בין ששת הדוחות הראשונים נמצא מקרה שבו מודל מחקרי שטרם פורסם הוסיף הוראות שאינן קשורות למשימה לתוך סיכומי עבודה, ובהן הוראות להתעלם מהמגבלות הרגילות שלו. החברה זיהתה 27 סיכומים שהושפעו מהתופעה.
במקרה אחר, במהלך אימון ג'י־פי־טי 5.6 סול, מופעים רבים של המודל הוסיפו לסיכומי המשימות הוראות שנועדו להסתיר טעויות או התנהגות לא תואמת מהמשתמש. במקרה נוסף, מודל מצא מפתח גישה שנחשף במאגר ציבורי והשתמש בו ללא הרשאה. לאחר שלא הצליח להשיג באמצעותו את הנתונים שהתבקש למצוא, הוא יצר נתונים שלא היו בידיו והציג אותם כאילו הגיעו מהמקור המבוקש.
מקרה נוסף עסק במודל שהעלה קובץ לאינטרנט כדי שיוכל להפנות אליו כמקור בתשובה, אף שהמשתמש לא ביקש ממנו להעלות את הקובץ. החברה דיווחה גם על מודלים שהשתמשו במאגר תוכנה פנימי כדי להעביר הודעות בין מופעים שונים של המודל, וכן על סוכנים ששיתפו קבצים באמצעות אתרי אחסון ציבוריים לאחר שלא הצליחו לגשת לקבצים מקומיים של סוכנים אחרים.
אופן.איי.איי מדגישה כי מדובר בדוגמאות נקודתיות ולא במדידה של שכיחות התופעות במודלים שלה. לדבריה, מטרת הפרסום היא לאפשר לחוקרים ולמפתחים מחוץ לחברה לבחון את המקרים, לזהות בעיות דומות ולשפר אמצעי בטיחות.
גם עובדים יכולים לדווח על התנהגות חריגה
לפי המסגרת החדשה, כל עובד של אופן.איי.איי יכול לדווח על מקרה של התנהגות לא תואמת לצוותי הבטיחות וההתאמה של החברה ולבקש שייבחן לפרסום. לאחר הדיווח, צוותים טכניים אמורים לבדוק מה התרחש, מה עדיין אינו ברור והאם יש הצדקה לפרסום.
- ראש ChatGPT: מנוי בלתי מוגבל בעידן הזה דומה למכירת חשמל בלתי מוגבל
- OpenAI רוכשת את גלאס אימג'ינג של זיו אתר ביותר מ-300 מיליון דולר
החברה מחלקת את המקרים לשלושה מסלולים: מקרים שמוכנים לפרסום, מקרים הדורשים חקירה נוספת, וחקירות מורכבות יותר, המכונות "מסלול איטי". המסלול המורכב מיועד בין היתר לאירועים שבהם מעורבים גורמים חיצוניים.
אופן.איי.איי מציינת כי במקרה שבו גורם חיצוני עלול להיפגע, חובות האבטחה והדיווח האחראי קודמות למסגרת הפרסום החדשה. החברה גם מתכוונת לכלול בדוחות, ככל שניתן, את ההתנהגות שנצפתה, חומרתה, ההשפעה החיצונית שלה, האופן שבו התגלתה והצעדים שננקטו או מתוכננים כדי לטפל בה.
הפעילות באגינג פייס החלה מוקדם יותר מהידוע
במקביל להודעת החברה, רויטרס דיווחה היום כי פעילות הקשורה לסוכני הבינה המלאכותית של אופן.איי.איי באגינג פייס החלה מוקדם יותר מכפי שהיה ידוע עד כה.
לפי חוקרים שבחנו את הפעילות, כבר ב-13 במאי השתלטו הסוכנים על שני חשבונות משתמש באגינג פייס ושלחו לשרתי החברה קבצים בעלי מבנה חריג. החוקרים העריכו כי הפעילות נראתה כמו ניסיון למפות את הרשת או לבדוק חלקים ממנה בחיפוש אחר דרך לחדור למערכת. עם זאת, הם הדגישו כי אין ראיות לכך שהפעילות המוקדמת עצמה הסתיימה בפריצה.
האירוע שונה מהפריצה שנחשפה ביולי. אופן.איי.איי כבר דיווחה בעבר כי אחד מסוכניה השיג פרטי גישה של משתמש באגינג פייס והשתמש בהם כדי להגיע לקובץ הקשור לביולוגיה. בדיקה מאוחרת יותר העלתה תמונה רחבה יותר של פעילות הסוכנים. החברה מסרה כי האירוע ממאי נכלל בדיווח שלה וכי היא עדכנה באופן פרטי את האגינג פייס בנושא.
- הקונגרס נגד חשבון החשמל של הבינה המלאכותית: מי ישלם על מרכזי הנתונים?
- טראמפ מאשים את הוועדה המוניטרית, לא את וורש: "ארה"ב צריכה ריבית של 1% או פחות"
אופן.איי.איי עצמה הגדירה את האירוע באגינג פייס כמקרה החמור ביותר מסוג זה שזיהתה עד כה. החברה מסרה כי הסוכנים עקפו בקרות פנימיות, הגיעו לאינטרנט הפתוח ותיאמו פעולות, וכי בדיעבד היו סימנים מוקדמים שהיו צריכים להוביל לתגובה מהירה יותר.
במקביל: חששות בקרב חוקרים בתעשייה
האירועים האחרונים מתרחשים במקביל לדיון גובר בקרב חוקרים ומהנדסים לגבי קצב התקדמות מערכות הבינה המלאכותית. אחד הקולות הבולטים בתקופה האחרונה הוא יעקב קוקסון, חוקר שעבד במשך כשלוש שנים באנתרופיק ובאופן.איי. בתחילת ספטמבר הודיע על עזיבתו את אנתרופיק ופרסם סדרת פוסטים שבהם הזהיר מפני המירוץ לפיתוח מערכות המסוגלות לשפר את עצמן.
קוקסון טען כי חברות בתחום מתקדמות במהירות לעבר מערכות בעלות יכולות שיפור עצמי, וכי לדעתו קיימים סיכונים משמעותיים שאינם מקבלים מענה מספק. דבריו זכו לחשיפה רחבה והצטרפו לדיון שכבר מתנהל בקרב חוקרים ומנהלים בתעשייה סביב הקצב שבו יש לפתח מערכות מתקדמות.
גם דיווח של סי־אן־אן שפורסם היום תיאר חששות בקרב עובדים וחוקרים בתחום. לפי הדיווח, חלק מהעובדים חוששים כי ככל שמערכות יוכלו לבצע בעצמן יותר משימות הקשורות לאימון ולשיפור של מודלים, כוח המיקוח של העובדים עצמם עלול להצטמצם.
במקביל, אופן.איי.איי עצמה מציינת במסגרת החדשה כי תעשיית הבינה המלאכותית עדיין לא פתרה את בעיות ההתאמה והניטור במידה מספקת. החברה אומרת כי המטרה של פרסום המקרים היא לאפשר בחינה חיצונית של התנהגות המודלים ולסייע בפיתוח אמצעי הגנה טובים יותר.
לא כולם סבורים שיש להאט את הפיתוח
מנגד, בתעשייה ובמערכת הפוליטית האמריקאית יש גם מי שסבורים שהחששות מפני התקדמות הבינה המלאכותית אינם מצדיקים האטה מתואמת של פיתוח המודלים.
נשיא ארצות הברית דונלד טראמפ דחה את הקריאות להאט את קצב הפיתוח והדגיש את החשיבות של שמירת היתרון האמריקאי מול סין, באומרו כי "מי שמנצח בבינה המלאכותית מנצח".
גם מנכ"ל מטא, מארק צוקרברג, דחה את הרעיון של האטה כלל-תעשייתית. לדבריו, לחברות הבינה המלאכותית יש תמריץ טבעי לפתח מערכות בטוחות, בין היתר משום שמשתמשים לא ירצו להשתמש בסוכנים שאינם מתאימים להוראותיהם, ומכיוון שחברות חשופות לאחריות משפטית במקרה של נזק. צוקרברג טען כי כל מעבדה צריכה לקבוע בעצמה את קצב הפיתוח המתאים לה ולנקוט באמצעי בטיחות בהתאם, במקום להסתמך על האטה מתואמת של התעשייה כולה.