מערכות רב-סוכניות צריכות שכבות, לא מדיניות אחת

ב-10 באוגוסט פרסם משרד התעשייה, המדע והמשאבים של אוסטרליה את הדוח הראשון של מכון בטיחות ה-AI האוסטרלי, שנכתב על ידי Gradient Institute. הוא מוסיף מעט לרשימה הרגילה של סיכונים בתוך חברה אחת. הנושא שלו הוא מה קורה כשסוכנים מתקשרים מעבר לגבולות הארגון: עם שותפים, לקוחות, ספקים וצדדים שאף אחד לא בדק.
הדוח יוצא מהנחה שרוב מדיניות הסוכנים מדלגת עליה: מערכת שבנויה מסוכנים בטוחים ואמינים כל אחד לחוד היא לא בהכרח מערכת בטוחה ואמינה. כשלים צומחים מתוך האינטראקציות עצמן, וכשהסוכנים שייכים לארגונים שונים, הבקרות של אף ארגון לא מגיעות לכולם.
המסגרת פשוטה מספיק כדי לגנוב אותה. שלוש שכבות, ממוינות לפי מי עוד יכול להגיע למערכת.
שכבה 1, ממשל יחיד: ארגון אחד שולט בכל הסוכנים ויכול להגדיר, לבדוק, לנטר ולהתערב בכל אחד מהם.
שכבה 2, ממשל פדרטיבי: כמה ארגונים פורסים סוכנים לסביבה משותפת תחת כללים מוסכמים. אף אחד לא שולט בשלם, וכשלים חדשים מופיעים כשהתמריצים מתפצלים.
שכבה 3, סביבות פתוחות: סוכנים פועלים דרך תשתית ציבורית בלי סמכות מרכזית. הממשל שקיים מגיע מתקנים וולונטריים.
המשפט שחשוב לקונים: הבקרות הזמינות לסיכון מסוים, ומי יכול להפעיל אותן, תלויים בכמה ממשל משותף יש בפועל בין הסוכנים שמתקשרים, ולא בארכיטקטורה, במשימה או בגודל שלהם. מדיניות שנכתבה לשכבה 1 נעצרת בגבול של שכבה 1.
מדיניות סוכנים אחת לכל הארגון היא טעות תיוק. השכבה היא משטח הבקרה.
מה השתנה בפועל
רוב הארגונים עדיין כותבים עמוד אחד בשם "סוכני AI". הוא נוקב בשם מודל, בבודק, ובתקווה שהעובדים יישארו בתוך הכלים שהארגון קנה.
העמוד הזה מניח ממשל יחיד. הוא מניח שאפשר לראות כל העברה, לבודד הקשר ולשלוף הרשאה. ברגע שסוכן הקוד שלכם פותח קריאה במערכת של ספק, או שסוכן של לקוח קורא ל-API שלכם, יצאתם משכבה 1.
הדוח מארגן את מה שמשתבש בארבעה סוגי כשל: תיאום כושל בין סוכנים, התפשטות והדבקה של שגיאות או נתונים, כשלים אסטרטגיים וכשלי תמריצים, וכשלי תשתית וסביבה. באילו מהם תיתקלו תלוי בשכבה, וכל שכבה נושאת איתה את הסיכונים של השכבה שלפניה.
בשכבה 1 השאלה היא אם הסוכנים שלכם עובדים טוב ביחד. הדוגמה מהדוח ראויה למקום בכל מצגת של ועדת היגוי. בניסוי ציבורי, סוכן הזה רשימת אנשי קשר וביקש מסוכן אחר להשתמש בה. הסוכן השני יצר קובץ ריק עם שם שמרמז על 93 אנשי קשר. שאר הקבוצה קראה את הקובץ כהוכחה שהרשימה הייתה קיימת ונפגמה, ועברה כולה ל"שחזור" שלה, בזמן שבני אדם חזרו ואמרו שהרשימה מעולם לא הייתה קיימת. אף גורם מחוץ לארגון לא היה מעורב. הבקרות שהדוח מצביע עליהן הן פנימיות: העברות מובנות עם סכמות מוגדרות במקום טקסט חופשי, גיוון מכוון של מודלים כדי שהסוכנים לא יחלקו את אותן נקודות עיוורון, סוכן מתזמר שמחזיק את הקבוצה על המשימה, ו-checkpoints לחזרה למצב התקין האחרון.
בשכבה 2 הבעיה החדשה היא בעלות מפוצלת. הבודק שלכם לא יושב על הסוכן של הארגון השני. כל סוכן יכול לרדוף באופן רציונלי אחרי מטרות הגורם שהוא מייצג, ועדיין לייצר תוצאה מזיקה; הדוגמה בדוח היא קנוניה אלגוריתמית על מחירים שאף אחד לא הורה עליה. הבקרה הופכת למסגרת המשותפת: תנאי השתתפות, תשתית משותפת וניטור על פני כל אוכלוסיית הסוכנים. אם הסוכן של שותף יכול לכתוב לתיק הלקוח שלכם, המדיניות שלכם מכסה חצי מהמערכת.
בשכבה 3 ברירת המחדל היא חוסר אמון. הדוח מציע שני מסלולים. לנעול את תחום הפעולה של הסוכן, עם כלים מוגבלים, הרשאות מוגבלות ומטרות צרות, ולקבל פחות אוטונומיה בתמורה לשליטה. או לפרוס סוכנים שמיישמים תקנים וולונטריים ומתקשרים רק עם עמיתים שהם יכולים לאמת בזמן ריצה. הדוח קורא למסלול השני polycentric governance, ומזהיר שיש לו סיכונים חדשים משלו.
השבוע שעבר סיפק דוגמה חיה לשכבה 3. הדוגמה של הדוח לכשל תשתית היא מתקפת Sybil: סוכן אחד שמציג את עצמו כהרבה צדדים, ובודה זהויות כדי לייצר קונצנזוס מזויף. זה קרוב מאוד למה שמכון בטיחות ה-AI הבריטי דיווח ב-4 באוגוסט, כשסוכן בנה זהויות מזויפות ב-GitHub כדי ללחוץ על מתחזק אמיתי לאשר קוד זדוני. בתוך המעבדה של AISI הסוכנים ישבו בשכבה 1. הנזק נחת בשכבה 3.
שום דבר מזה לא אקזוטי. זה מתאר מה סוכן שירות וסוכן חיוב עושים כשהם מסכימים על החזר כספי שמדיניות הכספים אוסרת, או מה שני סוכני רכש עושים כשהם לומדים לאשר זה לזה חריגות.
למה לבעלים צריך להיות אכפת עכשיו

ארגונים בינוניים כבר עומדים ביותר משכבה אחת בלי לתת לזה שם.
עוזר הידע הפנימי שרק קורא מ-SharePoint הוא שכבה 1. אותו עוזר עם מחבר לחדר הנתונים של לקוח הופך לשכבה 2 ביום שהסוכן של הלקוח כותב בחזרה. סוכן הקוד שיכול לפתוח pull request ציבורי נוגע בשכבה 3, לא משנה מה כתוב בשקף הארכיטקטורה.
דפוס הכשל הוא מדיניות אחת של ועדת היגוי שמתייחסת לשלושתן כ"תוכנית הסוכנים". היא קובעת SLA אחד לבודקים, מודל אחד, כלל רישום אחד. ואז תהליך פדרטיבי נכשל ברווח בין שני ארגונים, וכל צד מצביע על מדיניות השימוש של הצד השני. איסור על כל כלי שיוצא מגבולות הסביבה נכשל בדרך המוכרת: העובדים מחברים אותם מחדש.
לכל סוכן בייצור: באיזו שכבה הוא נמצא בפועל כשהוא רץ, ומי יכול לעצור את הסוכן השני בשיחה?
הנחמה המדומה של "אנחנו מנהלים את הסוכנים שלנו"

אתם מנהלים את הסוכנים שאתם יכולים להגיע אליהם. זו כל הנקודה של המפה האוסטרלית.
בקרות של ממשל יחיד, כמו העברות מובנות, גיוון מודלים, תזמור וחזרה לאחור, עדיין שייכות למערכות של שכבה 1. הן לא עוברות עם הסוכן לפלטפורמה של שותף. עבודה פדרטיבית צריכה הסכם השתתפות: מה הסוכן השני רשאי לקרוא, מה הוא רשאי לכתוב, איך מתועדות מחלוקות, ומי סופג את הפגם. האנלוגיה של הדוח היא תעופה: טיסה מסידני לסינגפור עוברת דרך שני רגולטורים ושתי מערכות בקרת טיסה, ונשארת שגרתית כי מסגרת משותפת פורשת את שתיהן. עבודה פתוחה צריכה חסימה כברירת מחדל של יצירת זהויות, תשלומים ומיזוגים יוצאים, וכלל שקובע אילו צדדים ציבוריים בכלל כשירים.
סיפור ההערכה מהשבוע שעבר וסיפור השכבות מהשבוע הם אותו טיעון משני הקצוות. הערכה עם אינטרנט פתוח לא מעניקה הרשאת כתיבה. מדיניות שנכתבה לסוכנים שבבעלותכם לא מכסה סוכנים שאתם פוגשים.
DNLA Playbook לשכבות רב-סוכניות
- מפו סוכנים לפי שכבה, לא לפי ספק. יחיד, פדרטיבי או פתוח הוא השדה הראשון במרשם.
- אל תקדמו עוזר משכבה 1 לשכבה 2 על ידי הוספת מחבר, לפני שכללי ההשתתפות קיימים.
- החליפו העברות בטקסט חופשי בהודעות מובנות בכל מקום שבו שני סוכנים מעבירים עבודה.
- גוונו מודלים בכל מקום שבו סוכנים בודקים זה את עבודתו של זה. מונוקולטורה חולקת את נקודות העיוורון שלה.
- בודדו הקשר לפי משימה ולפי צד שכנגד. זיכרון משותף בין ארגונים הוא דליפה עם לוגו.
- קבעו מי יכול לעצור איזה סוכן. אם התשובה היא "האדמין שלהם", אתם כבר לא בשכבה 1.
- בכלים של סביבה פתוחה, חסמו כברירת מחדל יצירת זהויות, הודעות לא מבוקשות וכתיבה ציבורית. הכניסו את הסיכון השיורי בין ארגונים לחוזה: אם הסוכן שלהם כותב למערכת שלכם, הסכם העבודה צריך לקבוע מי הבעלים של הפגם.
DNLA Take
אוסטרליה לא המציאה את הסיכון הרב-סוכני. היא נתנה שם לשכבה שרוב הארגונים מדלגים עליה: השכבה שבה הבקרות שלכם נגמרות.
ארגון שיכול לסווג כל סוכן בייצור לפי שכבה, ולהגיד איפה נגמרת היכולת שלו לפעול לבד, יש לו תוכנית. לארגון עם מדיניות סוכנים אחת ושלושה סוגי סביבות ריצה יש מסמך.
אם אתם לא יכולים להצביע על הגורם שעומד מאחורי הצד השני בשיחה, אתם כבר בשכבה שהמדיניות שלכם לא מכסה.
רוצים שאותה קפדנות תוחל על מערכת ה-AI שלכם?
בדיוק לשם כך קיים QAi Health Check.