כלכלת סוכנים היא לא מחיר טוקנים

בתוך יומיים פרסמה McKinsey שני מסמכים שכדאי לקרוא ביחד. ב-24 באוגוסט הוציאה QuantumBlack מדריך מעשי לכלכלה של תהליכים אגנטיים. ב-25 באוגוסט פרסמה החברה את סקר State of AI לשנת 2026. כשקוראים אותם זה לצד זה, מבינים למה הורדות המחיר של החודש לא יופיעו בתוצאות של רוב החברות.
נתחיל בסקר. שמונה מכל עשרה משיבים אומרים ש-AI שיפר את הפרודוקטיביות האישית שלהם. ובכל זאת, שיעור המדווחים ש-AI תורם ל-EBIT של הארגון עומד על 37 אחוז, כמעט ללא שינוי לעומת שנה שעברה. בערך אחד מכל חמישה ארגונים אומר שעלויות התפעול של AI כבר מגבילות את השימוש בו, גם כשרובם מצפים להגדיל את ההשקעה ב-AI בשנה הקרובה. הסוכנים מתפשטים, אבל לא באופן שווה: 40 אחוז מהמשיבים מחברות עם הכנסות של יותר ממיליארד דולר מדווחים על הרחבת סוכנים, לעומת 27 אחוז בשנה שעברה, בזמן שהארגונים הקטנים נשארו על 22 אחוז.
המדריך מסביר חלק גדול מהפער הזה. הכותרת המועילה ביותר בו צנועה: טוקנים הם לפעמים לא העלות הגבוהה ביותר. בדוגמה הבנקאית של McKinsey, חיובי הטוקנים הם 20 עד 25 אחוז מהעלות המשתנה של הפעלת סוכן שירות לקוחות. פיקוח אנושי של מומחי סיכון ומומחי תחום מהווה 70 עד 75 אחוז. סוכנים מול לקוחות בחלק מהבנקים יכולים לעלות $20,000 עד $30,000 בתהליך של סוכן יחיד ו-$100,000 עד $200,000 בצוות רב-סוכני. והנפח משנה את החשבון: קליטה של 2,500 לקוחות בשנה עם סוכן שיחה עולה $10,000 עד $15,000, והכפלת הנפח מעלה את העלות רק ל-$15,000 עד $20,000.
זו שיחה אחרת לגמרי מהמחירונים של החודש. OpenAI, Anthropic ו-Google בילו את סוף יולי ואמצע אוגוסט בהזזת מחירים ליחידה. McKinsey אומרת לקונים שהיחידה היא בכלל לא מה שצריך למדוד. המדד שהיא שמה במקום הראשון הוא ROI של עבודה שהושלמה: העלות המלאה של סיום המשימה עם אנשים, סוכנים ומערכות דטרמיניסטיות, מול הערך שנוצר.
סוכן הוא תהליך עם ניסיונות חוזרים, כלים, בודקים, ומצב כשל שנוחת על אדם. מי שמתמחר אותו כמו עובד זול יותר שבמקרה מחייב בטוקנים מפספס את רוב החשבון.
מה השתנה בפועל
כבר ביולי McKinsey הזהירו, בהסתמך על מחקר על משימות קוד אגנטיות, שסוכנים יכולים לצרוך בסדר גודל של פי 1,000 טוקנים ממשימות קוד או צ'אט של סבב אחד, ושריצות של אותה משימה יכולות להשתנות בערך פי 30. המדריך של אוגוסט שם מסגרת של עלות כוללת סביב המספרים האלה.
ארבע עלויות יושבות עכשיו על אותו דף.
ראשית, טוקנים ושרשראות חשיבה. מודל עבודה זול יותר עדיין מתרבה כשהסוכן מתכנן, קורא לכלים, מנסה שוב ושולח מחדש הקשר ארוך.
שנית, השכבה הקבועה. McKinsey סופרת את תשתית ה-AI ואת תזמור הסוכנים, כולל ה-data scientists שמתחזקים את הסוכן בייצור, כעלויות קבועות לכל סוכן. צוותים רב-סוכניים מכבידים את השכבה הזו דרך העברות בין סוכנים, זיכרון משותף וקריאות נוספות ליישוב צעדים סותרים. הנפח עוזר רק אחרי שהשכבה הזו כבר שולמה.
שלישית, פיקוח אנושי. בדוגמת הקליטה של McKinsey, 10 עד 20 אחוז מההרצות עוברות למומחי סיכון ותחום. הבודק הזה שייך לעלות היחידה של הסוכן. מי שמתייק אותו תחת שורה נפרדת של "ניהול שינוי" מסתיר אותו.
רביעית, העבודה שהסוכן רשאי לגעת בה. פעולות כתיבה, הודעות ללקוחות, הגשות וקריאות בייצור נושאות פרופיל הפסד צפוי שונה לגמרי מטיוטה שלא יוצאת מ-Slack.
צוותי כספים שמסתכלים רק על דולרים למיליון טוקנים יאשרו את המערכות הלא נכונות ויהרגו את הנכונות. חשבון טוקנים גבוה על תהליך שמבטל תור של ארבעה אנשים יכול להיות זול. חשבון טוקנים זעיר על תהליך שעדיין דורש עורך דין על כל פלט חמישי יכול להיות יקר.
למה לבעלים צריך להיות אכפת עכשיו

נתון ה-EBIT מהסקר ונתון הפיקוח מהמדריך מתארים את אותה בעיה משני הקצוות. פיילוטים של סוכנים נכשלים כמו שנכשלים מעברים למודלים זולים: ההדגמה מודדת את המודל, והחשבון בייצור מודד את המערכת.
דפוס הכישלון ספציפי. צוות מראה שסוכן "מטפל" בקליטת לקוחות או במיון קריאות. עלות הטוקנים נראית קטנה ליד שכר מלא. אחרי העלייה לאוויר שיעורי החריגות נשארים גבוהים, חלונות ההקשר ממשיכים לגדול, ואותם אנשים בכירים שהיו אמורים להשתחרר בודקים עכשיו פלט של מכונה. חשבונית הטוקנים היא המספר היחיד שקל לראות, אז היא הופכת לטיעון. עלות הפיקוח נשארת בתקציב השכר ולא נכנסת לתוכנית העסקית. כך הפרודוקטיביות עולה ליד השולחן וה-EBIT נשאר במקום.
יש כישלון שני בצד השני. מנהלים מקפיאים עבודה על סוכנים כי סטאק רב-סוכני נראה יקר במצגת, בלי לשאול אם הנפח יפרוס את השכבה הקבועה. החשבון של McKinsey מזכיר: ברגע שהפלטפורמה קיימת, הרצות נוספות יכולות להיות זולות. בדוגמת פתיחת חשבון הבנק שלהם, העלות המלאה של קליטת לקוח אחד יכולה לרדת מכ-$50 עד $150 לכ-$10 עד $30. זה נכון רק אם מישהו אחראי על הניתוב, על התקרות ועל הבדיקה.
בסקר יש גם אות שלישי ששווה לעקוב אחריו. 32 אחוז מהמשיבים אומרים שהארגון שלהם החליט לא לרכוש לפחות מוצר או פיצ'ר תוכנה אחד, כי יכלו לבנות אותו בעצמם עם כלי קוד אגנטיים. זה יכול להיות חיסכון אמיתי. זה גם מעביר את העלות של הספק לתקציב ההרצה שלכם, לתור הבדיקה שלכם ולאחריות שלכם.
בסוכן שאתם עומדים להרחיב, איזה חלק מעלות ההרצה הוא טוקנים, איזה חלק הוא אדם שעדיין צריך להסתכל, ומי אחראי על ההרצה כששני המספרים זזים?
הנחמה המדומה של "המודל נהיה זול יותר"

הורדות המחיר של החודש לא מצילות סוכן שתוכנן רע. הן מקלות להריץ סוכן שתוכנן רע יותר פעמים.
צעד ראשון במחיר של Luna מועיל אם הצעד השני מוגן בשער. הוא נהיה יקר אם כל קריאה זולה יכולה לפתוח כלי שכותב. סוכן קוד במחיר של Flash מועיל אם הניסיונות החוזרים מוגבלים והשינויים בקוד נבדקים. הוא נהיה יקר אם הוא רץ כל הלילה על מאגר שאף אחד לא מסתכל עליו.
המחירונים של הספקים ימשיכו לרדת ולעלות לפי לוח הזמנים שלהם. יחסי הפיקוח ירדו רק אם הארגון יתכנן אותם כלפי מטה: אחזור טוב יותר כדי שהסוכן יראה את הקובץ הנכון בפעם הראשונה, הרשאות כתיבה ברורות יותר, תור בודקים עם SLA, וכלל עצירה כשהשונות בין הרצות יוצאת משליטה.
התשובה של McKinsey היא יכולת AgentOps, המקבילה של FinOps לעולם הסוכנים: צוות רב-תחומי שמנהל את ההוצאה באופן שוטף ומכניס את כלכלת היחידה של ה-AI לסקירות העסקיות הרבעוניות. העבודה הזו שייכת לתפעול. הרכש לא יכול לעשות אותה לבד.
DNLA Playbook לכלכלת סוכנים
- תמחרו את התהליך. טוקנים, תזמור, זמן בדיקה, טיפול בחריגות והפסד צפוי מפעולות כתיבה צריכים לשבת על גיליון אחד.
- הפרידו בין עלות פלטפורמה קבועה לבין עלות הרצה משתנה. הנפח עוזר רק אחרי שהפלטפורמה אמיתית.
- מדדו שונות, לא רק ממוצעים. תנודה של פי 30 בין הרצות היא בעיית בקרה.
- הגבילו לולאות, ניסיונות חוזרים וגדילת הקשר לפני העלייה לאוויר. הקשר ארוך הוא חיוב חוזר.
- מנו בעלים להרצה. מישהו צריך לעצור סוכן כשעומס הפיקוח או שונות הטוקנים יוצאים מהטווח שתוקצב.
- תקצבו בדיקה אנושית כעלות קבועה. אם התכנון מניח ש-10 עד 20 אחוז מההרצות צריכות מומחה, תקצבו את המומחה.
- פתחו מחדש את שאלת build מול buy כשסוכנים מתחילים להחליף רכישות תוכנה. בנייה פנימית עם סוכן קוד עדיין משאירה אתכם עם עלות הרצה, עלות בדיקה ואחריות.
DNLA Take
מלחמת המחירים של אמצע אוגוסט ענתה על שאלה שרוב הדירקטוריונים כבר שאלו בצורה הלא נכונה. מחירי טוקנים חשובים, אבל הם לא קובעים אם סוכן מחזיר את עצמו. סקר שבו שמונה מכל עשרה אנשים מרגישים פרודוקטיביים יותר, בזמן שפחות מארבעה מכל עשרה מדווחים על השפעה על ה-EBIT, הוא מה שהטעות הזו נראית כמו בקנה מידה.
סוכן מחזיר את עצמו כשההרצה המלאה, כלומר המודל, הכלים, הניסיונות החוזרים והאדם שעדיין חותם, זולה מהעבודה שהיא מחליפה, באיכות שהארגון יכול להגן עליה. המספר הזה לא נמצא במחירון. הוא נמצא בתהליך.
אם אתם לא יודעים להגיד כמה עולה סוכן ביום רע, אין לכם כלכלת סוכנים. יש לכם חשבונית טוקנים ותקווה שהפיקוח יישאר בחינם.
רוצים שאותה קפדנות תוחל על מערכת ה-AI שלכם?
בדיוק לשם כך קיים QAi Health Check.