גל המודלים הזולים הופך משמעת עלויות לקשה יותר, לא לקלה יותר

בשבועיים וחצי האחרונים המחיר ליחידה של מודלים מתקדמים זז שוב. ב-30 ביולי הורידה OpenAI את מחיר GPT-5.6 Luna ב-80 אחוז, ל-$0.20 למיליון טוקני קלט ו-$1.20 למיליון טוקני פלט, ואת Terra ב-20 אחוז, ל-$2 ו-$12. מודל הדגל GPT-5.6 Sol נשאר על $5 ו-$30. ב-10 באוגוסט הפכה Anthropic את מחיר ההיכרות של Claude Sonnet 5, $2 / $10, לקבוע, וביטלה את ההעלאה ל-$3 / $15 שתוכננה ל-1 בספטמבר. ב-13 באוגוסט השיקה Google את Gemini 3.7 Flash במחיר היכרות של $0.75 / $3.75 עד 31 בדצמבר 2026, חצי ממחיר ההשקה של 3.6 Flash, כשהמחיר אמור להכפיל את עצמו ב-1 בינואר 2027.
צוותי כספים יקראו את המספרים האלה כהקלה. הם צריכים לקרוא אותם כאזהרה. טוקן זול יותר מזמין עוד לולאות, עוד טיוטות שמנותבות למודל ועוד סוכנים בלי השגחה, בדרך כלל בלי שמישהו חדש לוקח אחריות על החשבון.
כשמחיר המדבקה יורד והשימוש לא מוגבל, הארגון לא חוסך כסף. הוא מאבד את הסיבה האחרונה לשאול אם הקריאה למודל הייתה צריכה לקרות בכלל.
מה הורדות המחיר שינו בפועל
ההורדות אמיתיות, והן מרוכזות במקום שבו נמצא הנפח. Luna זול מספיק כדי לשבת מתחת לסיווג, לחילוץ נתונים, לטיוטה ראשונה ולצעד הראשון של סוכן. Sonnet 5 ננעל כמודל עבודה במקום מחיר מבצע שהכספים נאלצו לתכנן כזעזוע של ספטמבר. Gemini 3.7 Flash מתומחר כדי למשוך תעבורת קוד וסוכנים לסביבה של Google עד סוף השנה. Google גם העבירה את 3.6 Flash לאותו מחיר היכרות, כך שכרגע שני המודלים עולים אותו דבר, וההנחה מהכותרת היא בעצם חלון עם תאריך סיום.
כל זה לא משנה ארבע עובדות תפעוליות.
ראשית, עבודה אגנטית מכפילה טוקנים. הוראה אחת של משתמש יכולה להתפצל לקריאות לכלים, לניסיונות חוזרים, לשלבי תכנון ולשרשראות חשיבה ארוכות. ב-Gemini 3.7 Flash חיובי הפלט כוללים את טוקני החשיבה, כך שמודל שחושב יותר זמן גובה יותר על אותה תשובה. הורדה של 80 אחוז במחיר המודל הזול לא מייצרת הורדה של 80 אחוז בעלות התהליך אם התהליך רץ עכשיו פי עשרה.
שנית, מנויים ומונה API הם תקציבים נפרדים. OpenAI השאירה את מחירי המנויים והמכסות של ChatGPT ו-Codex ללא שינוי, והפחיתה את כמות הקרדיטים ש-Luna ו-Terra צורכים. ארגון יכול להרגיש עשיר יותר בתוך המנוי ועני יותר בחשבונית שמגיעה מה-API, מחריגה בכלי קוד, או מספק שמוכר מחדש את אותם מודלים.
שלישית, מחיר היכרות הוא עדיין החלטה מוצרית. Google כבר פרסמה את ההעלאה של ינואר 2027 ל-3.7 Flash. Anthropic הראתה עכשיו שגם העלאה שפורסמה יכולה להתבטל. כך או כך, מחירון הוא בחירה של הספק שאינה בשליטתכם, והוא תחזית גרועה.
רביעית, הטוקן עצמו הוא יחידה שזזה. Sonnet 5 והמודלים של Claude שאחריו משתמשים ב-tokenizer חדש שמייצר בערך 30 אחוז יותר טוקנים לאותו טקסט לעומת Sonnet 4.6. צוות שעבר מ-Sonnet 4.6 ב-$3 / $15 ל-Sonnet 5 ב-$2 / $10 חסך פחות ממה שהכותרת מרמזת, כי המונה סופר עכשיו יותר יחידות לכל עמוד.
למה מודלים זולים מחריפים את בעיית הממשל

רוב החברות עדיין מודדות עלות AI כמו שמדדו פיילוט: טוקנים כפול מחיר מחירון, או מושבים כפול הצעת מחיר של ספק. השיטה הזו נשברת ברגע שעובדים יכולים לבחור מודל זול יותר בלי לבחור משימה זולה יותר.
דפוס הכישלון מוכר. צוות מעביר סיכומים וניסוח קריאות שירות ל-Luna או ל-Flash כי העלות ליחידה נראית קטנה. אחר כך הסוכנים מנסים שוב ושוב קריאות לכלים שנכשלו. מפתחים משאירים סוכני קוד רצים כל הלילה. חברה בינונית מגלה שהסקה “כמעט בחינם” היא השורה החדשה הגדולה ביותר בהוצאות הענן, ואף אחד לא יודע להגיד איזה תהליך ייצר אותה.
יש גם החלפה בין איכות לעלות שאף פעם לא מופיעה במחירון. מודל זול שדורש שלושה תיקונים אנושיים, שני שלבי אחזור נוספים, או מעבר שני על מודל חזית, יוצא יקר. מודל בינוני שמסיים את העבודה בפעם אחת עשוי להיות הבחירה הזולה יותר. בלי כללי ניתוב, בלי הערכה ובלי בעלים בשם, הארגון קונה את המדבקה הנמוכה ומשלם את הסכום הגבוה.
אותו פער מופיע בשיחות עם ספקים. ספק יכול להגיד עכשיו שהמודל זול ב-80 אחוז מהחודש שעבר, ולשתוק על ניסיונות חוזרים, בזבוז חלון הקשר, פרומפטים בלי מטמון ופעולות כתיבה שמפעילות מערכות בהמשך השרשרת. מחיר הוא החלק בסטאק שהספק שמח לדבר עליו. השליטה בשימוש היא החלק שהקונה צריך להחזיק בעצמו.
אם כל מודל מאושר בארגון היה נהיה זול ב-50 אחוז מחר, מי היה עוצר סוכן מלבזבז את החיסכון בסוף שבוע אחד?
הנחמה המדומה של “אינטליגנציה לדולר”

המעבדות ימשיכו לדבר על אינטליגנציה לדולר. הביטוי משרת היטב את סיפור היעילות שלהן, ומשמש מדד ניהולי גרוע.
אינטליגנציה לדולר לא אומרת לכם אם המשימה צריכה לרוץ על מודל חזית, על מודל עבודה, על מסווג, או בלי מודל בכלל. היא לא אומרת אם הפלט נבדק. היא לא אומרת אם לסוכן הייתה הרשאה להפעיל כלי שכותב. והיא לא אומרת אם החשבונית של החודש שעבר מתאימה לתהליך שעוד קיים.
משמעת עלויות ב-AI דומה יותר ל-FinOps מאשר לרכש. צריך מלאי של המודלים שבשימוש, נתיב ברירת מחדל לכל סוג משימה, תקרות ללולאות של סוכנים, רישום שמקשר טוקנים לצוות ולתהליך, וכלל שקובע מתי אסור להשתמש במודל זול יותר כי הנזק מתשובה שגויה גדול מהחיסכון.
זה איטי יותר מלהחליף את ברירת המחדל ב-Luna. זו גם הדרך היחידה שבה הורדת מחיר הופכת לחיסכון ולא לזינוק בשימוש.
DNLA Playbook לשליטה בעלויות מודלים
- הפרידו בין מחיר ליחידה לבין עלות התהליך. מדדו דולרים לתוצאה שהושלמה ונבדקה, לא דולרים למיליון טוקנים.
- הגדירו בעלים לכל נתיב מודל בייצור: מי מפעיל אותו, מי משלם, מי יכול לכבות אותו.
- נתבו לפי סוג משימה. סיווג, חילוץ נתונים, ניסוח וייעוץ בסיכון גבוה לא צריכים לחלוק מודל ברירת מחדל.
- הגבילו לולאות וניסיונות חוזרים של סוכנים. מודל זול עם קריאות לכלים בלי הגבלה הוא חשבון פתוח.
- רשמו טוקנים לפי צוות, מערכת וספק. אם הכספים לא רואים את הדרך מהחשבונית לתהליך, אין לכם שליטה.
- תקצבו לפי המחיר הסטנדרטי שפורסם, ורשמו כל הנחת מבצע כרווח אפשרי. מדדו מחדש את כמות הטוקנים בכל מעבר לדור מודל חדש.
- הריצו מחדש את חישוב build מול buy כשרמת מודלי העבודה זזה. הורדת מחיר יכולה להצדיק הישארות אצל ספק. היא יכולה גם להסתיר את העובדה שהמערכת עדיין לא מוכיחה ערך.
DNLA Take
גל המודלים הזולים של סוף יולי ואמצע אוגוסט בודק אם לחברה יש בכלל מערכת לניהול עלויות AI, וועדת הכספים צריכה להתייחס אליו כמבחן.
מחירי מחירון נמוכים מקלים להתחיל עוד עבודה ומקשים לשים לב שלעבודה אין בעלים, אין תקרה ואין תוצאה מדודה. חברות שכבר עוקבות אחרי שימוש לפי תהליך יהפכו את ההורדות לרווחיות. חברות שמסתכלות רק על המחירון יהפכו אותן לחשבון גדול ושקט יותר.
טוקן זול יותר אינו משמעת עלויות. משמעת עלויות היא לדעת אילו קריאות מותרות, איזה מודל רשאי לבצע אותן, ומה קורה כשהחשבונית והתוכנית העסקית מפסיקות להתאים.
רוצים שאותה קפדנות תוחל על מערכת ה-AI שלכם?
בדיוק לשם כך קיים QAi Health Check.