Счета за агентный ИИ пробивают бюджеты компаний — что сделать командам до масштабирования

Короткий ответ
Агентный ИИ сломал модель бюджета «за место». Uber исчерпал весь свой ИИ-бюджет на 2026 год примерно за четыре месяца после того, как развернул Claude Code для около 5000 инженеров, а 2 июля 2026 года Anthropic ответила новой аналитикой и контролем расходов для Claude Enterprise — дашбордами, показывающими затраты по командам и пользователям, оповещениями о превышении порогов расходов, правами на модели и аналитическим API. Урок не в том, что один инструмент дорогой. Он в том, что автономные агенты тарифицируются по токенам, потребляют их в масштабе, недоступном обычному чату, и делают старые финансовые прогнозы ненадёжными.
Решение — не более дешёвая модель и не более крупный бюджет. Решение — относиться к расходам на агентный ИИ как к дисциплине управления и инженерии: лимиты, атрибуция, маршрутизация моделей и ограничения усилий, введённые до того, как агенты масштабируются, а не после того, как придёт счёт.
Если вы собираетесь масштабировать ИИ-агентов в инженерии или операциях, сначала встройте защитные механизмы по затратам. Команды, у которых это получается, относятся к расходам агентов так же, как облачные команды десятилетие назад научились относиться к вычислениям — с атрибуцией, лимитами и оповещениями. Эта дисциплина — часть построения ИИ-агентов, которые переживают столкновение с реальным бюджетом, а не только демо.
Что произошло на самом деле?
Два события с разницей в несколько дней рассказывают одну историю с противоположных концов. Сначала — шок спроса: Uber развернул Claude Code от Anthropic в своей инженерной организации в декабре 2025 года, доля пользователей выросла примерно с трети инженеров в феврале до около 84%, классифицированных как agentic-coding-пользователи, к марту, а к апрелю компания израсходовала весь свой ИИ-бюджет на 2026 год — на четвёртом месяце года. Uber ограничил использование ИИ-инструментов сотрудниками 2 июня 2026 года, и об этом писали Bloomberg, TechCrunch, Forbes и Fortune. Средние затраты составили около $150–$250 на инженера в месяц, но продвинутые пользователи, оркестрирующие параллельных агентов, тратили $500–$2000, а технический директор Uber описал, как потратил около $1200 за одну двухчасовую сессию.
Затем — ответ со стороны предложения. 2 июля 2026 года Anthropic выпустила новую аналитику и средства контроля затрат для Claude Enterprise, нацеленные прямо на эту проблему: админ-дашборд, показывающий использование и затраты по группам и пользователям; оповещения о превышении порога расходов, срабатывающие на 75% и 90% лимита; настройки моделей по умолчанию и права доступа, задающие, с какой модели начинаются диалоги; видимость расходов по каждому пользователю; и Analytics API, экспортирующий данные в инструменты наблюдаемости вроде Datadog и CloudZero. Когда вендор выпускает управление расходами в том же новостном цикле, в котором знаковый клиент публично ограничивает использование, рынок подсказывает вам, где болит. Если вы разворачиваете разработку ИИ-агентов в продакшене, управление затратами теперь — часть сборки, а не то, о чём думают потом.
Почему счета за агентный ИИ ведут себя так по-другому?
Коренная причина — несовпадение моделей ценообразования. Традиционный SaaS оплачивается за место: предсказуемо, линейно, легко прогнозировать. Агентный ИИ оплачивается по токенам, и автономный агент потребляет токены по совершенно другой кривой. Исследование GitHub, опубликованное в мае 2026 года, показало, что agentic-задача по написанию кода может использовать порядка в 1000 раз больше токенов, чем стандартный однократный запрос, потому что агент подтягивает большой контекст, вызывает инструменты, рассуждает в несколько шагов и может продолжать работать ещё долго после того, как человек отвёл взгляд. Инженер, принимающий подсказки автодополнения, и инженер, оркестрирующий параллельных агентов по монорепозиторию, находятся на противоположных концах диапазона в 1000×, занимая при этом одну и ту же строку в таблице «за место».
Uber усугубил ситуацию, ранжируя инженеров во внутренних рейтингах по объёму использования Claude Code — превратив потребление токенов в игру за статус. Это поучительная история про стимулы, а не только про инструменты: вознаграждайте людей за сжигание токенов — и они будут их сжигать. Более глубокая мысль в том, что расходы агентов переменны, зависят от нагрузки и часто невидимы, пока их не измерят. Именно эту дисциплину командам по ИИ, ML и данным приходится встраивать с первого дня — инструментировать, куда уходят токены, по каждой команде, проекту и агенту, чтобы затраты были видимым инженерным сигналом, а не сюрпризом в конце квартала.
Это только проблема Uber?
Нет — Uber просто самая публичная точка данных. Отчёт FinOps Foundation State of FinOps 2026 сообщил, что у большинства компаний затраты на ИИ превысили изначальные прогнозы, а ответственность за управление расходами на ИИ распространилась примерно с трети FinOps-специалистов в 2025 году почти на всех в 2026-м. Индекс управления SaaS Zylo 2026 обнаружил, что большинство ИТ-руководителей столкнулись с непредвиденными счетами из-за ИИ-ценообразования по потреблению. Axios сообщил об одной компании, потратившей полмиллиарда долларов за один месяц после того, как раздала доступ к ИИ без лимитов использования. А в июне 2026 года CEO OpenAI сказал CNBC, что затраты превратились из темы, которая почти никогда не поднималась, во вторую по частоте озабоченность, которую он слышит от клиентов.
Прогнозные цифры не менее показательны. Обзор Gartner на 2026 год предупреждает, что значительная доля проектов агентного ИИ будет отменена к 2027 году из-за одного лишь перерасхода затрат — не из-за технического провала, не из-за отсутствия ценности, а из-за счетов, обогнавших бизнес-обоснование. Когда четыре разных сигнала — знаковый клиент, запуск продукта вендором, отраслевой опрос и прогноз аналитиков — сходятся на одной проблеме в течение нескольких недель, это структурный сдвиг, а не единичный случай.
Что это значит для команд разработки в США и ЕС
Если убрать заголовки, остаётся три следствия. Первое — коррекция прогнозирования: любой бюджет, который моделирует агентный ИИ как SaaS «за место», уже неверен. Затраты нужно моделировать по токенам и нагрузкам, с широким диапазоном разброса и жёстким потолком, потому что разница между лёгким и тяжёлым пользователем — не 3×, а может составлять три порядка величины. Финансам и инженерии нужен общий взгляд на эту кривую до масштабирования агентов, а не после.
Второе — управление затратами теперь инженерная функция, а не пункт в закупочном чек-листе. Средства контроля, которые Anthropic только что выпустила — лимиты, оповещения по порогам, права на модели, атрибуция затрат, аналитический API — это те же примитивы, что облачные команды выстраивали за десятилетие FinOps. Команды, которые относятся к расходам агентов как к первоклассной инженерной задаче — с атрибуцией по проектам и агентам и с более дешёвыми моделями, направленными на рутину — будут запускать агентов в масштабе экономно. Команды, которые прикручивают контроль после первого шока, проведут следующий квартал в разгребании последствий. Для регулируемых отраслей это усугубляется: в FinTech- или медицинском бизнесе неконтролируемый доступ агентов — это риск не только для бюджета, но и для управления данными, потому что каждый автономный вызов затрагивает системы, за которые GDPR и отраслевые правила возлагают на вас ответственность.
Третье — урок «строить против масштабировать». Чтобы упереться в эту стену, не нужен масштаб Uber в 5000 инженеров; команда среднего сегмента, давшая пятидесяти инженерам неуправляемый доступ к агентам, способна пропорционально сжечь квартальный бюджет так же быстро. Преимущество теперь у команд, которые пилотируют с включёнными защитными механизмами с первого дня — лимиты, ограничения усилий, атрибуция — и только затем масштабируются, а не масштабируются первыми и инструментируют после счёта.
Что сделать в этом квартале
Вот версия, готовая к внедрению. Отнеситесь к эпизоду с Uber и ответу Anthropic как к рыночному подтверждению, а затем поставьте защитные механизмы до того, как масштабироваться.
Повторяющаяся ошибка — относиться к агентному ИИ как к лицензии, которую покупают, а не к системе, которой управляют. Места статичны; агенты — это нагрузки, а нагрузки требуют лимитов, атрибуции и оповещений, как любая другая продакшен-стоимость. Команды, которые это усваивают, сочетают ясный бизнес-результат с дисциплинированной инженерией затрат с самого начала.
Ничто из этого не является инвестиционным или юридическим советом, и ваши конкретные обязательства зависят от ваших данных, отрасли и юрисдикции. Но стратегический сигнал трудно не заметить: ИИ-индустрия только что потратила целый новостной цикл на признание, что расходы агентов — это новая сложная проблема. Преимущество у команд, которые относятся к затратам как к инженерной дисциплине — инструментированной, ограниченной лимитами и распределённой по атрибуции — пока они масштабируются, а не после того, как придёт счёт.
Частые вопросы
Почему счета за агентный ИИ так отличаются? Потому что агенты тарифицируются по токенам, а не по местам, и потребляют их в масштабе, недоступном прежним чат-инструментам. Исследование GitHub от мая 2026 года показало, что agentic-задача по коду может использовать порядка в 1000 раз больше токенов, чем однократный запрос. В Uber средние затраты составляли $150–$250 на инженера в месяц, тогда как продвинутые пользователи тратили $500–$2000, а технический директор сообщил, что потратил около $1200 за одну двухчасовую сессию. Бюджет «за место» не способен предсказать такой разброс.
Что именно выпустила Anthropic? Новую аналитику и контроль затрат: дашборд, показывающий использование и затраты по группам и пользователям, метрики Claude Code и Analytics API, экспортирующий в инструменты вроде Datadog и CloudZero; плюс настройки моделей по умолчанию и права доступа, оповещения о превышении порога расходов на 75% и 90%, видимость расходов по каждому пользователю и Admin API — в дополнение к уже существующим лимитам расходов и контролю усилий.
Это проблема всей отрасли? Да. State of FinOps 2026 показал, что большинство компаний превысили прогнозы затрат на ИИ, а ответственность FinOps за расходы на ИИ выросла примерно с трети специалистов почти до всех за год. В июне 2026 года CEO OpenAI сказал CNBC, что затраты стали второй по частоте озабоченностью, которую он слышит, а Gartner предупреждает, что значительная доля проектов агентного ИИ будет отменена к 2027 году из-за одного лишь перерасхода.
Не решат ли проблему более дешёвые модели? Нет. Цены за токен резко упали — отраслевые оценки говорят о снижении смешанной стоимости передовых моделей примерно на две трети год к году — но внедрение и число токенов на задачу растут быстрее, чем падают удельные цены, поэтому итоговые счета продолжают расти. Управление затратами, а не ожидание более дешёвых моделей — вот что сохраняет доступность агентного ИИ в масштабе.
Что делать прямо сейчас? Относиться к этому как к дисциплине FinOps и инженерии: включить лимиты расходов и оповещения по порогам на уровне организации, команды и пользователя; распределять затраты по командам, проектам и агентам; направлять более дешёвые модели на рутину и оставлять премиум-модели для сложных задач; задавать лимиты усилий и контекста; избегать стимулов, вознаграждающих сжигание токенов. Постройте защитные механизмы до масштабирования, а не после счёта.