AI-spend уже стал зоной ответственности FinOps; agentic workflows создают большой и нестабильный расход; cost-per-attempt систематически недооценивает реальную цену результата.
AI становится дешевле. Но работа агентов — не обязательно.
Рынок уже умеет считать токены и ставить лимиты. Настоящая проблема начинается там, где нужно связать расход с результатом, объяснить перерасход и безопасно изменить workflow без потери качества.
Customer-side attribution и reconciliation, структурные guardrails и eval-verified оптимизация на уровне workflow — не ещё один dashboard.
Покупатель, готовность платить, заменяемый бюджет, доступная доля spend и самостоятельный TAM. Один разговор с инженером этого не чинит, как ни крути.
Шесть чисел, которые выдерживают вопрос «откуда это?»
У каждой цифры есть provenance и ограничение. Они поддерживают urgency и проблему измерения, но не заменяют buyer proof.
FinOps-команд уже управляют AI-spend
Рост с 31% в 2024 до 63% в 2025 и 98% в 2026. Это подтверждает актуальность проблемы, но не спрос на отдельный продукт.
оценка enterprise GenAI spend в 2025
Menlo: 3,2× год к году, из них $19B — application layer. Это survey + market model, не audited revenue и не наш TAM.
токенов на одну agentic coding task в среднем
В исследовании восьми frontier-моделей на SWE-bench Verified. Agentic task использовала примерно в 1000× больше токенов, чем code chat/reasoning.
разброс токенов на одной и той же задаче
Повторные запуски одной задачи давали до 30× разницы; больше токенов не означало выше accuracy. Вариативность — часть экономики агента.
за которые Uber исчерпал годовой AI-coding budget
Один громкий company case, не prevalence. После этого появился лимит $1,500 на сотрудника на инструмент в месяц.
ошибка между cost-per-attempt и cost-per-solved
Для строки HAL с 38% accuracy цена меняется с $0.134 за попытку до $0.353 за решённую задачу — ещё до human review.
Не одна находка, а связная причинная цепочка.
Расход быстро растёт, но публичная картина фрагментирована
Доллары, токены, seats, GPU-hours и requests — разные ряды. Их нельзя складывать в одну красивую кривую. Направление роста надёжнее его точного масштаба.
Menlo даёт $37B; Ramp сообщает 110T проанализированных токенов у 1,300+ компаний; OpenRouter показывает крупный public-traffic sample. Ни один источник не является полной enterprise-панелью.
У агентов экономика траектории, а не одного вызова
Delegation, retries, replayed context, tools, memory и human review делают стоимость стохастической. Оптимизировать один prompt — всё равно что экономить бензин, не замечая, что водитель заблудился.
4,17M токенов в среднем на coding task; до 30× вариативности на одинаковой задаче.
Visibility и базовые controls уже commodity
Providers, gateways, observability и FinOps-продукты уже дают tracing, budgets, alerts, caching, batch и routing. Ещё один cost dashboard — слабый wedge.
Adversarial review подтвердил существование hard budgets и eval-gated intervention; residual gap стал заметно уже.
Правильная единица — принятый результат
North star: fully loaded cost per accepted successful workflow. Внутри — failed runs, retries, review, integration, latency и reliability, а quality остаётся guardrail.
Публичные benchmark-ы частично считают API cost, но не закрывают human-accepted business outcome.
Не FinOps-дашборд. Control layer между telemetry и безопасным изменением workflow.
Чем ближе к outcome и безопасному действию, тем меньше commodity. Но одновременно выше требования к данным, deployment и доверию.
Reconcile
Свести provider bills, private pricing, credits и traces до invoice-grade факта.
Attribute
Привязать расход к owner, agent, delegation path, use case и принятому outcome.
Diagnose
Найти structural waste: retries, loops, duplicated context, wrong tiers, missing cache.
Intervene
Предложить bounded change; semantic change проходит eval, approval, verification и rollback.
Для enterprise это, вероятно, customer-side / VPC / self-hosted execution. Первое интервью уже показало, что внешний доступ к traces и invoices может быть запрещён политикой.
Routing layer усиливает тезис — но не подтверждает бизнес автоматически
Persistent agents требуют identity, permissions, durable state, delegation, retries, budgets, evaluation и audit. Поэтому cost layer естественно живёт в runtime/control plane, а не в отдельной таблице после факта.
- Единица атрибуции расширяется: request → agent → task → delegation graph → accepted outcome.
- Routing становится одним из optimization levers наряду с caching, retry policy и context control.
- Policy и budget можно применять до и во время выполнения, а не только объяснять счёт постфактум.
- Что horizontal agent collaboration станет отдельной большой категорией.
- Что enterprise купит независимую платформу вместо облака, Glean, Archestra или внутренней системы.
- Что buyer и budget line совпадают у routing runtime и cost optimization.
Понятно, но без магии «40 агентов согласились».
Модели помогали искать и атаковать claims. Доказательствами оставались source chains, а согласие моделей само по себе не считалось независимым подтверждением.
Сначала определили вопрос
Не «как сэкономить токены», а «можно ли снизить полную стоимость принятого результата без ухудшения качества».
Разложили рынок на competing hypotheses
Восемь гипотез, включая existing-tools null и сценарий, где падение цен убивает боль.
Собрали и нормализовали web evidence
40 research runs, 810 canonical claims, source tiers, contradictions и дедупликация source chains.
Атаковали собственный вывод
Independent audits и adversarial verification сузили thesis; generic dashboard и universal proxy не выдержали.
Перешли к primary proof
Теперь интернет уже не закроет гейты: нужны buyer interviews, приватные artifacts и эксперимент на реальных задачах.
Вот где заканчиваются факты и начинается следующая работа.
Кто реально покупатель?
FinOps/Finance, AI Platform и Engineering/Product interviews.
За что он заплатит?
Проверить replaceable budget: tooling, cloud waste, consulting, incidents или engineering time.
Доступны ли данные?
Получить redacted invoice/export + traces + owner/workflow metadata.
Работает ли оптимизация?
50–100 frozen tasks, repeated runs, quality non-inferiority, review cost.
Это продукт или feature?
Falsifier: incumbent/gateway закрывает reconciliation + approved verified change достаточно хорошо.
Что прочитать сегодня вечером — в порядке полезности.
Не 611 ссылок. Шесть материалов, после которых можно уверенно объяснить тезис и его ограничения.
Самое короткое объяснение, что выжило, что сузилось и почему web-фаза закончена.
15 минПочему AI-spend уже оказался у FinOps и где организационно находится buyer/operator.
15 минЛучшее числовое основание для тезиса о масштабе и вариативности agentic token consumption.
12 минКонтекст роста spend — с обязательной оговоркой, что это модель рынка, а не audited revenue/TAM.
10 минАрхитектурная рамка: почему budgets, evaluation, delegation и audit сходятся в runtime.
8 минЧто один инженер подтвердил про workflow и security boundary — и чего он не подтвердил про urgency/WTP.
Двенадцать слайдов. Одна мысль на слайд.
Стрелки клавиатуры переключают структуру. Это narrative outline, не попытка запихнуть весь research corpus на проектор.
AI становится дешевле. Работа агентов — не обязательно.
Открыть парадоксом: unit prices падают, но агентные workflows увеличивают объём, вариативность и скрытую работу.
Одна линия: цена модели ↓ / стоимость принятого результата ?
Epoch price decline + agentic consumption study
Что говорить — и где лучше не разгоняться.
- AI-spend и agentic consumption растут; базовые controls уже становятся стандартом.
- Agentic workflows требуют task-level, outcome-aware accounting.
- Наш surviving wedge узкий и проверяемый: customer-side attribution + structural/eval-gated optimization.
- Коммерческая гипотеза ещё не закрыта; следующий этап именно про buyer proof.
- «$37B — это наш TAM». Нет, это modelled enterprise GenAI spend.
- «Мы гарантируем 30% экономии». Granola правильно подсветила: без baseline и outcome это декоративный процент.
- «Никто не делает attribution или optimization». Делают; вопрос в completeness, correctness и customer boundary.
- «Интервью подтвердило спрос». Оно подтвердило workflow pain и constraints, не urgency, WTP или authority.