Keynote briefing · рабочая версияПрезентация · 14 августа 2026

AI становится дешевле. Но работа агентов — не обязательно.

Рынок уже умеет считать токены и ставить лимиты. Настоящая проблема начинается там, где нужно связать расход с результатом, объяснить перерасход и безопасно изменить workflow без потери качества.

Что доказано

AI-spend уже стал зоной ответственности FinOps; agentic workflows создают большой и нестабильный расход; cost-per-attempt систематически недооценивает реальную цену результата.

Что выглядит перспективно

Customer-side attribution и reconciliation, структурные guardrails и eval-verified оптимизация на уровне workflow — не ещё один dashboard.

Что не доказано

Покупатель, готовность платить, заменяемый бюджет, доступная доля spend и самостоятельный TAM. Один разговор с инженером этого не чинит, как ни крути.

/01
Цифры для первых слайдов

Шесть чисел, которые выдерживают вопрос «откуда это?»

У каждой цифры есть provenance и ограничение. Они поддерживают urgency и проблему измерения, но не заменяют buyer proof.

98%

FinOps-команд уже управляют AI-spend

Рост с 31% в 2024 до 63% в 2025 и 98% в 2026. Это подтверждает актуальность проблемы, но не спрос на отдельный продукт.

Сильный отраслевой сигнал
CLM-0029 · State of FinOps 2026
$37B

оценка enterprise GenAI spend в 2025

Menlo: 3,2× год к году, из них $19B — application layer. Это survey + market model, не audited revenue и не наш TAM.

Направление рынка
CLM-0310 · Menlo Ventures · Enterprise AI 2025
4,17M

токенов на одну agentic coding task в среднем

В исследовании восьми frontier-моделей на SWE-bench Verified. Agentic task использовала примерно в 1000× больше токенов, чем code chat/reasoning.

Независимое измерение
CLM-0088 · Bai et al. · How Do AI Agents Spend Your Money?
30×

разброс токенов на одной и той же задаче

Повторные запуски одной задачи давали до 30× разницы; больше токенов не означало выше accuracy. Вариативность — часть экономики агента.

Независимое измерение
CLM-0298 · Bai et al. · repeated runs
2,63×

ошибка между cost-per-attempt и cost-per-solved

Для строки HAL с 38% accuracy цена меняется с $0.134 за попытку до $0.353 за решённую задачу — ещё до human review.

Проверяемый denominator effect
CLM-0798 · HAL · перерасчёт Unreal Labs
/02
Что мы знаем

Не одна находка, а связная причинная цепочка.

01

Расход быстро растёт, но публичная картина фрагментирована

Доллары, токены, seats, GPU-hours и requests — разные ряды. Их нельзя складывать в одну красивую кривую. Направление роста надёжнее его точного масштаба.

Основание

Menlo даёт $37B; Ramp сообщает 110T проанализированных токенов у 1,300+ компаний; OpenRouter показывает крупный public-traffic sample. Ни один источник не является полной enterprise-панелью.

02

У агентов экономика траектории, а не одного вызова

Delegation, retries, replayed context, tools, memory и human review делают стоимость стохастической. Оптимизировать один prompt — всё равно что экономить бензин, не замечая, что водитель заблудился.

Основание

4,17M токенов в среднем на coding task; до 30× вариативности на одинаковой задаче.

03

Visibility и базовые controls уже commodity

Providers, gateways, observability и FinOps-продукты уже дают tracing, budgets, alerts, caching, batch и routing. Ещё один cost dashboard — слабый wedge.

Основание

Adversarial review подтвердил существование hard budgets и eval-gated intervention; residual gap стал заметно уже.

04

Правильная единица — принятый результат

North star: fully loaded cost per accepted successful workflow. Внутри — failed runs, retries, review, integration, latency и reliability, а quality остаётся guardrail.

Основание

Публичные benchmark-ы частично считают API cost, но не закрывают human-accepted business outcome.

/03
Surviving thesis

Не FinOps-дашборд. Control layer между telemetry и безопасным изменением workflow.

Чем ближе к outcome и безопасному действию, тем меньше commodity. Но одновременно выше требования к данным, deployment и доверию.

01

Reconcile

Свести provider bills, private pricing, credits и traces до invoice-grade факта.

02

Attribute

Привязать расход к owner, agent, delegation path, use case и принятому outcome.

03

Diagnose

Найти structural waste: retries, loops, duplicated context, wrong tiers, missing cache.

04

Intervene

Предложить bounded change; semantic change проходит eval, approval, verification и rollback.

Enterprise boundary

Для enterprise это, вероятно, customer-side / VPC / self-hosted execution. Первое интервью уже показало, что внешний доступ к traces и invoices может быть запрещён политикой.

/04
Новый routing thesis

Routing layer усиливает тезис — но не подтверждает бизнес автоматически

Persistent agents требуют identity, permissions, durable state, delegation, retries, budgets, evaluation и audit. Поэтому cost layer естественно живёт в runtime/control plane, а не в отдельной таблице после факта.

Что он усиливает
  • Единица атрибуции расширяется: request → agent → task → delegation graph → accepted outcome.
  • Routing становится одним из optimization levers наряду с caching, retry policy и context control.
  • Policy и budget можно применять до и во время выполнения, а не только объяснять счёт постфактум.
Чего он не доказывает
  • Что horizontal agent collaboration станет отдельной большой категорией.
  • Что enterprise купит независимую платформу вместо облака, Glean, Archestra или внутренней системы.
  • Что buyer и budget line совпадают у routing runtime и cost optimization.
/05
Как проводилось исследование

Понятно, но без магии «40 агентов согласились».

Модели помогали искать и атаковать claims. Доказательствами оставались source chains, а согласие моделей само по себе не считалось независимым подтверждением.

01

Сначала определили вопрос

Не «как сэкономить токены», а «можно ли снизить полную стоимость принятого результата без ухудшения качества».

02

Разложили рынок на competing hypotheses

Восемь гипотез, включая existing-tools null и сценарий, где падение цен убивает боль.

03

Собрали и нормализовали web evidence

40 research runs, 810 canonical claims, source tiers, contradictions и дедупликация source chains.

04

Атаковали собственный вывод

Independent audits и adversarial verification сузили thesis; generic dashboard и universal proxy не выдержали.

05

Перешли к primary proof

Теперь интернет уже не закроет гейты: нужны buyer interviews, приватные artifacts и эксперимент на реальных задачах.

/06
Открытые гейты

Вот где заканчиваются факты и начинается следующая работа.

0 buyer-grade interviews

Кто реально покупатель?

FinOps/Finance, AI Platform и Engineering/Product interviews.

WTP не подтверждён

За что он заплатит?

Проверить replaceable budget: tooling, cloud waste, consulting, incidents или engineering time.

0 customer artifacts

Доступны ли данные?

Получить redacted invoice/export + traces + owner/workflow metadata.

0 real-task pilots

Работает ли оптимизация?

50–100 frozen tasks, repeated runs, quality non-inferiority, review cost.

Не решено

Это продукт или feature?

Falsifier: incumbent/gateway закрывает reconciliation + approved verified change достаточно хорошо.

/07
Reading list

Что прочитать сегодня вечером — в порядке полезности.

Не 611 ссылок. Шесть материалов, после которых можно уверенно объяснить тезис и его ограничения.

/08
Pitch-deck skeleton

Двенадцать слайдов. Одна мысль на слайд.

Стрелки клавиатуры переключают структуру. Это narrative outline, не попытка запихнуть весь research corpus на проектор.

Черновик слайда 011 / 12

AI становится дешевле. Работа агентов — не обязательно.

Открыть парадоксом: unit prices падают, но агентные workflows увеличивают объём, вариативность и скрытую работу.

Визуал

Одна линия: цена модели ↓ / стоимость принятого результата ?

Основание

Epoch price decline + agentic consumption study

/09
Формулировки

Что говорить — и где лучше не разгоняться.

Говорить
  • AI-spend и agentic consumption растут; базовые controls уже становятся стандартом.
  • Agentic workflows требуют task-level, outcome-aware accounting.
  • Наш surviving wedge узкий и проверяемый: customer-side attribution + structural/eval-gated optimization.
  • Коммерческая гипотеза ещё не закрыта; следующий этап именно про buyer proof.
Не говорить
  • «$37B — это наш TAM». Нет, это modelled enterprise GenAI spend.
  • «Мы гарантируем 30% экономии». Granola правильно подсветила: без baseline и outcome это декоративный процент.
  • «Никто не делает attribution или optimization». Делают; вопрос в completeness, correctness и customer boundary.
  • «Интервью подтвердило спрос». Оно подтвердило workflow pain и constraints, не urgency, WTP или authority.
Keynote briefing · 11 августа 2026

Все числа на странице либо связаны с canonical claim ID, либо явно помечены как внутренний synthesis. Reachability URL не считается content verification.