Живое исследованиеОбновлено 13 авг., 17:38

Unreal Labs · evidence-программа

От токенов
к результатам.

Проверяем, может ли управление стоимостью AI-workflows стать большим бизнесом — и не обманываем ли мы себя красивыми процентами экономии.

Главный denominator
(provider + infra + failures + review + engineering) / принятый успешный workflow

Качество treatment должно оставаться в preregistered non-inferiority ε.

Как мы к этому пришли
40
research runs
26 discovery · 10 audit · 4 adversarial
810
канонических claims
816 raw evidence cards
611
source URLs
543 технически доступны
22
противоречий
храним явно, не усредняем
22
продуктов / сущностей
capability и market map
10
company cases
9 public · 1 primary interview
/01
Путь исследования

Мы не прыгаем сразу к продукту.

Каждый этап убирает отдельный класс самообмана: от иллюзии согласия до ложной экономии и выдуманного спроса покупателей.

Сейчас06 / 09

Данные от покупателей и операторов

Вышли из интернета в реальность

ListenLabs и тёплые интервью должны найти прямые инциденты, владельца, подписанта, заменяемый бюджет, доступ к артефактам и готовность к пилоту.

1 завершено · 0 подтверждений покупателя · 0 артефактов
/02
После 40 исследовательских запусков

Что пережило проверку.

Это не финальное решение о продукте, а текущий набор тезисов, которые не сломались после независимого аудита и попыток опровержения.

Метрикавыжило

Полная стоимость одного принятого успешного workflow

Токены и экономия по list price — промежуточные переменные, а не бизнес-результат.

01
Возможный wedgeусловно

Customer-side reconciliation + structural correctness

Только если доказаны invoice accuracy, traffic coverage, ownership и WTP.

02
Изменениявыжило

Сначала deterministic waste; semantic changes — за eval gates

Loops, retry budgets и очевидный payload waste безопаснее автономных изменений, влияющих на качество.

03
Архитектуравыжило

Гибридные data/control planes вместо одного universal proxy

Provider API, SaaS seats, browsers, endpoints и self-hosted workloads дробят coverage.

04
Не продуктовая ниша

Что мы перестали продавать самим себе

01Generic tracing / observability как самостоятельный wedge
02Hard budgets и alerts как дифференциация
03Universal benchmark comparison без task-specific evals
04Сэкономленные токены как главная outcome-метрика
05Funding, logos, stars или keyword volume как customer demand
/03
Конкурирующие гипотезы

Восемь способов оказаться неправыми.

Выбери гипотезу: справа — текущая оценка, контргипотеза и конкретный признак опровержения. Открытая гипотеза означает ровно «открыта», а не «почти доказана».

Возможный wedgeH-A

Атрибуция остаётся ручной, но invoice-grade точность и срочность ещё не доказаны.

Компании видят общий AI-spend, но не могут надёжно связать его с workflow, фичей, пользователем, агентом или инженерным решением.

Контргипотеза

Текущие billing, gateway и observability-системы уже дают покупателям достаточную атрибуцию.

Что её опровергнет

Несколько репрезентативных компаний распределяют spend по принятым бизнес-результатам с минимальным ручным трудом в текущих инструментах.

/04
Первичные данные · волна 01

Первый ответ не подтвердил покупателя.

Зато показал реальный рабочий процесс, ограничения доступа и предпочтительный порядок продуктовых концепций. Полезный направляющий сигнал, но пока не валидация покупателя.

Eval-gated optimization выбрали первым, но все концепции оказались «полезными, но не срочными».
Текущий рабочий процесс

Backend logs + внутренние отчёты + spreadsheets + ручные A/B tests.

Блокер внедрения

Политика компании запрещает передавать наружу invoices, traces, usage exports и workflow diagrams.

5
стартов
1
завершено
0
подтверждений покупателя
0
артефактов
0
согласий на пилот
3
квота инженеров
3 Engineering + по 1 на остальные когорты; инженеры дают operator evidence, но не заменяют buyer proof.
/05
Библиотека оптимизаций

Что вообще можно оптимизировать.

Одиннадцать рычагов: безопасные структурные ограничения, изменения за гейтом оценки и решения, зависящие от загрузки и операционной экономики.

LEV-001Кэширование промптаПовторно использовать стабильные префиксы prompt/context через provider prompt caching.средняя
LEV-002Пакетная обработкаАсинхронная batch-обработка у провайдера.низкая
LEV-003Маршрутизация моделейРаспределять или каскадировать задачи между дешёвыми и сильными моделями.высокая
LEV-004Сокращение контекстаУбирать лишний context, system и tool payload, сохраняя состояние задачи.высокая
LEV-005Стратегия capacityВыбирать pay-as-you-go или provisioned throughput по реальной утилизации.высокая
LEV-006Бюджеты и квотыОграничивать budgets и alerts по проекту, команде или ключу.средняя
LEV-007Контроль loops и retriesОграничивать retries и находить no-progress или tool loops.средняя
LEV-008Self-hosted моделиИспользовать fine-tuned open-weight или self-hosted модели для подходящих turns.высокая
LEV-009Отложенная загрузка toolsЗагружать через tool search только релевантные schemas.не указана
LEV-010Выполнение через кодГде безопасно, заменять разговорную tool choreography на code execution или CLI.не указана
LEV-011Семантический кэшПовторно использовать семантически эквивалентные ответы, а не только byte-identical prefixes.не указана
/06
Гейты решения

Что должно случиться до решения о пивоте.

Исследование по открытым источникам закончено. Остальные доказательства нельзя получить ещё одним красивым отчётом — нужны люди, приватные данные и парный эксперимент.

G1

Подтверждение покупателя

3–5 интервью: Finance/FinOps, AI Platform, Engineering/Product

сейчас1
G2

Доступ к данным

≥1 redacted invoice + traces + owner/workflow sample

заблокирован0
G3

Техническое подтверждение

База против изменения на 50–100 реальных задачах

в очереди0
G4

Коммерческое подтверждение

Подтверждены подписант, готовность платить и заменяемый бюджет

заблокирован0
Коммерческий риск

Технический пробел может существовать без отдельного большого бизнеса.

K01 · рыноксредне-высокая

Модели дешевеют быстрее, чем растёт полезное потребление.

K02 · конкуренциявысокая

Существующие инструменты уже закрывают достаточно workflow.

K03 · платформавысокая

Провайдеры коммодитизируют независимые cost controls.

K04 · архитектуравысокая

Central proxy видит слишком мало трафика или создаёт security risk.

K05 · валидациявысокая

Цена task-specific evals съедает найденную экономию.

K06 · коммерциявысокая

Нет владельца одновременно с болью и бюджетом.

K07 · правонеизвестно

Data access и terms блокируют deployment.

K08 · moatвысокая

Dashboard и recommendations легко копируются и не создают moat.

Текущий тезис

Узкая техническая возможность.
Коммерческое подтверждение ещё впереди.

Возможная ниша — сверка и атрибуция на стороне клиента, структурная корректность и изменения за гейтом оценки. Но покупатель, подписант, готовность платить, заменяемый бюджет и доступная доля расходов пока не доказаны.

Вернуться к этапам
Собрано из канонического workspace

/Users/artyom/Documents/docs/token-usage-efficiency

Доступность URL не подтверждает содержание.
Согласие моделей не является независимым evidence.
Keyword и social signals описывают язык, но не TAM или adoption.
Private interview estimates ограничены directness, scope и authority.