AI Development Retrospective · 2–7 августа 2026

TASK-source-reuse-project-documents

Куда ушли 330,1 млн токенов и $180,47, почему review (ревью) оказалось дороже первоначальной разработки и как сократить расход на 64–76%.

Исходный Markdown PR #2814 191 файл · 42 commits

Итог в цифрах

Общий расход330,1 млнraw tokens (сырых токенов)
Cached input96,8%повторно переданный контекст
Вызовы модели2 82818,5 на запрос пользователя
Расход после первого PR92,6%305,6 млн токенов

Эквивалентная стоимость

Cached input$125,82 · 69,7%
Fresh input$39,38 · 21,8%
Output$15,28 · 8,5%

Pay-per-token equivalent (эквивалент при оплате за токены). Фактическое списание по Codex subscription может отличаться.

Стоимость по моделям

gpt-5.6-sol
$147,90 · 82,0%
gpt-5.6-terra
$32,57 · 18,0%
МодельFresh inputCached inputOutput
gpt-5.6-sol$5,00 / 1M$0,50 / 1M$30,00 / 1M
gpt-5.6-terra$2,00 / 1M$0,20 / 1M$12,00 / 1M

Цены взяты из локального analytics report (аналитического отчёта), собранного 8 августа 2026 года.

Календарное время

10,7% 89,3%
Agent active: 773 минHuman wait: 6 439 мин

7 212 минут, или около 120 часов полного elapsed time (календарного времени).

Размер итогового diff

1 737 2 761 310
Code/configTestsDocs/todo

4 824 строки: +4 155 / −669. На одну итоговую строку пришлось около 68,4 тыс. raw tokens.

Куда ушли токены

Взаимоисключающая классификация по доминирующему действию model call (вызова модели).

Обсуждение и reasoning
117,8 млн · $51,99
Анализ и review
98,1 млн · $64,25
Tool feedback
57,2 млн · $32,58
Правки файлов
47,3 млн · $26,85
Commit и PR delivery
7,1 млн · $2,74
Оркестрация
2,6 млн · $2,07

Измеримый overhead

Tool feedback17,3%
Delivery2,2%
Оркестрация0,8%
Инженерная работа79,7%

66,9 млн токенов, $37,39 и 563 вызова модели — измеримый non-development operational overhead (операционный расход вне анализа и правок).

make check feedback loop

Всего запусков27
До первого PR7
После первого PR20
До первого PR
6,7 / 24,5 млн
После первого PR
50,5 / 305,6 млн

57,2 млн токенов, или $32,58, — нижняя граница стоимости проверок. Верхняя граница вместе со всеми последующими правками — 104,5 млн, но она включает изменения по замечаниям пользователя.

Ограничение финальной проверки

Последний полный make check не стал полностью green (успешным) из-за двух зафиксированных несвязанных Integration errors: ModelPriceModel::getProvider и InvitationModel::getCount. Targeted checks, static analysis, unit tests и Source pipeline прошли; пользователь принял это состояние.

Расход по этапам

Первичная разработка
15,4 млн · 4,7%
Первичное review
9,3 млн · 2,8%
Замечания пользователя
276,6 млн · 83,8%
E2E и финализация
28,7 млн · 8,7%
ЭтапAgent activeHuman waitВызовы
Первичная разработка285,1 мин0 мин240
Self-review и code review21,6 мин294,6 мин129
Проверка PR и исправления411,1 мин6 133,4 мин2 234
Cross-user E2E и финализация55,5 мин11,2 мин225

Где возник основной rework

API и domain model
102,5 млн · 31,0%
CreateByUri и workflow
124,8 млн · 37,8%
Atomic events и pipeline
49,4 млн · 15,0%

Около 69% всех токенов ушло на две группы проблем: границы API/domain relation и перепроектирование CreateByUri с Source workflow.

Что в итоге улучшилось

  • Readiness (готовность) стала project-scoped (ограниченной проектом).
  • Состояние подготовки перенесено в relation Source ↔ Project.
  • Document List освобождён от посторонней ответственности.
  • Уточнены transaction и event boundaries (границы транзакций и событий).
  • Убраны необоснованные locks и прямые вызовы handler.
  • Cross-user E2E покрывает общий Source для двух пользователей.
  • Финальный Source pipeline: 17 tests, 235 assertions.

Главные изменения процесса

1
Architecture Gate до реализации

Зафиксировать ownership, API, transaction/event boundaries, global и project-scoped state.

2
Компактный handoff сабагенту

Передавать commit range, conventions, invariants и нужные файлы вместо всей истории.

3
Batch review по pattern

После первого системного замечания проверять весь diff на аналогичные нарушения.

4
Review только стабильного решения

Порядок: архитектура → реализация → targeted tests → self-review → independent review.

5
Остановка после третьего rework

Вместо локальной четвёртой правки выполнить root-cause review и перепроектировать блок целиком.

6
Baseline checks до разработки

Сохранить исходные ошибки и состояние Source pipeline, чтобы не расследовать чужой drift.

Прогноз экономии

Baseline (фактический результат): 330 млн токенов

Консервативный процесс
$66–82 · −55–64%
Реалистичная цель
$44–66 · −64–76%
Оптимистичный сценарий
$33–44 · −76–82%

Основной рычаг: ограничить повторную передачу контекста. 96,8% input составлял cached context, а не новый ввод. Dollar forecast (прогноз в долларах) предполагает неизменное соотношение моделей и типов токенов.

Методика и ограничения