Сначала доказательства

Как мы определяем,
что задача выполнена

Как VOLY отделяет заявление AI-агента о завершении от принятого инженерного результата.

Пройти анкету

04 меры →

Что считается реальным успехом?

Главная экономическая единица — не стоимость запуска и не количество сгенерированного кода, а цена подтверждённо выполненной задачи.

01

Verified Success Rate

accepted tasks / all tasks
02

False Completion Rate

reported done, but rejected
03

Cost per Verified Task

total cost / accepted tasks
04

Scope Drift

runs with unrequested changes

Гипотезы исследования

Не верим архитектуре на слово

Multi-agent workflow не считается лучше по определению. Он должен доказать преимущество по качеству, стоимости результата или восстановлению после ошибок.

H1

Agent said done ≠ task completed

Reported success систематически выше результата, подтверждённого тестами, diff и code review.

H2

Roles can reduce false completion

Архитектор, разработчик и ревьюер должны показать преимущество над одним универсальным агентом.

H3

Gates can contain scope drift

Plan gate, protected paths и file limits проверяются как инструменты снижения незапрошенных изменений.

Architecture ≠ outcome

Одна задача.
Четыре режима.

Каждая архитектура получает одинаковый исходный commit, постановку задачи, бюджет времени и заранее замороженные критерии приёмки.

РежимМеханикаЗачемСтатус
Single agentОдин агент делает всёДешевле и быстрее для простых задачBaseline
Supervisor–WorkerОркестратор назначает специалистовКонтроль ролей и handoffPrimary
Debate / CritiqueАгенты оспаривают результатСложные решения и reviewSelective
SwarmМного простых агентов параллельноМассовый анализFuture
10 шагов

От чистого commit
к проверенному результату

  1. RestoreВосстановить эталонный commit и чистый working tree.
  2. FreezeЗафиксировать scope, acceptance criteria и abort rules.
  3. RunЗапустить режим с одинаковым бюджетом времени и попыток.
  4. CaptureСохранить команды, tool calls, токены, стоимость и fallback.
  5. DiffПолучить список изменённых файлов и diff hash.
  6. TestЗапустить тесты, линтер, сборку и security checks.
  7. ScopeПроверить protected paths и незапрошенные изменения.
  8. ReviewПровести слепую человеческую оценку результата.
  9. SeparateХранить reported success отдельно от acceptance result.
  10. ResetСбросить среду перед следующим исполнителем.

опрос 1–2 мин · интервью 30 мин

Что происходит в реальных командах?

01Использование

Какие AI coding tools использует команда, как часто и для каких типов задач?

02Завершение

Что считается готовностью: ответ агента, diff, тесты, review, merge или production metric?

03Ошибки

Как часто агент говорит «готово», меняет лишнее или создаёт регрессию?

04Экономика

Видит ли команда стоимость задачи и что происходит при исчерпании квоты?

05Доверие

Какие доказательства нужны, чтобы принять результат без полного ручного повторения работы?

Редакционная честность

Что можно писать.
И что пока нельзя.

Можно

В нашем эксперименте N из M задач прошли acceptance criteria.

На выбранном test bank role workflow показал…

По самоотчётам участников…

Нельзя без данных

Большинство компаний… при нерепрезентативной выборке.

Multi-agent всегда лучше и дешевле.

Выдавать roadmap или внешнюю цифру за результат VOLY.