Verified Success Rate
accepted tasks / all tasksСначала доказательства
Как VOLY отделяет заявление AI-агента о завершении от принятого инженерного результата.
Пройти анкету04 меры →
Главная экономическая единица — не стоимость запуска и не количество сгенерированного кода, а цена подтверждённо выполненной задачи.
accepted tasks / all tasksreported done, but rejectedtotal cost / accepted tasksruns with unrequested changesГипотезы исследования
Multi-agent workflow не считается лучше по определению. Он должен доказать преимущество по качеству, стоимости результата или восстановлению после ошибок.
Reported success систематически выше результата, подтверждённого тестами, diff и code review.
Архитектор, разработчик и ревьюер должны показать преимущество над одним универсальным агентом.
Plan gate, protected paths и file limits проверяются как инструменты снижения незапрошенных изменений.
Architecture ≠ outcome
Каждая архитектура получает одинаковый исходный commit, постановку задачи, бюджет времени и заранее замороженные критерии приёмки.
опрос 1–2 мин · интервью 30 мин
Какие AI coding tools использует команда, как часто и для каких типов задач?
Что считается готовностью: ответ агента, diff, тесты, review, merge или production metric?
Как часто агент говорит «готово», меняет лишнее или создаёт регрессию?
Видит ли команда стоимость задачи и что происходит при исчерпании квоты?
Какие доказательства нужны, чтобы принять результат без полного ручного повторения работы?
Редакционная честность
В нашем эксперименте N из M задач прошли acceptance criteria.
На выбранном test bank role workflow показал…
По самоотчётам участников…
Большинство компаний… при нерепрезентативной выборке.
Multi-agent всегда лучше и дешевле.
Выдавать roadmap или внешнюю цифру за результат VOLY.