«Не промпти Claude. Построй систему, которая промптит себя». Интерес смещается от одного чата к агентным системам.
VOLYПроверяем не популярность multi-agent, а условия, при которых специализация и независимая проверка дают измеримый выигрыш.
Практическое исследование надёжности AI coding agents — от красивого отчёта модели до результата, который действительно можно принять в репозиторий.
Benchmark · методология · test bank · полевое исследование
The completion gap
Агент может убедительно сообщить об успехе и при этом не изменить ни одного файла, пропустить требование или сломать соседний сценарий.
Поэтому статус задачи должен следовать за фактами на диске: diff, тестами, соблюдением scope и независимым review.
Signals from the field
«Не промпти Claude. Построй систему, которая промптит себя». Интерес смещается от одного чата к агентным системам.
VOLYПроверяем не популярность multi-agent, а условия, при которых специализация и независимая проверка дают измеримый выигрыш.
Пользователи Claude Code обсуждают usage limits и ручные обходы: несколько аккаунтов, proxy CLI и альтернативные harnesses.
VOLYЭто подтверждает Job: завершить задачу без срыва из-за квоты — с прозрачным fallback и общей стоимостью результата.
Нативные Managed Agents уже вводят session budgets — базовая оркестрация быстро становится возможностью платформы.
VOLYПоэтому дифференциация VOLY — не роли сами по себе, а сквозной бюджет задачи между агентами, инструментами и fallback-переходами.
Большие multi-agent системы усиливают потребность в наблюдаемой среде, границах ролей и проверяемых эпизодах.
VOLYСначала собираем доверенные episodes и role metrics; self-play откладываем, пока доказательства результата недостаточно надёжны.
Показатели — снимок публичной активности на момент проверки. Это контекст рынка, а не результаты исследования VOLY.
04 меры →
Главная экономическая единица — не стоимость запуска и не количество сгенерированного кода, а цена подтверждённо выполненной задачи.
accepted tasks / all tasksreported done, but rejectedtotal cost / accepted tasksruns with unrequested changesГипотезы исследования
Multi-agent workflow не считается лучше по определению. Он должен доказать преимущество по качеству, стоимости результата или восстановлению после ошибок.
Reported success систематически выше результата, подтверждённого тестами, diff и code review.
Архитектор, разработчик и ревьюер должны показать преимущество над одним универсальным агентом.
Plan gate, protected paths и file limits проверяются как инструменты снижения незапрошенных изменений.
Architecture ≠ outcome
Каждая архитектура получает одинаковый исходный commit, постановку задачи, бюджет времени и заранее замороженные критерии приёмки.
30 воспроизводимых задач
Шесть измерений по пять задач. У каждой — эталонный commit, разрешённый scope и машинно проверяемый acceptance pack.
API, idempotency, concurrency, DB pool
state, accessibility, forms, responsive UI
regression, flaky tests, properties, queues
Docker, healthcheck, CI cache, rollback
traversal, secrets, commands, protected paths
DB → API → UI, flags, timezones, audit
Одна задача крупным планом
Не просим верить отчёту агента. Каждая задача проходит одинаковую цепочку физических доказательств.
Сделать POST /payments идемпотентным при повторной отправке одного ключа.
src/payments/** и tests/payments/**. Миграции и конфигурация запрещены.
Один charge для одинакового ключа; корректный ответ при concurrency; существующие тесты проходят.
pytest tests/payments -q · ruff check · git diff --check
Уже работает в VOLY
Исследование ещё идёт, но базовые границы доверия уже реализованы в продукте и проверяются тестами.
Завершение процесса не равно приёмке. Результат получает verified_success только после детерминированной evaluation policy.
voly/evaluation · tests/test_evaluation.pyCode-generation role, который сообщил об успехе, но не оставил заявленных или обнаруженных изменений, считается failed.
voly/a2a/hybrid.py · tests/test_hybrid_a2a.pyНезависимый judge видит task, acceptance criteria и diff, но получает только read-only инструменты без shell и записи файлов.
voly/a2a/agentic_judge.py · tests/test_agentic_judge.pyНовый capability требует шесть измеренных outcomes, включая два held-out; routing probe сам по себе не считается валидацией.
voly/capability · tests/test_capability_production_validation.pyВоспроизводимый mock benchmark
26.3%fixture savingsBaseline $0.137 против $0.101 у fallback-chain. Экономия возникает только в четырёх billing-fallback задачах; happy path не получает искусственного выигрыша. Это детерминированные mock-cost fixtures, не production invoices.
python benchmarks/finops-suite/run.py --mode mockЦелевая проверка evidence, evaluation, judge, FinOps и production-gates: 57 тестов пройдено 13 августа 2026. Это не полный test suite проекта.
Главная метрика
Цена не ответа агента, а результата, который прошёл проверки и может быть принят командой.
опрос 1–2 мин · интервью 30 мин
Какие AI coding tools использует команда, как часто и для каких типов задач?
Что считается готовностью: ответ агента, diff, тесты, review, merge или production metric?
Как часто агент говорит «готово», меняет лишнее или создаёт регрессию?
Видит ли команда стоимость задачи и что происходит при исчерпании квоты?
Какие доказательства нужны, чтобы принять результат без полного ручного повторения работы?
Редакционная честность
В нашем эксперименте N из M задач прошли acceptance criteria.
На выбранном test bank role workflow показал…
По самоотчётам участников…
Большинство компаний… при нерепрезентативной выборке.
Multi-agent всегда лучше и дешевле.
Выдавать roadmap или внешнюю цифру за результат VOLY.
План запуска на 30 дней
Проверить implemented / partial / roadmap и доступную телеметрию.
10 задач × 3 режима; устранить методологические пробелы.
30+ анкет, 5+ интервью, расширение test bank.
30 задач; слепое review; воспроизводимый анализ.
HTML-отчёт, графики, партнёрская волна и диагностика.
Открытое исследование · 1–2 минуты
Нас интересует не мнение об AI в целом, а последняя задача, на которую вы действительно потратили время, бюджет или внимание команды.Участники первыми получат итоговый benchmark и краткую диагностику процесса проверки. Публичный профиль необязателен.