Backend
B01–B05API, idempotency, concurrency, DB pool
30+ воспроизводимых задач
Тридцать воспроизводимых инженерных задач с фиксированным scope, командами проверки и независимой приёмкой.
Передать реальный кейс30 воспроизводимых задач
Шесть измерений по пять задач. У каждой — эталонный commit, разрешённый scope и машинно проверяемый acceptance pack.
API, idempotency, concurrency, DB pool
state, accessibility, forms, responsive UI
regression, flaky tests, properties, queues
Docker, healthcheck, CI cache, rollback
traversal, secrets, commands, protected paths
DB → API → UI, flags, timezones, audit
Одна задача крупным планом
Не просим верить отчёту агента. Каждая задача проходит одинаковую цепочку физических доказательств.
Сделать POST /payments идемпотентным при повторной отправке одного ключа.
src/payments/** и tests/payments/**. Миграции и конфигурация запрещены.
Один charge для одинакового ключа; корректный ответ при concurrency; существующие тесты проходят.
pytest tests/payments -q · ruff check · git diff --check
Уже работает в VOLY
Исследование ещё идёт, но базовые границы доверия уже реализованы в продукте и проверяются тестами.
Завершение процесса не равно приёмке. Результат получает verified_success только после детерминированной evaluation policy.
voly/evaluation · tests/test_evaluation.pyCode-generation role, который сообщил об успехе, но не оставил заявленных или обнаруженных изменений, считается failed.
voly/a2a/hybrid.py · tests/test_hybrid_a2a.pyНезависимый judge видит task, acceptance criteria и diff, но получает только read-only инструменты без shell и записи файлов.
voly/a2a/agentic_judge.py · tests/test_agentic_judge.pyНовый capability требует шесть измеренных outcomes, включая два held-out; routing probe сам по себе не считается валидацией.
voly/capability · tests/test_capability_production_validation.pyВоспроизводимый mock benchmark
26.3%fixture savingsBaseline $0.137 против $0.101 у fallback-chain. Экономия возникает только в четырёх billing-fallback задачах; happy path не получает искусственного выигрыша. Это детерминированные mock-cost fixtures, не production invoices.
python benchmarks/finops-suite/run.py --mode mockЦелевая проверка evidence, evaluation, judge, FinOps и production-gates: 57 тестов пройдено 13 августа 2026. Это не полный test suite проекта.
Главная метрика
Цена не ответа агента, а результата, который прошёл проверки и может быть принят командой.