30+ воспроизводимых задач

Test bank,
а не демо на удачу

Тридцать воспроизводимых инженерных задач с фиксированным scope, командами проверки и независимой приёмкой.

Передать реальный кейс

30 воспроизводимых задач

Test bank, а не демо на удачу

Шесть измерений по пять задач. У каждой — эталонный commit, разрешённый scope и машинно проверяемый acceptance pack.

01

Backend

B01–B05

API, idempotency, concurrency, DB pool

02

Frontend

F01–F05

state, accessibility, forms, responsive UI

03

Testing

T01–T05

regression, flaky tests, properties, queues

04

DevOps

D01–D05

Docker, healthcheck, CI cache, rollback

05

Security

S01–S05

traversal, secrets, commands, protected paths

06

Cross-stack

X01–X05

DB → API → UI, flags, timezones, audit

Одна задача крупным планом

Как выглядит проверяемый результат

Не просим верить отчёту агента. Каждая задача проходит одинаковую цепочку физических доказательств.

01Agent reportЗаявление о завершении
02Git diffФактические изменения
03TestsМашинные проверки
04ScopeТолько разрешённые файлы
05ReviewНезависимая оценка
06AcceptedПодтверждённый результат
Посмотреть пример acceptance pack +
Задача B03

Сделать POST /payments идемпотентным при повторной отправке одного ключа.

Разрешённый scope

src/payments/** и tests/payments/**. Миграции и конфигурация запрещены.

Критерии приёмки

Один charge для одинакового ключа; корректный ответ при concurrency; существующие тесты проходят.

Команды проверки

pytest tests/payments -q · ruff check · git diff --check

Уже работает в VOLY

Механизмы, а не обещания

Исследование ещё идёт, но базовые границы доверия уже реализованы в продукте и проверяются тестами.

Implemented

Verified success — отдельное состояние

Завершение процесса не равно приёмке. Результат получает verified_success только после детерминированной evaluation policy.

voly/evaluation · tests/test_evaluation.py
Implemented

Нет diff — нет code success

Code-generation role, который сообщил об успехе, но не оставил заявленных или обнаруженных изменений, считается failed.

voly/a2a/hybrid.py · tests/test_hybrid_a2a.py
Implemented

Judge не может исправить себе ответ

Независимый judge видит task, acceptance criteria и diff, но получает только read-only инструменты без shell и записи файлов.

voly/a2a/agentic_judge.py · tests/test_agentic_judge.py
Implemented

Capability активируется доказательствами

Новый capability требует шесть измеренных outcomes, включая два held-out; routing probe сам по себе не считается валидацией.

voly/capability · tests/test_capability_production_validation.py

Воспроизводимый mock benchmark

26.3%fixture savings

8 фиксированных задач · 4 executor labels

Baseline $0.137 против $0.101 у fallback-chain. Экономия возникает только в четырёх billing-fallback задачах; happy path не получает искусственного выигрыша. Это детерминированные mock-cost fixtures, не production invoices.

python benchmarks/finops-suite/run.py --mode mock

Целевая проверка evidence, evaluation, judge, FinOps и production-gates: 57 тестов пройдено 13 августа 2026. Это не полный test suite проекта.

Главная метрика

Cost per Verified Task=
стоимость всех попыток
принятые задачи

Цена не ответа агента, а результата, который прошёл проверки и может быть принят командой.