Лаборатория сравнений сопоставляет несколько прогонов одной задачи. Она помогает понять, какой Flow дал лучший результат, какой кодирующий агент или модель справились качественнее и оправдана ли разница во времени и расходе токенов.

Что потребуется

  • Проект и одна задача, которую решают все сравниваемые прогоны.
  • Не менее двух готовых прогонов или рецепты для запуска новых вариантов.
  • Подходящий метод оценки и доверенные агенты-судьи, если нужна ИИ-оценка.

Создайте исследование

Откройте Проект → Сравнения и создайте исследование для одной задачи. Участников можно добавить двумя способами:
  • Наблюдаемый — выбрать существующий прогон для ретроспективного сравнения.
  • Запускаемый — закрепить рецепт, по которому исследование создаст новые прогоны с контролируемыми параметрами.
Рецепт фиксирует ревизию Flow, версию пакета, назначение исполнителей и моделей по слотам, набор возможностей, политику исполнения, входные данные и число повторов. Предварительная проверка подтверждает совместимость, доверие к пакетам, доступность исполнителей и обязательных артефактов.

Сравнивайте осмысленные варианты

Если разброс ответов модели может быть велик, запускайте несколько повторов. Один прогон способен выявить дефект, но редко даёт устойчивый рейтинг.

Что фиксирует исследование

После запуска состав участников и ограниченные снимки доказательств становятся неизменяемыми. Так последующее редактирование каталога, метода или панели судей не меняет смысл уже полученной оценки. В снимок могут входить изменения кода, отчёты тестов и проверок, структурные результаты, дерево дочерних прогонов, длительность и расход токенов. Отсутствующие данные остаются отсутствующими и не превращаются в ноль.

Методы оценки

ИИ-оценки носят рекомендательный характер. Только человек записывает итоговый вердикт, исправляет его новой записью или закрепляет победивший рецепт.

Читайте результат в четырёх измерениях

  1. Корректность и доказательства — обязательные проверки, свежесть артефактов, изменения и готовность к продвижению.
  2. Оценка качества — баллы, попарные результаты, согласие судей и причины.
  3. Ход исполнения — повторы, доработки, сбои, дочерние прогоны и ожидание человека.
  4. Экономика — входные, выходные и кешированные токены, длительность, исполнитель, модель и события бюджета.
Низкий расход не доказывает качество. Сопоставляйте его с результатом и доказательствами: дешёвый вариант может стать стандартом для обычных задач, а более сильная модель — остаться для сложных.

Закрепите победителя

После окончательного решения человека участник проекта может закрепить подходящий запускаемый рецепт для проектного слота. MAIster ещё раз выполняет предварительную проверку и добавляет новую запись аудита. Откат также создаёт новую ревизию и не переписывает историю. Закрепление рецепта не продвигает код и не меняет состояние прогонов. Это остаётся отдельным действием человека.

Признаки проблемы

  • Предварительная проверка отказала — устраните указанную несовместимость, проблему доверия, артефакта или исполнителя.
  • Оценка частичная — часть проверок, пар или попыток судей не дала достаточных корректных данных.
  • Требуется решение человека — судьи разошлись или не набрали кворум.
  • Итог не определён — сохраните результат без искусственного победителя.

Связанные страницы