Материал на согласовании. Демонстрационная редакция.

Разбор / метод

Как оценивать полезность ИИ

Контрольная выборка, стоимость ошибки и понятный критерий остановки.

Сначала определить результат

«Система хорошо отвечает» — впечатление. «Система выделяет все обязательные поля, показывает источник и передаёт неоднозначные случаи специалисту» — начало проверяемого критерия.

Полезность зависит от задачи. Для черновика допустимо редактирование, для операции с последствиями нужно отдельное подтверждение. Смешивать эти случаи в одной средней оценке опасно: редкая критическая ошибка исчезает за множеством простых успехов.

Построить контрольный набор

  • Типовые задачи, отражающие обычный поток.
  • Неполные и противоречивые входные данные.
  • Ситуации, в которых система должна отказаться от действия.
  • Ошибки инструментов и недоступность источника.

Считать работу полностью

Измеряйте время вместе с проверкой и исправлениями. Сохраняйте одинаковый критерий качества для ручного и автоматизированного способов. Если состав документов меняется, сравнение может отражать сложность выборки, а не качество системы.

Когда остановиться

До пилота договоритесь, какие ошибки неприемлемы, сколько стоит сопровождение и кто принимает решение о продолжении. Неудачный эксперимент полезен, если показывает, какое ограничение мешает получить результат.

Источник и ограничения

Anthropic, Demystifying evals for AI agents описывает подходы к оценке многократных агентных запусков. Рекомендации выше — наша адаптация к узкому документному процессу. Измерений конкретного продукта здесь нет.

Читать дальше

ИИ-агенты: где заканчивается диалог и начинается система

Текст ожидает авторского согласования перед публикацией.