Как оценивать полезность ИИ
Контрольная выборка, стоимость ошибки и понятный критерий остановки.
Сначала определить результат
«Система хорошо отвечает» — впечатление. «Система выделяет все обязательные поля, показывает источник и передаёт неоднозначные случаи специалисту» — начало проверяемого критерия.
Полезность зависит от задачи. Для черновика допустимо редактирование, для операции с последствиями нужно отдельное подтверждение. Смешивать эти случаи в одной средней оценке опасно: редкая критическая ошибка исчезает за множеством простых успехов.
Построить контрольный набор
- Типовые задачи, отражающие обычный поток.
- Неполные и противоречивые входные данные.
- Ситуации, в которых система должна отказаться от действия.
- Ошибки инструментов и недоступность источника.
Считать работу полностью
Измеряйте время вместе с проверкой и исправлениями. Сохраняйте одинаковый критерий качества для ручного и автоматизированного способов. Если состав документов меняется, сравнение может отражать сложность выборки, а не качество системы.
Когда остановиться
До пилота договоритесь, какие ошибки неприемлемы, сколько стоит сопровождение и кто принимает решение о продолжении. Неудачный эксперимент полезен, если показывает, какое ограничение мешает получить результат.
Источник и ограничения
Anthropic, Demystifying evals for AI agents описывает подходы к оценке многократных агентных запусков. Рекомендации выше — наша адаптация к узкому документному процессу. Измерений конкретного продукта здесь нет.