ИИ-проект говорит «производительность выше», и самое важное, что стоит выяснить, — согласованы ли условия сравнения.
Ниже — гипотетический пример тестирования, он не соответствует текущему проекту. Проект A утверждает, что обработка одной картинки занимает 2 секунды, а проект B — 1 секунду. A включает в расчёт чтение изображения, постановку в очередь и полностью завершённый вывод; тест выполняется на обычной видеокарте. B учитывает только время генерации модели, использует более мощную видеокарту и один прогон после прогрева. Цифры могут быть правдивыми, но нельзя писать, что производительность B выше, потому что измеряются не одни и те же вещи.
Сравнимость обеспечивается при условии, что совпадают: задача, входные примеры, аппаратная платформа, уровень параллелизма и точки начала/окончания измерения. Также нужно проверить качество выходных данных: быстрее, но с большим числом ошибок — не значит лучше; одного только быстродействия недостаточно. Если отсутствует хотя бы один из пунктов, вывод может быть только таким: «каждый отчитался о своём результате, пока невозможно провести прямое сравнение».
Когда появятся новые результаты, сверьтесь с командой проекта: тот же тестовый набор, тот же способ измерения и те же показатели качества. Если получить это не удаётся, замените «производительность выше» на «условия не согласованы, требуется верификация». Если изначально обе стороны выполняют разные задачи, то прямое сравнение тоже некорректно — тогда следует спросить, достигли ли они обе одинаковой цели.
Ниже — гипотетический пример тестирования, он не соответствует текущему проекту. Проект A утверждает, что обработка одной картинки занимает 2 секунды, а проект B — 1 секунду. A включает в расчёт чтение изображения, постановку в очередь и полностью завершённый вывод; тест выполняется на обычной видеокарте. B учитывает только время генерации модели, использует более мощную видеокарту и один прогон после прогрева. Цифры могут быть правдивыми, но нельзя писать, что производительность B выше, потому что измеряются не одни и те же вещи.
Сравнимость обеспечивается при условии, что совпадают: задача, входные примеры, аппаратная платформа, уровень параллелизма и точки начала/окончания измерения. Также нужно проверить качество выходных данных: быстрее, но с большим числом ошибок — не значит лучше; одного только быстродействия недостаточно. Если отсутствует хотя бы один из пунктов, вывод может быть только таким: «каждый отчитался о своём результате, пока невозможно провести прямое сравнение».
Когда появятся новые результаты, сверьтесь с командой проекта: тот же тестовый набор, тот же способ измерения и те же показатели качества. Если получить это не удаётся, замените «производительность выше» на «условия не согласованы, требуется верификация». Если изначально обе стороны выполняют разные задачи, то прямое сравнение тоже некорректно — тогда следует спросить, достигли ли они обе одинаковой цели.