Los proyectos de IA dicen: “rendimiento más alto”. Lo más importante que hay que preguntar es si las condiciones de comparación están alineadas.

A continuación hay un ejemplo hipotético de evaluación; no corresponde al proyecto actual. El proyecto A afirma que procesa una imagen en 2 segundos, mientras que el proyecto B lo hace en 1 segundo. A incluye la lectura de la imagen, la cola y la salida completa; se ejecuta en una GPU “normal”. B solo contabiliza el tiempo de generación del modelo, usando una GPU más potente y una petición única tras el precalentamiento. Los números podrían ser ciertos, pero aún no se puede escribir que “el rendimiento de B es mejor”, porque no se está midiendo lo mismo en ambos casos.

El requisito para poder comparar es que la tarea, los datos de entrada, el hardware, el nivel de concurrencia y los puntos exactos de inicio y fin de la medición sean los mismos. También hay que comprobar si la calidad de la salida cumple: ser más rápido pero errar más, y que no importe la velocidad por sí sola. Si falta cualquiera de estos elementos, la conclusión solo puede redactarse como: “cada uno reportó un resultado; por el momento no es posible compararlos de forma horizontal”.

Cuando veas nuevas puntuaciones, pide al equipo del proyecto que verifique el mismo conjunto de pruebas, el mismo criterio de medición y los mismos indicadores de calidad. Si no puedes obtenerlo, cambia “más fuerte” por “las condiciones no están alineadas; pendiente de verificación”. Si en realidad ambos proyectos están completando tareas diferentes, la comparación horizontal tampoco aplica; entonces conviene preguntar si ambos alcanzan el mismo objetivo.