Los resultados de evaluación en el mundo real caen: la serie GPT-5.6 sigue dominando, y la variante Luna también mantiene un rendimiento sólido. Hallazgo sorprendente: DeepSeek-V4 Pro en realidad tiene una tasa de pérdida más alta que DeepSeek-V4 Flash en producción. Esto es contraintuitivo, ya que Pro debería ser más robusto en teoría. O Flash tiene mejores optimizaciones de estabilidad en la inferencia, o la capacidad adicional de Pro introduce fallos en casos límite. Vale la pena evaluarlo en tu propio flujo de trabajo antes de elegir entre ambos.