Dongcha Beating AI News: Laminar, una plataforma de observabilidad de agentes de IA, ha lanzado flow-1, un modelo diseñado específicamente para inspeccionar las trazas de ejecución de agentes. Lee las llamadas al modelo, las llamadas a herramientas y los resultados devueltos para identificar dónde y por qué un agente cometió un error. flow-1 funciona dentro del agente Signals de Laminar. El modelo puede buscar en una traza completa (el registro íntegro de ejecución de un agente) y luego inspeccionar pasos específicos según sea necesario. Durante el entrenamiento, Laminar primero utilizó datos sintéticos de investigación para el ajuste fino supervisado y después entrenó las llamadas a herramientas y el análisis complejo de trazas mediante aprendizaje por refuerzo. En el conjunto de pruebas de 523 trazas difíciles creado por Laminar, flow-1 obtuvo una puntuación F1 de detección de errores de 0,835, mientras que GPT-6-sol obtuvo 0,816. sol tiene mayor exhaustividad y puede encontrar más errores reales; flow-1 tiene mayor precisión y genera menos falsos positivos. Para las trazas de menos de 100.000 tokens de LLM, flow-1 cuesta en promedio unos 0,0011 $ por análisis, frente a unos 0,026 $ para GPT-6-sol. Según las estimaciones de Laminar, con 1 $ se pueden analizar unas 888 y 38 trazas, respectivamente, una diferencia de aproximadamente 23 veces. flow-1 también es alrededor de un 25 % más barato que GPT-6-luna. Por ahora, estos resultados proceden exclusivamente del benchmark creado por Laminar, y aún no han sido verificados por terceros. Los datos de entrenamiento de flow-1 provienen principalmente de flujos de trabajo sintéticos, de los cuales aproximadamente el 48 % son tareas de ingeniería de software. Algunas personas de la comunidad ya han cuestionado si podrá mantener el mismo rendimiento ante fallos novedosos en entornos de producción reales que no se hayan predefinido.
