Un nuevo artículo presenta un concepto potente: el «embotellado» —¿puede un agente LLM comprimir una carga de trabajo repetitiva en un artefacto económico y reutilizable (un modelo pequeño o un programa), en lugar de gastar tokens en cada llamada?
Hallazgo principal: 48 de 60 ejecuciones rindieron peor que la propia línea base zero-shot del modelo. La mayoría también quedó por debajo de una destilación simple con el mismo presupuesto de tokens. Las clasificaciones de zero-shot en las tablas de posiciones no predicen en absoluto el rendimiento del embotellado.
Un caso de éxito: Claude Opus 5 conservó aproximadamente el 82 % de su macro-F1 zero-shot en relevancia entre consultas y productos, con un costo 657 veces menor. También recuperó aproximadamente el 94 % del F1 de un modelo especializado de bajo costo, a una cuarta parte del costo proyectado.
Por qué esto importa desde el punto de vista técnico:
• La economía de producción cambia cuando la tarea se repite. El artefacto (herramienta/modelo) importa más que la traza de razonamiento.
• Los benchmarks zero-shot ahora son oficialmente engañosos para las cargas de trabajo amortizadas.
• El embotellado depende mucho de la tarea; no esperes ahorros universales en trabajos abiertos.
Esto podría transformar la forma en que las empresas implementan LLM: entrenar una vez y reutilizar para siempre, en vez de llamar a las API una y otra vez. Se podrían ahorrar miles de millones en cómputo si se hace bien.
Hallazgo principal: 48 de 60 ejecuciones rindieron peor que la propia línea base zero-shot del modelo. La mayoría también quedó por debajo de una destilación simple con el mismo presupuesto de tokens. Las clasificaciones de zero-shot en las tablas de posiciones no predicen en absoluto el rendimiento del embotellado.
Un caso de éxito: Claude Opus 5 conservó aproximadamente el 82 % de su macro-F1 zero-shot en relevancia entre consultas y productos, con un costo 657 veces menor. También recuperó aproximadamente el 94 % del F1 de un modelo especializado de bajo costo, a una cuarta parte del costo proyectado.
Por qué esto importa desde el punto de vista técnico:
• La economía de producción cambia cuando la tarea se repite. El artefacto (herramienta/modelo) importa más que la traza de razonamiento.
• Los benchmarks zero-shot ahora son oficialmente engañosos para las cargas de trabajo amortizadas.
• El embotellado depende mucho de la tarea; no esperes ahorros universales en trabajos abiertos.
Esto podría transformar la forma en que las empresas implementan LLM: entrenar una vez y reutilizar para siempre, en vez de llamar a las API una y otra vez. Se podrían ahorrar miles de millones en cómputo si se hace bien.