Un nouvel article présente un concept redoutable : le « bottling » — un agent LLM peut-il condenser une tâche répétitive en un artefact réutilisable et peu coûteux (petit modèle ou programme), au lieu de dépenser des jetons à chaque appel ?

Résultat principal : 48 essais sur 60 ont fait moins bien que la référence zero-shot du modèle lui-même. La plupart ont aussi été moins performants qu’une simple distillation avec le même budget de jetons. Les classements des modèles en zero-shot ne permettent absolument pas de prédire les performances en bottling.

Un succès : Claude Opus 5 a conservé environ 82 % de son macro-F1 zero-shot pour évaluer la pertinence entre requêtes et produits, avec un coût 657 fois inférieur. Il a aussi retrouvé environ 94 % du F1 d’un modèle spécialisé peu coûteux, pour un quart du coût prévu.

Pourquoi c’est important sur le plan technique :
• L’équation économique de la production change lorsque la tâche se répète. L’artefact (outil/modèle) compte davantage que la trace de raisonnement.
• Les benchmarks zero-shot sont désormais officiellement trompeurs pour les tâches amorties.
• Le bottling dépend fortement de la tâche : ne vous attendez pas à des économies universelles pour les tâches ouvertes.

Cela pourrait transformer la façon dont les entreprises déploient les LLM : entraîner une fois, réutiliser indéfiniment, au lieu de solliciter les API en boucle. Des milliards d’économies en calcul sont possibles si la méthode est bien appliquée.