A NVIDIA lançou um modelo aberto menor, projetado para lidar com tarefas repetitivas e de alto volume que mantêm agentes autônomos funcionando, com o objetivo de reduzir o custo e a latência das cargas de trabalho de agentes em execução prolongada.
Chamado de Nemotron 3.5 Lightning, o modelo tem 30 bilhões de parâmetros no total, mas ativa apenas 3 bilhões para cada token. A NVIDIA afirma que esse design de mixture-of-experts permite oferecer a capacidade de um modelo maior usando computação mais próxima da de um modelo bem menor.
O Nemotron 3.5 Lightning também foi projetado para rodar localmente, incluindo no NVIDIA DGX Spark, em sistemas Jetson e em placas de vídeo GeForce RTX 5090. Ele também pode ser implantado em data centers, dando aos desenvolvedores opções para executar cargas de trabalho de alto volume mais perto de onde elas são geradas.
O modelo foi treinado pensando em frameworks populares de agentes, incluindo OpenClaw e Hermes Agent. A NVIDIA diz que esse treinamento ajuda os agentes a fazer chamadas de ferramentas mais precisas, ao mesmo tempo em que reduz a latência durante tarefas repetitivas.#NVIDIA $NVDAB
