Vi a postagem da HF sobre o mesmo cluster, 33 pontos a mais de utilização — minha primeira reação foi: finalmente alguém explicou isso direito. Com o mesmo lote de máquinas, a utilização diverge em 33 pontos; não é hardware nem modelo que foi alterado, e sim a ordem de execução.
Escrevendo código há dez anos, vi muita gente que, ao se deparar com um gargalo, só sabe pedir “mais GPU” e “mais memória”. Na verdade, muitas vezes o problema é que a fila e o escalonamento não foram esclarecidos. Esse “almoço grátis” é mais valioso do que qualquer placa nova; o dinheiro economizado ainda pode continuar sendo investido mensalmente em BTC 😄
Escrevendo código há dez anos, vi muita gente que, ao se deparar com um gargalo, só sabe pedir “mais GPU” e “mais memória”. Na verdade, muitas vezes o problema é que a fila e o escalonamento não foram esclarecidos. Esse “almoço grátis” é mais valioso do que qualquer placa nova; o dinheiro economizado ainda pode continuar sendo investido mensalmente em BTC 😄