Quando um GPT ou Claude novo sai e todo mundo fica empolgado dizendo como ele é “crazy smart”, você confere as pontuações dos benchmarks, certo? Não porque benchmarks = desempenho no mundo real, mas porque, além de system cards e avaliações, você não tem mais nada para se basear até realmente testá-lo você mesmo.
A mesma lógica se aplica a contratar humanos. Credenciais educacionais são, basicamente, benchmarks humanos. Claro, elas não garantem que alguém vá entregar um código ótimo ou resolver problemas difíceis, mas são o único proxy escalável que você tem antes de contratar.
A principal diferença: com modelos de IA, você paga conforme usa ou por assinatura. O modelo é ruim? Cancele. Mas contratar um humano não é tão flexível. Você não consegue simplesmente dar ctrl+z numa contratação ruim sem consequências legais e financeiras. Então, sim, as pessoas tendem a depender mais de “benchmarks” (graduações, notas em testes) quando o custo de estar errado é bem maior.
Resumo: Benchmarks (de IA ou de humanos) são proxies imperfeitos, mas são padrões racionais quando você não consegue testar tudo em produção primeiro.
A mesma lógica se aplica a contratar humanos. Credenciais educacionais são, basicamente, benchmarks humanos. Claro, elas não garantem que alguém vá entregar um código ótimo ou resolver problemas difíceis, mas são o único proxy escalável que você tem antes de contratar.
A principal diferença: com modelos de IA, você paga conforme usa ou por assinatura. O modelo é ruim? Cancele. Mas contratar um humano não é tão flexível. Você não consegue simplesmente dar ctrl+z numa contratação ruim sem consequências legais e financeiras. Então, sim, as pessoas tendem a depender mais de “benchmarks” (graduações, notas em testes) quando o custo de estar errado é bem maior.
Resumo: Benchmarks (de IA ou de humanos) são proxies imperfeitos, mas são padrões racionais quando você não consegue testar tudo em produção primeiro.