18 de agosto, segundo a MaxForAI, o projeto de IA J-Space Cognition Suite, que explodiu hoje na plataforma X, está enfrentando questionamentos da comunidade. Ele é acusado de que os resultados de testes do DeepSeek V4 divulgados por meio de sua publicidade não podem ser reproduzidos. Antes, o projeto havia afirmado que o V4 Flash, quando combinado com o J-Space, consegue empatar o GLM-5.3; já o V4 Pro, por sua vez, consegue superar o Fable 5 em vários Agent Benchmark, com aumento de velocidade de 2,53 vezes e melhoria de eficiência de tokens de 2,21 vezes.
O usuário do GitHub GoForceX realizou uma nova bateria de testes em alta concorrência usando um subconjunto de 87 questões do Terminal Bench 2.1 e confirmou o carregamento dos módulos relacionados ao J-Space. Os resultados mostram que, ao adicionar o J-Space, o desempenho nos benchmarks na verdade caiu levemente; além disso, o uso de tokens e os custos aumentaram, indo na direção oposta à alegada melhora de desempenho, velocidade e eficiência de tokens pelo projeto.
Em seguida, a comunidade exigiu que o projeto publicasse a configuração completa dos testes, os resultados por questão, logs de execução, o tempo original e dados de consumo de tokens. Atualmente, o projeto divulga principalmente resultados consolidados e ainda não forneceu registros experimentais originais completos suficientes para validar os dados precisos acima. Vale ressaltar que, diante das críticas, os autores do projeto responderam que os dados “de fato foram exagerados” e afirmaram que a melhoria real está, aproximadamente, entre 1,6 e 3 vezes. Até o momento, o autor ainda não apresentou uma resposta oficial às acusações da comunidade, e algumas das Issues relacionadas às críticas foram excluídas.
🧧🧧🧧回复221获得$SOL 🧧🧧🧧
🎁🎁🎁👇👇👇🎁🎁🎁
O usuário do GitHub GoForceX realizou uma nova bateria de testes em alta concorrência usando um subconjunto de 87 questões do Terminal Bench 2.1 e confirmou o carregamento dos módulos relacionados ao J-Space. Os resultados mostram que, ao adicionar o J-Space, o desempenho nos benchmarks na verdade caiu levemente; além disso, o uso de tokens e os custos aumentaram, indo na direção oposta à alegada melhora de desempenho, velocidade e eficiência de tokens pelo projeto.
Em seguida, a comunidade exigiu que o projeto publicasse a configuração completa dos testes, os resultados por questão, logs de execução, o tempo original e dados de consumo de tokens. Atualmente, o projeto divulga principalmente resultados consolidados e ainda não forneceu registros experimentais originais completos suficientes para validar os dados precisos acima. Vale ressaltar que, diante das críticas, os autores do projeto responderam que os dados “de fato foram exagerados” e afirmaram que a melhoria real está, aproximadamente, entre 1,6 e 3 vezes. Até o momento, o autor ainda não apresentou uma resposta oficial às acusações da comunidade, e algumas das Issues relacionadas às críticas foram excluídas.
🧧🧧🧧回复221获得$SOL 🧧🧧🧧
🎁🎁🎁👇👇👇🎁🎁🎁