As mensagens de IA da ME, em 22 de setembro, a 5ª Cúpula Global de Inovação do Setor de Armazenamento GMIF2026, com o tema “Armazenamento por IA, impulsionando o futuro”, foi realizada em Shenzhen. Zhou Tao, gerente geral do departamento de servidores do grupo de negócios de infraestruturas da Lenovo China, foi convidado para proferir uma palestra temática, na qual apresentou a solução da Lenovo para uma fábrica híbrida de tokens (mixed token factory) e compartilhou, sob a perspectiva da cooperação entre computação e armazenamento, suas reflexões mais recentes sobre a evolução da infraestrutura de computação na era da economia de tokens.   Atualmente, a tecnologia de IA está avançando de inteligência gerativa para fases de raciocínio e inteligência de ação, impulsionando a explosão da demanda por tokens. Em março de 2026, o volume diário médio de chamadas de tokens na China ultrapassou 140 trilhões, aumentando 1400 vezes em pouco mais de dois anos. Ao mesmo tempo, os pontos-chave de valor da indústria de computação estão sendo reestruturados: em vez de liquidação de valor por aluguel de recursos de GPU, passa-se a liquidação por tokens como unidade de valor; o raciocínio torna-se a carga de trabalho central da infraestrutura de computação. O padrão para medir o valor da infraestrutura de IA também está mudando: do desempenho de pico para a capacidade de produção efetiva de tokens.   Nesse contexto, a infraestrutura de IA está mudando gradualmente de um modelo centrado no fornecimento de recursos para um modelo centrado na entrega de valor. Zhou Tao apontou que, com a entrada da indústria na era do raciocínio, o foco das empresas deixa de ser apenas quanto poder computacional elas possuem; passa a ser a capacidade de produzir e entregar tokens de forma contínua, estável e eficiente. “No passado, para medir computação, era comum olhar a quantidade de placas de GPU; hoje, ao comprar computação e implantar modelos grandes, na essência, está-se comprando um serviço de tokens com produção efetiva. Os tokens se tornaram o novo bem comercial da era da IA.”   Do ponto de vista das práticas da indústria, a construção de uma fábrica híbrida de tokens não é simplesmente adicionar modelos ou expandir recursos de computação; trata-se de um projeto sistemático que abrange design de metas, governança de dados, otimização de computação e garantias de segurança. Atualmente, a construção de fábricas híbridas de tokens enfrenta, em geral, desafios como metas pouco claras, insuficiência de disponibilidade de dados, baixa eficiência de produção de computação e riscos como vazamento de dados e ataques a modelos.   Para enfrentar esses problemas da indústria, a Lenovo construiu quatro pilares principais—design de alto nível, governança de dados, otimização de computação e gestão de segurança—proporcionando suporte metodológico completo para a construção em escala de fábricas híbridas de tokens.     Por meio do design de alto nível, a Lenovo ajuda os clientes a esclarecerem seu público-alvo, problemas de negócios e objetivos de construção, e então reverte o processo para determinar as capacidades diferenciadas da fábrica híbrida de tokens. No cenário de serviços de apoio psicológico, a Lenovo utiliza modelos grandes de saúde psicológica e mental como núcleo, integra infraestrutura local de computação e capacidades do cenário, e forma um sistema rotineiro de serviços psicológicos que cobre avaliação multimodal, triagem automática, classificação de riscos e rastreabilidade de responsabilidades. Isso oferece ao governo bases digitais quantificáveis e em ciclo fechado para a governança de saúde mental, aliviando de forma significativa a pressão sobre professores de psicologia das escolas e profissionais de saúde da atenção básica.   No nível de governança de dados, a Lenovo, ao organizar conceitos centrais das áreas de negócio e suas relações de atributos, transforma dados dispersos em uma rede de conhecimento que pode ser chamada com eficiência pela IA. Por exemplo, no setor automobilístico, a Lenovo cria um dicionário de automóveis, constrói mapas de conhecimento, define regras de inferência e fornece serviços semânticos, transformando dados originais de bancos de dados em “combustível” de alta pureza que pode ser chamado por IA a qualquer momento e reutilizado em qualquer lugar.   Na otimização de computação, a Lenovo acredita que o pico de capacidade de computação do hardware não equivale à capacidade produtiva efetiva de uma “fábrica de IA”; a computação efetiva de verdade deve ser igual ao pico de computação multiplicado pela taxa de utilização e pelo coeficiente de estabilidade. Diante do problema de aumento do atraso de cauda causado por pools mistos de Prefill e Decode, a Lenovo adota uma arquitetura de separação por pool para recursos de treino e inferência, define limites de capacidade entre pools e estratégias de degradação, para melhorar a estabilidade do SLA, tornar o custo por unidade controlável e transformar a capacidade de pico em capacidade produtiva efetiva de fato.   Na gestão de segurança, a Lenovo, por sua vez, constrói uma “rede de purificação profunda” para aplicações de agentes por meio de segurança de interação, segurança de Skill, gestão de permissões e comportamentos e segurança de nível inferior, reduzindo riscos de vazamento de dados e ataques a modelos e garantindo a implantação em escala de aplicações de IA nas empresas.   “A fábrica híbrida de tokens não é simplesmente adicionar um modelo ou comprar um lote de servidores; é um desenho sistêmico ao redor de objetivos claros de produção, com design de dados, modelos, computação, arquitetura e segurança. Somente quando todas as etapas formarem verdadeiramente uma força conjunta é que se consegue melhorar continuamente a eficiência de produção e entrega de tokens.” disse Zhou Tao.   A razão de a fábrica híbrida de tokens ser chamada de “fábrica” está em sua capacidade de transformar recursos dispersos em uma capacidade de produção de tokens estável, contínua e operável. Para isso, a Lenovo construiu uma estrutura de dupla rotação composta por “oficina de computação” e “centro de operação e gerenciamento”, criando um sistema completo de produção de tokens por meio de cooperação entre software e hardware: a oficina de computação fornece bases de hardware como capacidade de computação, capacidade de armazenamento e capacidade de transporte; o centro de operação e gerenciamento assume serviços full-stack como governança de dados, gestão de consumo de energia, proteção de segurança e operação/manutenção de cluster. A colaboração entre ambos viabiliza a construção de capacidades sistêmicas, indo do fornecimento de recursos até a entrega de tokens.   No lado do hardware, a Lenovo desenvolveu uma estrutura de infraestrutura que cobre três grandes capacidades: computação, armazenamento e transporte. A capacidade de computação de IA adota uma arquitetura “1+3+N”: baseada em uma arquitetura de sistema unificada, abrange três plataformas principais de CPU, é compatível com GPUs de múltiplas marcas e suporta interconexões rápidas como OAM e NVLink. Ao mesmo tempo, leva em conta ecossistemas globais e locais de chips de computação, atendendo a necessidades diversas como treinamento de modelos grandes, inferência geral, computação de alto desempenho e implantação de forma local/doméstica. A capacidade de armazenamento de IA cobre cenários de treino e inferência de modelos de diferentes escalas—do grande ao médio e ao pequeno. No caso do novo armazenamento AFX, utiliza uma arquitetura desacoplada totalmente nova, alcançando otimização extrema de desempenho, e juntos criam uma base inteligente de armazenamento de alto desempenho para chamadas eficientes de grandes volumes de dados e modelos. A capacidade de transporte de IA, por sua vez, se apoia em redes inteligentes de baixa latência e multi-arquitetura, conectando canais de dados entre computação e armazenamento e elevando a eficiência global de operação do cluster. As três capacidades se fundem, estabelecendo uma base sólida de infraestrutura para produção token em escala, de forma estável e eficiente.   Para que os recursos de hardware se convertam em efetiva eficiência, é necessário que a plataforma de software realize gerenciamento unificado e otimizações contínuas. Como o sistema nervoso central da fábrica híbrida de tokens, a Lenovo Wanquan (万全) plataforma híbrida de computação inteligente heterogênea (异构智算) atende quatro cenários de infraestrutura de IA: clusters nacionais de IA de alta qualidade, projetos de computação inteligente da indústria e de pesquisa científica, arquiteturas híbridas de computação de empresas e infraestrutura base de IA das empresas. Com 9 inovações técnicas, cobre todo o fluxo de pré-treinamento, pós-treinamento e inferência, e com 3 plataformas de gerenciamento oferece otimização extrema para demandas de computação diversas.   A mais recente versão V5.0 da Lenovo Wanquan trouxe duas inovações técnicas principais: a tecnologia de aceleração de treino e inferência em clusters por meio de separação PD, compartilhamento de KV Cache e otimização de cache, multiplicando em velocidade a eficiência geral da rede “computar-armazenar” (算存网) dos clusters de computação e reduzindo interferências de recursos entre diferentes tarefas de inferência; e a tecnologia de otimização de compilação para “chips modulares” (芯模) que realiza correspondência adaptativa de grafos de computação para modelos diferentes e geração automática de operadores, adequando profundamente o ecossistema de chips de computação multiforme, elevando a eficiência de computação em todo o fluxo de treino e inferência e construindo com precisão a melhor combinação entre GPU e modelos.   A ascensão da economia de tokens não apenas traz mudanças na infraestrutura técnica, como também leva a indústria de computação a reexaminar novamente como produzir, medir e entregar valor. A obra especializada no setor, produzida oficialmente pela Lenovo (Fábrica de Tokens: o paradigma de produção de riqueza na economia de tokens), organiza sistematicamente a lógica subjacente da economia de tokens e a metodologia de construção de fábricas híbridas de tokens, fornecendo uma nova perspectiva para que o setor entenda produção, operação e cálculo de valor de tokens.   (Fonte: ME)