Fonte da reimpressão do artigo: AIGC
Fonte: Qubits
Recentemente, a “batalha de centenas de modelos” intensificou-se. No boom dos grandes modelos, o “talento” tornou-se o foco de uma competição acirrada entre grandes empresas de tecnologia, equipes empreendedoras e instituições de pesquisa. No entanto, ainda existe uma grande lacuna em talentos de ponta na área de AIGC.
Que tipo de talentos devem ser recrutados para facilitar o desenvolvimento do modelo?
Onde recrutar talentos de grandes modelos?
Como cultivar talentos de P&D de grandes modelos?
Para responder às perguntas acima, Qubit Think Tank convida especialmente profissionais, especialistas e acadêmicos na área de grandes modelos de IA para compartilhar as oportunidades, desafios e perspectivas de desenvolvimento futuro de grandes talentos de modelos com equipes corporativas e candidatos a emprego.
Este artigo faz parte da série de entrevistas em profundidade "Big Model Talent" do QuantumBit Think Tank. Para mais informações, preste atenção ao próximo (Relatório Panorama de Desenvolvimento de Talentos Big Model da AIGC de 2023)
Perfil da Entrevista
Fang Han, presidente e CEO da Kunlun Wanwei e um dos fundadores do Linux chinês, liderou o desenvolvimento do acelerador DUDU, o primeiro software de download P2P na China.
△Fang Han, Presidente e CEO da Kunlun Wanwei
Ele se juntou à Kunlun Wanwei em 2008 e liderou o desenvolvimento de "Three Kingdoms" e do jogo RPG "Wuxia Fengyun", ganhando muitos prêmios.
Vistas maravilhosas
Dentro de 1 a 2 anos, a escassez de talentos em algoritmos será bastante aliviada.
Minha compreensão da conscientização sobre inovação de talentos se refere a como resolver problemas de forma inovadora e melhorar indicadores de uma perspectiva técnica e de engenharia.
"Seleção" é mais importante que "cultivo", e o aprendizado independente é mais importante que o relacionamento mestre-aprendiz.
Em um campo novo como o da grande indústria da moda, estudantes de doutorado recém-formados podem se tornar especialistas na área após meio ano de treinamento.
Da perspectiva da oferta, atualmente há uma escassez de talentos em grandes modelos, mas a situação será bastante aliviada em 3 a 5 anos.
De uma perspectiva macro, em comparação com as indústrias tradicionais, a dificuldade em cultivar talentos para grandes modelos reside no fato de que as universidades atualmente não têm poder de computação.
As empresas que criam novos modelos de negócios no nível de aplicação com base em IA e grandes modelos colherão as maiores recompensas.
Transcrição da entrevista
Como definir o talento de um grande modelo?
Quantum Bit Think Tank: Como a Kunlun Wanwei divide os talentos das grandes empresas?
Fang Han: Acredito que o treinamento do modelo deve ser dividido em duas partes: treinamento de inferência e desenvolvimento de aplicação. De acordo com o processo de treinamento do modelo, dividimos os talentos em talentos de algoritmos, talentos de arquitetura e talentos de desenvolvimento de aplicativos. Os talentos do algoritmo principal são divididos em pré-treinamento, processamento de dados, ajuste fino de otimização de inferência, etc.
QuantumBit Think Tank: Talentos em algoritmos, talentos em arquitetura, talentos em desenvolvimento de aplicativos, que tipo de talento você acha que é o mais escasso? E é provável que continue escasso por muito tempo.
Fang Han: Atualmente, os talentos mais escassos são definitivamente os de algoritmos essenciais, mas a situação de oferta e demanda será aliviada rapidamente. Porque há um fenômeno muito interessante aqui. Atualmente, o poder computacional de várias universidades é seriamente insuficiente, e a direção relacionada a grandes modelos é atualmente um tópico quente. Há muitos talentos que podem se voltar para esse campo de pesquisa. Por exemplo, todos os talentos que fazem PNL estão se voltando para grandes modelos.
Portanto, minha opinião pessoal é que dentro de 1 a 2 anos, a escassez de talentos em algoritmos será bastante aliviada, porque há muitos talentos em algoritmos com altos salários. Acredito que a China ainda é muito orientada ao mercado na alocação de talentos.
Elementos de habilidade que grandes talentos de modelos devem possuir
Quantum位 Think Tank: Ao recrutar talentos, quais qualidades você mais valoriza?
Fang Han: Entre os aspectos que você mencionou, ou seja, realizações acadêmicas, experiência prática, formação educacional e consciência inovadora, damos prioridade à experiência prática e à consciência inovadora: Em primeiro lugar, o treinamento de grandes modelos é essencialmente um problema de engenharia, então a experiência prática é definitivamente muito importante. Em segundo lugar, grandes modelos são projetos inovadores, porque todas as grandes empresas de modelos estão competindo em paralelo. Sem um senso de inovação, é difícil ficar à frente dos outros, porque esta é uma direção de engenharia completamente nova.
QuantumBit Think Tank: O que você acha desse senso de inovação?
Fang Han: Minha compreensão de inovação é diferente da inovação definida pelo público em geral. No passado, era mais sobre inovação de algoritmos. Quando digo inovação, antes de tudo, quero dizer acompanhar os avanços de ponta dos grandes modelos. Há muitas pessoas ao redor do mundo pesquisando treinamento de modelos grandes, e essa direção está progredindo muito rapidamente. Centenas de novos artigos são publicados todos os dias, trazendo melhorias em todas as direções e áreas. A segunda é ser capaz de usar novos métodos para resolver problemas de engenharia com base nas necessidades reais. A inovação aqui se concentra mais em como resolver problemas e melhorar indicadores de forma inovadora, de uma perspectiva técnica e de engenharia.
Quantum Bit Think Tank: Você acha que é possível julgar a consciência inovadora de grandes modelos por meio de conquistas acadêmicas, resultados de patentes, etc.?
Fang Han: Acho que não é razoável julgar a consciência inovadora dos talentos com base em suas conquistas patentes. A OpenAI não dá muita importância ao desempenho de talentos na solicitação de patentes. A melhor inovação, na verdade, depende do acúmulo de experiência interna. Não é razoável julgar apenas pela perspectiva das patentes.
No entanto, as conquistas acadêmicas podem servir como uma base relativamente importante para o julgamento. Por exemplo, as primeiras pessoas a criar o modelo Vicunha e as primeiras pessoas a criar o ControlNet eram estudantes de doutorado. Nessa perspectiva, as conquistas acadêmicas podem servir de referência.
Entretanto, no processo operacional real, além das grandes inovações na publicação de artigos, inúmeras pequenas inovações também são necessárias na engenharia para alcançar o sucesso. Portanto, a conscientização sobre inovação ainda deve ser avaliada com base na velocidade e na capacidade de entrega dos talentos na resolução de problemas na prática.
Como cultivar talentos para grandes modelos
QuantumBit Think Tank: O modelo Tiangong foi atualizado de 1.0 para 3.5. Em quais áreas de talentos serão focados os diferentes estágios?
Fang Han: Nos estágios iniciais, precisamos de talentos em algoritmos que estejam mais familiarizados com a arquitetura subjacente de grandes modelos, CNN e Transformer e, claro, talentos em ciência de dados em limpeza e processamento de dados; quando os grandes modelos amadurecerem gradualmente e precisarem recorrer à multimodalidade, precisaremos de um grupo de talentos em visão computacional; se quisermos lançar os grandes modelos para o mundo exterior, precisaremos de talentos em auditoria de segurança.
Quantum Bit Think Tank: Como a Kunlun Wanwei cultiva seus próprios talentos em grandes modelos?
Fang Han: Kunlun Wanwei começou a treinar modelos grandes em 2020. Naquela época, havia poucos talentos no mercado que sabiam trabalhar com modelos grandes. Havia mais pessoas seguindo o caminho BERT e relativamente poucas seguindo o caminho GPT, então optamos por treinar grandes modelos talentosos nós mesmos.
O método de treinamento é permitir que talentos com experiência em algoritmos aprendam a direção do treinamento do modelo. Portanto, ao recrutar, devemos considerar selecionar talentos familiarizados com aprendizado de máquina e aprendizado profundo, bem como talentos com forte automotivação e alta velocidade de aprendizado, e talentos com experiência em algoritmos. Alguns dos nossos talentos estudaram originalmente CNN e outras áreas técnicas, e agora se voltarão mais para a área de treinamento do GPT.
Quantum位 Think Tank: O que você acha desse modelo de treinamento de “vacas grandes liderando vacas pequenas”?
Fang Han: Na verdade, toda empresa voltada para a tecnologia escolherá o método de treinamento "vaca grande liderando vaca pequena", mas selecionar talentos é mais importante do que treiná-los, e o aprendizado independente é mais importante do que o relacionamento mestre-aprendiz. Portanto, ao recrutar, também damos grande importância à capacidade de aprendizado independente dos talentos.
Para direções técnicas tradicionais, como Java, é necessária uma vasta experiência, e recém-formados precisam de um período de treinamento mais longo para se tornarem especialistas na área. No entanto, o treinamento de modelos de grande porte é um campo emergente, e o acúmulo de experiência da indústria não é muito mais profundo do que o da academia. O que temos a mais que a academia é poder computacional, mas na verdade não estamos muito à frente das universidades em termos de algoritmos.
Quantum Bit Think Tank: Quanto tempo leva para recém-formados se tornarem especialistas em grandes modelos?
Fang Han: Há um grande número de estudantes de doutorado que podem publicar artigos de grande porte de vanguarda. Também é possível observar que muitos artigos sobre inovação em grandes modelos são publicados por alunos de doutorado do segundo e terceiro ano. Encontramos talentos nas escolas que podem começar imediatamente e se tornar especialistas em suas áreas em apenas alguns meses.
Nossa ideia é selecionar talentos entre os recém-doutores que demonstraram capacidade inovadora e visão técnica enquanto estavam na escola. Podemos treinar "vacas pequenas" para se tornarem o que vocês chamam de "vacas grandes" em um período de tempo mais curto.
Quantum Bit Think Tank: Depois de alguns meses a um ano, esses recém-formados em doutorado podem se tornar "grandes nomes" na área. Entendo que as "vacas grandes" às quais você se refere são aquelas que têm capacidades essenciais de pesquisa e desenvolvimento.
Fang Han: Sim, oferecemos muitas oportunidades para os jovens. Na verdade, provavelmente há apenas algumas dezenas de pessoas trabalhando no treinamento GPT na OpenAI, e um grande número delas são pessoas que se formaram há alguns anos. Acredito que esse seja basicamente o caso das grandes equipes de modelos na China. Este é um campo totalmente novo e há grandes oportunidades para iniciantes. Um aluno de doutorado recém-formado pode não ter problemas em se tornar um especialista técnico na área depois de trabalhar por cerca de meio ano, mas ele ou ela definitivamente não terá habilidades de gestão. Este campo técnico é muito novo e todos estão correndo na mesma linha de partida, então os recém-formados não estão necessariamente em desvantagem.
Quantum位 Think Tank: A maioria dos novos graduados que você mencionou está se formando em processamento de linguagem natural? Em que áreas específicas ele será subdividido?
Fang Han: Não é um processamento de linguagem totalmente natural. Acredito que em todo o ciclo de vida de um grande modelo, além do processamento de dados que exige dependência do acúmulo de engenharia, há direções de pesquisa correspondentes na academia em áreas como pré-treinamento, RLHF, SFT e otimização de operadores. Então acredito que eles têm 70-80% da capacidade de desenvolver e treinar grandes modelos.
É muito fácil para pessoas que estudam aprendizado de máquina, aprendizado por reforço e aprendizado profundo migrarem para modelos grandes. Além disso, como há muitos modelos de código aberto atualmente, e muitas pessoas na comunidade acadêmica estão fazendo trabalhos de pesquisa baseados em modelos de código aberto, não acredito que haja uma lacuna absoluta na divisão de trabalho entre talentos universitários.
O desenvolvimento do mercado nacional de talentos de grandes modelos
Quantum位 Think Tank: O que você acha do desenvolvimento geral do atual mercado de talentos de grandes modelos?
Fang Han: Acho que grandes modelos talentosos estão em uma situação muito escassa no geral, então haverá mais pessoas trabalhando em estoques existentes. Entretanto, à medida que mais e mais pessoas se envolvem em modelagem em larga escala, a divisão do trabalho se tornará cada vez mais detalhada. Este é um processo natural de diferenciação. O processo de desenvolvimento de qualquer nova tecnologia é assim: desde os primeiros engenheiros full-stack se tornando gradualmente líderes de equipe e líderes de nível de diretoria, até que as direções técnicas dos membros da equipe se tornam mais diferenciadas.
Quantum位 Think Tank: A maioria dos talentos recrutados pela Kunlun Wanwei vem de universidades ou mais desta indústria?
Fang Han: Atualmente, precisamos de talentos com experiência prática, então escolheremos mais talentos da indústria que tenham vasta experiência em engenharia. Mas também recrutamos recém-formados como reservas, então há mais recrutamentos no campus, e a proporção de recrutamento no campus para recrutamento social é de cerca de 1:5.
Quantum位 Think Tank: Em que estágio você acha que está o atual desenvolvimento de talentos em modelos de larga escala?
Fang Han: A julgar pelo número de conquistas acadêmicas de talentos como um todo, a China ocupa o primeiro lugar no mundo em termos de número de artigos sobre IA publicados, e os Estados Unidos, o segundo. O número de artigos publicados pelos Estados Unidos é maior que o da China.
Acredito que, em termos de capacidades de talento, talentos com experiências diferentes são necessários para grandes modelos. Deve incluir talentos de reserva recém-formados, especialistas de campo e líderes. Entretanto, da perspectiva da oferta, estamos atualmente em uma fase de escassez. A situação da oferta será bastante aliviada em cerca de 3 a 5 anos, porque leva 5 anos desde a criação das disciplinas até a formatura dos alunos.
A dificuldade de cultivar talentos em grandes modelos
Quantum位 Think Tank: Em quais aspectos você acha que o treinamento de talentos pode ser melhorado?
Fang Han: Compartilharei principalmente de duas perspectivas: a perspectiva empresarial e a perspectiva macro.
De uma perspectiva corporativa, os talentos podem crescer mais rápido quando participam de projetos de engenharia. Esta é uma maneira muito óbvia e prática. Em grandes empresas que são mais pacientes com talentos, os talentos serão mais profissionais no que fazem, mas os talentos na grande equipe de modelos de uma pequena empresa crescem de forma mais abrangente e devem ter todos os elementos de capacidade de um conjunto completo de grandes modelos.
De uma perspectiva macro, em comparação com outras indústrias tradicionais, a dificuldade em cultivar talentos para grandes modelos reside no fato de que as universidades atualmente não têm poder de computação, o que dificulta que as escolas cultivem talentos arquitetônicos. Esses talentos só podem ir às empresas para treinamento. Este é um dilema enfrentado por todas as universidades ao redor do mundo. Acreditamos que essa situação será aliviada depois que o poder computacional nacional for compartilhado com as universidades.
Quantum Bit Think Tank: Ou seja, ele depende mais da ligação entre produção, educação, pesquisa e política para cultivar talentos para grandes modelos.
Fang Han: Acho que devemos fazer o nosso melhor para fornecer as mesmas condições de hardware nas escolas e nas empresas, caso contrário, o que aprendemos na escola será definitivamente relativamente limitado.
A tendência de desenvolvimento futuro de grandes talentos de modelos e empresas de IA
Quantum Bit Think Tank: Da sua perspectiva, qual será a tendência geral de desenvolvimento da indústria de modelos de grande porte no futuro?
Fang Han: Acho que não deveria ser chamada de indústria de grandes modelos, mas sim de toda a indústria de IA. As oportunidades encontradas pela indústria de IA não devem ser menores do que aquelas da Internet e da Internet móvel. Estou muito otimista quanto à tendência de desenvolvimento da indústria de IA. Acredito que a IA mudará profundamente toda a Internet e que toda a vida humana será grandemente impactada e transformada. Acredito que toda a indústria passará por uma mudança de direção.
Quantum位 Think Tank: Com base nessa tendência, que tipo de talento de grande porte você acha que será mais favorecido pelas empresas?
Fang Han: Primeiro de tudo, uma situação de "guerra de cem modelos" agora se formou. Todo mundo está fazendo bases de modelos grandes. No futuro, o segmento de base de modelos grandes será definitivamente reduzido a alguns grandes fabricantes. Mais empresas devem estar em condições de usar modelos grandes para aplicações. Então acredito que haverá cada vez mais talentos desenvolvendo aplicações baseadas em grandes modelos.
Talentos envolvidos no treinamento básico de grandes modelos, otimização de algoritmos e arquiteturas se reunirão em grandes empresas ou grandes equipes de modelos. No entanto, acreditamos que os maiores gigantes não são necessariamente as grandes empresas de modelos, mas sim aquelas que criam aplicativos poderosos baseados em grandes modelos. À medida que essas empresas crescem, elas também construirão seus próprios grandes modelos.
Acreditamos que "a aplicação é rei", o que significa que as empresas que criam novos modelos de negócios baseados em IA e grandes modelos em aplicativos obterão os maiores benefícios. Então acreditamos que nos próximos dez anos definitivamente haverá novas empresas gigantes como ByteDance, Meituan e Didi, e elas certamente crescerão de 0 a 100. Empresas fundadas neste ano ou no próximo ano devem ter essa possibilidade e oportunidade.
