Fonte da reimpressão do artigo: AI DreamWorks

Fonte do artigo: Xinzhiyuan

Dois estudiosos do MIT publicaram um artigo provando que grandes modelos de linguagem podem compreender o mundo! O seu trabalho mostra que o LLM não aprende apenas estatísticas superficiais, mas também aprende um modelo do mundo que inclui dimensões fundamentais como espaço e tempo.

Dentro do grande modelo de linguagem, existe um modelo mundial?

O LLM tem noção de espaço? E em múltiplas escalas espaçotemporais?

Recentemente, vários investigadores do MIT descobriram que a resposta é sim!

Endereço do artigo: https://arxiv.org/abs/2310.02207

Eles descobriram que o Llama-2-70B era realmente capaz de representar um mapa literal do mundo real dos pesquisadores.

Em representações espaciais, os pesquisadores executaram o modelo em nomes de milhares de cidades, regiões e marcos naturais ao redor do mundo usando o modelo Llama-2.

Treinaram detectores lineares nas ativações do último token e descobriram que o Llama-2 pode prever a verdadeira latitude e longitude de cada local.

Em representações temporais, os pesquisadores executaram o modelo em nomes de figuras históricas dos últimos 3000 anos, títulos de músicas, filmes e livros desde 1950 e manchetes de notícias do New York Times na década de 2010, e treinaram uma sonda linear (linear probe) que previu com sucesso o ano de falecimento das figuras históricas, a data de lançamento das músicas, filmes e livros e a data de publicação das notícias.

Em suma, todas as conclusões mostram: LLMs não são apenas papagaios aleatórios — o Llama-2 contém um modelo detalhado do mundo, e não é exagero dizer que os humanos descobriram até um 'neurônio de longitude' em grandes modelos de linguagem!

Assim que este trabalho foi lançado, imediatamente recebeu uma resposta entusiástica. O autor compartilhou o resumo do artigo no Twitter, e em menos de 15 horas, a contagem de visualizações já ultrapassava 1,4 milhão!

Os internautas exclamaram: este trabalho é incrível!

Alguns afirmaram: intuitivamente, isso faz sentido. Porque o cérebro é exatamente aquilo que destila nosso mundo físico e armazena isso em redes biológicas. Quando 'vemos' coisas, elas são, na verdade, projeções que nosso cérebro processa internamente.

Incrível é que vocês conseguiram modelar isso!

Alguns compartilham a mesma opinião, afirmando que talvez a maneira como tentamos imitar o cérebro tenha enganado o criador.

LLMs não são papagaios aleatórios.

Antes, muitos especularam que as impressionantes habilidades mostradas pelos grandes modelos de linguagem podem ser atribuídas ao fato de que aprenderam um grande número de conjuntos de dados superficiais de estatísticas, e não porque são um modelo coerente que contém o processo de geração de dados (ou seja, um modelo do mundo).

Em 2021, a linguista da Universidade de Washington, Emily M. Bender, publicou um artigo afirmando que grandes modelos de linguagem são apenas 'papagaios estocásticos', que não compreendem o mundo real, mas apenas estatísticas das probabilidades de ocorrência de certas palavras e, em seguida, geram frases que parecem razoáveis, como um papagaio.

Devido à natureza não interpretável das redes neurais, a academia ainda não conseguiu esclarecer se os modelos de linguagem são, de fato, papagaios aleatórios; as opiniões divergentes são bastante variadas.

Devido à falta de testes amplamente reconhecidos, se os modelos podem 'entender o mundo' também se torna uma questão filosófica, em vez de uma questão científica.

No entanto, pesquisadores do MIT descobriram que os LLMs aprenderam representações lineares de espaço e tempo em várias escalas, e que essas representações são robustas a mudanças nas solicitações e são unificadas em diferentes tipos de ambientes (como cidades e marcos).

Eles até descobriram que os LLMs possuem 'neurônios espaciais' e 'neurônios temporais' independentes que podem codificar de forma confiável coordenadas espaciais e temporais.

Ou seja, os LLMs não aprenderam apenas as estatísticas superficiais, mas adquiriram conhecimento estruturado sobre dimensões fundamentais como espaço e tempo.

Em resumo, grandes modelos de linguagem são capazes de compreender o mundo.

LLMs podem entender espaço e tempo.

Neste artigo, os pesquisadores levantaram a questão: será que os LLMs podem formar modelos do mundo (e do tempo) a partir do conteúdo dos conjuntos de dados?

Os pesquisadores tentaram responder a essa pergunta extraindo um mapa do mundo real do LLM.

Especificamente, os pesquisadores construíram seis conjuntos de dados que incluem nomes de locais ou eventos com coordenadas espaciais ou temporais correspondentes que cruzam múltiplas dimensões.

Isso inclui endereços em todo o mundo, endereços dentro dos EUA e endereços na cidade de Nova Iorque.

Além disso, o conjunto de dados também incluiu diferentes coordenadas temporais:

1) Anos de falecimento de figuras históricas

2) 3000 anos de história

3) Datas de lançamento de obras de arte e programas de entretenimento desde a década de 1950.

4) Datas de publicação de manchetes de notícias de 2010 a 2020.

Usando a série Llama 2, os pesquisadores treinaram sondas de regressão linear (probe) para investigar as ativações internas dos nomes de cada um desses locais e eventos em cada camada do modelo, a fim de prever suas localizações ou tempos no mundo real.

Esses experimentos exploratórios revelaram evidências de que o modelo constrói representações espaciais e temporais em toda a sua camada inicial, e então alcança um estado estável (plateauing) nas proximidades dos pontos no modelo, com o resultado desse processo sendo que o desempenho de modelos maiores sempre superou o de modelos menores.

Além disso, os pesquisadores demonstraram que essas representações são

(1) Linear, pois sonda não linear teve um desempenho insatisfatório.

(2) A variação nas solicitações pode ter alta robustez.

(3) conceitos de diferentes tipos são semelhantes (por exemplo, cidades e marcos naturais são semelhantes)

Os pesquisadores acreditam que uma possível explicação para esse resultado é que o modelo aprendeu apenas a mapeação de local para país, enquanto as sondas realmente aprenderam como esses diferentes grupos estão relacionados na estrutura geográfica (ou temporal) global.

Para investigar isso, os pesquisadores realizaram uma série de verificações de robustez para entender como as sondas generalizam em diferentes distribuições de dados e como as sondas treinadas em componentes PCA se comportam.

Os resultados do estudo dos pesquisadores indicam que as sondas memorizaram as 'posições absolutas' desses conceitos, mas o modelo realmente possui algumas representações que refletem 'posições relativas'.

Em outras palavras, a sonda aprendeu o mapeamento das coordenadas dentro do modelo para coordenadas interpretáveis por humanos.

Por fim, os pesquisadores usaram sondas para identificar neurônios individuais ativados como funções espaciais ou temporais, fornecendo evidências robustas de que o modelo realmente usou essas características.

Preparação

Para a investigação, os pesquisadores construíram conjuntos de dados de seis nomes de entidades (pessoas, locais, eventos, etc.), que também incluíam suas respectivas localizações ou momentos em que ocorreram, com tamanhos de conjunto de dados variando.

Para cada conjunto de dados, os pesquisadores incluíram vários tipos de entidades, como cidades e outros locais densamente povoados, e marcos naturais como lagos, para estudar a representação unificada de diferentes tipos de objetos.

Além disso, os pesquisadores otimizaram e enriqueceram os metadados relevantes para que pudessem analisar os dados por meio de segmentações mais detalhadas e identificar as fontes de vazamento no teste de treinamento.

Informação de localização

Os pesquisadores construíram conjuntos de dados de nomes de locais do mundo, dos EUA e da cidade de Nova Iorque, com o conjunto de dados mundial dos pesquisadores sendo baseado nos dados originais consultados de DBpedia por Lehmann et al.

Além disso, os pesquisadores incluíram locais densamente povoados, locais naturais e locais estruturais (como edifícios ou infraestrutura). Em seguida, os pesquisadores combinaram isso com artigos da Wikipedia e filtraram entidades que não tinham pelo menos 5000 visualizações em três anos.

O conjunto de dados dos pesquisadores sobre os EUA inclui nomes de cidades, condados, códigos postais, universidades, locais naturais e estruturas, com locais de baixa população ou visualizações similares sendo filtrados.

O conjunto de dados de Nova Iorque inclui locais como escolas, igrejas, instalações de transporte e habitação pública dentro da cidade.

Informação temporal

Os três conjuntos de dados temporais dos pesquisadores incluem:

(1) Nomes e profissões de figuras históricas que faleceram entre 1000 a.C. e 2000 d.C.

(2) Usou a técnica de filtragem de visualizações de página da Wikipedia para construir um conjunto que inclui títulos e autores de músicas, filmes e livros de 1950 a 2020;

(3) As manchetes de notícias de 2010 a 2020 do New York Times, provenientes de colunas que escrevem notícias atuais.

Preparação de dados

Todos os experimentos dos pesquisadores foram realizados utilizando a versão básica da série Llama 2, abrangendo de 7 bilhões a 70 bilhões de parâmetros.

Para cada conjunto de dados, os pesquisadores executaram o modelo em cada nome de entidade, podendo adicionar um breve aviso no início, e armazenaram a ativação do estado oculto (fluxo residual) no último token de entidade de cada camada.

Para um conjunto de n entidades, isso geraria um

Conjunto de dados de ativação.

Sonda

Para buscar evidências de representações espaciais e temporais nos LLMs, os pesquisadores usaram técnicas padrão de sondas.

Ele ajusta um modelo simples nas ativações da rede, para prever alguns alvos (target labels) relacionados aos dados de entrada rotulados. Em particular, dado um conjunto de dados de ativações A ∈ Rn×dmodel e um alvo Y que contém coordenadas de latitude ou longitude em duas dimensões, os pesquisadores ajustaram sondas de regressão linear ridge (fit linear ridge regression probes).

Portanto, obteve-se a sonda linear:

O alto desempenho preditivo em dados fora da amostra indica que o modelo básico possui informações temporais e espaciais que podem ser linearmente decodificadas, embora isso não signifique que o modelo realmente usou essas representações.

Em todos os experimentos, os pesquisadores utilizaram validação cruzada eficiente (efficient leave-out-out cross validation) para ajustar λ no conjunto de treinamento das sondas.

Modelo linear de espaço e tempo

Existência

Os pesquisadores inicialmente investigaram o problema empírico: o modelo representa tempo e espaço? Se sim, em que posição dentro do modelo? A qualidade da representação mudará significativamente com as mudanças na escala do modelo?

No primeiro experimento dos pesquisadores, eles treinaram sondas para cada camada dos conjuntos de dados espaciais e temporais Llama 2-{7B, 13B, 70B}.

Os principais resultados dos pesquisadores são mostrados na figura abaixo, que exibe um padrão bastante consistente entre os conjuntos de dados. Em particular, tanto as características espaciais quanto temporais podem ser recuperadas por sondas lineares.

À medida que a escala do modelo aumenta, essas representações se tornam mais precisas e, antes de alcançar um estado estável, a qualidade das representações nas camadas iniciais do modelo aumenta de forma constante.

Essas observações são consistentes com os resultados da literatura sobre recuperação de fatos, indicando que as camadas iniciais a intermediárias do MLP são responsáveis pela recuperação de informações sobre temas de fatos.

O conjunto de dados com o pior desempenho é o conjunto de dados de Nova Iorque. Considerando que a maioria das entidades é relativamente vaga em comparação com outros conjuntos de dados, isso era esperado.

No entanto, este também é o conjunto de dados onde o maior modelo tem o melhor desempenho relativo, com seu R quase duas vezes maior do que o dos modelos menores, indicando que um LLM suficientemente grande pode eventualmente formar modelos espaciais detalhados de várias cidades.

Representação linear

Na literatura sobre interpretabilidade, cada vez mais evidências apoiam a hipótese de representação linear — as características nas redes neurais são representações lineares.

Ou seja, pode-se ler a presença ou intensidade de características ao projetar as ativações relevantes em um vetor de características. No entanto, esses resultados geralmente se referem a características binárias ou categóricas, diferentes das características contínuas naturais de espaço ou tempo.

Para testar se as características espaciais e temporais são representadas de maneira linear, os pesquisadores compararam o desempenho das sondas de regressão linear ridge (linear ridge regression probes) com o desempenho de uma MLP não linear mais expressiva (more expressive nonlinear MLP).

Os resultados são os seguintes, indicando que para qualquer conjunto de dados ou modelo, a melhoria usando sondas não lineares sobre R é mínima.

Os pesquisadores consideraram isso como uma forte evidência de que tanto espaço quanto tempo podem ser representados linearmente (ou pelo menos linearmente decodificáveis), embora sejam contínuos.

Sensibilidade a palavras-chave

Outra questão óbvia é se essas características espaciais ou temporais são sensíveis às palavras-chave, ou seja, se o contexto pode evocar ou inibir a recuperação dessas informações.

Intuitivamente, para qualquer token de entidade, o modelo autoregressivo seria incentivado a gerar representações adequadas para resolver qualquer contexto ou questão futura que pudesse surgir.

Para investigar essa questão, os pesquisadores criaram um novo conjunto de dados de ativações, onde marcaram diferentes avisos para cada entidade de acordo com alguns temas básicos. Em todos os casos, os pesquisadores incluíram um aviso 'vazio', que não continha nada além do token da entidade (e do início do token de sequência).

Os pesquisadores então adicionaram um aviso pedindo ao modelo que se lembrasse de fatos relevantes, como 'Qual é a latitude e longitude de <localização?' ou 'Qual é a data de lançamento de <livro?'

Para os conjuntos de dados de Nova Iorque e dos EUA, os pesquisadores também incluíram versões dessas solicitações, perguntando qual o local dentro dos EUA ou da cidade de Nova Iorque, para eliminar a ambiguidade de nomes de locais comuns (como a Prefeitura).

Como base, os pesquisadores incluíram 10 tokens aleatórios como solicitação (amostrados para cada entidade). Para determinar se os pesquisadores poderiam confundir o tema, para certos conjuntos de dados, os pesquisadores colocaram todos os nomes de entidades completamente em maiúsculas.

Por fim, para o conjunto de dados de títulos, os pesquisadores tentaram detectar o último token e o token de ponto final anexado ao título.

A figura acima é o resultado do modelo 70B, e a figura abaixo é o resultado de todos os modelos.

Os pesquisadores descobriram que fornecer informações explícitas ao modelo, ou dar dicas de desambiguação, como um local localizado nos EUA ou na cidade de Nova Iorque, quase não afeta o desempenho. No entanto, os pesquisadores ficaram surpresos com o grau em que tokens de interferência aleatória reduziram o desempenho.

Colocar o nome das entidades em maiúsculas também pode reduzir o desempenho, embora não de forma tão severa e não seja surpreendente, pois isso pode interferir na 'detokenização' das entidades.

Uma modificação que melhora significativamente o desempenho é a detecção do token de ponto final após o título, indicando que o ponto final contém algumas informações resumidas da sentença final.

Teste de robustez

A seção anterior já demonstrou que os pontos de tempo ou espaço reais de diferentes tipos de eventos ou locais podem ser recuperados linearmente das ativações internas das camadas finais do LLM.

No entanto, isso não significa se (ou como) o modelo realmente usou as direções aprendidas pelas sondas, pois as sondas podem aprender algumas combinações lineares de características mais simples que o modelo realmente usa.

Validação por meio de generalização

Para ilustrar os potenciais problemas nas conclusões dos pesquisadores, considere a tarefa de representar um mapa-múndi completo.

Se o modelo é como os pesquisadores esperam, com características binárias quase ortogonais em 'X país', então pode-se construir sondas de alta qualidade de latitude (longitude) somando esses vetores de características ortogonais de cada país, cujos coeficientes são iguais à latitude (longitude) daquele país.

Presumindo que um local esteja localizado apenas em um país, tal detecção colocaria cada entidade em seu centro nacional.

No entanto, neste caso, o modelo realmente não representa o espaço, apenas representa a filiação nacional, e ele aprende apenas a partir de supervisão explícita como os diferentes países têm formas geométricas.

Para diferenciar melhor essas situações, os pesquisadores analisaram como as sondas generalizam ao fornecer blocos de dados específicos.

Em particular, os pesquisadores treinaram uma série de sondas, em que cada sonda foi fornecida com um país, estado, divisão administrativa, século, década ou ano de um conjunto de dados sobre o mundo, os EUA, Nova Iorque, figuras históricas, entretenimento e notícias.

Os pesquisadores então avaliaram a detecção dos blocos de dados retidos. Na tabela acima, os pesquisadores relataram o erro médio de proximidade dos blocos de dados quando completamente retidos, comparando isso com o erro dos pontos de teste nesse bloco na divisão padrão de treinamento-teste (média para todos os blocos retidos).

Os pesquisadores descobriram que, embora o desempenho de generalização seja afetado, especialmente para conjuntos de dados espaciais, ainda é claramente superior ao de conjuntos de dados aleatórios. Ao traçar as previsões dos estados ou países marcados na figura abaixo, um padrão mais claro emerge.

Escala mundial

Ou seja, a sonda se generaliza corretamente ao colocar os pontos nas posições relativas corretas (medindo o ângulo entre os centros reais e previstos) em vez de posições absolutas.

Os pesquisadores consideraram isso como uma evidência fraca, indicando que a sonda está extraindo características aprendidas explicitamente do modelo, mas está memorizando a transformação de coordenadas do modelo para coordenadas humanas.

No entanto, isso não exclui completamente a hipótese de características binárias potenciais, pois pode haver uma hierarquia de tais características que não segue as fronteiras de países ou décadas.

Generalização entre entidades

Até agora, a afirmação implícita na discussão dos pesquisadores é que o modelo representa de forma unificada as coordenadas espaciais ou temporais de diferentes tipos de entidades (como cidades ou marcos naturais).

No entanto, semelhante à detecção de latitude que pode ser a soma ponderada de características de pertencimento, a detecção de latitude também pode ser a soma de diferentes direções (ortogonais) de latitude para cidades e marcos naturais.

Semelhante ao acima, os pesquisadores treinaram uma série de sondas para distinguir essas hipóteses, onde a divisão de treinamento e teste foi realizada para manter todos os pontos de uma classe de entidade específica, conforme mostrado na tabela abaixo, a proximidade e os erros das entidades no teste padrão de divisão, como antes, foram calculados para todas essas divisões.

Os resultados indicam que as sondas generalizam em grande parte sobre os tipos de entidades, exceto para o conjunto de dados de entretenimento.

Neurônios espaciais e temporais

Embora esses resultados anteriores sejam inspiradores, não há nenhuma evidência que indique diretamente que o modelo usou as características aprendidas pela sonda.

Para resolver esse problema, os pesquisadores procuraram neurônios individuais com pesos de entrada ou saída que tivessem alta similaridade de cosseno com a direção de detecção aprendida.

Ou seja, os neurônios que os pesquisadores estão procurando têm direções de leitura ou escrita semelhantes às direções aprendidas pela sonda.

Eles descobriram que ao projetar o conjunto de dados de ativações nos pesos dos neurônios mais semelhantes, esses neurônios eram altamente sensíveis às localizações reais das entidades no espaço ou no tempo.

Ou seja, existem neurônios individuais no modelo que são características de sondas com considerável capacidade preditiva.

Além disso, esses neurônios são sensíveis a todos os tipos de entidades no conjunto de dados, o que indica ainda mais que essas representações são unificadas.

Se as sondas treinadas sob supervisão explícita são um limite superior aproximado da medida em que o modelo representa essas características espaciais e temporais, então o desempenho de neurônios individuais é o limite inferior.

Em particular, os acadêmicos geralmente acreditam que as características são distribuições sobrepostas, o que torna o nível de análise de neurônios individuais incorreto.

No entanto, a presença desses neurônios individuais (exceto para a previsão do próximo token, eles não receberam supervisão) ainda é uma evidência poderosa de que o modelo aprendeu e usou características espaciais e temporais.

O Othello-GPT prova que LLMs entendem o mundo, recebendo elogios de Andrew Ng.

A inspiração mais direta dos pesquisadores do MIT veio da pesquisa anterior sobre a medida em que sistemas de aprendizado profundo formam modelos interpretáveis do processo de geração de dados.

E a demonstração mais poderosa e clara vem, sem dúvida, dos modelos GPT treinados em jogos de xadrez e Othello — esses modelos têm representações claras tanto do tabuleiro quanto do estado do jogo.

Em fevereiro deste ano, pesquisadores da Universidade de Harvard e do MIT publicaram conjuntamente um novo estudo, Othello-GPT, que validou a eficácia das representações internas em um simples jogo de tabuleiro.

Eles acreditam que os modelos de linguagem realmente estabeleceram um modelo do mundo, e não apenas memória ou estatísticas, embora a origem de sua capacidade ainda não esteja clara.

Link do artigo: https://arxiv.org/pdf/2210.13382.pdf

O processo experimental é muito simples, e na ausência de qualquer conhecimento prévio das regras do Othello, os pesquisadores descobriram que o modelo consegue prever operações de movimento legais com uma taxa de precisão muito alta, capturando o estado do tabuleiro.

Andrew Ng expressou alta aprovação a essa pesquisa em sua coluna 'Letters', afirmando que, com base nesta pesquisa, há razões para acreditar que grandes modelos de linguagem construíram um modelo do mundo suficientemente complexo e que, em certa medida, realmente compreendem o mundo.

Link do blog: https://www.deeplearning.ai/the-batch/does-ai-understand-the-world/

Modelo do mundo do tabuleiro

Se imaginarmos o tabuleiro como um 'mundo' simples e exigirmos que o modelo tome decisões continuamente durante o jogo, poderíamos inicialmente testar se o modelo sequencial consegue aprender representações do mundo.

Os pesquisadores escolheram um simples jogo de Othello como plataforma experimental, cujas regras são —

No centro do tabuleiro 8*8, coloque primeiro quatro peças, duas pretas e duas brancas; em seguida, ambos os lados jogam alternadamente, transformando todas as peças inimigas (não incluindo espaços vazios) entre suas duas peças em sua cor (chamado de captura), e cada jogada deve incluir uma captura; por fim, quando o tabuleiro estiver cheio, quem tiver mais peças vence.

Comparado ao xadrez, as regras do Othello são muito mais simples; ao mesmo tempo, o espaço de busca dos jogos de tabuleiro é grande o suficiente para que o modelo não possa gerar sequências apenas por memória, tornando-o ideal para testar a capacidade do modelo de aprender representações do mundo.

Modelo de linguagem Othello

Os pesquisadores inicialmente treinaram uma versão variante do modelo de linguagem GPT (Othello-GPT), inserindo o script do jogo (uma série de operações de movimento de peças feitas pelos jogadores) no modelo, mas o modelo não tinha conhecimento prévio sobre o jogo e suas regras.

O modelo também não foi explicitamente treinado para buscar melhorias estratégicas, vencer partidas, etc.; ele simplesmente teve uma alta taxa de precisão ao gerar operações de movimento legais de Othello.

Conjunto de dados

Os pesquisadores usaram dois conjuntos de dados de treinamento:

O Campeonato (Championship) foca mais na qualidade dos dados, principalmente nas etapas de movimento mais estratégicas adotadas por jogadores humanos profissionais em dois campeonatos de Othello, mas apenas coletou 7605 e 132921 amostras de jogos, respectivamente, e os dois conjuntos de dados foram aleatoriamente divididos na proporção de 8:2 em um conjunto de treinamento (20 milhões de amostras) e um conjunto de validação (3,796 milhões).

O sintético (Synthetic) foca mais na escala dos dados, consistindo em operações de movimento aleatórias e legais, com uma distribuição de dados diferente do conjunto de dados do campeonato, sendo amostradas uniformemente da árvore de jogo do Othello, com 20 milhões de amostras usadas para treinamento e 3,796 milhões de amostras usadas para validação.

A descrição de cada jogo é composta por uma sequência de tokens, com um tamanho de vocabulário de 60 (8 * 8 - 4).

Modelo e treinamento

A arquitetura do modelo é um modelo GPT de 8 camadas, com 8 cabeças e uma dimensão oculta de 512.

Os pesos do modelo foram inicializados aleatoriamente, incluindo a camada de incorporação de palavras, embora exista uma relação geométrica no vocabulário que representa as posições do tabuleiro (como C4 abaixo de B4), essa indução não foi explicitamente representada, mas deixada para o modelo aprender.

Prever movimentos legais

O principal critério de avaliação do modelo é se as operações de movimento previstas estão de acordo com as regras do Othello.

A taxa de erro do Othello-GPT treinado no conjunto de dados sintético é de 0,01%, enquanto a taxa de erro no conjunto de dados de campeonato é de 5,17%; em comparação, a taxa de erro do Othello-GPT não treinado é de 93,29%, o que significa que ambos os conjuntos de dados ensinaram o modelo, até certo ponto, as regras do jogo.

Uma possível explicação é que o modelo memorizou todas as operações de movimento do jogo de Othello.

Para validar essa suposição, os pesquisadores sintetizaram um novo conjunto de dados: no início de cada partida, o Othello tem quatro possíveis posições iniciais (C5, D6, E3 e F4), removendo todas as jogadas da abertura C5 como conjunto de treinamento, e usando os dados de abertura C5 como teste, ou seja, removendo quase 1/4 da árvore do jogo, e encontrando uma taxa de erro de apenas 0,02%.

Portanto, o alto desempenho do Othello-GPT não é devido à memória, pois os dados de teste não foram vistos durante o processo de treinamento, então o que realmente permite que o modelo faça previsões de sucesso?

Exploração de representações internas

Uma ferramenta comum para detectar representações internas em redes neurais é a sonda (probe), onde cada sonda é um classificador ou regressor, cuja entrada consiste nas ativações internas da rede e que é treinada para prever características de interesse.

Neste tarefa, para detectar se as ativações internas do Othello-GPT contêm representações do estado atual do tabuleiro, após inserir a sequência de movimentos, as ativações internas são usadas para prever o próximo passo de movimento.

Quando se utilizava sondas lineares, a representação interna do Othello-GPT treinado era apenas um pouco melhor que a taxa de acerto do chute aleatório.

Ao usar sondas não lineares (MLP de duas camadas), a taxa de erro diminuiu drasticamente, comprovando que o estado do tabuleiro não é armazenado de maneira simples nas ativações da rede.

Experimento de intervenção

Para determinar a relação causal entre as previsões do modelo e as representações do mundo emergente, ou seja, se o estado do tabuleiro realmente influenciou as previsões da rede, os pesquisadores realizaram um conjunto de testes de intervenção e mediram a magnitude do efeito resultante.

Dada uma série de ativações do Othello-GPT, prever o estado do tabuleiro com sondas, registrar as previsões de movimentos associadas e, em seguida, modificar a ativação para que a sonda preveja o estado do tabuleiro atualizado.

As operações de intervenção incluem modificar uma peça em uma determinada posição de branca para preta, e uma pequena modificação leva o modelo a descobrir que as representações internas podem prever de forma confiável, indicando que há uma influência causal entre as representações internas e as previsões do modelo.

Visualização

Além de validar a eficácia das representações internas por meio de experimentos de intervenção, os pesquisadores também visualizaram os resultados preditivos, por exemplo, para cada peça no tabuleiro, pode-se perguntar ao modelo como as previsões mudariam se a peça fosse alterada usando técnicas de intervenção, correspondendo à significância dos resultados preditivos.

É possível ver que os mapas de potencial significante preditivo top1 dos Othello-GPTs treinados nos conjuntos de dados sintéticos e de campeonato mostram padrões claros.

Em resumo, a pesquisa de Harvard e MIT mostra que grandes modelos de linguagem realmente entendem o mundo, não é de se admirar que tenham recebido elogios de Andrew Ng.

GPT-4 é apenas a centelha da AGI? LLMs acabarão saindo de cena, o modelo do mundo é o futuro.

Por que o 'modelo do mundo' é tão atraente?

Isso é exatamente porque a forma final e objetiva da inteligência artificial — a Inteligência Artificial Geral (AGI), um 'modelo capaz de compreender o mundo', e não apenas 'um modelo que descreve o mundo'.

Em 1931, Kurt Gödel publicou o teorema da incompletude.

O teorema de Gödel indica que mesmo a matemática não pode, em última instância, provar tudo — os humanos sempre terão fatos que não podem ser provados — e a teoria quântica demonstra que o mundo dos pesquisadores carece de certeza, dificultando previsões de certos eventos, como a velocidade e a posição de um elétron.

Embora Einstein tenha expressado a famosa opinião de que 'Deus não joga dados com o universo', na essência, as limitações humanas se manifestam de maneira clara ao prever ou compreender as coisas na física.

No livro 'Como Aprendemos', o acadêmico Stanislas Dehaene define aprendizado como 'o processo de formação de um modelo do mundo'.

Em 2016, o AlphaGo derrotou o campeão mundial Lee Sedol por 4 a 1 em uma competição de Go.

No entanto, carece da capacidade humana de reconhecer táticas incomuns e fazer os ajustes apropriados. Portanto, é apenas uma inteligência artificial fraca.

E o AGI que os pesquisadores desejam é um modelo do mundo que seja consistente com a experiência e capaz de fazer previsões precisas.

Em 13 de abril, a parceira da OpenAI, Microsoft, publicou um artigo intitulado 'Sparks of Artificial General Intelligence: Early experiments with GPT-4' (Centelhas de Inteligência Geral Artificial: Experimentos iniciais com GPT-4).

Endereço do artigo: https://arxiv.org/pdf/2303.12712

O que é mencionado:

O GPT-4 não só domina a linguagem, mas também resolve tarefas de ponta em áreas como matemática, codificação, visão, medicina, direito e psicologia, sem precisar de qualquer aviso especial. E em todas essas tarefas, o desempenho do GPT-4 é praticamente equivalente ao humano. Com base na amplitude e profundidade das funcionalidades do GPT-4, os pesquisadores acreditam que ele pode ser razoavelmente considerado uma versão quase, mas não totalmente, completa de inteligência artificial geral.

No entanto, como muitos especialistas criticaram, confundir desempenho com capacidade significa que o GPT-4 gera uma descrição resumida do mundo que é considerada uma compreensão do mundo real.

Atualmente, a maioria dos modelos aceita apenas treinamento em texto e não possui a capacidade de falar, ouvir, cheirar e agir no mundo real.

É como a alegoria da caverna de Platão, onde as pessoas que vivem na caverna só podem ver as sombras na parede e não reconhecem a verdadeira existência das coisas.

E tanto a pesquisa de fevereiro da Harvard e MIT quanto o artigo de hoje apontam que os grandes modelos de linguagem realmente podem entender o mundo em certa medida, e não apenas garantir que estão corretos gramaticalmente.

Apenas essas possibilidades já são suficientemente empolgantes.

Referências:

https://arxiv.org/abs/2310.02207

https://twitter.com/wesg52/status/1709551516577902782