Cientistas da Universidade de Ciência e Tecnologia da China e do YouTu Lab da Tencent desenvolveram uma ferramenta para combater a “alucinação” em modelos de inteligência artificial (IA).
Alucinação é a tendência do modelo de IA de produzir resultados de alta confiança que não parecem ser baseados nas informações encontradas nos dados de treinamento. Esse problema é comum em pesquisas de modelos de linguagem grande (LLM). Sua influência pode ser vista em modelos como ChatGPT da OpenAI e Claude da Anthropic.
A equipe USTC/Tencent desenvolveu uma ferramenta chamada “Woodpecker” que afirma poder corrigir alucinações em modelos multimodais de grandes linguagens (MLLM).
Este subconjunto de IA inclui modelos como GPT-4 (especificamente sua variante visual GPT-4V) e sistemas que incluem modelagem de linguagem baseada em texto, bem como visão e/ou outras operações de processamento.
A equipe observa que usou três modelos de IA separados para realizar a correção de alucinações, separados do MLLM que corrige as alucinações.
Estes incluem GPT-3.5 turbo, Grounding DINO e BLIP-2-FlanT5. Juntos, esses modelos funcionam como avaliadores para detectar alucinações e dar instruções para que o modelo corrigido reproduza seu resultado de acordo com seus dados.
Para corrigir alucinações, os modelos de IA que executam o “Woodpecker” usam um processo de cinco etapas que inclui “extração de conceitos-chave, formulação de perguntas, verificação visual de informações, geração de afirmações visuais e correção de alucinações”.
Os pesquisadores afirmam que essas técnicas fornecem transparência adicional e oferecem um “aumento de precisão de 30,66%/24,33% em relação à linha de base do MiniGPT-4/mPLUG-Owl”. Eles avaliaram muitos MLLMs “prontos para uso” usando seu método e concluíram que o Woodpecker “pode ser facilmente integrado a outros MLLMs”.
A versão de avaliação do Pica-Pau está disponível no Gradio Live, onde os entusiastas podem conferir o veículo em ação. Participe da discussão compartilhando suas idéias na seção de comentários.
Alucinação é a tendência do modelo de IA de produzir resultados de alta confiança que não parecem ser baseados nas informações encontradas nos dados de treinamento. Esse problema é comum em pesquisas de modelos de linguagem grande (LLM). Sua influência pode ser vista em modelos como ChatGPT da OpenAI e Claude da Anthropic.
A equipe USTC/Tencent desenvolveu uma ferramenta chamada “Woodpecker” que afirma poder corrigir alucinações em modelos multimodais de grandes linguagens (MLLM).
Este subconjunto de IA inclui modelos como GPT-4 (especificamente sua variante visual GPT-4V) e sistemas que incluem modelagem de linguagem baseada em texto, bem como visão e/ou outras operações de processamento.
A equipe observa que usou três modelos de IA separados para realizar a correção de alucinações, separados do MLLM que corrige as alucinações.
Estes incluem GPT-3.5 turbo, Grounding DINO e BLIP-2-FlanT5. Juntos, esses modelos funcionam como avaliadores para detectar alucinações e dar instruções para que o modelo corrigido reproduza seu resultado de acordo com seus dados.
Para corrigir alucinações, os modelos de IA que executam o “Woodpecker” usam um processo de cinco etapas que inclui “extração de conceitos-chave, formulação de perguntas, verificação visual de informações, geração de afirmações visuais e correção de alucinações”.
Os pesquisadores afirmam que essas técnicas fornecem transparência adicional e oferecem um “aumento de precisão de 30,66%/24,33% em relação à linha de base do MiniGPT-4/mPLUG-Owl”. Eles avaliaram muitos MLLMs “prontos para uso” usando seu método e concluíram que o Woodpecker “pode ser facilmente integrado a outros MLLMs”.
A versão de avaliação do Pica-Pau está disponível no Gradio Live, onde os entusiastas podem conferir o veículo em ação. Participe da discussão compartilhando suas idéias na seção de comentários.