Tradutor de Artigos

Traduzido do inglês

Toolformer é uma arquitetura de modelo de linguagem que aprende a usar ferramentas externas por meio de aprendizado autossupervisionado, permitindo que decida quando e como chamar APIs para melhorar o desempenho em tarefas.

Toolformer é uma arquitetura de modelo de linguagem de grande porte introduzida por pesquisadores da Meta AI em fevereiro de 2023. Ela é projetada para aprender de forma autônoma quais ferramentas externas usar - como calculadoras, mecanismos de busca, sistemas de tradução e APIs de calendário - por meio de um processo de treinamento autossupervisionado. Diferentemente de abordagens anteriores que exigiam extensas anotações humanas ou aprendizado por reforço, o Toolformer aprende o uso de ferramentas a partir de um pequeno conjunto de demonstrações e, em seguida, integra essas capacidades ao seu próprio processo de geração.

O modelo é construído sobre a arquitetura transformador e estende a modelagem autoregressiva padrão de linguagem com um mecanismo para inserir chamadas de ferramentas em sequências de texto. Durante a inferência, o Toolformer pode gerar uma sequência especial de tokens que invoca uma ferramenta, recebe a saída da ferramenta e continua gerando texto que incorpora essa saída. Isso permite que ele delegue tarefas como aritmética, consulta factual ou cálculos de datas a sistemas externos mais confiáveis, melhorando a precisão em tarefas onde o conhecimento paramétrico é insuficiente.

Procedimento de Treinamento

O treinamento do Toolformer usa um pipeline de dois estágios. Primeiro, um pequeno conjunto de exemplos escritos por humanos (cerca de 10 por ferramenta) demonstra como formular uma chamada de ferramenta. A partir desses, o modelo gera um conjunto de dados maior de chamadas de ferramentas potenciais, amostrando de suas próprias saídas e filtrando-as com base em um critério de perda autossupervisionado. Especificamente, o modelo avalia se a chamada de ferramenta reduz a perda no texto subsequente; apenas chamadas que melhoram a previsão são mantidas.

O conjunto de dados filtrado é então usado para ajustar o modelo de linguagem base (uma versão do GPT-J com 6,7 bilhões de parâmetros) por meio da previsão padrão do próximo token. Esse ajuste fino ensina ao modelo tanto quando invocar uma ferramenta quanto como formatar a chamada e integrar o resultado. Os autores relataram que essa abordagem exigiu apenas algumas centenas de exemplos de treinamento por ferramenta, contrastando com métodos que precisam de milhares de instâncias rotuladas.

Ferramentas Suportadas e Capacidades

O Toolformer foi avaliado com cinco ferramentas: uma calculadora para aritmética, um sistema de perguntas e respostas (baseado em um modelo de recuperação aumentada), um mecanismo de busca na Wikipédia, um sistema de tradução automática e uma API de calendário. O modelo aprendeu a usar cada ferramenta de forma apropriada, como chamar a calculadora para multiplicação de múltiplos dígitos e o mecanismo de busca para eventos recentes ou fatos obscuros. Em avaliações de zero disparo em tarefas downstream, como problemas de palavras matemáticas (GSM8K) e perguntas e respostas factuais, o Toolformer superou o modelo base e igualou ou excedeu modelos maiores como o GPT-3 (175B parâmetros) em certos benchmarks.

Uma escolha de design notável é que o Toolformer não exige ajuste fino da própria ferramenta; ele trata cada ferramenta como uma caixa preta com uma interface fixa. Essa modularidade permite que novas ferramentas sejam adicionadas fornecendo alguns exemplos e reexecutando o processo de filtragem.

Limitações e Críticas

O artigo original reconheceu várias limitações. As chamadas de ferramentas do Toolformer são geradas de forma gulosa e não podem ser revisadas com base na saída da ferramenta, o que pode levar a erros em cascata se a chamada inicial for malformada. O modelo também não tem a capacidade de encadear múltiplas chamadas de ferramentas em uma única etapa de raciocínio, limitando seu uso em problemas complexos de múltiplas etapas. Além disso, a filtragem autossupervisionada pode, às vezes, selecionar chamadas espúrias que reduzem a perda sem melhorar genuinamente o desempenho da tarefa.

Trabalhos subsequentes de outros pesquisadores notaram que os ganhos do Toolformer foram modestos em algumas tarefas e que sua dependência de um conjunto fixo de ferramentas limitava a generalização. No entanto, ele inspirou uma linha de pesquisa sobre modelos de linguagem aumentados por ferramentas, incluindo sistemas posteriores como Gorilla e ART, que expandiram o conjunto de ferramentas e melhoraram a robustez das chamadas.

Impacto e Legado

O Toolformer demonstrou que modelos de linguagem podem aprender o uso de ferramentas com supervisão mínima, um passo em direção a sistemas de IA mais capazes e confiáveis. Ele influenciou desenvolvimentos subsequentes em IA generativa e inteligência artificial, particularmente na integração de fontes de conhecimento externas e ferramentas computacionais. A abordagem foi adotada e estendida tanto por laboratórios acadêmicos quanto por grupos da indústria, incluindo OpenAI e Google DeepMind, que incorporaram mecanismos semelhantes de chamada de ferramentas em seus modelos de produção.

A ênfase do artigo no aprendizado autossupervisionado para aquisição de ferramentas também contribuiu para discussões mais amplas sobre aprendizado de máquina eficiente e os limites do conhecimento puramente paramétrico. Em 2025, modelos de linguagem aumentados por ferramentas são um componente padrão de muitos assistentes de IA implantados, embora normalmente usem métodos mais sofisticados de planejamento e verificação do que o Toolformer original.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:language-models·tool-use·self-supervised-learning·artificial-intelligence
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico