Traduzido do inglês

Ollama é uma plataforma de software de código aberto para executar e gerenciar grandes modelos de linguagem localmente em computadores pessoais, oferecendo uma CLI, GUI, API REST e ferramentas de gerenciamento de modelos. Desenvolvida por Jeffrey Morgan e Michael Chiang, ela suporta vários modelos de pesos abertos e integra-se com assistentes de codificação.

Ollama é uma plataforma de software de código aberto desenvolvida por Jeffrey Morgan e Michael Chiang em 2023 para executar e gerenciar modelos de linguagem de grande porte em computadores locais e por meio de modelos hospedados em nuvem. Ela fornece uma interface de linha de comando, uma interface gráfica nativa, uma API REST local, ferramentas de gerenciamento de modelos e integrações para usar modelos de código aberto com assistentes de codificação e outros aplicativos. A plataforma foi projetada para simplificar o processo de download, execução e gerenciamento de modelos como Llama, Gemma, Mistral, Qwen e DeepSeek em hardware pessoal, tornando a IA generativa mais acessível para usuários individuais e desenvolvedores.

Ollama atua como uma ponte entre os pesos brutos dos modelos e o usuário final, abstraindo as complexidades do serviço de modelos e da inferência. Por padrão, ela é executada localmente, o que aborda preocupações com privacidade e controle de dados que surgem com serviços de IA baseados em nuvem. O projeto ganhou força na comunidade de código aberto como uma ferramenta para experimentação, desenvolvimento e implantação de modelos de peso aberto sem exigir infraestrutura extensa ou assinaturas de nuvem.

História

Ollama foi lançada pela primeira vez em 8 de julho de 2023. O projeto se tornou associado ao crescimento do software de modelos de linguagem de grande porte local, permitindo que os usuários baixem e executem modelos como Llama, Gemma, Mistral, Qwen, gpt-oss, GLM e DeepSeek em uma máquina local. Este lançamento coincidiu com uma tendência mais ampla em direção à inferência local, impulsionada por melhorias na quantização de modelos e nas capacidades do hardware de consumo.

Em 2025 e 2026, a Ollama adicionou recursos adicionais de aplicativos e nuvem, incluindo modelos hospedados em nuvem, suporte a pesquisa na web, integrações de ferramentas e agentes de codificação, e suporte para uso da Ollama com aplicativos como Claude Code, Codex, OpenCode, Copilot CLI e OpenClaw. Em março de 2026, a Ollama anunciou suporte de pré-visualização para silício da Apple, expandindo sua compatibilidade com hardware Mac. Em julho de 2026, a empresa levantou US$ 65 milhões em financiamento, sinalizando a confiança dos investidores no crescimento e na posição de mercado da plataforma.

Recursos

A Ollama inclui ferramentas para baixar, executar, importar e gerenciar modelos de linguagem de grande porte. Os usuários podem executar modelos a partir da interface de linha de comando, interagir com eles por meio de uma API HTTP local ou usar bibliotecas de cliente para linguagens de programação como Python e JavaScript. O projeto fornece uma API REST para funções de bate-papo e gerenciamento de modelos, com o serviço local padrão comumente exposto na porta 11434. A Ollama também distribui uma imagem oficial do Docker e fornece bibliotecas de modelos e documentação para executar modelos suportados.

A plataforma usa o backend llama.cpp para inferência local, que suporta a execução de modelos quantizados que usam menos memória. Ela pode empregar placas gráficas (GPUs) para acelerar os cálculos, aproveitando o hardware de fornecedores como NVIDIA, AMD e Intel. A Ollama suporta um formato de biblioteca de modelos que permite aos usuários baixar, executar e gerenciar variantes de modelos por nome, simplificando o fluxo de trabalho para alternar entre diferentes modelos ou configurações.

Enquanto isso, o software para download do projeto está sendo explorado como uma plataforma de back-end para auto-hospedagem de LLMs de baixo código/sem código, potencialmente tornando os casos de uso de processamento de linguagem natural mais acessíveis para usuários finais não técnicos. A Ollama também tem suporte experimental para geração de imagens, usando modelos como Flux, em macOS, com suporte para Windows e Linux esperado no futuro.

Segurança

Como a Ollama é comumente usada para executar modelos de IA locais ou auto-hospedados, pesquisadores de segurança examinaram os riscos de implantações públicas mal configuradas. Em janeiro de 2026, o The Hacker News relatou uma pesquisa da SentinelOne e da Censys que descobriu que muitos servidores Ollama estavam expostos à internet pública, principalmente por estarem vinculados à interface INADDR_ANY (0.0.0.0), o que, em um sistema configurado de forma inadequada, permitiria acesso de outros dispositivos locais ou remotos, apesar do fato de a Ollama ser destinada a ser executada localmente por padrão. Isso destaca a importância da configuração adequada de rede e regras de firewall para usuários que implantam a Ollama em ambientes compartilhados ou em nuvem.

Ecossistema e Integrações

O design da Ollama como um servidor de inferência local a tornou um back-end popular para vários aplicativos. Ela se integra a assistentes de codificação como Copilot e outras ferramentas de desenvolvedor, permitindo que os usuários executem modelos de peso aberto para conclusão e geração de código sem enviar código para servidores externos. A plataforma também suporta recursos de pesquisa na web, permitindo que os modelos recuperem informações atualizadas durante conversas, e integrações de ferramentas que permitem que os modelos chamem funções ou APIs externas.

A biblioteca de modelos mantida pela Ollama inclui uma ampla gama de modelos de peso aberto de organizações como Meta (Llama), Google (Gemma), Mistral AI (Mistral) e Alibaba Cloud (Qwen). Essa diversidade permite que os usuários escolham modelos com base em desempenho, tamanho ou requisitos de licenciamento. A interface de linha de comando e a API REST da Ollama a tornam adequada para scripts e automação, e sua imagem Docker facilita a implantação em ambientes conteinerizados.

Ver também

  • llama.cpp - o backend de inferência usado pela Ollama
  • LM Studio - um aplicativo de desktop para executar e interagir localmente com LLMs
  • vLLM - um mecanismo de inferência de alto rendimento para LLMs
  • SGLang - uma estrutura de geração estruturada para LLMs
  • Lista de software de inteligência artificial de código aberto
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:open-source-software·large-language-models·artificial-intelligence·developer-tools
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico