Ollama est une plateforme logicielle open source développée par Jeffrey Morgan et Michael Chiang en 2023 pour exécuter et gérer des grands modèles de langage sur des ordinateurs locaux et via des modèles cloud hébergés. Elle fournit une interface en ligne de commande, une interface graphique native, une API REST locale, des outils de gestion de modèles et des intégrations pour utiliser des modèles à poids ouverts avec des assistants de codage et d'autres applications. La plateforme est conçue pour simplifier le processus de téléchargement, d'exécution et de gestion de modèles tels que Llama, Gemma, Mistral, Qwen et DeepSeek sur du matériel personnel, rendant l'IA générative plus accessible aux utilisateurs individuels et aux développeurs.
Ollama agit comme un pont entre les poids bruts des modèles et l'utilisateur final, en abstraisant les complexités du service et de l'inférence des modèles. Par défaut, il s'exécute localement, ce qui répond aux préoccupations de confidentialité et de contrôle des données soulevées par les services d'IA basés sur le cloud. Le projet a gagné en popularité au sein de la communauté open source en tant qu'outil d'expérimentation, de développement et de déploiement de modèles à poids ouverts sans nécessiter une infrastructure étendue ou des abonnements cloud.
Historique
Ollama a été publié pour la première fois le 8 juillet 2023. Le projet est devenu associé à la croissance des logiciels locaux de grands modèles de langage, permettant aux utilisateurs de télécharger et d'exécuter des modèles tels que Llama, Gemma, Mistral, Qwen, gpt-oss, GLM et DeepSeek sur une machine locale. Cette publication a coïncidé avec une tendance plus large vers l'inférence locale, stimulée par les améliorations de la quantification des modèles et des capacités matérielles des consommateurs.
En 2025 et 2026, Ollama a ajouté des fonctionnalités supplémentaires d'application et de cloud, notamment des modèles cloud hébergés, la prise en charge de la recherche web, des intégrations d'outils et d'agents de codage, ainsi que la prise en charge de l'utilisation d'Ollama avec des applications telles que Claude Code, Codex, OpenCode, Copilot CLI et OpenClaw. En mars 2026, Ollama a annoncé une prise en charge en aperçu pour Apple silicon, élargissant sa compatibilité avec le matériel Mac. En juillet 2026, l'entreprise a levé 65 millions de dollars de financement, signalant la confiance des investisseurs dans la croissance et la position de la plateforme sur le marché.
Fonctionnalités
Ollama comprend des outils pour télécharger, exécuter, importer et gérer des grands modèles de langage. Les utilisateurs peuvent exécuter des modèles depuis la ligne de commande, interagir avec eux via une API HTTP locale ou utiliser des bibliothèques clientes pour des langages de programmation tels que Python et JavaScript. Le projet fournit une API REST pour les fonctions de chat et de gestion des modèles, le service local par défaut étant généralement exposé sur le port 11434. Ollama distribue également une image Docker officielle et fournit des bibliothèques de modèles et de la documentation pour exécuter les modèles pris en charge.
La plateforme utilise le backend llama.cpp pour l'inférence locale des modèles, qui prend en charge l'exécution de modèles quantifiés utilisant moins de mémoire. Elle peut utiliser des cartes graphiques (GPU) pour accélérer les calculs, en exploitant le matériel de fournisseurs tels que NVIDIA, AMD et Intel. Ollama prend en charge un format de bibliothèque de modèles qui permet aux utilisateurs de tirer, exécuter et gérer des variantes de modèles par nom, simplifiant le flux de travail pour basculer entre différents modèles ou configurations.
Parallèlement, le logiciel téléchargeable du projet est exploré comme plateforme backend pour l'auto-hébergement de LLM à faible code ou sans code, permettant potentiellement de rendre les cas d'utilisation de traitement du langage naturel plus accessibles aux utilisateurs finaux non techniques. Ollama dispose également d'une prise en charge expérimentale de la génération d'images, utilisant des modèles tels que Flux, sur macOS, avec une prise en charge de Windows et Linux attendue à l'avenir.
Sécurité
Parce qu'Ollama est couramment utilisé pour exécuter des modèles d'IA locaux ou auto-hébergés, les chercheurs en sécurité ont examiné les risques liés aux déploiements publics mal configurés. En janvier 2026, The Hacker News a rapporté des recherches de SentinelOne et Censys qui ont constaté que de nombreux serveurs Ollama étaient exposés à l'Internet public, principalement en se liant à l'interface INADDR_ANY (0.0.0.0), ce qui, sur un système insuffisamment sécurisé, permettrait l'accès depuis d'autres appareils locaux ou distants malgré le fait qu'Ollama soit destiné à s'exécuter localement par défaut. Cela souligne l'importance d'une configuration réseau et de règles de pare-feu appropriées pour les utilisateurs déployant Ollama dans des environnements partagés ou cloud.
Écosystème et intégrations
La conception d'Ollama en tant que serveur d'inférence local en a fait un backend populaire pour diverses applications. Il s'intègre avec des assistants de codage comme Copilot et d'autres outils de développement, permettant aux utilisateurs d'exécuter des modèles à poids ouverts pour la complétion et la génération de code sans envoyer de code à des serveurs externes. La plateforme prend également en charge des fonctionnalités de recherche web, permettant aux modèles de récupérer des informations à jour pendant les conversations, ainsi que des intégrations d'outils qui permettent aux modèles d'appeler des fonctions ou des API externes.
La bibliothèque de modèles maintenue par Ollama comprend une large gamme de modèles à poids ouverts provenant d'organisations telles que Meta (Llama), Google (Gemma), Mistral AI (Mistral) et Alibaba Cloud (Qwen). Cette diversité permet aux utilisateurs de choisir des modèles en fonction de la performance, de la taille ou des exigences de licence. L'interface en ligne de commande et l'API REST d'Ollama le rendent adapté aux scripts et à l'automatisation, et son image Docker facilite le déploiement dans des environnements conteneurisés.
Voir aussi
- llama.cpp - le backend d'inférence utilisé par Ollama
- LM Studio - une application de bureau pour exécuter et interagir localement avec des LLM
- vLLM - un moteur d'inférence à haut débit pour les LLM
- SGLang - un framework de génération structurée pour les LLM
- Liste des logiciels d'intelligence artificielle open source