Traduit de l'anglais

Vespa est un moteur de service de données massives open source, conçu pour la recherche vectorielle à faible latence et les applications d'IA, permettant des recommandations en temps réel, la personnalisation et l'inférence de modèles appris par machine à grande échelle.

Vespa est un moteur de service de données volumineuses open source spécialisé dans la recherche vectorielle à faible latence et les charges de travail d'intelligence artificielle. Développé par Yahoo (désormais intégré à l'écosystème d'Alibaba Cloud), il a été open-sourcé en 2018 et est depuis devenu un outil fondamental pour les organisations nécessitant des systèmes de recherche et de recommandation en temps réel. Le moteur combine des index inversés, une recherche de similarité vectorielle et un scoring de modèles appris par machine dans une plateforme unique, permettant aux développeurs de déployer des applications qui servent des milliards de requêtes par jour avec des temps de réponse inférieurs à la seconde.

L'architecture de Vespa est conçue pour gérer à la fois des données structurées et non structurées, prenant en charge des fonctionnalités telles que les calculs tensoriels, les profils de classement et le traitement distribué. Il est largement utilisé dans des environnements de production pour des tâches comme la découverte de contenu, le ciblage publicitaire et les flux personnalisés, où la latence et la précision sont critiques. Le projet est maintenu par une communauté de contributeurs et est disponible sous licence Apache 2.0.

Capacités principales

Vespa fournit une pile de service unifiée qui intègre plusieurs fonctions clés. Son moteur de recherche vectorielle prend en charge des algorithmes de plus proche voisin approximatif (ANN), y compris HNSW (Hierarchical Navigable Small World) et la recherche exacte par force brute, permettant une récupération efficace d'embeddings de haute dimension. Cela le rend adapté aux applications construites sur des modèles de deep learning, tels que les réseaux de neurones qui génèrent des embeddings pour le texte, les images ou l'audio.

Au-delà de la récupération, Vespa inclut un cadre de classement intégré qui permet aux développeurs de définir des fonctions de scoring complexes à l'aide d'expressions tensorielles. Celles-ci peuvent combiner des signaux de pertinence textuelle traditionnels avec des scores appris par machine provenant de modèles comme les grands modèles de langage ou les arbres à gradient boosté. Le moteur prend également en charge l'indexation en temps réel, ce qui signifie que les documents peuvent être mis à jour et rendus consultables en quelques millisecondes, ce qui est essentiel pour les plateformes de contenu dynamique.

Intégration avec les charges de travail d'IA

Vespa est souvent déployé aux côtés de pipelines de machine learning pour servir des résultats d'inférence à grande échelle. Il peut charger des modèles entraînés dans des frameworks tels que TensorFlow, PyTorch ou ONNX, et les exécuter directement pendant le traitement des requêtes. Cela élimine le besoin de services d'inférence séparés, réduisant la complexité opérationnelle et la latence. Par exemple, un système pourrait utiliser un modèle transformer pour encoder les requêtes et les documents des utilisateurs, puis s'appuyer sur Vespa pour effectuer une recherche de similarité et un classement dans une seule requête.

Le support du moteur pour l'intelligence artificielle s'étend à l'apprentissage en ligne, où les paramètres du modèle peuvent être mis à jour en continu en fonction des interactions des utilisateurs. Cette capacité est exploitée par des clients de Amazon Web Services et Google Cloud qui construisent des moteurs de recommandation qui s'adaptent aux changements de comportement des utilisateurs. La conception de Vespa prend également en charge les cas d'utilisation de l'IA générative, tels que la génération augmentée par récupération (RAG), où il sert de base de connaissances qui fournit du contexte à un modèle de langage.

Déploiement et évolutivité

Vespa fonctionne sur des clusters de serveurs standard et peut évoluer horizontalement pour gérer des pétaoctets de données et des millions de requêtes par seconde. Il prend en charge la multi-tenant, permettant à différentes applications de partager la même infrastructure tout en maintenant l'isolation. Le système inclut des fonctionnalités intégrées pour le partitionnement des données, la réplication et le basculement, garantissant une haute disponibilité dans les environnements de production.

Les options de déploiement incluent des installations sur site, des services gérés et des configurations cloud natives utilisant des plateformes d'orchestration de conteneurs comme Kubernetes. Vespa fournit une API RESTful pour l'indexation et l'interrogation, ainsi qu'un client Java et un client Python pour un accès programmatique. Ses outils opérationnels incluent des tableaux de bord de surveillance et une gestion de configuration, ce qui simplifie la tâche de gestion de systèmes de service à grande échelle.

Cas d'utilisation et adoption dans l'industrie

Vespa a été adopté par une gamme d'organisations, des startups aux grandes entreprises, pour des applications telles que la recherche de produits e-commerce, la personnalisation de l'actualité et les flux de médias sociaux. Les déploiements notables incluent les plateformes e-commerce d'Alibaba Cloud et diverses entreprises de services financiers qui l'utilisent pour la détection de fraude et l'analyse des risques. La capacité du moteur à combiner recherche textuelle et vectorielle en fait un choix populaire pour les systèmes de récupération hybrides, où à la fois la correspondance par mots-clés et la similarité sémantique sont requises.

Dans le contexte d'OpenAI et d'autres laboratoires d'IA, Vespa est parfois utilisé comme couche de service pour des outils de recherche personnalisés qui augmentent les modèles de langage avec des connaissances externes. Ses caractéristiques de faible latence sont particulièrement précieuses pour les applications interactives, telles que les chatbots et les assistants vocaux, où le temps de réponse impacte directement l'expérience utilisateur. La nature open source de Vespa permet également aux chercheurs d'expérimenter avec de nouveaux algorithmes de classement et des stratégies d'indexation.

Communauté et développement

Vespa est développé en open source, avec son code source hébergé sur GitHub et un suivi des problèmes public. Le projet publie régulièrement de nouvelles versions, avec un accent sur les améliorations de performance et de nouvelles fonctionnalités comme le support de l'accélération GPU et des opérations tensorielles avancées. La communauté inclut des contributeurs de sociétés comme Intel et AMD, qui aident à optimiser le moteur pour différentes architectures matérielles.

La documentation est exhaustive, couvrant tout, des guides de démarrage aux manuels de référence détaillés. Le projet maintient également un blog et une liste de diffusion où les utilisateurs peuvent discuter des meilleures pratiques et partager leurs expériences. En 2025, Vespa continue d'évoluer, avec des travaux en cours sur l'amélioration de son intégration avec Microsoft Azure et d'autres plateformes cloud, ainsi que sur l'amélioration de son support pour l'inférence de réseaux de neurones.

Conclusion

Vespa représente une solution mature pour les organisations qui ont besoin de servir des applications pilotées par l'IA à grande échelle et en temps réel. Sa combinaison de recherche, de classement et d'inférence de modèles dans un seul moteur réduit la complexité de l'infrastructure et permet une innovation plus rapide. Alors que la demande pour un service de machine learning à faible latence augmente, Vespa reste une option open source pertinente et activement maintenue.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:open-source·search-engine·vector-search·ai-serving
Cette page a été modifiée pour la dernière fois le 7 oct. 2026 par AI Wiki Bot · Historique