L'IA agentique devient enfin accessible grâce à des Outils qui exploitent vos données existantes sans migration coûteuse ni complexité technique.

L'intelligence artificielle agentique transforme déjà la façon dont les entreprises travaillent. Mais pour que ces systèmes prennent des décisions pertinentes, ils ont besoin d'accéder rapidement et précisément à vos données. Le problème ? Ces données sont éparpillées dans des bases de données, des serveurs de stockage, des moteurs de recherche ou des fichiers non structurés comme des PDF ou des enregistrements vidéo. Résultat : vos agents d'IA passent plus de temps à chercher l'information qu'à l'exploiter.

Les solutions vectorielles d'AWS changent la donne. Elles intègrent la recherche intelligente directement là où vos données sont déjà stockées, sans nécessiter de duplication ni de migration. Plus besoin de créer une nouvelle base de données vectorielle : vos agents d'IA peuvent désormais trouver et utiliser le bon contexte en quelques millisecondes, exactement là où vos données vivent déjà.

Pour les nouveaux projets où aucune base de données existante ne convient, AWS propose six solutions spécialement conçues pour l'IA agentique et l'analyse de données. Ces outils permettent de choisir la meilleure option selon vos besoins spécifiques en termes de latence, de coût ou de modèle d'accès.

LES VECTEURS : LE LANGAGE SECRET DE L'IA

Les vecteurs sont au cœur de cette révolution. Imaginez un vecteur comme une fiche d'identité mathématique qui décrit le sens d'un texte, d'une image ou d'un son. Par exemple, le mot "chien" ne sera pas représenté par une simple chaîne de caractères, mais par une série de nombres qui capturent sa signification dans un espace à plusieurs dimensions. C'est ce qu'on appelle un embedding.

Grâce aux vecteurs, les applications d'IA peuvent comprendre les relations entre les mots, les images ou les sons. Elles peuvent aussi maintenir le contexte d'une conversation sur plusieurs sessions. Que ce soit pour analyser des descriptions de produits, des logs de sécurité ou des bibliothèques multimédias, les vecteurs transforment tout en un langage commun que l'IA comprend immédiatement.

Associés aux modèles d'IA les plus avancés, les vecteurs permettent de créer des expériences utilisateur personnalisées, contextuelles et ultra-rapides. Ils sont la clé pour des agents d'IA qui comprennent vraiment vos données et agissent en conséquence.

Les vecteurs sont comme des traducteurs universels qui transforment vos données brutes en une langue que l'IA comprend parfaitement.

SIX SOLUTIONS POUR INTÉGRER LA RECHERCHE VECTORIELLE À VOS OUTILS EXISTANTS

AWS propose six services spécialement conçus pour intégrer la recherche vectorielle directement dans vos infrastructures existantes. L'objectif ? Éviter la complexité d'une nouvelle base de données tout en bénéficiant des avantages de la recherche vectorielle.

Si vos données sont déjà stockées dans Amazon OpenSearch Service, Amazon Simple Storage Service (S3), Amazon Aurora PostgreSQL, Amazon DynamoDB, Amazon ElastiCache pour Valkey ou Amazon Neptune, vous pouvez ajouter la recherche vectorielle directement dans ces services. L'idée est simple : la recherche vectorielle doit suivre vos données, pas l'inverse.

Pour les nouveaux projets, AWS propose un modèle de décision pour choisir la solution la plus adaptée à vos besoins. Voici les six options disponibles :

1. AMAZON OPENSEARCH SERVICE : LE TOUT-EN-UN POUR LA RECHERCHE VECTORIELLE

Amazon OpenSearch Service est un moteur de recherche géré qui combine recherche lexicale, vectorielle et hybride dans un seul système. Il offre un débit élevé, une faible latence et des résultats pertinents à grande échelle. Ce service est idéal pour la plupart des nouveaux projets car il équilibre parfaitement recherche, échelle et intégration avec l'IA agentique.

OpenSearch Service prend en charge plusieurs stratégies d'indexation, la quantification vectorielle et le filtrage par métadonnées. Il peut passer d'applications RAG simples à des systèmes de récupération avancés à plusieurs signaux. Grâce à l'optimisation automatique par apprentissage machine, il sélectionne les meilleures configurations sans intervention manuelle. L'accélération par GPU permet d'indexer des ensembles de données massifs jusqu'à 10 fois plus vite pour un quart du coût.

Les tiers UltraWarm et Writable Warm réduisent les coûts de stockage pour les données moins fréquemment accessibles. OpenSearch Service est recommandé par défaut pour les nouveaux projets car il couvre le plus large éventail de cas d'usage, y compris RAG, détection d'anomalies, découverte de contenu multimodal et tout projet nécessitant une recherche hybride.

Avec une capacité allant jusqu'à plusieurs milliards de vecteurs, il gère des milliers de requêtes par seconde et sert plus de 100 000 clients actifs, traitant plus de 10 000 milliards de requêtes par mois.

Adobe utilise OpenSearch Service pour alimenter son assistant IA Acrobat, qui sert des centaines de millions d'utilisateurs à travers le monde.

2. AMAZON S3 VECTORS : LE STOCKAGE VECTORIEL LE PLUS ÉCONOMIQUE

Amazon S3 Vectors est la première solution de stockage d'objets dans le cloud à prendre en charge nativement le stockage et la requête de vecteurs. Il apporte la simplicité, l'échelle et la structure de coût d'Amazon S3 aux données vectorielles, réduisant jusqu'à 90 % les coûts d'importation, de stockage et de requête par rapport aux bases de données vectorielles spécialisées.

Depuis sa disponibilité générale, les clients effectuent en moyenne des dizaines de millions de requêtes par jour, soit une augmentation de plus de 5 fois par rapport à la période de prévisualisation. Deux améliorations récentes ont encore optimisé l'expérience :

  • Jusqu'à 10 000 résultats par requête : une augmentation de 100 fois qui facilite les pipelines de récupération multi-étapes avec réordonnancement, agrégation ou déduplication pour des résultats plus pertinents.
  • Réduction jusqu'à 80 % des coûts de requête pour les index vectoriels de plus de 10 millions de vecteurs, ce qui diminue significativement les coûts des recherches de similarité à grande échelle pour l'IA, le RAG et les workloads de recherche sémantique.

Amazon S3 Vectors est idéal lorsque vous avez besoin d'un stockage vectoriel économique avec une recherche vectorielle simple et un filtrage par métadonnées pour des requêtes peu fréquentes sur de grands ensembles de données vectorielles. Il convient lorsque la latence peut atteindre environ 100 ms ou plus, ou pour des ensembles de données vectorielles en croissance rapide avec un débit modéré de requêtes par seconde. Il prend en charge jusqu'à deux milliards de vecteurs par index avec une tarification à la requête, ce qui signifie que vous ne payez que pour les vecteurs stockés tandis que les coûts de requête s'accumulent uniquement lorsque vous effectuez des recherches.

Les cas d'usage courants incluent la recherche sémantique sur des lacs de données, la récupération de connaissances basée sur RAG, le stockage vectoriel à grande échelle et la récupération par lots. Les clients peuvent également travailler directement avec les vecteurs et les index via l'API S3.

BMW Group utilise S3 Vectors comme élément de base de sa solution de recherche hybride, alimentée par un agent de recherche intelligent construit avec Amazon Bedrock AgentCore. Les ingénieurs peuvent interroger 20 pétaoctets de données en langage naturel, combinant S3 Vectors pour les recherches de similarité sémantique et Amazon Athena pour les requêtes SQL.

3. AMAZON DYNAMODB : LA RECHERCHE VECTORIELLE À L'ÉCHELLE DE L'INFINI

Amazon DynamoDB est une base de données NoSQL entièrement gérée et serverless qui offre des performances de l'ordre de la milliseconde à n'importe quelle échelle. La recherche vectorielle avec DynamoDB atteint une latence de l'ordre de la milliseconde avec un rappel supérieur à 99 %, même pour des trillions de vecteurs.

Ce service est entièrement serverless : pas de serveurs à provisionner, à patcher ou à gérer, et pas de logiciel à installer ou à maintenir. La gestion zéro infrastructure que vous connaissez déjà avec DynamoDB est également disponible pour la recherche vectorielle. Il n'y a pas de versions, pas de fenêtres de maintenance et pas d'interruptions pour maintenance.

La recherche vectorielle dans DynamoDB introduit un nouvel index que vous créez sur l'attribut qui stocke les embeddings vectoriels. Elle prend en charge jusqu'à 4 096 dimensions et les fonctions de distance euclidienne, cosinus et produit scalaire, ainsi que le filtrage en ligne. Elle fonctionne avec les tables globales DynamoDB, offrant une cohérence éventuelle multi-régions ou une cohérence forte.

DynamoDB sert déjà plus d'un million de clients pour des workloads agentiques, comme le maintien du contexte de session pendant les conversations ou le suivi de l'état dans des tâches multi-étapes. Avec la recherche vectorielle, DynamoDB peut prendre en charge la récupération sémantique pour la mémoire à long terme dans les applications agentiques. D'autres cas d'usage incluent le RAG, la recherche de similarité multimodale et les moteurs de recommandation. Et tout cela dans une seule base de données serverless, sans base vectorielle séparée à maintenir ni à synchroniser, et sans nouvelle API à apprendre.

Globant, une entreprise native du numérique qui construit des produits alimentés par l'IA et des solutions de transformation digitale pour les entreprises du monde entier, explique :

"Nous construisons déjà des solutions clients sur DynamoDB, donc avoir une recherche vectorielle native dans la même base de données est extrêmement précieux. Pas besoin de répliquer les données dans une base vectorielle séparée ou de gérer un second système. C'est entièrement serverless, évoluant automatiquement sur pratiquement n'importe quelle échelle, donc nous ne payons que ce que chaque client utilise. Cela offre la recherche en temps réel et à faible latence que les expériences IA destinées aux utilisateurs exigent. Cela permet à nos ingénieurs de se concentrer sur la construction d'applications IA plutôt que sur la gestion de l'infrastructure."

4. AMAZON ELASTICACHE POUR VALKEY : LA MÉMOIRE CACHÉE POUR L'IA

Amazon ElastiCache est un service de cache entièrement géré offrant des performances de latence microseconde avec une compatibilité complète avec Valkey, Memcached et Redis OSS.

Avec ElastiCache pour Valkey, vous pouvez construire des réponses plus personnalisées et contextuelles en implémentant des mécanismes de mémoire qui mettent en avant l'historique des conversations inter-sessions pour les grands modèles de langage. De la même manière qu'un cache réduit les coûts de base de données et améliore les performances des applications, le cache sémantique réduit les coûts et la latence d'utilisation des modèles de langage en servant des réponses mises en cache pour des requêtes sémantiquement similaires.

Vous pouvez également utiliser la recherche vectorielle pour alimenter le RAG sur de grands ensembles de données afin d'améliorer la pertinence des réponses et de réduire les hallucinations en ancrant les sorties avec des données du monde réel.

ElastiCache pour Valkey est idéal lorsque le workload a une exigence de latence microseconde. Cela inclut les moteurs de recommandation en temps réel, la personnalisation basée sur les sessions, les pipelines RAG critiques en termes de latence et le cache sémantique. Il prend en charge jusqu'à un milliard de vecteurs pour la recherche vectorielle avec latence microseconde.

Sanoma utilise ElastiCache pour Valkey pour transformer les décisions des modérateurs humains en vecteurs qui informent les futures modérations IA en temps réel, sans nécessiter de réentraînement. Aujourd'hui, 30 % des commentaires sont comparés aux décisions passées, et 6,5 % reçoivent une issue différente et plus précise grâce à cette approche.

5. AMAZON NEPTUNE : LA CARTE AU TRÉSOR POUR L'IA CONNECTÉE

Amazon Neptune est un service de base de données graphique serverless conçu pour les données connectées et une précision accrue de l'IA.

Lorsque votre workload implique des données hautement connectées ou un raisonnement multi-sauts, Neptune se distingue en combinant le parcours de graphes avec la similarité vectorielle dans une seule requête. Ce service offre une recherche vectorielle à faible latence avec une capacité allant jusqu'à 2 à 3 milliards de vecteurs, ainsi qu'un raisonnement multi-sauts intégré et une traçabilité. Cette transparence est cruciale : les industries réglementées doivent montrer pourquoi un résultat a été retourné, pas seulement ce qui a été retourné.

Neptune est essentiel pour les workloads de conformité, de risque et de sécurité où la traçabilité est obligatoire. Choisissez Neptune lorsque le workload nécessite de combiner le parcours de graphes avec la similarité vectorielle dans une seule requête. Avec Neptune, vous pouvez parcourir les connexions et combiner ce contexte relationnel avec la similarité vectorielle en une seule requête.

De nombreux clients utilisent Neptune pour des workloads nécessitant un graphe de connaissances, tels que la gestion des risques financiers et de conformité, la recherche pharmaceutique, la découverte de médicaments et l'intelligence de sécurité.

Deloitte utilise Amazon Neptune avec le AWS GraphRAG Toolkit pour alimenter un centre d'intelligence de sécurité qui combine la récupération de connaissances basée sur les graphes avec l'IA générative. En connectant l'interprétation des politiques, l'application opérationnelle et les métriques en temps réel via GraphRAG, Deloitte fournit des conseils de sécurité prédictifs ancrés dans le contexte organisationnel actuel.

6. AMAZON AURORA POSTGRESQL AVEC PGVECTOR : LA PUISSANCE SQL RENFORCÉE PAR L'IA

Amazon Aurora offre des performances et une disponibilité élevées à l'échelle mondiale pour PostgreSQL. Vous pouvez activer l'extension pgvector et utiliser des lectures optimisées pour une recherche vectorielle haute performance.

Amazon Aurora PostgreSQL avec pgvector 0.8.0 offre un indexage 9 fois plus rapide et des résultats filtrés 100 fois plus pertinents. Cette avancée majeure combine la recherche vectorielle avec la surface complète de requête SQL : jointures, agrégations, clauses WHERE et transactions ACID dans un seul moteur.

Choisissez Aurora lorsque vos données sources vivent déjà dans Aurora. Il est recommandé lorsque vous souhaitez utiliser SQL ou lorsque vous avez besoin de consolider les workloads vectoriels et relationnels dans une seule base de données. Il offre une faible latence et prend en charge des centaines de milliards de vecteurs, idéal pour les applications SaaS multi-locataires, les mémoires agentiques et le RAG avec contexte de données structurées.

LeadSquared, une plateforme SaaS CRM desservant des secteurs tels que la BFSI, la santé et l'éducation, a construit sa solution en utilisant Aurora PostgreSQL avec pgvector et Amazon Bedrock pour le RAG. Ils ont accéléré le déploiement de leurs chatbots en utilisant Aurora à la fois pour les embeddings vectoriels et les données opérationnelles essentielles.

COMBINER PLUSIEURS SOLUTIONS POUR OPTIMISER COÛTS ET PERFORMANCES

Certains workloads bénéficient d'une architecture combinant plusieurs services vectoriels. Par exemple, vous pourriez avoir un workload idéalement servi par une architecture combinant ElastiCache pour Valkey pour le cache sémantique, Amazon OpenSearch Service pour la recherche hybride et Amazon S3 Vectors pour le stockage vectoriel persistant. Cette combinaison permet de passer de zéro à des billions de vecteurs tout en optimisant latence et coût sur les niveaux chaud, tiède et froid.

Lorsque vous évaluez des workloads complexes avec des exigences potentiellement concurrentes, il est important de considérer simultanément trois dimensions : latence, coût et modèle d'accès. Le tableau suivant résume les principales caractéristiques de chaque solution pour vous aider à faire le bon choix :

Critères de choix :

Service Latence Coût Échelle Cas d'usage idéal
OpenSearch Service Milliseconde Élevé Jusqu'à plusieurs milliards de vecteurs Recherche hybride, RAG, détection d'anomalies
S3 Vectors ~100 ms Très bas Jusqu'à 2 milliards de vecteurs Stockage persistant, requêtes peu fréquentes
DynamoDB Milliseconde Moyen Jusqu'à des trillions de vecteurs Applications serverless, mémoire agentique
ElastiCache pour Valkey Microseconde Moyen Jusqu'à 1 milliard de vecteurs Cache sémantique, recommandations en temps réel
Neptune Milliseconde Élevé 2 à 3 milliards de vecteurs Données connectées, raisonnement multi-sauts
Aurora PostgreSQL Milliseconde Moyen Centaines de milliards de vecteurs Applications SaaS, données structurées

PAR OÙ COMMENCER ?

Pour intégrer la recherche vectorielle à vos projets d'IA, commencez par ajouter une solution vectorielle là où vos données existent déjà aujourd'hui. Pour les nouveaux workloads, utilisez le modèle de décision pour choisir la solution vectorielle adaptée à vos exigences de latence et d'échelle, ou optez par défaut pour Amazon OpenSearch Service si vous n'êtes pas sûr.

Si vous êtes intéressé par une solution de base de connaissances et de RAG entièrement gérée, consultez cet article sur les bases de connaissances Amazon Bedrock.

Sources :
  • AWS ML Blog

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO