Une entreprise doit analyser 1000 documents financiers pour une acquisition de 500 millions ? L'intelligence artificielle classique échoue. Voici la solution : compresser toute la base en gardant uniquement ce qui compte, avec AWS.
LE PROBLÈME : LE RAG CLASSIQUE NE SUPPORTE PAS LES ANALYSES COMPLEXES
Si vous utilisez le RAG (Retrieval-Augmented Generation) pour des tâches analytiques qui couvrent des centaines de documents, vous avez probablement déjà heurté un mur. Le RAG fonctionne comme un moteur de Recherche : il trouve des morceaux de texte similaires à votre question, mais il rate souvent les liens entre ces morceaux. Prenez l'exemple d'un fonds d'investissement qui évalue l'achat d'une entreprise de 500 millions de dollars. Son équipe doit analyser les états financiers de 12 filiales sur 5 ans, plus 200 contrats fournisseurs, 8 rapports de conformité environnementale et 50 affaires judiciaires en cours. Quand un analyste demande : « Quels sont les risques financiers consolidés avec les conditions actuelles des fournisseurs et les litiges en cours ? », le RAG ne peut pas répondre. Pourtant, l'information existe, mais elle est dispersée dans des centaines de documents sans lien lexical entre eux.
LA SOLUTION : COMPRESSER TOUTE LA BASE DE CONNAISSANCES AVANT MÊME LA QUESTION
Pour résoudre ce problème, AWS propose une technique appelée TAKC (Task-Aware Knowledge Compression). Au lieu de chercher des morceaux de texte au moment de la question, TAKC compresse toute la base de connaissances à l'avance, en fonction de la tâche à accomplir. Par exemple, pour une analyse financière, il garde uniquement les chiffres de revenus, les marges, les flux de trésorerie et les indicateurs de risque. Pour une revue de conformité, il extrait les citations réglementaires et les historiques d'infractions. Contrairement à un résumé générique qui essaie de tout couvrir, TAKC se concentre sur ce qui est essentiel pour la tâche précise.
Le processus se fait hors ligne, une fois par document et par type de tâche. Au moment de la question, le système ne cherche pas dans les documents originaux, mais dans leurs versions compressées. Si la version compressée est trop légère pour répondre, un analyseur de complexité de la question redirige automatiquement vers une version moins compressée qui conserve plus de contexte.
QUATRE NIVEAUX DE COMPRESSION POUR TOUTES LES QUESTIONS
Toutes les questions ne nécessitent pas le même niveau de détail. Une question comme « Quel était le chiffre d'affaires du T3 ? » demande moins de contexte qu'une demande d'analyse des relations entre les délais de paiement des fournisseurs et les flux de trésorerie trimestriels des filiales. TAKC gère cela avec quatre niveaux de compression pour chaque type de tâche :
- Léger (8x) : conserve environ 87,5 % de contexte en moins. Suffisant pour des raisonnements en plusieurs étapes et des synthèses entre documents.
- Moyen (16x) : réduit le contexte d'environ 93,8 %. Idéal pour les questions analytiques de complexité modérée.
- Élevé (32x) : diminue le contexte d'environ 96,9 %. Parfait pour les questions factuelles et bien définies.
- Ultra (64x) : atteint une réduction d'environ 98,4 %. Adapté aux tâches de classification et aux recherches de mots-clés.
Un analyseur de complexité de la question examine la longueur de la requête, le type de question et la présence de termes analytiques pour router automatiquement vers le bon niveau de compression. Les questions factuelles simples utilisent le cache ultra-compressé, tandis que les questions analytiques complexes passent par le cache léger. Tout cela se fait de manière transparente pour l'utilisateur.
COMMENT ÇA MARCHE : L'ARCHITECTURE SERVERLESS SUR AWS
L'implémentation de TAKC sur AWS repose sur deux pipelines découplés : un pour l'ingestion des documents et un pour les requêtes. L'architecture utilise uniquement des services serverless, ce qui signifie qu'elle s'adapte automatiquement à la charge de travail sans nécessiter de gestion de serveurs.
Pour l'ingestion, quand un document arrive dans un bucket S3 (par exemple sous le préfixe raw-data/financial/), une notification déclenche une fonction Lambda. Cette fonction découpe le document en segments de 256 jetons avec un chevauchement de 50 jetons pour éviter de perdre des informations aux frontières. Chaque segment est ensuite compressé par une autre fonction Lambda, qui appelle Amazon Bedrock avec un prompt spécifique à la tâche. Ce prompt indique à l'IA ce qu'il faut conserver : pour une analyse financière, les chiffres de revenus, les marges, les flux de trésorerie et les indicateurs de risque. Les versions compressées sont stockées dans Amazon ElastiCache Serverless avec des clés comme takc:financial:medium, et sauvegardées sur S3 pour une durabilité accrue.
Pour les requêtes, l'utilisateur s'authentifie via Amazon Cognito, reçoit un JWT, puis envoie sa question via Amazon API Gateway. Une fonction Lambda analyse la complexité de la question, récupère la version compressée appropriée dans ElastiCache, et envoie le contexte compressé plus la question à Amazon Bedrock pour l'inférence. Si le système n'est pas sûr du niveau de compression à utiliser, il utilise par défaut le niveau moyen comme solution de repli sécurisée.
LES MODÈLES ET SERVICES UTILISÉS
L'architecture repose sur plusieurs services AWS :
- Amazon Bedrock : utilisé pour la compression et l'inférence avec les modèles Anthropic Claude 3 Haiku, Claude 3 Sonnet et Amazon Titan Text.
- AWS Lambda : gère le traitement des données et la logique des requêtes avec Python 3.12+.
- Amazon ElastiCache Serverless : stocke le cache compressé pour des lectures rapides sur des clés composites.
- Amazon S3 : héberge les données brutes, les segments et les sauvegardes du cache (chiffrées avec KMS).
- Amazon API Gateway : expose les endpoints REST.
- Amazon Cognito : gère l'authentification JWT sans code personnalisé.
- AWS WAF : protège l'API avec des règles de limitation de débit et de sécurité gérées.
- Amazon CloudWatch : fournit la surveillance et les métriques.
- AWS KMS : gère les clés de chiffrement.
L'infrastructure est définie comme une seule stack AWS CDK (Cloud Development Kit), déployable avec une seule commande. CDK permet des déploiements reproductibles et des personnalisations comme la taille des segments, la mémoire allouée aux Lambda ou les limites de stockage d'ElastiCache.
EXEMPLE DE PROMPT DE COMPRESSION POUR UNE ANALYSE FINANCIÈRE
Voici le prompt utilisé pour compresser un document financier. Il précise exactement ce qu'il faut conserver :
TASK: Financial analysis. Preserve revenue metrics, margins, cash flow, debt obligations, and financial risk indicators.
COMPRESSION TARGET: Reduce to approximately 1/16 of original length.
INSTRUCTIONS:
- Focus on facts and relationships relevant to the task
- Preserve numerical data and metrics
- Maintain entities and their attributes
- Keep causal relationships and dependencies
- Remove redundant or irrelevant information
Ce prompt explique à l'IA ce qui est important pour la tâche. C'est cette spécificité qui fait de TAKC une compression orientée tâche, bien différente d'un résumé générique.
COÛTS ET ÉCONOMIES : UNE FOIS POUR TOUTES, PAS À CHAQUE QUESTION
Le principal avantage de TAKC est économique. La compression a un coût initial lors de l'ingestion, mais ce coût est amorti sur le long terme pour les bases de connaissances qui changent peu et sont souvent interrogées. Par exemple, pour une base de 100 000 jetons interrogée 1 000 fois par jour, les économies de jetons dépendent directement des ratios de compression. Les jetons de sortie sont exclus car leur longueur ne dépend pas du contexte.
En revanche, pour les bases de connaissances qui changent toutes les heures, le modèle de récupération par requête du RAG peut être plus pratique. Voici un tableau qui résume quand chaque approche est la plus adaptée :
COMBINER TAKC ET RAG : LE MEILLEUR DES DEUX MONDES
En pratique, un système de production bénéficie souvent des deux approches. Le RAG gère efficacement les recherches rapides. TAKC prend le relais pour les questions analytiques où le RAG échoue à trouver les connexions. Un analyseur de complexité de la question peut router entre les deux. Utilisez le RAG quand les utilisateurs ont besoin de retracer les réponses jusqu'aux documents sources. Pour les charges de travail réglementées qui nécessitent à la fois du raisonnement entre documents et de l'auditabilité, combinez TAKC et RAG : utilisez TAKC pour la réponse analytique et le RAG pour récupérer les documents sources à des fins d'audit.
COMMENT DÉPLOYER TAKC SUR VOTRE COMPTE AWS
Pour déployer cette implémentation de référence, suivez ces étapes :
git clone https://github.com/aws-samples/sample-bedrock-takc-compression
cd sample-bedrock-takc-compression/cdk
python3 -m venv .venv && source .venv/bin/activate
pip install -r requirements.txt
cdk deploy
Une fois le déploiement terminé, testez le pipeline :
aws s3 cp your-document.pdf s3://$(aws cloudformation describe-stacks --stack-name TakcStack
--query 'Stacks[0].Outputs[?OutputKey==DataBucketName].OutputValue'
--output text)/raw-data/financial/
Attendez 2 à 3 minutes pour que le pipeline d'ingestion découpe et compresse le document aux quatre niveaux de compression. Ensuite, interrogez l'API :
curl -X POST $(aws cloudformation describe-stacks --stack-name TakcStack
--query 'Stacks[0].Outputs[?OutputKey==ApiEndpoint].OutputValue'
--output text)/query
-H "Authorization: Bearer $TOKEN"
-H "Content-Type: application/json"
-d '{"question": "What are the key financial risks?"}'
Le système gère automatiquement le découpage, la compression multi-niveaux, la mise en cache et le routage des requêtes sans configuration supplémentaire.
COMMENT DÉTRUIRE L'INFRASTRUCTURE POUR ÉVITER LES COÛTS INUTILES
Pour éviter des frais inutiles après vos tests, détruisez la stack CDK avec ces commandes :
aws s3 rm s3://$(aws cloudformation describe-stacks --stack-name TakcStack
--query 'Stacks[0].Outputs[?OutputKey==DataBucketName].OutputValue'
--output text) --recursive
cd sample-bedrock-takc-compression/cdk
source .venv/bin/activate
cdk destroy
Cela supprime les fonctions Lambda, l'API Gateway, le cache ElastiCache Serverless, le pool d'utilisateurs Cognito, les règles WAF et les alarmes CloudWatch. La clé KMS est conservée avec une fenêtre de suppression de 30 jours. Pour la supprimer immédiatement :
aws kms schedule-key-deletion --key-id <key-id> --pending-window-in-days 7
QUAND UTILISER TAKC ?
TAKC est particulièrement efficace dans les cas suivants :
- Analyse de centaines de documents pour des tâches complexes (due diligence financière, revues de conformité réglementaire).
- Bases de connaissances stables qui sont interrogées fréquemment.
- Besoin de raisonnements entre documents sans lien lexical évident.
- Réduction des coûts de jetons pour des requêtes répétitives.
En revanche, le RAG reste plus adapté pour :
- Bases de connaissances qui changent fréquemment (toutes les heures).
- Besoin de retracer les réponses jusqu'aux documents sources.
- Questions simples nécessitant un accès direct aux documents.
EN RÉSUMÉ : TAKC, LA FIN DES LIMITES DU RAG
Les tâches analytiques complexes qui couvrent des centaines de documents exigent plus qu'une simple récupération de fragments. TAKC propose une approche conçue pour ces défis : compressez toute la base de connaissances hors ligne en fonction de la tâche, mettez en cache ces représentations à plusieurs niveaux de fidélité, et associez chaque question au bon niveau de compression. L'implémentation AWS utilise Amazon Bedrock pour la compression et l'inférence, ElastiCache Serverless pour le cache, et une architecture entièrement serverless qui s'adapte à la demande.
Accédez à l'implémentation de référence, à l'infrastructure CDK et aux scripts de déploiement sur aws-samples/sample-bedroad-takc-compression. Pour commencer, déployez la stack CDK avec vos propres documents et observez comment le système répond à différents types de questions. Si votre charge de travail implique du raisonnement entre documents sur des bases de connaissances stables, TAKC peut réduire les coûts de jetons tout en améliorant la qualité des réponses.
COMMENT ÇA FONCTIONNE EN PRATIQUE : EXEMPLE CONCRET
Imaginons que vous avez un rapport annuel de 50 pages pour une entreprise. Voici ce que TAKC en fait selon la tâche :
- Analyse financière : conserve uniquement les chiffres clés (revenus, marges, flux de trésorerie) et les indicateurs de risque. Le document passe de 50 pages à l'équivalent d'une demi-page.
- Revue de conformité : extrait les citations réglementaires et les historiques d'infractions. Le document devient une liste de références et de violations.
- Analyse de risques juridiques : garde les informations sur les litiges en cours et les montants des provisions. Le document se réduit à un tableau synthétique.
Quand vous posez une question comme « Quels sont les risques financiers liés aux fournisseurs ? », le système utilise la version financière compressée. Si la réponse est trop vague, il bascule automatiquement vers une version moins compressée qui contient plus de détails. Tout cela se fait en quelques millisecondes, sans avoir à relire les 50 pages originales.
LES LIMITES À CONNAÎTRE
Malgré ses avantages, TAKC a quelques limites :
- Coût initial : la compression a un coût lors de l'ingestion, surtout pour les très gros volumes de documents.
- Mise à jour des prompts : si vous modifiez les prompts de compression, il faut recompresser tous les documents concernés. Stockez ces prompts dans un système de versionnage comme AWS Systems Manager Parameter Store ou un préfixe S3 dédié pour faciliter les audits.
- Complexité initiale : déployer TAKC nécessite une bonne compréhension des services AWS et de l'architecture serverless.
Cependant, pour les entreprises qui analysent régulièrement des centaines de documents, les économies de temps et de coûts à long terme justifient largement cet investissement initial.
LE FUTUR : VERS DES SYSTÈMES D'IA PLUS INTELLIGENTS
TAKC représente une évolution majeure dans la façon dont les entreprises peuvent exploiter l'IA pour des analyses complexes. En compressant intelligemment les connaissances avant même qu'une question ne soit posée, TAKC permet de répondre à des requêtes qui étaient auparavant impossibles à traiter avec les outils classiques. Cette approche ouvre la voie à des systèmes d'IA capables de raisonner sur des volumes de données bien plus importants, tout en restant économiques et performants.
Avec l'augmentation constante du volume de données dans les entreprises, des techniques comme TAKC deviennent indispensables. Elles permettent de transformer des montagnes de documents en informations exploitables, en quelques secondes, sans sacrifier la précision ni la profondeur de l'analyse.
POUR ALLER PLUS LOIN : RESSOURCES UTILES
Pour en savoir plus sur TAKC et déployer votre propre système, consultez les ressources suivantes :
- Le dépôt GitHub de l'implémentation de référence : aws-samples/sample-bedrock-takc-compression
- La documentation AWS sur Amazon Bedrock : aws.amazon.com/bedrock/
- Le guide AWS CDK pour déployer des architectures serverless : aws.amazon.com/cdk/
CONCLUSION : TAKC, L'OUTIL QUI VA CHANGER LA DONNE POUR LES ENTREPRISES
Les outils d'IA actuels, comme le RAG, ont des limites quand il s'agit d'analyser des centaines de documents pour des tâches complexes. TAKC brise ces limites en compressant toute la base de connaissances à l'avance, en fonction de la tâche, et en mettant en cache les versions compressées à plusieurs niveaux de fidélité. Résultat : des réponses ultra-rapides, une meilleure qualité d'analyse et des coûts réduits. L'implémentation sur AWS utilise une architecture entièrement serverless, scalable et sécurisée, prête à être déployée en quelques minutes.
Si votre entreprise doit analyser régulièrement des montagnes de documents, TAKC est l'outil qu'il vous faut. Essayez-le dès aujourd'hui et découvrez comment il peut transformer votre façon de travailler avec l'IA.
- AWS ML Blog
L'indépendance de CLODCO est votre garantie.
Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.
Soutenir CLODCO

