Qu’est-ce que GraphRAG ?

La génération augmentée par récupération basée sur un graphe (Graph Retrieval-Augmented Generation, ou GraphRAG) est une architecture d’intelligence artificielle (IA) qui améliore la génération augmentée par récupération (RAG) en utilisant un graphe de connaissances, des entités et des relations afin de constituer un contexte plus robuste avant qu’un modèle de langage ne génère une réponse. Dans l’approche GraphRAG de Microsoft, cela comprend généralement un pipeline d’indexation qui extrait les entités/relations à partir de contenus non structurés et produit des résumés/rapports de communautés, ainsi qu’un moteur de requête qui exploite ces artefacts du graphe pour améliorer la récupération et la synthèse.

En ancrant les réponses de l’IA dans des informations connectées et sensibles aux relations, GraphRAG peut produire des résultats plus précis, contextualisés et explicables, en particulier dans des environnements d’entreprise complexes où les réponses dépendent de la manière dont les informations sont liées à travers de multiples sources.

En quoi GraphRAG diffère du RAG traditionnel

Le RAG traditionnel améliore les grands modèles de langage en récupérant des documents ou des fragments de texte pertinents et en les fournissant comme contexte pour la génération de réponses. La récupération repose généralement sur la similarité sémantique (recherche vectorielle) ou sur la recherche par mots-clés. GraphRAG étend cette approche.

Parce qu’il repose sur un graphe de connaissances — un modèle structuré d’entités connectées (telles que produits, pièces, exigences, fournisseurs et réglementations) et de leurs relations — GraphRAG peut récupérer :

  • Les entités structurées référencées dans une requête : Identifie des objets spécifiques tels que des composants, des exigences ou des fournisseurs, plutôt que de récupérer uniquement des fragments de texte
  • Les relations entre ces entités : Utilise le contexte relationnel pour relier des éléments de preuve pertinents et améliorer la manière dont le modèle explique le « pourquoi » et le « comment », et pas seulement le « quoi »
  • Des connexions multi-étapes (multi-sauts) entre différents domaines : Suit des chemins relationnels pour raisonner à travers plusieurs domaines de connaissances et de contenus

Par exemple, au lieu de récupérer un document sur un composant, GraphRAG peut suivre un chemin relationnel tel que : Exigence → Composant → Fournisseur → Réglementation

Microsoft GraphRAG distingue également plusieurs modes de requête prenant en charge différents types de questions :

  • Recherche locale : raisonnement centré sur les entités combinant les données structurées du graphe de connaissances avec du texte de support
  • Recherche globale : synthèse à l’échelle du corpus utilisant des rapports de communautés générés par des LLM comme contexte dans un processus de type map-reduce
  • Recherche DRIFT : méthode combinant des informations locales et communautaires pour élargir la couverture des questions nécessitant une compréhension globale du jeu de données

Comment fonctionne GraphRAG

Une implémentation typique de GraphRAG comprend deux étapes : l’indexation et l’interrogation.

L’indexation (hors ligne) construit l’index basé sur le graphe à partir de contenus non structurés, incluant généralement :

  • L’extraction des entités et des relations (et, dans certains pipelines, des affirmations)
  • La détection de communautés parmi les entités
  • La génération de résumés et de rapports de communautés à différents niveaux de granularité
  • L’intégration (embedding) de texte pour la récupération sémantique

L’interrogation (à l’exécution) utilise les artefacts du graphe et les contenus de support pour répondre aux questions des utilisateurs :

  1. Un utilisateur soumet une question
  2. Le système identifie les entités pertinentes dans la requête
  3. Le graphe de connaissances (et/ou la structure communautaire) est utilisé pour trouver les entités, relations et éléments de preuve associés
  4. Un contexte connecté est assemblé (souvent via des stratégies de recherche locale et/ou globale)
  5. Le modèle de langage génère une réponse ancrée dans ce contexte sensible aux relations

Les réponses peuvent être plus transparentes et plus faciles à valider, car le contexte est construit à partir d’entités identifiables, de connexions et de sources de support.

Pourquoi GraphRAG est important

Les environnements de données d’entreprise, y compris les solutions de gestion du cycle de vie des produits (PLM), sont fortement interconnectés. Les produits sont liés aux composants, aux exigences, aux modifications d’ingénierie, aux fournisseurs, aux processus de fabrication et aux obligations réglementaires. Dans ces environnements, répondre à une question nécessite souvent de comprendre comment les informations sont connectées tout au long du cycle de vie, et pas seulement de récupérer un document.

GraphRAG favorise :

  • Un raisonnement plus précis à travers des structures produit complexes : Aide les systèmes d’IA à interpréter comment les composants, les exigences et les modifications sont liés dans des données produit connectées
  • Une meilleure traçabilité à travers le fil numérique : Offre une visibilité sur les connexions du cycle de vie, de la conception à la fabrication et au service
  • Une réduction du risque d’hallucinations de l’IA : Encourage des réponses fondées sur des preuves connectées plutôt que sur des inventions non étayées
  • Une plus grande explicabilité et auditabilité : Permet de retracer comment une réponse a été générée à travers des informations liées
  • Un support décisionnel inter-domaines renforcé : Relie les connaissances en ingénierie, chaîne d’approvisionnement, conformité, qualité et opérations dans un même contexte de raisonnement

GraphRAG est également utile pour les questions à l’échelle d’un corpus, celles qui nécessitent de résumer des thèmes et des relations à travers un large ensemble de contenus, là où la simple récupération d’extraits montre souvent ses limites.

Exemple Aras :
Analyse de contenu pilotée par GraphRAG avec un agent IA

Dans Aras Innovator, une approche de type GraphRAG peut alimenter un service de découverte de connaissances / analyse de contenu intégré à l’expérience conversationnelle de l’assistant IA Aras. Elle s’appuie sur une recherche sémantique avancée et va au-delà de l’assistance aux requêtes en analysant les bases de connaissances gérées par Aras Innovator — y compris les documents, figures et autres contenus non structurés ou faiblement structurés — afin de fournir des réponses fondées sur le sens, les liens et le contexte, et non uniquement sur la récupération.

Une valeur clé de cette approche est la mise en évidence de relations implicites qui n’ont jamais été formellement modélisées dans les structures PLM, par exemple l’identification de connexions entre un document et de nombreux numéros de pièces référencés, même lorsque ces relations n’ont pas été explicitement créées. Cela permet des conversations plus riches à travers le fil numérique, car les utilisateurs peuvent poser des questions nécessitant une synthèse entre les informations produit et les contenus associés.

Exemple d’investigation sensible au temps :
Le contenu évolue dans le temps ; l’exploration des relations doit donc être ancrée dans la période à laquelle la version du produit a été conçue ou modifiée, par exemple :
« Quelles exigences ont motivé les décisions de conception pour la version du produit qui a échoué sur le terrain ? »

Une capacité d’analyse de contenu pilotée par GraphRAG peut assembler des preuves et des liens inférés dans le contexte du cadre temporel historique pertinent, permettant des réponses plus fiables pour des produits à long cycle de vie.

RAG traditionnel GraphRAG
Récupère des fragments de documents Récupère des entités/relations ainsi que du contenu de support
Repose souvent sur la similarité vectorielle / le scoring par mots-clés Utilise un contexte dérivé du graphe et prend en charge des stratégies de requête locales/globales
Contexte construit principalement à partir de blocs de texte Contexte construit à partir de connaissances d’entreprise connectées + texte de support
Raisonnement inter-domaines limité Raisonnement multi-sauts à travers domaines et sources
Chemins de raisonnement plus difficiles à retracer Raisonnement plus explicable via entités, relations et sources

Le RAG traditionnel fonctionne bien pour la recherche et la synthèse de documents. GraphRAG est mieux adapté au raisonnement à travers des systèmes structurés et connectés ainsi que de vastes bases de connaissances d’entreprise.

Comment GraphRAG réduit les hallucinations de l’IA

Les hallucinations de l’IA se produisent lorsqu’un modèle génère des informations plausibles mais non étayées. GraphRAG atténue ce risque en :

  • Ancrant les réponses dans des entités identifiables et des sources de support : Les réponses restent liées à ce qui existe réellement dans la base de connaissances de l’entreprise.
  • Utilisant une construction de contexte sensible aux relations : Encourage un raisonnement fondé sur des preuves connectées plutôt que sur des associations libres.
  • Limitant le contexte aux sources de données approuvées et connectées : Réduit le risque d’introduire des affirmations non étayées.
  • Permettant des chemins de raisonnement traçables à travers des entités liées : Facilite l’examen de la manière dont une réponse a été construite.

Avec GraphRAG, les réponses sont générées à partir de connaissances connectées et vérifiables, ce qui les rend plus cohérentes et défendables dans des environnements d’entreprise.

Cas d’usage courants

GraphRAG est particulièrement utile dans des scénarios nécessitant un raisonnement à travers des systèmes connectés, notamment :

  • Analyse d’impact des modifications d’ingénierie : Identifier comment une modification de conception affecte des composants, fournisseurs, exigences et obligations de conformité associés
  • Traçabilité des exigences à travers les structures produit : Suivre la manière dont les exigences sont liées aux pièces, systèmes et dépendances en aval
  • Analyse des risques et dépendances de la chaîne d’approvisionnement : Révéler comment des perturbations ou changements chez un fournisseur impactent des composants ou produits associés
  • Enquêtes réglementaires et de conformité à travers les données du cycle de vie : Analyser comment les réglementations s’appliquent à des informations produit interconnectées et à la documentation associée
  • Intelligence produit inter-domaines : Connecter les connaissances en ingénierie, fabrication et service afin de fournir une vue opérationnelle plus complète

Dans chaque cas, la réponse dépend de la compréhension des relations entre les éléments de données à travers les systèmes.