Aller au contenu
Systèmes de connaissances8 min de lecture

Bases de connaissances IA privées pour les cabinets de conseil bruxellois

Par Intyb Technologies·
Des consultants examinent des documents structurés pour une base de connaissances IA privée à Bruxelles
Image: "Solution-Focused Consulting and Training North America (22)" par Mike Cardus Organization Development est sous licence CC BY 2.0. Pour consulter cette licence : https://creativecommons.org/licenses/by/2.0/.

Les cabinets de conseil bruxellois détiennent des connaissances difficiles à retrouver et risquées à exposer. Les formulations utilisées dans les propositions commerciales se trouvent dans des présentations. Les notes méthodologiques sont conservées sur des lecteurs partagés. Le contexte client est réparti entre les e-mails, les données du CRM, les notes d’ateliers, les documents de prestation et les conversations entre partenaires. Un consultant peut généralement trouver la bonne réponse après des recherches suffisamment approfondies, mais celles-ci dépendent de sa mémoire, de ses accès et des personnes qui sont connectées à ce moment-là.

Une base de connaissances IA privée peut être utile, mais seulement si elle est conçue comme un système opérationnel pour les connaissances internes, plutôt que comme un chatbot connecté à tous les fichiers. Pour un cabinet de conseil, l’objectif n’est pas de donner au modèle un ton assuré. Il s’agit d’aider une équipe à retrouver des connaissances approuvées, à préserver la confidentialité des clients, à respecter les droits d’accès et à indiquer la provenance de chaque réponse. Il s’agit d’un problème de conception différent de l’achat d’un assistant IA public dans lequel des documents sont ensuite importés.

Ce guide s’adresse aux équipes bruxelloises actives dans le conseil, les services consultatifs et les services professionnels qui souhaitent utiliser la génération augmentée par récupération pour leur travail interne : assistance à la rédaction de propositions, réutilisation de méthodologies, accompagnement des prestations, intégration des nouveaux collaborateurs, synthèses de recherches et contexte des comptes clients. Il se concentre sur le flux de travail, le périmètre des données, les contrôles et le plan de mesure nécessaires avant qu’une base de connaissances IA privée puisse être utile en production.

Commencez par le flux de connaissances

Ne commencez pas par indexer l’ensemble du lecteur partagé. Commencez par un ensemble de questions récurrentes. Une équipe de conseil pourrait débuter par « Qu’avons-nous déjà rédigé sur la maturité en matière d’IA des PME belges ? », « Quelle liste de contrôle des prestations s’applique à un atelier de cartographie des données ? » ou « Que doit savoir un nouveau gestionnaire de compte avant un entretien de renouvellement avec un client ? ». Chaque ensemble de questions doit avoir un utilisateur désigné, une source de référence connue et une décision que la réponse doit permettre d’étayer.

Cartographiez le parcours actuel entre la question et la réponse. Répertoriez les personnes qui posent les questions, les endroits où elles effectuent leurs recherches, les documents auxquels elles se fient, les dossiers dont l’accès est interdit, les personnes qui approuvent les formulations réutilisables et la procédure suivie lorsqu’une réponse est incertaine. Cette cartographie révèle souvent que le problème technique de récupération est moins important que le problème de gouvernance. Les équipes n’ont pas seulement besoin d’une recherche sémantique. Elles ont besoin d’une attribution claire de la propriété des documents, d’un contrôle des versions, d’une remise en ordre des droits d’accès, de règles de citation et d’une boucle de retour permettant de signaler les réponses incorrectes.

Pour les cabinets de conseil bruxellois travaillant avec des clients belges ou européens, cette cartographie du flux de travail doit tenir compte de la langue et de la juridiction. Certains contenus peuvent être confidentiels et propres à un client, d’autres peuvent relever de la méthodologie interne et d’autres encore provenir de sources publiques. Des documents en français, en néerlandais et en anglais peuvent décrire le même service avec des termes différents. Une base de connaissances utile nécessite des métadonnées qui préservent ces distinctions, au lieu de regrouper tous les documents dans un seul index indifférencié.

Choisissez soigneusement le premier corpus

Le premier corpus doit être utile, délimité et facile à maintenir. Parmi les bons candidats figurent les documents méthodologiques approuvés, les listes de contrôle des prestations, les descriptions de services, les modèles de politiques, les bilans de projets anonymisés, les notes de recherche publiques et les FAQ internes. Les archives brutes d’e-mails, les dossiers clients sans restriction d’accès, les anciennes propositions contenant des tarifs obsolètes et les documents dont la propriété n’est pas clairement définie constituent de moins bons candidats.

Appliquez une classification simple avant l’ingestion. Marquez chaque document comme public, interne, confidentiel pour le client, contenant des données à caractère personnel ou exclu. Consignez le propriétaire, la fréquence de mise à jour, la langue, le public visé et la durée de conservation prévue. Si la source est SharePoint, Google Drive, Notion, Confluence, un CRM ou un serveur de fichiers, conservez ce système comme source de référence. L’index IA doit refléter un contenu source correctement gouverné, et non devenir une copie non gérée qui s’en écarte progressivement.

Les règles européennes relatives à la protection des données rendent cette étape concrète plutôt que théorique. Les orientations de la Commission européenne sur la protection des données décrivent le cadre juridique applicable aux données à caractère personnel, aux droits et aux responsabilités dans l’Union européenne. Pour la base de connaissances d’un cabinet de conseil, cela signifie que l’équipe doit déterminer si des données à caractère personnel doivent être incluses dans le premier corpus, quelle base juridique s’applique, comment les accès sont contrôlés et comment une suppression ou une rectification effectuée dans le système source est répercutée dans l’index.

Concevez les droits d’accès avant les prompts

Une base de connaissances privée ne l’est réellement que si les droits d’accès sont maintenus lors de la récupération. Il ne suffit pas que le système de connexion de l’application connaisse l’identité de l’utilisateur. La couche de récupération doit respecter les éléments auxquels cet utilisateur peut accéder dans les systèmes sources ou dans une cartographie actualisée des habilitations. Un consultant débutant ne doit pas recevoir des notes de compte destinées au conseil d’administration simplement parce qu’elles contiennent un mot-clé également présent sur une page méthodologique sans caractère sensible.

Le modèle d’accès minimal comporte quatre volets. Premièrement, authentifier l’utilisateur au moyen du fournisseur d’identité de l’entreprise. Deuxièmement, joindre à chaque requête les métadonnées relatives à l’utilisateur, à l’équipe, au client et au rôle. Troisièmement, filtrer les résultats de récupération avant que le modèle n’y ait accès. Quatrièmement, journaliser la question, les identifiants des documents récupérés, la réponse, l’utilisateur et son retour, sans stocker inutilement de contenu sensible. Cela crée une piste d’audit sans transformer le journal en un autre référentiel de connaissances non contrôlé.

Le cadre de gestion des risques liés à l’IA du NIST est utile, car il structure le travail lié à l’IA autour de la cartographie, de la mesure, de la gestion et de la gouvernance des risques. Dans ce contexte, cartographier signifie connaître les sources de connaissances et les utilisateurs. Mesurer signifie tester la qualité des réponses et le contrôle des accès. Gérer signifie ajouter des mécanismes de refus, d’escalade et de correction. Gouverner signifie attribuer la responsabilité du corpus, de la configuration du modèle et du rythme des révisions.

Concevez le modèle de réponse

Pour les activités de conseil, le modèle de réponse le plus sûr est concis, étayé par des citations et clairement délimité. L’assistant doit répondre à partir des sources récupérées, nommer les documents utilisés, signaler toute incertitude et refuser de répondre lorsque le corpus ne permet pas d’étayer la réponse. Il doit éviter d’inventer des résultats obtenus pour des clients, des tarifs, des conclusions juridiques ou des engagements. Lorsque l’utilisateur demande un paragraphe pour une proposition ou le programme d’un atelier, le système peut produire un brouillon, mais le consultant reste responsable de sa révision avant tout envoi à un client.

Le prompt ne constitue qu’une couche du dispositif. L’application doit également imposer des seuils de qualité des sources, des exigences en matière de citations, des règles relatives aux actions protégées et des procédures de transfert. Si les documents les mieux classés par le système de récupération sont peu pertinents, obsolètes ou inaccessibles, le système doit le signaler. Si une question concerne un avis juridique, une décision de ressources humaines, un engagement financier ou des informations confidentielles propres à un client, le système doit orienter l’utilisateur vers le responsable compétent ou exiger une approbation humaine avant toute réutilisation.

Les travaux de l’OWASP sur les applications fondées sur de grands modèles de langage rappellent utilement que ces systèmes présentent des risques applicatifs en plus des risques liés aux modèles. L’injection de prompts, la gestion non sécurisée des résultats, l’autonomie excessive, la divulgation d’informations sensibles et la faiblesse des contrôles de la chaîne d’approvisionnement sont autant de risques à prendre en compte lorsque l’assistant peut consulter du contenu interne ou déclencher des actions dans un flux de travail. Une base de connaissances doit donc commencer en lecture seule, puis démontrer sa fiabilité avant de pouvoir créer des tâches, mettre à jour des champs du CRM ou envoyer des documents.

Parcours de mise en œuvre pour une équipe bruxelloise

  1. Choisissez un cas d’usage. Sélectionnez un ensemble de questions utilisé chaque semaine par les consultants, les responsables des prestations ou les gestionnaires de comptes. Évitez de faire de la recherche à l’échelle de toute l’entreprise le premier jalon.
  2. Nettoyez le corpus source. Supprimez les fichiers obsolètes, désignez des propriétaires, classifiez les niveaux de sensibilité et vérifiez que les droits d’accès dans les systèmes sources correspondent au public visé.
  3. Créez l’index de récupération. Segmentez les documents par section, conservez les métadonnées avec chaque segment et stockez les URL sources, les titres, les propriétaires, les langues et les dates de dernière mise à jour.
  4. Ajoutez la couche de contrôle. Faites respecter les droits d’accès avant la récupération, exigez des citations, bloquez les réponses non étayées et journalisez suffisamment d’informations pour pouvoir examiner les erreurs.
  5. Exécutez un ensemble d’évaluations. Avant le lancement, testez des questions réelles dont les réponses sont connues, des formulations dans plusieurs langues, des pièges fondés sur des documents obsolètes et des contrôles de droits d’accès.
  6. Lancez la solution auprès d’une seule équipe. Commencez par fournir des réponses en lecture seule dans Slack, Teams ou une interface web légère. Recueillez les retours et les demandes de correction pour chaque réponse.

Intyb classe généralement ce type de mise en œuvre parmi les systèmes de connaissances d’entreprise, plutôt que dans l’automatisation générique des flux de travail. La même couche de récupération peut ensuite prendre en charge des applications IA sur mesure, mais la valeur initiale provient de la possibilité de retrouver les connaissances existantes au moyen de contrôles clairs.

Situations dans lesquelles la solution fonctionne ou non

Une base de connaissances IA privée fonctionne bien lorsque le contenu est principalement textuel, que les documents sources ont des propriétaires clairement identifiés, que les questions sont récurrentes et que les réponses peuvent citer des éléments probants. Elle est particulièrement utile pour les guides de prestation, la réutilisation de propositions, l’intégration de nouveaux collaborateurs, la consultation des politiques internes, les notes techniques et la préparation des échanges avec les clients.

Elle fonctionne mal lorsque l’entreprise attend de l’assistant qu’il devine sa stratégie, remplace le jugement des experts ou recherche des informations dans du contenu qui n’a pas été nettoyé. Elle rencontre également des difficultés lorsque des connaissances essentielles sont enfermées dans des boîtes de réception personnelles, des appels non documentés ou des fichiers clients dont les limites de confidentialité ne sont pas claires. Dans ces situations, le premier projet approprié peut porter sur la conception des processus et la gouvernance documentaire plutôt que sur le déploiement d’un modèle. Le même principe figure dans la grille d’évaluation de la maturité des flux de travail IA à Bruxelles d’Intyb : le processus doit être prêt avant que la couche IA puisse être jugée fiable.

Le règlement européen sur l’intelligence artificielle incite également les équipes à réfléchir au rôle, à la finalité, à la transparence et à la supervision. De nombreux assistants internes de gestion des connaissances ne seront pas des systèmes à haut risque, mais les cabinets de conseil doivent néanmoins documenter l’usage prévu, les groupes d’utilisateurs, les limitations et les points de contrôle humain. Cette documentation est utile pour les clients, les collaborateurs et les futurs audits, et elle doit accompagner l’approche plus large du cabinet en matière de conformité de l’IA.

Plan de mesure

Évaluez la base de connaissances comme un flux de travail, et non comme une nouveauté. Avant le lancement, mesurez le temps de recherche initial, les questions répétées, les difficultés d’intégration des nouveaux collaborateurs, les efforts nécessaires pour réutiliser des propositions et le nombre de situations dans lesquelles les collaborateurs ne parviennent pas à identifier la source de référence actuelle. Après le lancement, examinez l’utilité des réponses, l’exactitude des citations, le taux de réponses non étayées, les défaillances des droits d’accès, les signalements de sources obsolètes et le délai de correction.

Un premier objectif réaliste n’est pas « l’IA a répondu à toutes les questions ». Il s’agit plutôt de constater que « les consultants ont trouvé plus rapidement les contenus approuvés et ont pu en vérifier la source ». Pendant le projet pilote, examinez chaque semaine un échantillon de réponses. Tenez à jour une file de documents à ajouter, à modifier ou à supprimer. Si les utilisateurs continuent à poser des questions qui ne peuvent pas être étayées, élargissez délibérément le corpus ou clarifiez davantage les limites de l’assistant.

Pour les cabinets de conseil bruxellois, le parcours de mise en œuvre le plus solide est contrôlé et progressif : une équipe, un corpus, un modèle de réponse et un rythme de révision. Les équipes qui souhaitent être accompagnées dans le choix de ce premier périmètre peuvent s’adresser à l’équipe de mise en œuvre bruxelloise d’Intyb. Pour découvrir les risques liés à cette même décision, consultez l’article expliquant pourquoi une mauvaise automatisation des processus coûte plus cher.

FAQ

Quels contenus un cabinet de conseil doit-il intégrer en premier dans une base de connaissances IA privée ?
Commencez par des documents méthodologiques approuvés, des listes de contrôle des prestations, des FAQ internes et des descriptions de services dont les propriétaires sont clairement identifiés. Évitez les dossiers clients bruts et les boîtes de réception personnelles tant que les règles relatives aux droits d’accès, à la conservation et à la confidentialité ne sont pas explicites.
Une base de connaissances IA privée peut-elle utiliser des documents de clients ?
Oui, mais uniquement lorsque la base juridique, les clauses contractuelles, les limites de confidentialité, les règles d’accès et la procédure de suppression sont clairement définies. De nombreux cabinets de conseil bruxellois devraient commencer par une méthodologie interne qui ne concerne pas les clients avant d’ajouter des corpus propres à certains clients.
Comment empêcher l’assistant de divulguer du contenu confidentiel ?
Authentifiez les utilisateurs, filtrez les documents avant la récupération, préservez les droits d’accès des sources, journalisez les identifiants des documents récupérés et testez les scénarios de contrôle des accès avant le lancement. Le modèle ne doit jamais recevoir de contenu que l’utilisateur n’est pas autorisé à consulter.
Comment faut-il mesurer la qualité des réponses ?
Utilisez un ensemble de test composé de questions réelles et des sources attendues. Suivez l’exactitude des citations, le taux de réponses non étayées, les signalements de sources obsolètes, les retours des utilisateurs et le temps nécessaire pour corriger les connaissances erronées ou manquantes.