Publié le November 19, 2024
Le graphe de connaissances Wikidata expliqué : éléments, SPARQL et usage en entreprise
13 min de lecture

Amandine Cami
Directrice Commerciale

Table des matières
Des questions ou envie d'une démo ?
Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.
Obtenir une démo
Résumé IA par QAnswer
Le graphe de connaissances Wikidata est le plus vaste jeu de données structurées sous licence libre du web : 122 983 051 éléments, construits par plus de 2,5 milliards de modifications et une communauté d'environ 41 000 contributeurs actifs. Il alimente des réponses que vous avez presque certainement déjà vues sans le savoir — dans les panneaux de Google, dans Siri, dans Alexa.
C'est aussi le meilleur modèle de référence disponible pour qui veut bâtir son propre graphe de connaissances. Wikidata a résolu, publiquement et à grande échelle, l'essentiel des problèmes que rencontre une organisation lorsqu'elle tente de rendre son savoir lisible par une machine : identifier les choses sans ambiguïté, consigner l'origine d'un fait, gérer les affirmations vraies seulement pendant une période, et garder l'ensemble interrogeable.
Ce guide explique ce qu'est le graphe Wikidata, comment s'y structurent éléments et déclarations, comment l'interroger en SPARQL — y compris la scission de 2025 qui a cassé beaucoup de requêtes existantes — et ce que tout cela implique si vous envisagez un graphe de connaissances d'entreprise. Nous avons déployé Wikibase pour la Commission européenne : c'est un terrain que nous avons parcouru en production, pas en théorie.
Qu'est-ce qu'un graphe de connaissances ?
Un graphe de connaissances stocke l'information comme un réseau de choses et de relations entre elles, plutôt que comme des lignes dans des tables. L'unité de base est un triplet : sujet, prédicat, objet.
Douglas Adams —[a étudié à]→ St John's College
Douglas Adams —[date de naissance]→ 1952-03-11
Douglas Adams —[œuvre notable]→ Le Guide du voyageur galactiqueEnchaînez-en assez et vous répondez à des questions qu'aucune table n'avait anticipées — « quels auteurs formés à Cambridge ont écrit de la science-fiction adaptée à la radio ? » — parce que les relations elles-mêmes sont des données que l'on peut parcourir.
Graphe de connaissances et base relationnelle
Un schéma relationnel est conçu autour des questions attendues. Ajouter un type de relation véritablement nouveau suppose en général de modifier des tables et de réécrire des requêtes. Dans un graphe, une nouvelle relation n'est qu'une arête de plus ; rien d'autre ne change.
Cette souplesse est tout l'intérêt. C'est aussi pourquoi les graphes conviennent aux savoirs désordonnés, évolutifs et hétérogènes — précisément ceux qu'ont réellement la plupart des organisations — et pourquoi ils s'accordent si bien avec l'IA, sujet abordé plus bas.
Qu'est-ce que Wikidata ?
Wikidata est le projet frère de Wikipédia dédié aux données structurées. Là où Wikipédia contient de la prose écrite pour des humains, Wikidata contient des faits écrits pour des machines — une seule fois, de façon centralisée et indépendante de la langue, réutilisables par toutes les éditions de Wikipédia et par n'importe quelle application externe.
L'échelle du projet
D'après la page de statistiques de Wikidata :
- 122 983 051 éléments — personnes, lieux, espèces, composés chimiques, œuvres, événements, organisations
- 2 533 498 484 modifications depuis le lancement
- 40 907 utilisateurs actifs qui l'entretiennent
Deux facteurs expliquent cette trajectoire, et tous deux méritent d'être copiés. Le premier est la communauté d'éditeurs. Le second est le logiciel sous-jacent : Wikibase.
Comment se structure un élément Wikidata
Chaque élément reçoit un identifiant opaque commençant par Q, chaque propriété un identifiant commençant par P. Douglas Adams est Q42 ; « nature de l'élément » est P31.
Ces identifiants opaques paraissent rébarbatifs et constituent en réalité la décision de conception la plus importante du projet. Q42 ne porte aucune langue, aucune orthographe, aucune hypothèse sur le nom de la chose. Des libellés dans plus de 300 langues se rattachent à l'identifiant ; l'identifiant, lui, n'a jamais à changer.
Q42 (libellés : Douglas Adams / Douglas Adams / ダグラス・アダムズ ...)
P31 nature de l'élément → Q5 (être humain)
P106 occupation → Q214917 (dramaturge)
P569 date de naissance → 1952-03-11
├─ qualificatif P1326 date au plus tard → ...
└─ référence P248 mentionné dans → Q36578Trois caractéristiques de cette forme comptent bien plus qu'il n'y paraît :
- Des déclarations, pas des champs. Un élément peut porter plusieurs valeurs concurrentes pour une même propriété, chacune avec un rang.
- Des qualificatifs. Le contexte d'une déclaration : valable à partir de, jusqu'à, dans quelle juridiction. La plupart des faits réels ne sont vrais que sous conditions.
- Des références. L'origine de l'affirmation. C'est ce qui distingue un graphe auditable d'un tas d'assertions.
Si vous bâtissez un graphe d'entreprise en faisant l'économie des qualificatifs et des références, vous les reconstruirez dans l'année. Toute organisation finit par devoir répondre à « vrai à quelle date ? » et « qui l'affirme ? ».
Qui utilise réellement Wikidata
Les moteurs de recherche s'en servent pour alimenter leurs panneaux d'entités. Les assistants vocaux y puisent leurs réponses factuelles. Bibliothèques, musées et institutions de recherche l'emploient comme référentiel d'autorité partagé, afin que leur catalogue et celui d'un autre s'accordent sur le « Paris » dont il est question. Wikidata est devenu le pivot d'identifiants de fait du web des données ouvertes.
Wikibase : le logiciel derrière Wikidata
Wikidata est un site. Wikibase est la suite logicielle libre sur laquelle il tourne, maintenue par Wikimedia Deutschland — et vous pouvez l'exécuter vous-même.
Wikidata et Wikibase
La distinction sème la confusion, disons-le simplement :
- Wikidata est un graphe de connaissances précis, public, entretenu par une communauté.
- Wikibase est le logiciel qui permet de construire des graphes de ce type — y compris privés.
Wikibase vous donne le même modèle élément/propriété/déclaration/qualificatif/référence, les mêmes libellés multilingues, le même historique de modifications, et un point d'accès SPARQL sur vos propres données. Bibliothèques, institutions culturelles, consortiums de recherche et administrations publiques l'adoptent précisément parce que le modèle a déjà été éprouvé à 123 millions d'éléments.
La fédération : garder les données à leur place
Wikibase prend en charge la fédération : votre instance peut référencer des identifiants Wikidata sans copier le contenu de Wikidata. Vous décrivez vos entités dans votre instance et pointez vers Q142 quand vous voulez dire « France », au lieu de maintenir éternellement votre propre liste de pays.
Pour quiconque a des obligations de souveraineté, c'est la propriété décisive : vocabulaire partagé, contrôle local. Vos données sensibles ne quittent jamais votre infrastructure et restent interopérables. C'est le principe que nous détaillons dans qu'est-ce que l'IA privée, appliqué aux données structurées. Voir aussi notre article sur Wikidata en service local.
Interroger le graphe Wikidata en SPARQL
Un graphe ne vaut que par votre capacité à l'interroger. Wikidata expose un point d'accès SPARQL public sur query.wikidata.org.
Une première requête
Les dix plus grandes villes de France, libellés en français :
SELECT ?city ?cityLabel ?population WHERE {
?city wdt:P31/wdt:P279* wd:Q515 ; # nature : (sous-classe de) ville
wdt:P17 wd:Q142 ; # pays : France
wdt:P1082 ?population . # population
SERVICE wikibase:label { bd:serviceParam wikibase:language "fr,en" . }
}
ORDER BY DESC(?population)
LIMIT 10Notez wdt:P31/wdt:P279*. Ce chemin de propriété signifie « instance de quelque chose qui est, transitivement, une sous-classe de ville » : vous attrapez ainsi communes, municipalités et métropoles sans les énumérer. Ce type de parcours est exactement ce que l'on achète en choisissant un graphe.
La scission de 2025 — et pourquoi vos anciennes requêtes ont cassé
C'est le point que la plupart des tutoriels n'ont pas intégré. Le 9 mai 2025, le service de requêtes Wikidata a été scindé en deux graphes, car les données d'articles scientifiques (WikiCite) dépassaient la moitié de tous les triplets et Blazegraph ne pouvait plus monter en charge sur l'ensemble.
- Graphe principal —
query.wikidata.org— tout sauf les articles scientifiques. - Graphe scientifique —
query-scholarly.wikidata.org— articles scientifiques et entités associées.
Un point d'accès complet transitoire a existé jusqu'en décembre 2025 ; il a depuis disparu. Toute requête ayant besoin des deux côtés doit donc recourir explicitement à la fédération SPARQL :
SELECT ?work ?workLabel WHERE {
# atteindre le graphe scientifique depuis le point d'accès principal
SERVICE <https://query-scholarly.wikidata.org/sparql> {
?work wdt:P50 wd:Q42 . # auteur : Douglas Adams
}
SERVICE wikibase:label { bd:serviceParam wikibase:language "fr" . }
}La leçon pratique se généralise bien au-delà de Wikidata : un graphe qui continue de croître finira par imposer des décisions d'architecture sur le partitionnement et la fédération. Anticipez-les avant qu'elles ne deviennent urgentes.
L'API Wikidata
SPARQL sert à poser des questions sur des motifs. Quand vous savez déjà quelle entité vous voulez, les API REST et Action sont plus simples et moins coûteuses — récupérer Q42, lire ses libellés et déclarations, terminé. Règle approximative : l'API pour la consultation, SPARQL pour la découverte. Les deux sont gratuites et limitées en débit : mettez en cache agressivement en production.
De Wikidata au graphe de connaissances d'entreprise
La plupart des organisations ont le problème que Wikidata s'est attaqué à résoudre : la même entité — un client, un produit, une réglementation, un site — décrite différemment dans une dizaine de systèmes, sans identifiant partagé ni trace de provenance.
Pourquoi les organisations en construisent
- Une identité par chose. Un identifiant interne stable qui survit aux renommages et aux réorganisations.
- Des questions transversales aux silos. Croiser CRM, ERP et documentation sans un projet d'entrepôt par question.
- La provenance par défaut. Chaque fait porte sa source, ce qui le rend auditable.
- Un ancrage pour l'IA. Un graphe curé est un bien meilleur substrat pour un assistant qu'un dossier de PDF.
Quatre leçons que Wikidata a déjà payées
- Utilisez des identifiants opaques. Tout ce qui est lisible par un humain devient faux dès qu'une chose est renommée.
- Modélisez des déclarations, pas des champs. Autorisez des valeurs concurrentes avec des rangs ; la réalité est rarement univoque.
- Rendez les références obligatoires tôt. Rétro-ajouter la provenance sur des millions de faits est un supplice.
- Prévoyez de partitionner. La scission de 2025, c'est à quoi ressemble le succès à grande échelle.
Graphes de connaissances et LLM : pourquoi ils vont ensemble
Les modèles de langage sont forts sur la langue et peu fiables sur la restitution. Les graphes de connaissances sont l'inverse : précis, structurés, vérifiables et incapables de converser. Les réunir couvre les deux faiblesses.
L'ancrage : le graphe fournit les faits
Au lieu de demander au modèle de se souvenir, on récupère les faits pertinents dans le graphe et on lui demande de répondre à partir de ceux-ci, source attachée. Ce basculement — de la mémoire vers la lecture — est le principal levier sur la fiabilité de l'IA, comme nous l'exposons dans ChatGPT est-il fiable. Un graphe le renforce encore, car un triplet récupéré est dépourvu d'ambiguïté là où un paragraphe récupéré n'en est pas exempt.
Du langage naturel au SPARQL
L'autre direction est tout aussi utile : laisser le modèle écrire la requête. L'utilisateur pose sa question en langage courant, le système génère du SPARQL, l'exécute sur le graphe et répond à partir de résultats réels. L'utilisateur n'a besoin de connaître ni P31 ni Q515, et la réponse est calculée plutôt que remémorée.
C'est le problème que QAnswer a été créé pour résoudre, et c'est pourquoi nos assistants IA et nos API traitent les sources structurées à égalité avec les documents.
Nos travaux avec Wikidata et Wikibase
Nous ne sommes pas des commentateurs sur ce sujet. Nous avons déployé une instance Wikibase pour la Commission européenne et y avons intégré diverses sources de données, produisant un graphe de connaissances européen public sur les données ouvertes liées de l'UE.
Nous avons aussi créé WikidataComplete, qui utilise l'IA pour proposer à Wikidata de nouvelles déclarations extraites de textes non structurés, chacune soumise à l'approbation d'un éditeur humain — l'IA trouve les faits candidats, la communauté décide. Et nous connectons des assistants directement à des instances MediaWiki et Wikibase, pour que le wiki d'une organisation devienne une source dont un assistant peut répondre, avec citations.
Si vous voulez voir ce que donne un graphe couplé à un assistant sur vos propres contenus, la même machinerie est disponible via nos intégrations — déployables sur site ou en cloud privé, ce qui, dans le secteur public et les environnements réglementés, est généralement l'exigence qui décide de tout le reste. Voir souveraineté des données.
Questions fréquentes
Qu'est-ce que le graphe de connaissances Wikidata ?
C'est un graphe de connaissances libre et collaboratif de 122 983 051 éléments, qui stocke les faits sous forme de déclarations structurées avec qualificatifs et références plutôt qu'en prose. Il est interrogeable en SPARQL et réutilisé par les moteurs de recherche, les assistants vocaux et les institutions culturelles du monde entier.
Quelle est la taille de Wikidata ?
122 983 051 éléments, issus de plus de 2,53 milliards de modifications par environ 40 900 utilisateurs actifs, selon la page de statistiques de Wikidata. Les seules données d'articles scientifiques ont dépassé la moitié de tous les triplets, ce qui a forcé la scission du service de requêtes en 2025.
Quelle différence entre Wikidata et Wikibase ?
Wikidata est un graphe de connaissances public. Wikibase est le logiciel libre sur lequel il tourne, que chacun peut déployer pour construire le sien — publiquement ou de façon entièrement privée.
Wikidata est-il un graphe de connaissances ou une base de données ?
Les deux, d'une certaine manière : il est stocké dans une base de données et modélisé comme un graphe. Ce qui en fait un graphe de connaissances, c'est la forme — des entités reliées par des relations typées, avec la provenance sur les déclarations — et non la technologie de stockage.
Comment interroger Wikidata ?
Utilisez SPARQL sur query.wikidata.org pour les questions par motif, ou les API REST et Action quand vous connaissez déjà l'entité. Depuis mai 2025, les requêtes touchant à la fois le graphe principal et le graphe scientifique nécessitent la fédération SPARQL.
Pourquoi le service de requêtes Wikidata a-t-il été scindé en deux graphes ?
Les données d'articles scientifiques dépassaient la moitié de tous les triplets et le moteur Blazegraph ne pouvait plus monter en charge sur le jeu complet. Depuis le 9 mai 2025, le graphe principal est servi sur query.wikidata.org et le graphe scientifique sur query-scholarly.wikidata.org ; le point d'accès complet transitoire a été retiré fin 2025.
Puis-je construire un graphe de connaissances privé comme Wikidata ?
Oui — c'est exactement l'objet de Wikibase. Vous disposez du même modèle de données et d'un point d'accès SPARQL sur vos propres contenus, vous pouvez fédérer avec les identifiants Wikidata pour les concepts partagés, et tout héberger dans votre propre infrastructure.
Comment les graphes de connaissances améliorent-ils les réponses de l'IA ?
Ils fournissent au modèle des faits vérifiables au lieu de lui demander de se souvenir. Les triplets récupérés sont non ambigus et portent leur provenance : les réponses sont donc traçables jusqu'à une source — et l'on peut demander au modèle de générer le SPARQL pour que les utilisateurs interrogent le graphe en langage courant.
Par où commencer
Le graphe de connaissances Wikidata mérite d'être compris à deux titres : comme le plus grand jeu de données structurées ouvert sur lequel bâtir gratuitement, et comme un modèle de conception éprouvé pour votre propre graphe. La discipline des identifiants, le modèle de déclarations, l'exigence de références — voilà ce qu'il faut copier.
Et une fois le graphe en place, un assistant IA posé dessus cesse d'être un générateur de texte plausible pour devenir quelque chose qui répond à partir de faits que vous pouvez montrer.
Construisez un assistant IA sur vos propres connaissances — documents, wikis ou graphes — avec QAnswer. Découvrez nos assistants IA, notre intégration MediaWiki et notre liste complète d'intégrations.
Plus d'informations sur www.qanswer.ai
Un projet de graphe de connaissances ? Contactez-nous ou écrivez à info@the-qa-company.com
Retour au Blog
La plateforme IA qui fonctionne.
Essayer gratuitement