Archives par mot-clé : une

Données structurées, données ouvertes et liées: est-ce la même chose ?

Données structurées et données ouvertes et liées sont des expressions dont l’usage indifférencié peut nuire à la prise de décisions qui ont une grande importance pour la réussite d’un projet dans le domaine culturel. Par données structurées , on fait ici référence à la technique d’indexation préconisée par Google (structured data). Ces expressions désignent deux manières différentes de travailler dans le web des données. Ce billet concerne les modèles de données et outils proposés afin de documenter des ressources pour les moteurs de recherche.

Un autre billet abordera les avantages spécifiques des données ouvertes et liées.

Guide des données structurées de Google pour documenter des livres.
Guide des données structurées de Google pour documenter des livres.

Google et le web sémantique

En 2013, Google effectue un des plus importants changements sur son algorithme de recherche en plus d’une décennie.

Baptisée Hummingbird , la nouvelle mouture s’appuie sur le sens et le contexte plutôt que sur la pondération de mots clés. Elle fait également appel à un savoir encyclopédique qui est organisé comme un graphe de connaissances et qui est constitué en grande partie à partir de Freebase, une base de données structurées collaborative, acquise par Google. Cette masse de données, appelée Knowledge Graph, permet de à l’algorithme de classer l’information et, de ce fait, de savoir à quelles autres informations elle est liée. C’est une logique similaire à celle de Wikipédia, où chaque article comporte plusieurs liens internes et externes.

La nouvelle version de l’algorithme peut donc effectuer des recherches en mode « conversationnel » (Où faire réparer mon téléphone?) et, surtout, améliorer les résultats de recherche grâce aux concepts du web sémantique: des métadonnées qui donnent le sens des données et qui permettent de faire des liens qui produisent de l’information. En comprenant le sens et le contexte de la demande, il devient possible, pour le moteur de recherche, de mieux interpréter l’intention de l’individu qui la transmet.

De la liste de pages web aux résultats enrichis

Depuis, la recherche de (méta)données qui font du sens prend progressivement le pas sur la recherche de mots clés. C’est une transition que l’on peut très facilement constater sur nos écrans mobiles. Nous passons donc d’une liste de pages qui comportent les mots clés recherchés à une agrégation d’informations qui résulte de liens entre des données structurées.

Il y a toujours une recherche de pages, mais ce sont les données qui décrivent des « ressources » (personnes, choses, concepts) qui sont désormais importantes. Au web documentaire, celui où l’information est présentée métaphoriquement en pages, s’ajoute le web des données, celui où toute connaissance est de la donnée qui peut être collectée et traitée par des machines. Celles des moteurs de recherche et celles de toute entité qui souhaite s’en servir pour développer un service ou un produit qui aurait de la valeur.

Schema: représentation pour moteurs de recherche

Les données structurées sont exprimées selon un modèle de métadonnées qui a été conçu par un regroupement de moteurs de recherche (Google, Bing, Yahoo! et le russe, Yandex). Ces données sont publiées dans le code HTML des pages où sont présentées les ressources qu’elles décrivent. Ces données sont publiques, mais pas ouvertes. Mais ce sont cependant des données liées puisque le modèle Schema permet de produire des triplets (symphonie pour un homme seul (sujet) – est de type (prédicat)- électroacoustique (objet)). Quelques exemples sont présentés dans un billet précédent l’usage de données structurées par Google. Le rôle des données structurées et des liens vers Wikipédia est expliqué plus en détail dans un guide sur la documentation des contenus produit pour le Fonds indépendant de production, avec la collaboration de TV5.ca et l’appui de la SODEC.

Apprendre à documenter: une étape nécessaire

Alors, documenter une ressource à l’aide de données structurées, en intégrant celles-ci dans la page web de la ressource, est-ce « travailler pour Google » ?

Oui, bien sûr. Mais, ce n’est qu’un premier pas dans l’apprentissage pratique du rôle clé des données dans une économie numérique. Mais s’en tenir à cette étape, c’est conformer notre représentation de la culture à un modèle de représentation et à des impératifs d’affaires qui sont hors de notre contrôle et qui ne répondent à des impératifs économiques qui avantagent la plateforme.

Ne pas dépendre d’entreprises qui se placent au-dessus des lois et des États est un des enjeux qui motivent des gouvernements et des institutions à soutenir, par des politiques et des programmes de financement, des projets basés sur les principes et les technologies du web sémantique qu’ils peuvent contrôler. Nous verrons, dans un prochain billet, les opportunités qu’offrent ces technologies pour l’innovation et la promotion de la culture.

Découvrabilité : quand les écrans ne sont plus nécessaires 

Présentation donnée lors de la clinique d’information du Fonds Bell, le 17 octobre 2017, à la Cinémathèque (Montréal).

Mise à jour (16 février 2018):  Cette présentation accompagnait le lancement du guide Êtes-vous repérables ? Guide pratique pour documenter vos contenus , réalisé pour le Fonds indépendant de production, avec la collaboration de TV5.ca et l’appui de la SODEC .

La découvrabilité qui devrait intéresser plus particulièrement tout créateur et producteur de contenus résulte de la présence, dans le web, de données descriptives qui sont intelligibles et manipulables par des machines. Il ne s’agit pas de campagnes de promotion, ni de référencement de pages web, mais de la documentation de  contenus (textes, images, vidéo, enregistrements sonores et toutes autres types de ressources).  Ces trois types d’activité visent des objectifs spécifiques et complémentaires.

Les changements qui affectent la visibilité et la découvrabilité

La plus grande proportion du trafic sur le web est portée par les petits écrans mobiles.
Graphique: le trafic web est porté par les écrans mobiles

Liens utiles:
Smartphones are driving all growth in web traffic
Search engine market share – Mobile – Canada
Cahier de Tendances N°11 : au delà du mobile, France Télévisions

Les moteurs de recherche s’adaptent aux petits écrans.
Lorsque l’information qui décrit un contenu est disponible dans un format que les moteurs peuvent traiter, la liste des résultats de recherche passe au second plan.

Face à la surabondance d’information et de contenus, la pertinence de la recommandation devient un facteur important de fidélisation.

Google - Résultat de recherche sur téléphone

Recherche vocale et assistants virtuels: l’information sans écran.
Plus de 30 millions d’assistants vocaux dans les foyers, aux États-Unis, d’ici la fin de l’année

Assistants virtuels ou assistants vocaux

Liens utiles:
More than 30 million ‘voice-first’ devices in US homes by year end [Report]
Report: 57% of smart speaker owners have bought something with their voice
Gartner Predicts 30% Of Searches Without A Screen In 4 Years

Ces nouvelles interfaces du web n’ont pas d’écran et ne peuvent dont nous répondre en nous fournissant une liste de résultats.
« Enfin et c’est cela qui pose à mon sens le plus gros problème dès que l’on sort de la seule sphère « commerciale », il y a … « le choix d’Alexa », c’est à dire l’idée que bien sûr Amazon / Alexa ne va pas nous « lire » une série de réponses suite à notre requête mais nous en proposer une seule, mettant naturellement en évidence des produits vendus par la marque hôte.» (La voix et l’ordre, billet d’Olivier Ertzscheid).

Moteurs de réponses et de suggestions
Lorsque les données qui décrivent un contenu sont accessibles, intelligibles et manipulables par des applications, elles peuvent être triées par des algorithmes et liées à d’autres données qui décrivent un même auteur, lieu, création, objet, producteur, etc.  Un contenu peut se trouver sur la parcours d’un internaute des décennies après sa création.

Liens utiles:
Les sites web sont-ils en voie de disparition ?
#DIVERTISSEMENT Les algorithmes vont-ils mettre fin à la tyrannie du choix ?
How Netflix will someday know exactly what you want to watch as soon as you turn your TV on

Les moteurs de recherche comprennent-ils nos contenus?

Les pages web sont faites pour être lues par des humains. Les machines ne comprennent pas le contenu de la page, mais elles peuvent manipuler des données qui s’y trouvent  lorsque celles-ci sont mises en contexte grâce à des métadonnées et sont dans un format qu’elles reconnaissent.

Pour savoir si un moteur de recherche peut faire des liens entre votre websérie et d’autres informations disponibles dans le web, il suffit de chercher celle-ci afin de voir si une fiche d’information est produite.

Validation des données structurées: recherche de la série Carmilla.

Chez Google, la fiche d’information, appelée Knowledge card, est générée grâce à  la mise en contexte des données qui décrivent le contenu avec son modèle de classification des connaissances (Knowledge graph). Ces mêmes données descriptives sont mises en relation avec celles d’autres plateformes comme Wikidata (les données structurées de Wikipédia) et, selon le contexte, avec les données de plateformes spécialisées.

Dans le domaine du cinéma, de la vidéo et de la télévision, nous pouvons retrouver les données issues des agrégateurs IMDb (Internet Movie Database,  propriété d’Amazon), AlloCiné et Rotten Tomatoes. Notez que le contenu de ces plateformes n’est pas produit par une seule organisation, mais par des utilisateurs et/ou des producteurs de contenus.

Ce sont des données structurées qui, chez les moteurs de recherche comme Google et Bing , permettent de faire des liens sémantiques qui fournissent une description succincte ou détaillée  d’un contenu dans une fiche d’information. C’est cette fiche qui tend à occuper un espace de plus en plus important sur nos écrans.

De la même manière qu’il a fourni aux développeurs des instructions pour faciliter le référencement de sites web, Google fournit désormais des instructions et des outils pour encourager la production de données structurées. L’outil de test des données structurées détecte la présence de ces données dans une page web et, le cas échéant,  signale les erreurs à corriger et les améliorations possibles.

Google: validation des données structurées: page d'accueil de Louis-Jean Cormier.

Il est également possible de produire des métadonnées pour décrire un contenu qui est présent dans une page web sans connaître le modèle de métadonnées Schema et sans programmation. L’outil d’aide au balisage des données structurées qui est proposé par Google permet de copier les données qui sont encodées en JSON-LD, un format pour les données liées, et de les coller dans le code HTML de la page web où se trouve le contenu.

Google: outil de balisage de données structurées, page web de Vincent Vallières

Cet outil présente un intérêt supplémentaire: il indique les informations qui devraient apparaître dans la page de présentation d’un contenu. De trop nombreuses pages web où sont présentés des films, spectacles, livres, pièces musicales ou œuvres d’art ne contiennent pas le minimum d’information qui permettrait aux moteurs de recherche de les lier à d’autres informations dans le web.

Plus l’information qui décrit le contenu est détaillée et riche, plus grand est le potentiel de celui-ci d’être lié à d’autres contenus et donc, d’être découvert.

Documenter nos contenus, n’est-ce pas travailler pour Google et cie?

Documenter (ou indexer) un contenu, tout comme faire du référencement de pages web, c’est normaliser et organiser la  représentation de celui-ci.  C’est, effectivement, contribuer à l’amélioration continue des applications et des algorithmes des moteurs de recherche.

Mais c’est également une étape nécessaire pour apprendre à nous servir de nos données et, par la suite, développer nos propres outils de découverte, de recommandation et de reconnaissance de ceux qui ont contribué à la création et à la production  d’œuvres.

Libérer le potentiel de nos données culturelles ou laisser d’autres en tirer profit

Silos riachuelo

Tu peux produire de l’excellent contenu, mais s’il ne fait pas partie du web, il ne fait pas partie du discours universel.

Tim Berners-Lee, en entrevue avec Jean-François Coderre pour La Presse.

C’est une affirmation que de nombreux états, institutions et entreprises tiennent désormais pour une réalité. Une réalité que plusieurs expérimentent depuis quelques années déjà et qui s’impose encore davantage à ceux qui observent les transformations qui sont à l’œuvre  dans le web , notamment du côté des moteurs de recherche.

Alors, ne devrions-nous pas élaborer une approche stratégique afin de regrouper et de structurer notre offre culturelle plutôt que d’encourager la production de silos d’informations qui sont difficilement exploitables ?

Comment tirer notre épingle du jeu numérique ?

Il faut nous attaquer à la dispersion de l’offre culturelle, d’une part, et d’autre part, à l’absence de vision transverse sur les données. Autrement, incapables de développer nos propres modèles d’exploitation numériques, nous risquons d’être confinés aux rôles de fournisseurs et de clients de plateformes beaucoup plus attractives et efficaces que nos sites web.

Principal défi: sauf dans des domaines, comme les bibliothèques et  les archives, les organisations ont, en général, peu d’intérêt ou de ressources à investir pour la production de métadonnées standards. Cela pourrait cependant changer.

Données structurées pour moteurs de recherche en quête de sens

Les moteurs de recherche privilégient de façon croissante les contenus web dont la description leur est fournie par des données structurées (appelées quelquefois,métadonnées embarquées). Schema est le modèle de métadonnées soutenu par les grands acteurs du numérique, tels que Google, Microsoft et Apple afin d’alimenter les algorithmes qui fournissent de l’information plutôt que des listes de résultats. Google offre même aux développeurs des modèles descriptifs pour des types de contenus dont la liste s’allonge progressivement.

L’utilisation de la base de connaissance Knowledge Graph, d’un modèle de métadonnées qui est dérivé de la syntaxe du web sémantique (RDF ou Resource Description Framework) et d’un  format d’encodage de données liées (JSON-LD ou Java Script Object Notation for Linked Data) témoigne de la préférence de Google pour le web des données et les liens permettant de générer du sens.

Avec Schema, qui facilite l’intégration des données dans des pages HTML (il existe également des extensions spécialisées pour WordPress), les robot indexeurs et les algorithmes des moteurs de recherche deviennent donc beaucoup plus performants. Il n’est déjà plus nécessaire de quitter leur interface pour trouver une information ou découvrir, par exemple, de nouveaux groupes musicaux.

La production de données structurées est une technique qui deviendra rapidement aussi essentielle que l’optimisation de pages web. Mais une technique, aussi efficace soit-elle, n’est qu’un moyen et ne peut remplacer une stratégie.

Regrouper et structurer notre offre culturelle

Les données doivent pouvoir être extraites des silos existants et reliées entre elles grâce à des métadonnées communes. Les éléments d’information produits par chacun des acteurs du milieu des arts et de la culture peuvent ainsi être reliés de façon cohérente afin de constituer une offre d’information globale et riche et de nous fournir une meilleure visibilité sur les données relatives à l’accès et à l’utilisation de contenus.

Comment accompagner la transition ?

Comment extraire les données descriptives des bases de données et les normaliser ? Comment définir les métadonnées qui formeraient les éléments descriptifs essentiels pour permettre de relier entre eux des ensembles de données qui  utilisent des référentiels standards mais différents ? Et, surtout, comment convaincre les producteurs de données de l’importance de l’interopérabilité et de la structuration intelligente des données ?

Dans cette perspective et afin de travailler collectivement à définir des pistes d’action, nos politiques et programmes devraient jeter les bases d’un projet de mise en commun des données culturelles en soutenant:

  • L’adoption des meilleures pratiques en matière d’indexation de contenu avec des métadonnées et une syntaxe de description qui s’adressent aux machines;
  • L’élaboration d’un un ensemble de métadonnées de base (modèle de médiation) qui permette de « faire la traduction » entre les différents standards et vocabulaires employés selon les domaines (musique, cinéma, arts visuels) et les missions (bibliothèque, archives, commerce, gestion de droits);
  • La libération des données qui décrivent nos créations artistiques, nos produits culturels, nos talents et notre patrimoine. Les données ouvertes constituent une première étape vers la diffusion de données ouvertes et liées.
  • L’acquisition des compétences techniques et technologiques qui sont requises afin de concevoir et de maintenir des outils pour faciliter la saisie et la réutilisation des données par les acteurs concernés.
  • L’harmonisation des différents modèles d’indexation documentaire (référentiels transversaux pour la production des données culturelles, cartes d’identité des biens culturels) au sein du Ministère de la Culture et des Communications.
  • Une étroite collaboration entre les institutions et les organismes producteurs de données autour de la rédaction d’une politique des métadonnées culturelles.

On ne devient numérique qu’en le faisant. Mais c’est un chantier qui repose davantage sur la collaboration et la mise en commun de l’information que sur la technologie.