{
 "url": "https://11d.im/write.apreslanu.it/tk/1704290400/",
 "published": "Tue Oct 15 2024 23:13:07 GMT+0200 (Central European Summer Time)",
 "updated": "Tue Oct 15 2024 23:13:07 GMT+0200 (Central European Summer Time)",
 "author": {
  "name": "tk",
  "url": "https://11d.im"
 },
 "content": "<section>\n<p>\u00c0 la suite de deux articles de The Markup sur le <em>scraping</em>, j\u2019en profite pour revenir sur ce morceau important du web et articuler quelques cl\u00e9s de lecture. Qu\u2019est-ce c\u2019est\u2009? Pourquoi est-ce important\u2009? Et quelques contextes d\u2019usage avec leurs enjeux.</p>\n<p>Il y a quelques approximations par esprit de concision. Pardon par avance.</p>\n<!--more-->\n</section>\n<section>\n<div class=\"section-link\">\n<a class=\"no-tufte-underline\" href=\"https://11d.im/write.apreslanu.it/tk/1704290400/#qu%E2%80%99est-ce-que-c%E2%80%99est-%3F\"></a><h2 id=\"qu%E2%80%99est-ce-que-c%E2%80%99est-%3F\" tabindex=\"-1\">Qu\u2019est-ce que c\u2019est\u2009?</h2>\n</div>\n<p>Le <em>scraping</em> est l\u2019op\u00e9ration consistant \u00e0 extraire syst\u00e9matiquement de l\u2019information d\u2019un ensemble de pages web (un site en particulier, une pelote de liens, etc.) pour constituer un jeu de donn\u00e9es (les donn\u00e9es, les changements dans ces donn\u00e9es, etc.) qui pourra \u00e9ventuellement servir \u00e0 produire une nouvelle information (comparaison, vue macro, etc.). Une fois automatis\u00e9e, cela permet de changer, l\u2019\u00e9chelle en quantit\u00e9 et en temporalit\u00e9, des informations provenant du web. Cela en fait un \u00e9l\u00e9ment important de l\u2019\u00e9cologie de la connaissance dans notre univers hyperm\u00e9diatique.</p>\n<p>Le <em>scraping</em> mobilise les t\u00e2ches suivantes\u00a0:</p>\n<ul>\n<li>naviguer sur des pages web, c.-\u00e0-d. au format <em>HTML</em>,</li>\n<li>extraire l\u2019information de ces pages,</li>\n<li>et de l\u2019organiser sous la forme d\u2019une base de donn\u00e9es, un fichier ou des fichiers, bref, restructurer l\u2019information diff\u00e9rement.</li>\n</ul>\n<p>Le degr\u00e9 z\u00e9ro est de le faire soit m\u00eame \u00e0 la main. Il y a longtemps, il y avait m\u00eame des extensions pour navigateurs, par exemple <a href=\"https://medialab.sciencespo.fr/en/tools/navicrawler/\">navicrawler</a> du Medialab de Sciences Po, pour aider \u00e0 cela. La plupart du temps, c\u2019est un <em>script</em> dans un langage comme <em>python</em> qui permet d\u2019automatiser la partie r\u00e9p\u00e9titive.</p>\n<p>Pour abstraire et g\u00e9n\u00e9raliser l\u2019extraction d\u2019information, il faut souvent une comp\u00e9tence de compr\u00e9hension de la structure d\u2019une page web, c.-\u00e0-d. savoir lire du HTML, et en comprendre la syntaxe. Bien heureusement, le web est une technologie fondamentalement ouverte et tous les navigateurs permettent d\u2019afficher le code source d\u2019une page en deux clics (clic droit, voir le code source, clic gauche). Si vous entendez parler d\u2019\u00ab\u2009inspecter le code source\u2009\u00bb, c\u2019est cela, une manipulation qui permet de relier un \u00e9l\u00e9ment visuel avec un morceau de langage technique d\u00e9crivant cet \u00e9l\u00e9ment. Le jeu est alors de trouver le motif permettant de rassembler tous les \u00e9l\u00e9ments semblables.</p>\n<p>Certains \u00e9diteurs de site web cherchent \u00e0 emp\u00eacher ce genre d\u2019op\u00e9ration, il n\u2019est alors pas rare d\u2019utiliser \u00e0 nouveau un script qui va simuler des s\u00e9ries d\u2019actions humaines dans un navigateur web. Redonnant ainsi un sens au terme de <em><a href=\"https://en.wikipedia.org/wiki/User_agent\">user agent</a></em> qui permettait d\u2019identifier un navigateur comme un instrument d\u2019agissement (ou d\u2019agentivit\u00e9) d\u2019un utilisateur.</p>\n</section>\n<section>\n<div class=\"section-link\">\n<a class=\"no-tufte-underline\" href=\"https://11d.im/write.apreslanu.it/tk/1704290400/#pourquoi-est-ce-important-%3F\"></a><h2 id=\"pourquoi-est-ce-important-%3F\" tabindex=\"-1\">Pourquoi est-ce important\u2009?</h2>\n</div>\n<p>Le <em>scraping</em> et sa continuit\u00e9 de pratiques sont importants, car dans le paradigme marketing actuel de l\u2019intelligence artificielle, ce qui est automatisable a une bonne probabilit\u00e9 d\u2019\u00eatre recycl\u00e9 comme un service payant avec un travail qui est surtout de la conception d\u2019interface utilisateur, mais comme le design ne paie plus on parle de \u00ab\u2009robot\u2009\u00bb et d\u2019\u00ab\u2009intelligence artificielle\u2009\u00bb. <a href=\"https://www.browse.ai/\">Browse.ai</a> est un exemple de ce genre de maquillage. D\u2019ailleurs, tout cela pourrait \u00eatre fait avec du travail humain en exploitant un service comme <em>Mechanical Turk</em> d\u2019Amazon et cela resterait du <em>scraping</em>. La diff\u00e9rence notable est la responsabilit\u00e9 de l\u2019usage de technologie et la volont\u00e9 de fermer les yeux, ou non, sur les conditions d\u2019extraction et d\u2019exploitation du travail. Dans ce contexte, la notion de comp\u00e9tence est \u00e9galement importante, car, bien que technique, savoir lire du HTML est une connaissance n\u00e9cessaire et normalement relativement facile d\u2019acc\u00e8s. On n\u2019est pas dans des affres de complexit\u00e9 et un minimum de p\u00e9dagogie fait l\u2019affaire. La promesse <s>du no-code</s> de l\u2019intelligence artificielle est une barri\u00e8re \u00e0 cela et emp\u00eache la r\u00e9solution du moindre probl\u00e8me ainsi que l\u2019identification d\u2019erreurs. C\u2019est une d\u00e9pendance directe au bon vouloir d\u2019une entreprise/d\u2019un service en fonction des orientations manag\u00e9riales et du march\u00e9.\nDit autrement, le <em>scraping</em> est un bon cas pour ouvrir les diff\u00e9rentes probl\u00e9matiques sociales invisibilis\u00e9es dans le paradigme dans lequel nous sommes plong\u00e9s depuis quelques ann\u00e9es et acc\u00e9l\u00e9rer par le succ\u00e8s commercial de <a href=\"https://write.apreslanu.it/tk/tag:openai\">OpenAI</a>.</p>\n<p>L\u2019autre point important est la complexification des technologies web. La professionnalisation des m\u00e9tiers du web et l\u2019\u00e9conomie num\u00e9rique alimentant un besoin de produire de plus en plus de pages am\u00e8nent \u00e0 un amoncellement de nouvelles solutions pour r\u00e9soudre des probl\u00e8mes sauf que chaque solution vient avec ses propres probl\u00e8mes. Pour mettre une page web en ligne, on est bien loin du glisser-d\u00e9poser d\u2019un fichier vers le FTP fourni gratuitement avec son acc\u00e8s \u00e0 Internet. Souvent, pas toujours, un site web est plus une surcouche sur une API, un point d\u2019acc\u00e8s programmatique, qui permet de g\u00e9n\u00e9rer des pages et d\u2019avoir une gestion plus dynamique de son contenu que le mod\u00e8le standard de la page web. Par exemple, plut\u00f4t que de faire une page diff\u00e9rente par personne c\u00f4t\u00e9 serveur, on va demander au navigateur d\u2019aller r\u00e9cup\u00e9rer des informations en parall\u00e8le et le laisser modifier la page \u00e0 un endroit qui sera indiqu\u00e9 par avance. Sch\u00e9matiquement. Une solution de repli pour l\u2019extraction d\u2019information est alors d\u2019aller la chercher dans l\u2019API. On s\u2019\u00e9loigne alors petit \u00e0 petit du <em>scraping</em> et de ce que percoit normalement un navigateur et donc du contexte de lecture ainsi que les diff\u00e9rentes transformations possibles. L\u2019information r\u00e9cup\u00e9r\u00e9e de cette fa\u00e7on est souvent d\u00e9j\u00e0 structur\u00e9e et ainsi plus propre.</p>\n</section>\n<section>\n<div class=\"section-link\">\n<a class=\"no-tufte-underline\" href=\"https://11d.im/write.apreslanu.it/tk/1704290400/#quels-sont-les-enjeux-%3F\"></a><h2 id=\"quels-sont-les-enjeux-%3F\" tabindex=\"-1\">Quels sont les enjeux\u2009?</h2>\n</div>\n<h3 id=\"commerciaux\" tabindex=\"-1\">commerciaux</h3>\n<p>Commen\u00e7ons par les choses qui f\u00e2chent. Le <em>scraping</em> a une fonction importante dans l\u2019\u00e9conomie num\u00e9rique. Les premiers comparateurs de prix utilisaient du <em>scraping</em> pour alimenter leurs contenus avant l\u2019av\u00e8nement du hangar global. Marc Zuckerberg <a href=\"https://www.vox.com/2018/4/10/17220290/mark-zuckerberg-facemash-testimony\">a scrap\u00e9 les trombinoscopes</a>, les <em>facebooks</em>, de sa fac pour en faire une comp\u00e9tition assez malsaine et \u00e0 la mode \u00e0 l\u2019\u00e9poque. Les startups sont friandes de donn\u00e9es personnelles laiss\u00e9es \u00e0 l\u2019air libre pour alimenter des bases de donn\u00e9es prospectives. Laisser son email en clair sur une page web, c\u2019est s\u2019assurer de retrouver sa boite inond\u00e9e de publicit\u00e9s. Avoir un profil public github, la plateforme de Microsoft pour publier du code, c\u2019est aussi la garantie de se faire prospecter de fa\u00e7on r\u00e9guli\u00e8re \u00e0 propos de nouveaux projets crypto.</p>\n<p>\u00c0 ce titre, la <a href=\"https://www.cnil.fr/fr/la-reutilisation-des-donnees-publiquement-accessibles-en-ligne-des-fins-de-demarchage-commercial\">CNIL</a> est sur le coup et rappelle que c\u2019est interdit. Par contre, aller piller les autres bo\u00eetes, c\u2019est une autre histoire. Cousin proche du <em>scraping</em>, il y a un <em>crawling</em> qui indexe le contenu des pages pour les indexer dans un moteur de recherche. La diff\u00e9rence, c\u2019est peut-\u00eatre que le <em>crawling</em> est anticip\u00e9, et optimis\u00e9, par les \u00e9diteurs de site web. \u00c7a s\u2019appelle du SEO, ce n\u2019est pas beau \u00e0 voir et c\u2019est une tout autre histoire.</p>\n<p>Dans une autre mesure, la possibilit\u00e9 de scraper le web est un dommage collat\u00e9ral de la volont\u00e9 des acteurs du web commercial \u00e0 extraire une valeur \u00e9conomique de l\u2019attention des internautes. Afin de pouvoir assurer l\u2019exposition \u00e0 des publicit\u00e9s, <a href=\"https://arstechnica.com/gadgets/2023/07/googles-web-integrity-api-sounds-like-drm-for-the-web/\">Google cherche ainsi \u00e0 contr\u00f4ler la lecture d\u2019une page web</a> avec tout un tas de complications dont l\u2019excuse est l\u2019int\u00e9grit\u00e9 de ce qui est d\u00e9clench\u00e9. C\u2019est assez fallacieux et c\u2019est un probl\u00e8me qui se mord la queue dans la mesure o\u00f9 le principal risque est les programmes malveillants qui se propagent par l\u2019interm\u00e9diaire du r\u00e9seau des banni\u00e8res publicitaires. C\u2019est une bataille du web en cours et le soutien, par l\u2019usage, de Firefox est vital.</p>\n<h3 id=\"recherche\" tabindex=\"-1\">recherche</h3>\n<p>C\u00f4t\u00e9 recherche, il y a diverses probl\u00e9matiques allant de la conservation \u00e0 l\u2019analyse du langage naturel ou bien l\u2019analyse des r\u00e9seaux sociaux.</p>\n<p>La plus importante est l\u2019archivage du web et sa conservation. De la m\u00eame fa\u00e7on que les <em>crawlers</em> commerciaux, l\u2019enjeu est de conserver de fa\u00e7on intacte le maximum de choses possibles. Cela concerne des projets comme l\u2019embl\u00e9matique <a href=\"https://archive.org/\">archive.org</a> et <a href=\"https://larevuedesmedias.ina.fr/larchivage-du-web-un-outil-pour-comprendre-internet\">l\u2019archivage du web</a> de la BnF et de l\u2019INA.</p>\n<p>Une autre probl\u00e9matique est l\u2019analyse des controverses et le champ pr\u00e9c\u00e9dent des <em>digital methods</em> qui utilisent les mat\u00e9riaux comme un mat\u00e9riau pour construire des cartographies. C\u2019est beaucoup plus que cela, mais il y a des livres tr\u00e8s bien sur le sujet comme <a href=\"https://www.goodreads.com/book/show/58153939-controversy-mapping?ac=1&amp;from_search=true&amp;qid=zVxbIVtJrf&amp;rank=3\">Controversy Mapping</a> de Venturini et Munk.</p>\n<h3 id=\"journalisme\" tabindex=\"-1\">journalisme</h3>\n<p><a href=\"https://themarkup.org/hello-world/2023/12/16/how-elon-musk-is-trying-to-make-web-scraping-dangerous-again\">https://themarkup.org/hello-world/2023/12/16/how-elon-musk-is-trying-to-make-web-scraping-dangerous-again</a></p>\n<p><a href=\"https://themarkup.org/news/2020/12/03/why-web-scraping-is-vital-to-democracy\">https://themarkup.org/news/2020/12/03/why-web-scraping-is-vital-to-democracy</a></p>\n<p>The Markup est un m\u00e9dia US dont la th\u00e9matique est la technologie. N\u2019en faisant pas seulement un sujet, les journalistes de cette r\u00e9daction mobilisent r\u00e9guli\u00e8rement des m\u00e9thodologies d\u2019extraction d\u2019information qu\u2019il serait laborieux de faire manuellement. \u00c0 ce titre, ils soulignent que le <em>scraping</em> du web est important d\u2019un point de vue d\u00e9mocratique et central dans certaines de leurs enqu\u00eates. Cela d\u00e9range assez les gros acteurs pour que cela se termine devant la justice avec de gros enjeux de r\u00e9gulation.</p>\n<p>La question que je me pose alors est le lien entre pratique du <em>scraping</em> dans les r\u00e9dactions fran\u00e7aises et la faiblesse du journalisme de donn\u00e9es, en tant que champ, en France. Si vous \u00eates journaliste et que vous scrapez le web pour vos articles, cela m\u2019int\u00e9resse d\u2019en discuter dans le cadre d\u2019une \u00e9tude au long cours sur vos pratiques.</p>\n<h3 id=\"soci%C3%A9t%C3%A9-civile\" tabindex=\"-1\">soci\u00e9t\u00e9 civile</h3>\n<p>La transparence et l\u2019acc\u00e8s de l\u2019information sont \u00e9galement importants pour la soci\u00e9t\u00e9 civile et l\u2019existence d\u2019un \u00e9cosyst\u00e8me citoyen qui ne soient pas dans une confrontation constante avec la sph\u00e8re marchande et la sph\u00e8re administrative.</p>\n<p>Laisser la possibilit\u00e9 de construire de l\u2019information publique et de nouveaux services, comme vite ma dose, est un signe de sant\u00e9 d\u00e9mocratique, car il est alors possible de construire des communs et, enfin, orienter des technologies vers plus d\u2019inclusion, de solidarit\u00e9 et de compr\u00e9hension des collectifs.</p>\n<p>L\u2019association UFC-Que Choisir construit ainsi une <a href=\"https://www.quechoisir.org/carte-interactive-drives-n21243/\">cartographie des drives</a> \u00e0 partir d\u2019un <em>scraping</em> des sites des diff\u00e9rentes enseignes. \u00c0 partir de l\u00e0, il fournit un indicateur de co\u00fbt du panier moyen selon les profils de m\u00e9nage. Avec un peu de travail, il est possible de scraper \u00e0 nouveau ces pages pour les <a href=\"https://framagit.org/taniki/ufc-drives\">transformer en donn\u00e9es tabulaires</a> permettant des analyses alternatives et de nouvelles mises en r\u00e9cit.</p>\n</section>\n<section>\n<div class=\"section-link\">\n<a class=\"no-tufte-underline\" href=\"https://11d.im/write.apreslanu.it/tk/1704290400/#conclusion\"></a><h2 id=\"conclusion\" tabindex=\"-1\">conclusion</h2>\n</div>\n<p>Le <em>scraping</em> est symbolique de la possibilit\u00e9 de prendre du recul, d\u2019avoir une vue d\u2019ensemble, \u00e0 propos du web et de ce qui y circule. Certainement pas une pratique quotidienne pour l\u2019internaute moyen, c\u2019est un indicateur de la fronti\u00e8re entre ce qui est ouvert ou ne l\u2019est pas sur le web. \u00c0 ce titre, sa pratique permet de mesurer la surface du web comme <em>espace public</em>. Une trajectoire vers moins de contenus qui seraient disponibles au regard des internautes par cet interm\u00e9diaire est indicateur d\u2019une opacit\u00e9 de l\u2019information. Les grandes entreprises technologiques, et les gouvernements, en parall\u00e8le, b\u00e9n\u00e9ficient d\u2019une grande transparence sur nos donn\u00e9es individuelles. Comme dirait <a href=\"https://craphound.com/category/internetcon/\">Cory Doctorow \u00e0 propos de l\u2019interop\u00e9rabilit\u00e9</a>, le <em>scraping</em> est une condition n\u00e9cessaire, mais pas suffisante pour un futur d\u00e9sirable o\u00f9 Internet reste omnipr\u00e9sent. Autrement dit, Internet ne peut pas \u00eatre une technologie sociale si le web ne reste pas ouvert et s\u2019il n\u2019y a pas la possibilit\u00e9 de construire une \u00e9cologie de la connaissance o\u00f9 le contr\u00f4le technique ne serait pas du c\u00f4t\u00e9 des citoyens.</p>\n<p>Du c\u00f4t\u00e9 de la production de contenus, de pages et de sites web, il est ainsi important d\u2019avoir cette intention du web comme commun et espace public. La prolif\u00e9ration des applications pour smartphones (\u00e0 99,9\u00a0% r\u00e9serv\u00e9es aux jardins/enclos d\u2019Apple et de Google) est ainsi un grand pas vers la cl\u00f4ture du web et par extension de l\u2019information comme moteur de la d\u00e9mocratie.</p>\n<p>type\u00a0: #analyse\nsujets\u00a0: #openweb #scraping</p>\n<hr/>\n<p>Merci d'avoir lu ce texte ! On peut <a href=\"https://social.apreslanu.it/@tk\">en discuter sur mastodon</a>. Pour \u00eatre inform\u00e9\u00b7e lors de la parution de nouveaux articles, <a href=\"https://write.apreslanu.it/tk/feed/\">abonnez-vous au fil rss</a>.</p>\n</section>",
 "content-plain": "\u00c0 la suite de deux articles de The Markup sur le scraping, j\u2019en profite pour revenir sur ce morceau important du web et articuler quelques cl\u00e9s de lecture. Qu\u2019est-ce c\u2019est\u2009? Pourquoi est-ce important\u2009? Et quelques contextes d\u2019usage avec leurs enjeux.\n\nIl y a quelques approximations par esprit de concision. Pardon par avance.\n Qu\u2019est-ce que c\u2019est\u2009?\nLe scraping est l\u2019op\u00e9ration consistant \u00e0 extraire syst\u00e9matiquement de l\u2019information d\u2019un ensemble de pages web (un site en particulier, une pelote de liens, etc.) pour constituer un jeu de donn\u00e9es (les donn\u00e9es, les changements dans ces donn\u00e9es, etc.) qui pourra \u00e9ventuellement servir \u00e0 produire une nouvelle information (comparaison, vue macro, etc.). Une fois automatis\u00e9e, cela permet de changer, l\u2019\u00e9chelle en quantit\u00e9 et en temporalit\u00e9, des informations provenant du web. Cela en fait un \u00e9l\u00e9ment important de l\u2019\u00e9cologie de la connaissance dans notre univers hyperm\u00e9diatique.\n\nLe scraping mobilise les t\u00e2ches suivantes\u00a0:\n naviguer sur des pages web, c.-\u00e0-d. au format HTML, extraire l\u2019information de ces pages, et de l\u2019organiser sous la forme d\u2019une base de donn\u00e9es, un fichier ou des fichiers, bref, restructurer l\u2019information diff\u00e9rement.\nLe degr\u00e9 z\u00e9ro est de le faire soit m\u00eame \u00e0 la main. Il y a longtemps, il y avait m\u00eame des extensions pour navigateurs, par exemple navicrawler du Medialab de Sciences Po, pour aider \u00e0 cela. La plupart du temps, c\u2019est un script dans un langage comme python qui permet d\u2019automatiser la partie r\u00e9p\u00e9titive.\n\nPour abstraire et g\u00e9n\u00e9raliser l\u2019extraction d\u2019information, il faut souvent une comp\u00e9tence de compr\u00e9hension de la structure d\u2019une page web, c.-\u00e0-d. savoir lire du HTML, et en comprendre la syntaxe. Bien heureusement, le web est une technologie fondamentalement ouverte et tous les navigateurs permettent d\u2019afficher le code source d\u2019une page en deux clics (clic droit, voir le code source, clic gauche). Si vous entendez parler d\u2019\u00ab\u2009inspecter le code source\u2009\u00bb, c\u2019est cela, une manipulation qui permet de relier un \u00e9l\u00e9ment visuel avec un morceau de langage technique d\u00e9crivant cet \u00e9l\u00e9ment. Le jeu est alors de trouver le motif permettant de rassembler tous les \u00e9l\u00e9ments semblables.\n\nCertains \u00e9diteurs de site web cherchent \u00e0 emp\u00eacher ce genre d\u2019op\u00e9ration, il n\u2019est alors pas rare d\u2019utiliser \u00e0 nouveau un script qui va simuler des s\u00e9ries d\u2019actions humaines dans un navigateur web. Redonnant ainsi un sens au terme de user agent qui permettait d\u2019identifier un navigateur comme un instrument d\u2019agissement (ou d\u2019agentivit\u00e9) d\u2019un utilisateur.\n Pourquoi est-ce important\u2009?\nLe scraping et sa continuit\u00e9 de pratiques sont importants, car dans le paradigme marketing actuel de l\u2019intelligence artificielle, ce qui est automatisable a une bonne probabilit\u00e9 d\u2019\u00eatre recycl\u00e9 comme un service payant avec un travail qui est surtout de la conception d\u2019interface utilisateur, mais comme le design ne paie plus on parle de \u00ab\u2009robot\u2009\u00bb et d\u2019\u00ab\u2009intelligence artificielle\u2009\u00bb. Browse.ai est un exemple de ce genre de maquillage. D\u2019ailleurs, tout cela pourrait \u00eatre fait avec du travail humain en exploitant un service comme Mechanical Turk d\u2019Amazon et cela resterait du scraping. La diff\u00e9rence notable est la responsabilit\u00e9 de l\u2019usage de technologie et la volont\u00e9 de fermer les yeux, ou non, sur les conditions d\u2019extraction et d\u2019exploitation du travail. Dans ce contexte, la notion de comp\u00e9tence est \u00e9galement importante, car, bien que technique, savoir lire du HTML est une connaissance n\u00e9cessaire et normalement relativement facile d\u2019acc\u00e8s. On n\u2019est pas dans des affres de complexit\u00e9 et un minimum de p\u00e9dagogie fait l\u2019affaire. La promesse du no-code de l\u2019intelligence artificielle est une barri\u00e8re \u00e0 cela et emp\u00eache la r\u00e9solution du moindre probl\u00e8me ainsi que l\u2019identification d\u2019erreurs. C\u2019est une d\u00e9pendance directe au bon vouloir d\u2019une entreprise/d\u2019un service en fonction des orientations manag\u00e9riales et du march\u00e9. Dit autrement, le scraping est un bon cas pour ouvrir les diff\u00e9rentes probl\u00e9matiques sociales invisibilis\u00e9es dans le paradigme dans lequel nous sommes plong\u00e9s depuis quelques ann\u00e9es et acc\u00e9l\u00e9rer par le succ\u00e8s commercial de OpenAI.\n\nL\u2019autre point important est la complexification des technologies web. La professionnalisation des m\u00e9tiers du web et l\u2019\u00e9conomie num\u00e9rique alimentant un besoin de produire de plus en plus de pages am\u00e8nent \u00e0 un amoncellement de nouvelles solutions pour r\u00e9soudre des probl\u00e8mes sauf que chaque solution vient avec ses propres probl\u00e8mes. Pour mettre une page web en ligne, on est bien loin du glisser-d\u00e9poser d\u2019un fichier vers le FTP fourni gratuitement avec son acc\u00e8s \u00e0 Internet. Souvent, pas toujours, un site web est plus une surcouche sur une API, un point d\u2019acc\u00e8s programmatique, qui permet de g\u00e9n\u00e9rer des pages et d\u2019avoir une gestion plus dynamique de son contenu que le mod\u00e8le standard de la page web. Par exemple, plut\u00f4t que de faire une page diff\u00e9rente par personne c\u00f4t\u00e9 serveur, on va demander au navigateur d\u2019aller r\u00e9cup\u00e9rer des informations en parall\u00e8le et le laisser modifier la page \u00e0 un endroit qui sera indiqu\u00e9 par avance. Sch\u00e9matiquement. Une solution de repli pour l\u2019extraction d\u2019information est alors d\u2019aller la chercher dans l\u2019API. On s\u2019\u00e9loigne alors petit \u00e0 petit du scraping et de ce que percoit normalement un navigateur et donc du contexte de lecture ainsi que les diff\u00e9rentes transformations possibles. L\u2019information r\u00e9cup\u00e9r\u00e9e de cette fa\u00e7on est souvent d\u00e9j\u00e0 structur\u00e9e et ainsi plus propre.\n Quels sont les enjeux\u2009? commerciaux\nCommen\u00e7ons par les choses qui f\u00e2chent. Le scraping a une fonction importante dans l\u2019\u00e9conomie num\u00e9rique. Les premiers comparateurs de prix utilisaient du scraping pour alimenter leurs contenus avant l\u2019av\u00e8nement du hangar global. Marc Zuckerberg a scrap\u00e9 les trombinoscopes, les facebooks, de sa fac pour en faire une comp\u00e9tition assez malsaine et \u00e0 la mode \u00e0 l\u2019\u00e9poque. Les startups sont friandes de donn\u00e9es personnelles laiss\u00e9es \u00e0 l\u2019air libre pour alimenter des bases de donn\u00e9es prospectives. Laisser son email en clair sur une page web, c\u2019est s\u2019assurer de retrouver sa boite inond\u00e9e de publicit\u00e9s. Avoir un profil public github, la plateforme de Microsoft pour publier du code, c\u2019est aussi la garantie de se faire prospecter de fa\u00e7on r\u00e9guli\u00e8re \u00e0 propos de nouveaux projets crypto.\n\n\u00c0 ce titre, la CNIL est sur le coup et rappelle que c\u2019est interdit. Par contre, aller piller les autres bo\u00eetes, c\u2019est une autre histoire. Cousin proche du scraping, il y a un crawling qui indexe le contenu des pages pour les indexer dans un moteur de recherche. La diff\u00e9rence, c\u2019est peut-\u00eatre que le crawling est anticip\u00e9, et optimis\u00e9, par les \u00e9diteurs de site web. \u00c7a s\u2019appelle du SEO, ce n\u2019est pas beau \u00e0 voir et c\u2019est une tout autre histoire.\n\nDans une autre mesure, la possibilit\u00e9 de scraper le web est un dommage collat\u00e9ral de la volont\u00e9 des acteurs du web commercial \u00e0 extraire une valeur \u00e9conomique de l\u2019attention des internautes. Afin de pouvoir assurer l\u2019exposition \u00e0 des publicit\u00e9s, Google cherche ainsi \u00e0 contr\u00f4ler la lecture d\u2019une page web avec tout un tas de complications dont l\u2019excuse est l\u2019int\u00e9grit\u00e9 de ce qui est d\u00e9clench\u00e9. C\u2019est assez fallacieux et c\u2019est un probl\u00e8me qui se mord la queue dans la mesure o\u00f9 le principal risque est les programmes malveillants qui se propagent par l\u2019interm\u00e9diaire du r\u00e9seau des banni\u00e8res publicitaires. C\u2019est une bataille du web en cours et le soutien, par l\u2019usage, de Firefox est vital.\nrecherche\nC\u00f4t\u00e9 recherche, il y a diverses probl\u00e9matiques allant de la conservation \u00e0 l\u2019analyse du langage naturel ou bien l\u2019analyse des r\u00e9seaux sociaux.\n\nLa plus importante est l\u2019archivage du web et sa conservation. De la m\u00eame fa\u00e7on que les crawlers commerciaux, l\u2019enjeu est de conserver de fa\u00e7on intacte le maximum de choses possibles. Cela concerne des projets comme l\u2019embl\u00e9matique archive.org et l\u2019archivage du web de la BnF et de l\u2019INA.\n\nUne autre probl\u00e9matique est l\u2019analyse des controverses et le champ pr\u00e9c\u00e9dent des digital methods qui utilisent les mat\u00e9riaux comme un mat\u00e9riau pour construire des cartographies. C\u2019est beaucoup plus que cela, mais il y a des livres tr\u00e8s bien sur le sujet comme Controversy Mapping de Venturini et Munk.\njournalisme\nhttps://themarkup.org/hello-world/2023/12/16/how-elon-musk-is-trying-to-make-web-scraping-dangerous-again\n\nhttps://themarkup.org/news/2020/12/03/why-web-scraping-is-vital-to-democracy\n\nThe Markup est un m\u00e9dia US dont la th\u00e9matique est la technologie. N\u2019en faisant pas seulement un sujet, les journalistes de cette r\u00e9daction mobilisent r\u00e9guli\u00e8rement des m\u00e9thodologies d\u2019extraction d\u2019information qu\u2019il serait laborieux de faire manuellement. \u00c0 ce titre, ils soulignent que le scraping du web est important d\u2019un point de vue d\u00e9mocratique et central dans certaines de leurs enqu\u00eates. Cela d\u00e9range assez les gros acteurs pour que cela se termine devant la justice avec de gros enjeux de r\u00e9gulation.\n\nLa question que je me pose alors est le lien entre pratique du scraping dans les r\u00e9dactions fran\u00e7aises et la faiblesse du journalisme de donn\u00e9es, en tant que champ, en France. Si vous \u00eates journaliste et que vous scrapez le web pour vos articles, cela m\u2019int\u00e9resse d\u2019en discuter dans le cadre d\u2019une \u00e9tude au long cours sur vos pratiques.\nsoci\u00e9t\u00e9 civile\nLa transparence et l\u2019acc\u00e8s de l\u2019information sont \u00e9galement importants pour la soci\u00e9t\u00e9 civile et l\u2019existence d\u2019un \u00e9cosyst\u00e8me citoyen qui ne soient pas dans une confrontation constante avec la sph\u00e8re marchande et la sph\u00e8re administrative.\n\nLaisser la possibilit\u00e9 de construire de l\u2019information publique et de nouveaux services, comme vite ma dose, est un signe de sant\u00e9 d\u00e9mocratique, car il est alors possible de construire des communs et, enfin, orienter des technologies vers plus d\u2019inclusion, de solidarit\u00e9 et de compr\u00e9hension des collectifs.\n\nL\u2019association UFC-Que Choisir construit ainsi une cartographie des drives \u00e0 partir d\u2019un scraping des sites des diff\u00e9rentes enseignes. \u00c0 partir de l\u00e0, il fournit un indicateur de co\u00fbt du panier moyen selon les profils de m\u00e9nage. Avec un peu de travail, il est possible de scraper \u00e0 nouveau ces pages pour les transformer en donn\u00e9es tabulaires permettant des analyses alternatives et de nouvelles mises en r\u00e9cit.\n conclusion\nLe scraping est symbolique de la possibilit\u00e9 de prendre du recul, d\u2019avoir une vue d\u2019ensemble, \u00e0 propos du web et de ce qui y circule. Certainement pas une pratique quotidienne pour l\u2019internaute moyen, c\u2019est un indicateur de la fronti\u00e8re entre ce qui est ouvert ou ne l\u2019est pas sur le web. \u00c0 ce titre, sa pratique permet de mesurer la surface du web comme espace public. Une trajectoire vers moins de contenus qui seraient disponibles au regard des internautes par cet interm\u00e9diaire est indicateur d\u2019une opacit\u00e9 de l\u2019information. Les grandes entreprises technologiques, et les gouvernements, en parall\u00e8le, b\u00e9n\u00e9ficient d\u2019une grande transparence sur nos donn\u00e9es individuelles. Comme dirait Cory Doctorow \u00e0 propos de l\u2019interop\u00e9rabilit\u00e9, le scraping est une condition n\u00e9cessaire, mais pas suffisante pour un futur d\u00e9sirable o\u00f9 Internet reste omnipr\u00e9sent. Autrement dit, Internet ne peut pas \u00eatre une technologie sociale si le web ne reste pas ouvert et s\u2019il n\u2019y a pas la possibilit\u00e9 de construire une \u00e9cologie de la connaissance o\u00f9 le contr\u00f4le technique ne serait pas du c\u00f4t\u00e9 des citoyens.\n\nDu c\u00f4t\u00e9 de la production de contenus, de pages et de sites web, il est ainsi important d\u2019avoir cette intention du web comme commun et espace public. La prolif\u00e9ration des applications pour smartphones (\u00e0 99,9\u00a0% r\u00e9serv\u00e9es aux jardins/enclos d\u2019Apple et de Google) est ainsi un grand pas vers la cl\u00f4ture du web et par extension de l\u2019information comme moteur de la d\u00e9mocratie.\n\ntype\u00a0: #analyse sujets\u00a0: #openweb #scraping\n\nMerci d'avoir lu ce texte ! On peut en discuter sur mastodon. Pour \u00eatre inform\u00e9\u00b7e lors de la parution de nouveaux articles, abonnez-vous au fil rss.",
 "syndication": [],
 "type": "entry",
 "name": "les vertus politiques du scraping"
}