Il y a quelques jours, j'aidais une amie qui travaille dans les opérations à traiter des données, et elle m'a confié qu'elle était sur le point de devenir folle à cause des pages web. Voici ce qui s'est passé : elle voulait extraire des descriptions de produits et des articles d'un site concurrent pour se constituer une base de données personnelle. Au départ, elle pensait qu'il suffisait de lancer un robot d'IA pour en finir, mais le résultat était tout simplement illisible — des balises HTML partout, des sauts de ligne en désordre, et une multitude de symboles étranges mélangés au texte. Elle m'a dit qu'en voyant ce fouillis, elle avait l'impression d'avoir versé une caisse de livres dans un mixeur.
Je comprends parfaitement ce sentiment. Beaucoup de gens pensent qu'une fois que le robot a extrait le contenu, tout est réglé, mais en réalité, les vrais ennuis ne font que commencer. Le contenu que vous extrayez d'une page web est essentiellement un ensemble de code structuré ; le navigateur peut le rendre sous forme de page agréable, mais si vous le mettez directement dans un document ou un logiciel de notes, c'est une catastrophe. Les balises div, les attributs class, les scripts, et toutes sortes de styles en ligne se mélangent au corps du texte — inutile de parler de lecture, même trouver où se trouve le texte principal relève de la chance.
Auparavant, face à ce genre de situation, il fallait soit copier-coller manuellement, soit écrire une multitude d'expressions régulières pour nettoyer. Le faire à la main est trop lent, et les regex risquent de supprimer des éléments par erreur. Puis j'ai découvert une méthode particulièrement pratique — utiliser un outil de conversion HTML vers Markdown. En gros, c'est un traducteur qui transforme la structure HTML complexe d'une page web en Markdown, ce langage de balisage léger. Après la conversion, les titres sont des titres, les listes sont des listes, les liens sont des liens — propre et net.
Comment procéder concrètement ? C'est très simple. Vous enregistrez d'abord le contenu HTML extrait par le robot d'IA dans un fichier, ou vous le collez directement dans l'outil de conversion. Un clic sur convertir, et il supprime automatiquement les balises superflues, en conservant la structure et le format essentiels du texte. Par exemple, un bloc de texte enveloppé dans une série de div imbriqués devient un paragraphe propre après conversion. Une liste construite avec des ul et li devient une liste à puces Markdown. Un texte en gras devient deux astérisques qui l'encadrent.
Mon amie, après avoir essayé, m'a dit que c'était comme si elle avait donné un bain à ce fouillis de caractères. Le contenu qui donnait mal à la tête peut maintenant être directement utilisé dans Notion ou Obsidian. Elle a aussi découvert un avantage : le format Markdown est particulièrement adapté au retraitement. Que vous vouliez modifier la hiérarchie des titres, réorganiser les paragraphes, ou extraire une partie du contenu, c'est bien plus facile qu'avec du HTML.
Cependant, il y a un point à noter : tous les outils de conversion HTML vers Markdown ne sont pas fiables. Certains perdent la mise en forme, d'autres transforment les tableaux en désordre, et d'autres encore ont un mauvais support du chinois, produisant des caractères illisibles après conversion. J'en ai essayé plusieurs, et finalement j'utilise un outil open source dont le taux de précision est assez élevé et qui supporte le traitement par lots. Si vous devez souvent traiter du contenu extrait par des robots, je vous conseille d'en essayer plusieurs pour trouver celui qui vous convient le mieux.
Une autre petite astuce : avant la conversion, il vaut mieux supprimer les balises script et style du HTML. Ces éléments ne peuvent pas être traités par les outils de conversion, et les garder ne fait qu'alourdir la conversion, parfois même provoquer des erreurs. Beaucoup d'outils ont en fait une fonction de filtrage intégrée, mais une vérification manuelle est plus sûre.
En fin de compte, le robot d'IA est un bon outil, il peut vous aider à obtenir rapidement une grande quantité de contenu. Mais l'obtention n'est que la première étape ; le nettoyage et l'organisation sont les véritables étapes qui rendent les données utiles. La conversion HTML vers Markdown semble être une petite astuce, mais en réalité elle peut vous faire économiser beaucoup de temps et d'énergie. La prochaine fois que vous tomberez sur du contenu extrait par un robot en désordre, ne vous précipitez pas pour supprimer manuellement — essayez cette méthode, vous verrez que les choses sont bien plus simples qu'elles n'y paraissent.