curl.md – Récupérez le texte de n'importe quelle page web au format Markdown

Je ne sais pas si vous connaissez curl.md, mais c’est un service qui prend l’adresse d’une page web et vous l’affiche en Markdown. Y’a pas de menus, pas de bandeaux de cookies, et ce genre de conneries… C’est juste le texte de votre article, les titres, les liens et les tableaux.
Et le plus sympa, c’est que vous n’avez rien à installer pour l’essayer. Vous collez curl.md/ devant l’adresse qui vous intéresse, dans la barre de votre navigateur, et vous obtenez la page en texte markdonw. Avec curl dans un terminal, c’est pareil, la réponse arrivera en text/markdown, et si vous préférez du JSON, vous envoyez l’en-tête Accept: application/json.

Un article de korben.info passé par curl.md : le texte, les liens, et un en-tête de métadonnées en haut
Et vous pouvez aller plus loin
avec le paramètre –objective. Par exemple, vous décrivez ce que vous cherchez dans la page, et le service ne vous renvoie que le passage qui correspond. Il y a aussi des mots-clés, qui font un pré-filtrage avant l’extraction, et un mode smart ou rush selon que vous voulez une passe plus poussée ou plus rapide. Tout ça passe en paramètres d’URL, donc sans ligne de commande.
Pour ceux qui y reviennent souvent, il existe également un client à installer avec npm, avec bun ou avec un script, et qui s’invoque ensuite par curl.md ou par son alias court md :
# Sans rien installer
curl curl.md/example.com
# Ou avec le client
npm i -g curl.md
md zod.dev/error-formatting --objective "tree error formatting"
Côté agents de code, il y a des intégrations natives pour Amp, Claude, OpenCode et Pi. Si votre outil n’est pas dans la liste, le client sait aussi tourner en serveur MCP avec curl.md --mcp, et il existe un SDK TypeScript. Dans tous les cas, c’est l’agent qui va chercher les pages tout seul, vous n’avez plus rien à lui coller.
Du coup, ça sert à quoi ?
Bah dans le cadre de votre boulot, c’est surtout pour arrêter de coller des pages entières dans vos prompt. Vous donnez à votre agent la doc d’une bibliothèque avec un objectif précis, et il reçoit trois paragraphes au lieu de quarante pages HTML.
Ça marche aussi pour un script de veille qui suit les notes de version d’un projet, ou pour aspirer une doc dans un fichier texte que vous garderez dans le dépôt (bien plus lisible qu’un PDF dans un coin…).
Et en usage perso, ça vous permet de récupérer par exemple un article pour le relire au calme dans Obsidian, d’archiver une recette ou un mode d’emploi avant qu’il disparaisse, ou de vous envoyer une page à ChatGPT sans lui faire avaler la moitié du site autour. Notez que si c’est la consommation de vos agents qui vous embête, j’avais parlé de
RTK, un proxy qui économise des tokens
sur le même principe.
Par contre, il y a un plafond. En mode anonyme sur la version hébergée, vous avez droit à 100 requêtes par heure, et 1 000 une fois connecté. Et pour les requêtes avec un objectif, celles qui font justement l’intérêt du truc, c’est 3 par heure en anonyme et 10 en étant connecté. Bref, de quoi essayer, mais pas vraiment de quoi travailler… Au-delà, faudra passer par des crédits prépayés, à recharger par tranches de 5, 10, 20 ou 50 dollars.
Et si vous ne voulez pas dépenser d’argent, le code source est public sur GitHub sous licence MIT pour l’auto-héberger chez vous.
C’est à tester sur
, et merci à
pour le lien !
Source : korben.info