Commencer par l’option la plus simple

Pour un seul fichier courant, le convertisseur dans le navigateur est généralement le chemin le plus court. Le Skill devient utile lorsque l’agent doit enchaîner lecture, correction, export et vérification sans quitter sa tâche.

SituationPoint de départ
Un fichier simpleConvertisseur web
Conversions répétées dans un agentAgent Skill
PDF → Markdown → DOCXAgent Skill
Reproduction exacte d’une mise en page complexeFlux manuel propre au format

Markdown sert de couche de travail

Les fichiers non Markdown deviennent d’abord une représentation Markdown modifiable. La sortie suivante est générée à partir de cette représentation, pas comme une copie directe du document d’origine.

Ce choix facilite la correction des titres, paragraphes, listes, liens, code et tableaux simples. Il fixe aussi la limite : une animation PowerPoint ou une formule Excel perdue pendant l’extraction ne réapparaît pas lors d’un nouvel export.

Flux
PDF / DOCX / XLSX / PPTX → Markdown modifiable
Sorties
PDF / DOCX / XLSX / PPTX / HTML / EPUB / images

Installer le Skill

Le dépôt utilise le format ouvert Agent Skills. Il demande Node.js 20 ou une version plus récente et inclut son moteur de conversion, ses ressources OCR prises en charge, ses polices et son vérificateur.

Commande d’installation
npx skills add agent-tools-lab/markdown-converter --skill markdown-converter
Dépôt
https://github.com/agent-tools-lab/markdown-converter

Convertir un PDF texte ou numérisé

Si une phrase est sélectionnable dans le lecteur PDF, utilisez l’extraction de texte. Une page composée uniquement d’une image peut utiliser l’OCR local dans les langues documentées : anglais, espagnol, allemand, japonais et chinois simplifié.

Le français n’est pas inclus dans les modèles OCR actuels. Un PDF en français avec couche texte reste extractible ; un scan français doit utiliser un autre flux OCR.

  • 30 MB (30 Mo) maximum
  • 100 pages au total
  • 20 pages OCR maximum
  • Relire noms, dates, nombres, titres et tableaux

Convertir un document Word en Markdown

Un document DOCX principalement composé de texte est un bon candidat. Les titres, paragraphes, listes, liens et tableaux simples peuvent devenir une base Markdown facile à relire et à modifier avec l’agent.

Les commentaires, le suivi des modifications, les macros, les éléments flottants, les médias intégrés et la mise en page précise ne font pas partie de cette représentation. Conservez donc toujours le fichier Word d’origine.

Commande
node "$MARKDOWN_CONVERTER_DIR/scripts/runtime/convert.mjs" rapport.docx --to markdown -o rapport.md
À contrôler
Hiérarchie des titres, listes, liens et tableaux simples

Comprendre les formats de sortie

Les noms de formats décrivent une sortie précise, pas une intégration universelle. La cible JSON contient les jetons du document Markdown ; elle ne transforme pas automatiquement le texte en données métier. La sortie Notion produit du Markdown destiné à l’import, sans appeler l’API Notion.

De même, la sortie Confluence utilise l’ancien balisage wiki et ne garantit pas un collage parfait dans chaque éditeur Confluence Cloud. Consultez les capacités du dépôt avant d’automatiser un flux critique.

Générer un PDF contenant du texte réel

La sortie PDF écrit des objets texte pour les caractères pris en charge. Le résultat doit pouvoir être recherché, sélectionné et extrait, contrairement à une image de chaque page.

Conversion
node "$MARKDOWN_CONVERTER_DIR/scripts/runtime/convert.mjs" notes.md --to pdf -o notes.pdf
Contrôle
Ouvrir notes.pdf et sélectionner une phrase représentative

Vérifier le fichier généré

Une commande terminée sans erreur ne suffit pas. Exécutez le vérificateur inclus, ouvrez le fichier et comparez des passages représentatifs avec la source.

  • Le fichier existe, n’est pas vide et s’ouvre
  • Les titres et paragraphes correspondent
  • Le PDF possède du texte extractible
  • Le résultat OCR correspond au scan
Vérifier un PDF
python3 "$MARKDOWN_CONVERTER_DIR/scripts/verify_output.py" notes.pdf --format pdf
Puis
Contrôler texte, titres, listes, tableaux, liens et caractères non ASCII

Protéger le fichier source

Une conversion doit créer un fichier dérivé, jamais remplacer l’unique exemplaire de la source. Utilisez un autre nom de sortie, ouvrez le résultat dans l’application adaptée et comparez au moins un titre, un paragraphe, une liste et un tableau représentatifs.

  • Conserver l’original
  • Écrire vers un nouveau chemin
  • Vérifier les caractères accentués
  • Documenter les pertes acceptées

Conversion locale ne signifie pas fidélité absolue

Le moteur du Skill s’exécute localement et les fichiers générés ne doivent contenir ni logo, ni filigrane, ni lien promotionnel, ni métadonnée produit cachée. Cette propriété concerne le traitement et la sortie ; elle ne change pas les limites propres à Markdown.

Pour un document où la présentation visuelle constitue l’information principale, travaillez dans le format d’origine ou utilisez un flux spécialisé. Choisissez Markdown lorsque la structure éditable est plus importante que la reproduction au pixel près.

Connaître les limites avant de convertir

Le Skill ne promet pas une mise en page identique, les formules et comportements d’un tableur, les commentaires et modifications suivies, les animations, les notes du présentateur, les médias intégrés, l’écriture manuscrite ou la reconstruction exacte de tableaux complexes.

EntréeCe qui devient MarkdownLimite principale
DOCXTitres, paragraphes, listes, liens, tableaux simplesMise en page et suivi des modifications
XLSXValeurs par feuilleFormules, styles et graphiques
PPTXTitres et texte des diapositivesDesign, médias et animations
PDFTexte et structure probableColonnes, tableaux et ordre de lecture

Outils associés

Aide-mémoire MarkdownContrôler titres, listes, tableaux, liens et codePDF vers MarkdownExtraire le texte ou utiliser un modèle OCR local compatibleMarkdown vers PDFCréer un PDF contenant du texte réel
FAQ

Questions fréquentes

Codex peut-il convertir un PDF en Markdown ?

Oui, après installation du Skill. L’extraction utilise la couche texte ou un modèle OCR local pris en charge.

Claude Code utilise-t-il le même Skill ?

Oui. Le dépôt vise les clients compatibles avec le format Agent Skills.

L’OCR français est-il inclus ?

Non dans cette version. N’utilisez pas un modèle d’une autre langue comme s’il reconnaissait nativement le français.

Le PDF créé est-il une image ?

Non. Il contient du texte réel pour les caractères pris en charge et doit être vérifié après génération.

Quand utiliser ilovemd.net ?

Pour une conversion ponctuelle, une édition ou un aperçu rapide dans le navigateur.

Le Skill envoie-t-il mes fichiers à ilovemd.net ?

Non. La conversion documentée s’exécute localement et n’appelle pas le site ni une API de conversion.

Peut-on convertir Word, Excel et PowerPoint en Markdown ?

Oui pour DOCX, XLSX ou XLS et PPTX, avec une conservation centrée sur le contenu lisible plutôt que sur la mise en page, les formules ou les animations.

Une conversion aller-retour est-elle identique à l’original ?

Non. Le nouveau fichier est généré depuis la représentation Markdown ; les éléments que Markdown ne sait pas décrire ne sont pas reconstruits.