Commencer par l’option la plus simple
Pour un seul fichier courant, le convertisseur dans le navigateur est généralement le chemin le plus court. Le Skill devient utile lorsque l’agent doit enchaîner lecture, correction, export et vérification sans quitter sa tâche.
| Situation | Point de départ |
|---|---|
| Un fichier simple | Convertisseur web |
| Conversions répétées dans un agent | Agent Skill |
| PDF → Markdown → DOCX | Agent Skill |
| Reproduction exacte d’une mise en page complexe | Flux manuel propre au format |
Markdown sert de couche de travail
Les fichiers non Markdown deviennent d’abord une représentation Markdown modifiable. La sortie suivante est générée à partir de cette représentation, pas comme une copie directe du document d’origine.
Ce choix facilite la correction des titres, paragraphes, listes, liens, code et tableaux simples. Il fixe aussi la limite : une animation PowerPoint ou une formule Excel perdue pendant l’extraction ne réapparaît pas lors d’un nouvel export.
PDF / DOCX / XLSX / PPTX → Markdown modifiablePDF / DOCX / XLSX / PPTX / HTML / EPUB / imagesInstaller le Skill
Le dépôt utilise le format ouvert Agent Skills. Il demande Node.js 20 ou une version plus récente et inclut son moteur de conversion, ses ressources OCR prises en charge, ses polices et son vérificateur.
npx skills add agent-tools-lab/markdown-converter --skill markdown-converterhttps://github.com/agent-tools-lab/markdown-converterConvertir un PDF texte ou numérisé
Si une phrase est sélectionnable dans le lecteur PDF, utilisez l’extraction de texte. Une page composée uniquement d’une image peut utiliser l’OCR local dans les langues documentées : anglais, espagnol, allemand, japonais et chinois simplifié.
Le français n’est pas inclus dans les modèles OCR actuels. Un PDF en français avec couche texte reste extractible ; un scan français doit utiliser un autre flux OCR.
- 30 MB (30 Mo) maximum
- 100 pages au total
- 20 pages OCR maximum
- Relire noms, dates, nombres, titres et tableaux
Convertir un document Word en Markdown
Un document DOCX principalement composé de texte est un bon candidat. Les titres, paragraphes, listes, liens et tableaux simples peuvent devenir une base Markdown facile à relire et à modifier avec l’agent.
Les commentaires, le suivi des modifications, les macros, les éléments flottants, les médias intégrés et la mise en page précise ne font pas partie de cette représentation. Conservez donc toujours le fichier Word d’origine.
node "$MARKDOWN_CONVERTER_DIR/scripts/runtime/convert.mjs" rapport.docx --to markdown -o rapport.mdHiérarchie des titres, listes, liens et tableaux simplesComprendre les formats de sortie
Les noms de formats décrivent une sortie précise, pas une intégration universelle. La cible JSON contient les jetons du document Markdown ; elle ne transforme pas automatiquement le texte en données métier. La sortie Notion produit du Markdown destiné à l’import, sans appeler l’API Notion.
De même, la sortie Confluence utilise l’ancien balisage wiki et ne garantit pas un collage parfait dans chaque éditeur Confluence Cloud. Consultez les capacités du dépôt avant d’automatiser un flux critique.
Générer un PDF contenant du texte réel
La sortie PDF écrit des objets texte pour les caractères pris en charge. Le résultat doit pouvoir être recherché, sélectionné et extrait, contrairement à une image de chaque page.
node "$MARKDOWN_CONVERTER_DIR/scripts/runtime/convert.mjs" notes.md --to pdf -o notes.pdfOuvrir notes.pdf et sélectionner une phrase représentativeVérifier le fichier généré
Une commande terminée sans erreur ne suffit pas. Exécutez le vérificateur inclus, ouvrez le fichier et comparez des passages représentatifs avec la source.
- Le fichier existe, n’est pas vide et s’ouvre
- Les titres et paragraphes correspondent
- Le PDF possède du texte extractible
- Le résultat OCR correspond au scan
python3 "$MARKDOWN_CONVERTER_DIR/scripts/verify_output.py" notes.pdf --format pdfContrôler texte, titres, listes, tableaux, liens et caractères non ASCIIProtéger le fichier source
Une conversion doit créer un fichier dérivé, jamais remplacer l’unique exemplaire de la source. Utilisez un autre nom de sortie, ouvrez le résultat dans l’application adaptée et comparez au moins un titre, un paragraphe, une liste et un tableau représentatifs.
- Conserver l’original
- Écrire vers un nouveau chemin
- Vérifier les caractères accentués
- Documenter les pertes acceptées
Conversion locale ne signifie pas fidélité absolue
Le moteur du Skill s’exécute localement et les fichiers générés ne doivent contenir ni logo, ni filigrane, ni lien promotionnel, ni métadonnée produit cachée. Cette propriété concerne le traitement et la sortie ; elle ne change pas les limites propres à Markdown.
Pour un document où la présentation visuelle constitue l’information principale, travaillez dans le format d’origine ou utilisez un flux spécialisé. Choisissez Markdown lorsque la structure éditable est plus importante que la reproduction au pixel près.
Connaître les limites avant de convertir
Le Skill ne promet pas une mise en page identique, les formules et comportements d’un tableur, les commentaires et modifications suivies, les animations, les notes du présentateur, les médias intégrés, l’écriture manuscrite ou la reconstruction exacte de tableaux complexes.
| Entrée | Ce qui devient Markdown | Limite principale |
|---|---|---|
| DOCX | Titres, paragraphes, listes, liens, tableaux simples | Mise en page et suivi des modifications |
| XLSX | Valeurs par feuille | Formules, styles et graphiques |
| PPTX | Titres et texte des diapositives | Design, médias et animations |
| Texte et structure probable | Colonnes, tableaux et ordre de lecture |
Outils associés
Questions fréquentes
Codex peut-il convertir un PDF en Markdown ?
Oui, après installation du Skill. L’extraction utilise la couche texte ou un modèle OCR local pris en charge.
Claude Code utilise-t-il le même Skill ?
Oui. Le dépôt vise les clients compatibles avec le format Agent Skills.
L’OCR français est-il inclus ?
Non dans cette version. N’utilisez pas un modèle d’une autre langue comme s’il reconnaissait nativement le français.
Le PDF créé est-il une image ?
Non. Il contient du texte réel pour les caractères pris en charge et doit être vérifié après génération.
Quand utiliser ilovemd.net ?
Pour une conversion ponctuelle, une édition ou un aperçu rapide dans le navigateur.
Le Skill envoie-t-il mes fichiers à ilovemd.net ?
Non. La conversion documentée s’exécute localement et n’appelle pas le site ni une API de conversion.
Peut-on convertir Word, Excel et PowerPoint en Markdown ?
Oui pour DOCX, XLSX ou XLS et PPTX, avec une conservation centrée sur le contenu lisible plutôt que sur la mise en page, les formules ou les animations.
Une conversion aller-retour est-elle identique à l’original ?
Non. Le nouveau fichier est généré depuis la représentation Markdown ; les éléments que Markdown ne sait pas décrire ne sont pas reconstruits.
