La idea clave
Transforma archivos en texto estructurado. Empieza con un documento conocido y revisa tablas y encabezados antes de confiar en las respuestas de un asistente.
Quieres pedir a una IA que encuentre una respuesta entre varios documentos, pero primero tienes que conseguir que pueda leerlos. MarkItDown aborda ese paso previo: transformar archivos en texto estructurado que otras herramientas puedan procesar.
Qué hace y qué resultado entrega
Microsoft describe MarkItDown como una utilidad Python para convertir documentos a Markdown, conservando elementos como títulos, listas, tablas y enlaces. Admite diversos formatos, entre ellos PDF, Word, Excel y PowerPoint, con dependencias opcionales según el caso.
Requiere Python 3.10 o superior y tiene licencia MIT. Su objetivo es preparar contenido para análisis textual; no reproducir fielmente el aspecto de una página. Esa diferencia importa cuando una tabla o una columna comunica información mediante su posición.
Instalación mínima para probar un PDF
Con Python 3.10 o posterior, estos comandos usan un entorno separado y el conversor de PDF documentado. Ejecútalos desde la carpeta que contiene manual.pdf; en Windows sustituye python3 por py si ese es tu lanzador.
python3 -m venv .venv
# macOS / Linux
.venv/bin/python -m pip install "markitdown[pdf]"
.venv/bin/markitdown manual.pdf -o manual.md
# Windows: usa estas dos líneas en lugar de las anteriores
.venv\Scripts\python.exe -m pip install "markitdown[pdf]"
.venv\Scripts\markitdown.exe manual.pdf -o manual.md
Son comandos basados en la documentación, no una instalación ejecutada por Texploto. Para comprobar el resultado, busca en ambos archivos un título, una cantidad con su unidad y una fila de tabla. Si falta texto porque el PDF es una imagen escaneada, repetir la pregunta al asistente no repara la extracción.
El paso que merece más atención
Antes de entregar el texto a un asistente, abre el resultado y compara una tabla, un encabezado y un párrafo con el original. Comprueba también que no se hayan mezclado pies de página o fragmentos de columnas. Si la extracción está mal, una respuesta fluida puede ocultar ese error.
Un ejercicio útil sería pedir que localice tres condiciones de un manual y devuelva el fragmento que respalda cada una. Conserva el PDF para comprobarlas. Es una propuesta de uso, no una evaluación de precisión realizada por Texploto.
Local no significa que todo el flujo lo sea
Convertir un archivo local y enviarlo después a un proveedor de IA son operaciones distintas. Las integraciones opcionales pueden añadir servicios externos y costes. El README también recuerda que la utilidad opera con los permisos del proceso que la ejecuta; un servicio que acepte archivos o direcciones de terceros necesita limitar cuidadosamente esos accesos.
Nos interesa especialmente como primer paso de una biblioteca documental pequeña. Empieza con archivos conocidos y aumenta el volumen cuando sepas qué estructura conserva y qué debes revisar manualmente.
Guía basada en la documentación consultada el 13 de septiembre de 2026; no hemos realizado una prueba funcional del proyecto. Consulta también los diez proyectos de esta edición semanal.



