Recursos · IA para empresas
Por qué un PDF le cuesta más tokens de los que debería (y cómo bajarlo)
Subir un PDF, un Word o un Excel directo a un modelo de IA infla el consumo de tokens sin que nadie lo note. Convertir el documento a texto plano antes de procesarlo puede bajar ese gasto de forma medible.
Justo Torrente Olmos · 13 de septiembre de 2026 · 5 min
Revisado el 12 de septiembre de 2026

En esta guía
- Por qué un documento de oficina (PDF, Word, Excel, PPT) cuesta más tokens que su propio texto
- Qué es MarkItDown y qué hace con un documento antes de enviarlo a un modelo de IA
- Cuánto puede bajar el consumo de tokens al convertir el documento a texto plano
- Qué pasa cuando una empresa no mide este costo (por qué no aparece en ningún reporte)
- Cuándo este ahorro puntual no alcanza y hace falta un proceso ordenado de adopción de IA
Un documento de veinte páginas puede consumir hasta setenta mil tokens antes de que alguien le haga la primera pregunta al modelo, según muestra el reel de Bprosys que originó esta nota. Ese gasto no aparece separado en ninguna factura: se mezcla con el resto del consumo de IA de la empresa y nadie lo nota hasta que la cuenta mensual sube sin una razón clara. Si quiere ir directo al número, puede saltar a cuánto se puede bajar el consumo de tokens al convertir el documento a texto plano.
Por qué un documento de oficina (PDF, Word, Excel, PPT) cuesta más tokens que su propio texto
Un modelo de IA no recibe un PDF como texto limpio. Recibe formato, tablas que muchas veces llegan rotas, encabezados repetidos e imágenes incrustadas, y tiene que procesar todo eso antes de llegar al contenido real. Cada página de un PDF procesada por un modelo de IA puede costar entre mil quinientos y tres mil tokens, precisamente porque se está pagando por el formato y no solo por las palabras, como detalla el mismo reel. Otros análisis del mismo problema, como este video, coinciden en que un archivo de veinte páginas puede gastar decenas de miles de tokens antes de la primera pregunta que se le haga al modelo.
Esto no es un defecto de un proveedor de IA en particular. Ocurre con cualquier modelo al que se le suba un PDF, un Word con tablas o una presentación completa en su formato original, sin importar si la empresa usa Claude, Gemini o cualquier otro.
Qué es MarkItDown y qué hace con un documento antes de enviarlo a un modelo de IA
La solución no requiere pagar por otra suscripción. MarkItDown es una herramienta gratuita y de código abierto de Microsoft, disponible en su repositorio de GitHub, que convierte PDF, Word, Excel o presentaciones en texto plano antes de que ese contenido llegue al modelo. En vez de enviarle al modelo el archivo con todo su formato, se le envía el texto que realmente importa: sin las tablas rotas, sin el ruido visual, sin las imágenes que el modelo no necesita para responder una pregunta sobre el contenido.
Al ser agnóstica de proveedor, MarkItDown no ata a la empresa a un solo ecosistema de IA. Sirve igual si el equipo trabaja con Claude, con un modelo propio o con cualquier otra plataforma que reciba texto como entrada.
Cuánto puede bajar el consumo de tokens al convertir el documento a texto plano
Convertir el documento a texto plano antes de procesarlo puede bajar el consumo de tokens hasta un setenta por ciento y, además, mejorar la calidad de las respuestas del modelo, porque deja de gastar capacidad de procesamiento interpretando formato y la concentra en el contenido real. Para una empresa que sube contratos, reportes financieros o manuales operativos a un modelo de IA de forma habitual, esa diferencia se nota en la factura mensual, no en una prueba aislada.
La cuenta es simple: si un documento de veinte páginas puede costar setenta mil tokens sin conversión, bajar ese consumo un setenta por ciento significa procesar el mismo documento por una fracción del costo, sin perder información ni precisión en la respuesta.
Qué pasa cuando una empresa no mide este costo (por qué no aparece en ningún reporte)
Si el equipo ya está pagando por inteligencia artificial sin medir esto, está pagando de más y ese sobrecosto no aparece en ningún reporte. No hay una línea en la facturación que diga "tokens desperdiciados en formato de PDF": el gasto queda diluido dentro del consumo total, y nadie lo cuestiona porque nadie lo está midiendo por separado.
Esto es un problema de proceso, no de las personas que suben los documentos. El equipo que carga un PDF entero a un modelo de IA no está haciendo nada mal: simplemente nadie definió antes un paso de conversión que debería ser automático. El costo invisible aparece cuando falta ese paso, no porque alguien lo esté usando mal.
Cuándo este ahorro puntual no alcanza y hace falta un proceso ordenado de adopción de IA
Convertir documentos a texto plano resuelve un desperdicio concreto y medible, pero es una pieza chica dentro de una pregunta más grande: ¿la empresa sabe cuánto le cuesta usar IA en cada proceso y si ese proceso es el que debería estar automatizando primero? Esa pregunta no se responde con una herramienta suelta, sino con un relevamiento del proceso real antes de sumar más tecnología, que es justamente lo que cubre Process Discovery.
Lo mismo aplica a otras herramientas de IA que ya se usan dentro de la operación diaria, como las que reemplazan tareas puntuales en Excel y hojas de cálculo, o las que un equipo técnico adopta para ejecutar más sin sumar freelancers sueltos, como se explica en el artículo sobre Claude Code para equipos tech. En todos los casos, el principio es el mismo: entender primero qué se está pagando y por qué, antes de sumar más herramientas de IA sin criterio.
Convertir un PDF a texto plano antes de procesarlo es un ajuste de minutos que cualquier equipo puede aplicar hoy con una herramienta gratuita. Pero si su empresa no sabe cuánto le cuesta hoy cada documento que sube a un modelo de IA, ese desconocimiento suele ser la señal de un problema más amplio: nadie relevó el proceso antes de empezar a automatizarlo.
Preguntas frecuentes sobre Costo de tokens al procesar documentos de oficina con IA
¿Por qué un PDF consume más tokens que el texto que contiene?
Porque un modelo de IA no lee el PDF como texto plano: procesa también el formato, las tablas rotas y las imágenes incrustadas. Cada página puede costar entre mil quinientos y tres mil tokens, según explica el reel original de Bprosys, aunque el contenido real ocupe una fracción de eso en texto puro.
¿Qué es MarkItDown y qué hace con un documento antes de enviarlo a un modelo de IA?
Es una herramienta gratuita de código abierto de Microsoft que convierte PDF, Word, Excel y presentaciones a texto plano o markdown antes de pasarlas a un modelo de IA. El repositorio y la documentación están disponibles en GitHub.
¿Cuánto se puede reducir el consumo de tokens al convertir un documento a texto plano?
Según el mismo reel, la conversión puede bajar el consumo de tokens hasta un setenta por ciento y, al mismo tiempo, mejorar la calidad de la respuesta, porque el modelo deja de gastar capacidad interpretando formato en vez de contenido. Puede ver el cálculo completo en la sección sobre cuánto se puede bajar el consumo de tokens.
¿Este ahorro reemplaza un proceso de adopción de IA ordenado en la empresa?
No. Convertir documentos a texto plano baja un costo puntual y medible, pero no resuelve si la empresa sabe qué proceso automatizar primero ni si mide el gasto real de IA en su operación. Ese relevamiento previo es lo que cubre Process Discovery.
¿Qué otras herramientas de IA ayudan a reducir el trabajo manual con documentos de oficina?
Además de convertir documentos antes de procesarlos, hay herramientas de IA que ya reemplazan tareas puntuales en Excel y hojas de cálculo, como se detalla en este artículo sobre herramientas de IA para la empresa.
Seguir leyendo