Un equipo ligado al medio especializado MarkTechPost publicó Token Saver, una extensión de código abierto para Claude Desktop que promete reducir entre 90% y 99% el consumo de tokens al procesar documentos PDF. La herramienta funciona de forma local, sin enviar el contenido de los archivos a servidores externos, según la documentación publicada en GitHub.
El problema que ataca es concreto y familiar para quien trabaja con asistentes de IA. Cada vez que un usuario carga un PDF extenso en un chatbot como Claude, el modelo de Anthropic, el documento completo se convierte en tokens —las unidades mínimas de texto que procesa el modelo— y cada token cuenta para el costo y para el límite de contexto. Un informe de cientos de páginas puede agotar la ventana disponible y encarecer la consulta de forma notable.
Qué hace distinto a Token Saver
En lugar de volcar el PDF entero al modelo, Token Saver aplica una técnica conocida como RAG híbrido (Retrieval-Augmented Generation, o generación aumentada por recuperación). La idea es sencilla: el sistema indexa el documento localmente, y cuando el usuario hace una pregunta, recupera solo los fragmentos relevantes y se los entrega a Claude. Así, el modelo lee un puñado de pasajes en vez del texto completo.
El término «híbrido» alude a que combina dos formas de búsqueda: la semántica, que entiende el significado de la pregunta, y la de palabras clave, que localiza coincidencias literales. Para la parte semántica, la extensión utiliza un modelo de incrustaciones abierto y liviano, all-MiniLM-L6-v2, que puede correr en una computadora personal sin hardware especializado.
Esa ejecución local es el segundo argumento del proyecto. Como la indexación y la búsqueda ocurren en el equipo del usuario, el contenido de los documentos no viaja a la nube más allá de los fragmentos que finalmente se envían al modelo para responder. Para quien maneja contratos, expedientes médicos o material confidencial, la diferencia no es menor.
Cómo se integra con Claude
Token Saver se distribuye como una extensión MCP. El Protocolo de Contexto de Modelo (MCP, por sus siglas en inglés) es un estándar impulsado por Anthropic que permite conectar herramientas y fuentes de datos externas a un asistente de IA de manera ordenada. El proyecto se empaqueta con el formato de bundle MCP, lo que facilita instalarlo en Claude Desktop sin configuraciones complejas.
La propuesta se apoya en trabajos previos de la comunidad, como los repositorios pdfkb-mcp y pdfrag, que ya exploraban la lectura eficiente de PDF mediante recuperación de fragmentos. Token Saver los combina en una extensión lista para usar.
Por qué importa el ahorro de tokens
El costo de operar con modelos de lenguaje se mide, en buena parte, en tokens procesados. A escala individual el ahorro puede parecer marginal, pero para equipos que consultan grandes volúmenes de documentación a diario, recortar el gasto en un orden de magnitud cambia la ecuación de forma directa. Es la misma lógica que empujan otras iniciativas del sector orientadas a abaratar la inferencia sin resignar utilidad.
Conviene tomar las cifras con cautela. El rango de 90% a 99% de reducción depende del tipo de documento, de la pregunta y de cuántos fragmentos necesite el modelo para responder bien; no es una garantía uniforme. El recorte también implica un compromiso: si la búsqueda no recupera el pasaje correcto, la respuesta puede quedar incompleta, un riesgo inherente a cualquier sistema RAG.
Al ser de código abierto, cualquier desarrollador puede revisar cómo funciona, adaptarlo o auditar su manejo de datos. En un momento en que el costo y la privacidad marcan buena parte de las decisiones sobre adopción de IA, herramientas como esta apuntan a que lo pesado ocurra en el propio equipo y solo lo justo llegue al modelo.
