La empresa Fastino presentó GLiNER2.5, una nueva familia de modelos para extracción de información que reemplaza el método tradicional de «enumerar» fragmentos de texto por otro basado en predecir sus límites. El cambio, detallado en el anuncio oficial de la compañía, busca que identificar entidades largas en un documento deje de encarecer el cómputo, un cuello de botella habitual en este tipo de tareas.

La extracción de información es el proceso de detectar y clasificar datos dentro de un texto: nombres de personas, empresas, fechas, montos o relaciones entre ellos. Los sistemas previos solían evaluar todas las combinaciones posibles de palabras contiguas (los llamados spans) para decidir cuáles eran entidades relevantes. Ese enfoque se vuelve costoso cuando las entidades son extensas, porque la cantidad de fragmentos a revisar crece con rapidez.

Qué cambia con la predicción de límites

GLiNER2.5 abandona esa enumeración exhaustiva y opta por predecir directamente dónde empieza y dónde termina cada entidad. La consecuencia práctica es que el ancho de la entidad ya no impacta el costo de procesamiento: extraer una frase de diez palabras cuesta lo mismo que una de dos. La arquitectura está documentada en el repositorio del proyecto en GitHub.

El lanzamiento suma capacidades que amplían el alcance de estos modelos. Entre ellas, la decodificación conjunta de entidades y relaciones (identificar en un solo paso tanto los datos como los vínculos entre ellos), clasificación con restricciones, atributos por fragmento y una ventana de contexto de 4.096 palabras, es decir, la cantidad de texto que el modelo puede analizar de una sola vez.

Tres modelos abiertos y ejecutables en CPU

Fastino publicó tres versiones bajo licencia Apache 2.0, que permite uso comercial libre: de 74, 194 y 287 millones de parámetros. Los parámetros son los valores internos que un modelo ajusta durante su entrenamiento; en términos generales, menos parámetros implican un modelo más liviano y económico de operar.

El punto que distingue a esta familia es que las tres variantes pueden ejecutarse en un procesador convencional (CPU), sin necesidad de tarjetas gráficas especializadas (GPU). Eso reduce el costo de infraestructura y abre la puerta a correr extracción de datos de forma local, un factor relevante para organizaciones con presupuestos ajustados o requisitos de privacidad que evitan enviar información a la nube. En Latinoamérica, donde el acceso a hardware de cómputo intensivo y a servicios en la nube suele encarecer los proyectos de IA, este tipo de modelos compactos y abiertos baja la barrera de entrada para equipos pequeños y desarrolladores independientes.

En cuanto a desempeño, Fastino reporta un macro F1 general de 56,17 sobre 16 pruebas de tipo zero-shot, es decir, tareas para las que el modelo no fue entrenado específicamente. El F1 es una métrica que combina precisión y cobertura de las predicciones; el promedio macro le da igual peso a cada categoría evaluada, sin importar cuán frecuente sea.

Por qué importa

La tendencia hacia modelos especializados, pequeños y de código abierto contrasta con la carrera por sistemas cada vez más grandes. Para tareas acotadas como la extracción estructurada de datos, un modelo de decenas de millones de parámetros que corre en hardware común puede resultar más práctico y barato que apoyarse en un modelo de lenguaje de propósito general. Los tres checkpoints ya están disponibles en Hugging Face para su descarga y prueba, junto con la documentación técnica del proyecto.