Robbyant, la unidad de robótica y tecnología de Ant Group (la matriz de Alipay), publicó en código abierto LingBot-Vision, una familia de modelos de visión por computador diseñada para la percepción espacial densa. La liberación incluye los pesos del modelo, disponibles a través de un repositorio abierto en Hugging Face, y apunta a tareas donde una máquina debe entender la geometría fina de una escena, como estimar distancias o delimitar objetos con precisión.
El elemento distintivo del proyecto es su enfoque en los bordes de las imágenes. LingBot-Vision se apoya en una técnica que sus autores llaman modelado de bordes enmascarados (masked boundary modeling), que convierte los contornos de una imagen en una señal de entrenamiento nativa. Dicho de otro modo, en lugar de tratar los límites entre objetos como un subproducto, el modelo aprende a reconstruirlos de forma explícita durante su fase de aprendizaje.
Qué es un modelo de base visual
LingBot-Vision pertenece a la categoría de los llamados modelos de base visual: redes entrenadas con grandes volúmenes de imágenes sin etiquetar que luego sirven como cimiento para múltiples aplicaciones. La familia se construye sobre una arquitectura ViT (Vision Transformer), un tipo de red neuronal que procesa la imagen dividiéndola en fragmentos y analizando las relaciones entre ellos, de forma análoga a como los modelos de lenguaje procesan palabras.
El entrenamiento es autosupervisado, lo que significa que el sistema aprende a partir de los datos sin necesidad de anotaciones humanas costosas. Esa característica abarata la escala y explica por qué este tipo de modelos se ha vuelto la base preferida para tareas de visión especializadas.
Un modelo de 1.000 millones de parámetros que compite con los más grandes
Según la información difundida por Robbyant, la versión con 1.000 millones de parámetros —la medida aproximada del tamaño y la capacidad de un modelo— iguala o supera a modelos de mayor tamaño en las pruebas de percepción espacial densa. Es un argumento relevante en un momento en que buena parte de la industria asocia el rendimiento con el crecimiento indiscriminado del número de parámetros.
Ese mismo backbone, el núcleo del modelo, sirve además para inicializar LingBot-Depth 2.0, un sistema de estimación de profundidad monocular, es decir, la capacidad de calcular a qué distancia están los objetos a partir de una sola cámara. Los detalles técnicos del método se recogen en un documento técnico publicado en GitHub.
La percepción de profundidad y la delimitación precisa de contornos son piezas centrales para la robótica y los sistemas de navegación autónoma, terrenos en los que Ant Group ha mostrado creciente interés a través de Robbyant. Un modelo capaz de interpretar la estructura tridimensional de una escena con una sola cámara reduce la dependencia de sensores más caros, como el lidar.
Otra apuesta china por el código abierto
La decisión de liberar el modelo se inscribe en una tendencia marcada por las tecnológicas chinas, que en los últimos meses han optado por publicar sus modelos de forma abierta para ganar tracción entre desarrolladores e investigadores fuera de sus fronteras. Al poner los pesos a disposición pública, Robbyant permite que terceros ajusten el modelo a sus propios casos de uso sin partir de cero.
Queda por ver la adopción real de LingBot-Vision frente a alternativas ya consolidadas en el campo de la visión por computador. La combinación de un tamaño contenido, licencia abierta y un enfoque técnico poco habitual le da, al menos, un argumento para llamar la atención de quienes construyen aplicaciones de robótica y percepción espacial.
